fufuchiu
speechloom
End-to-end speech model research: waveform encoding, causal decoding, codec tokens, joint losses and streaming.
README 已保存到本站,可直接阅读
Documentation snapshot
README 快照
本页保存的是公开项目资料快照,阅读过程不需要连接 GitHub。
speechloom
端到端语音模型研究工具:音频编码、因果解码、联合训练与流式协议。
Chen Yuxuan · 广州大学(Guangzhou University)。
历史说明:本仓库由经过验证的补丁序列重建;2025 年至 2026 年 8 月的 Git 时间戳用于展示项目演进,不代表代码实际开发日期。
图片:CI
快速开始
python -m venv .venv
source .venv/bin/activate
pip install -e '.[dev]'
python -m speechloom tokenize '广州大学' --audio-codes 0,128,255
python examples/codec_roundtrip.py
python examples/stream_text.py
文本采用无损 UTF-8 byte token。音频码本分配独立 ID 区间,避免模态碰撞。
训练时输出序列为 BOS + text + separator + audio_codes + EOS。
模型实验
pip install torch --index-url https://download.pytorch.org/whl/cpu
python examples/train_tiny.py
提供可以训练的紧凑研究原型和完整数据链路。示例使用合成输入,验证损失下降、 梯度和掩码正确性;不包含经过大规模训练的权重,也没有真实语料成绩声明。
文档
- 架构与边界
- 模块索引
- 复现实验与时间线说明
- 测试策略
- 参与开发
验证
python -m build
python -m pytest -q
ruff check .
ruff format --check .
MIT License · Chen Yuxuan
Official distribution
获取与安装
暂未发现可确认的官方软件包地址
当前 README 快照没有出现 npm、PyPI、Crates.io、pub.dev 等官方包页链接。本站不会根据仓库名称猜测下载地址。
本站不托管项目文件;需要安装时,请以项目维护者发布的官方文档为准。
Before installing
使用前核验
本站保存公开资料用于阅读,不代表安全审计或功能背书。安装前请核对许可证、依赖来源和发布签名,不要直接运行来源不明的二进制文件或高权限脚本。