跳到正文

fufuchiu

speechloom

End-to-end speech model research: waveform encoding, causal decoding, codec tokens, joint losses and streaming.

README 已保存到本站,可直接阅读

Documentation snapshot

README 快照

本页保存的是公开项目资料快照,阅读过程不需要连接 GitHub。

speechloom

端到端语音模型研究工具:音频编码、因果解码、联合训练与流式协议。

Chen Yuxuan · 广州大学(Guangzhou University)。

历史说明:本仓库由经过验证的补丁序列重建;2025 年至 2026 年 8 月的 Git 时间戳用于展示项目演进,不代表代码实际开发日期。

图片:CI

快速开始

python -m venv .venv
source .venv/bin/activate
pip install -e '.[dev]'
python -m speechloom tokenize '广州大学' --audio-codes 0,128,255
python examples/codec_roundtrip.py
python examples/stream_text.py

文本采用无损 UTF-8 byte token。音频码本分配独立 ID 区间,避免模态碰撞。 训练时输出序列为 BOS + text + separator + audio_codes + EOS。

模型实验

pip install torch --index-url https://download.pytorch.org/whl/cpu
python examples/train_tiny.py

提供可以训练的紧凑研究原型和完整数据链路。示例使用合成输入,验证损失下降、 梯度和掩码正确性;不包含经过大规模训练的权重,也没有真实语料成绩声明。

文档

  • 架构与边界
  • 模块索引
  • 复现实验与时间线说明
  • 测试策略
  • 参与开发

验证

python -m build
python -m pytest -q
ruff check .
ruff format --check .

MIT License · Chen Yuxuan

Official distribution

获取与安装

暂未发现可确认的官方软件包地址

当前 README 快照没有出现 npm、PyPI、Crates.io、pub.dev 等官方包页链接。本站不会根据仓库名称猜测下载地址。

本站不托管项目文件;需要安装时,请以项目维护者发布的官方文档为准。

使用前核验

本站保存公开资料用于阅读,不代表安全审计或功能背书。安装前请核对许可证、依赖来源和发布签名,不要直接运行来源不明的二进制文件或高权限脚本。