MOSS Transcribe Diarize 0.9B
此 Soniqo 页面记录本地 speech-swift / speech-core 实现中的 MOSS Transcribe Diarize 0.9B。Hugging Face 包链接放在集成说明之后。
先进入站内页面
首页卡片和文档菜单先指向这里;源模型和权重包链接仍在本页提供。
概览
| 模型 | MOSS Transcribe Diarize 0.9B |
|---|---|
| 用途 | 批量转写,并由模型生成说话人标签和时间戳 |
| 后端 | CoreML,使用基于 Accelerate 的原生 Whisper 前端 |
| 输出 | 纯文本转写以及带时间戳的说话人分段 |
| 语言 | 多语言 MOSS 转写模型 |
| 许可证 | 使用前请核对源模型及权重包的许可条款 |
| 状态 | 可通过 speech transcribe --engine moss 和 MossTranscribe Swift 产品使用 |
| 来源 | OpenMOSS-Team/MOSS-Transcribe-Diarize |
| Swift 产品 | MossTranscribe |
| CLI / 运行时 | speech transcribe --engine moss |
使用
下面的片段对应当前 speech-swift 仓库暴露的 API 或命令。
# 推荐默认使用 INT8。
.build/release/speech transcribe recording.wav --engine moss
# FP16 参考版本。
.build/release/speech transcribe recording.wav --engine moss --model fp16
模型链接
实现说明
- 在 M5 Pro 上对齐测试 80 个英语片段:两个版本的整体 WER 均为 8.16%,CER 均为 5.90%。
- 两次反向顺序运行汇总后,INT8 的 RTF 为 0.070(14.3× 实时),FP16 为 0.079(12.6×);采样峰值 RSS 分别为 2.38–2.40 GB 和 3.69–3.74 GB。
- Swift 运行时负责精确的 Whisper log-mel 预处理、MOSS 时间标记提示构建、音频嵌入注入、MLState 缓存更新、贪心解码和结构化输出解析。
- INT8 保留 FP16 音频编码器及解码器输入输出,并对解码器采用对称线性 INT8 block-32 量化。
- 解码器的提示与输出共享固定的 1024-token 上下文。当前运行时仅支持批量模式,并会拒绝 --stream。