Voxtral Mini 3B 2507

此 Soniqo 页面记录本地 speech-swift / speech-core 实现中的 Voxtral Mini 3B 2507。Hugging Face 包链接放在集成说明之后。

先进入站内页面

首页卡片和文档菜单先指向这里;源模型和权重包链接仍在本页提供。

概览

模型Voxtral Mini 3B 2507
用途High-accuracy multilingual offline speech-to-text
后端Native MLX on Apple Silicon
输出Plain-text transcription
语言English, French, German, Spanish, Italian, Portuguese, Dutch, and Hindi
许可证Apache-2.0
状态Published FP16, INT5, and INT8 bundles; INT5 is the default
来源Mistral Voxtral Mini 3B 2507
Swift 产品VoxtralASR
CLI / 运行时speech transcribe --engine voxtral

使用

下面的片段对应当前 speech-swift 仓库暴露的 API 或命令。

# INT5 is the default.
speech transcribe recording.wav --engine voxtral

# Select another published precision and pass a language hint.
speech transcribe recording.wav --engine voxtral --model int8 --language fr

# --model also accepts a Hugging Face model ID or a local directory.
speech transcribe recording.wav --engine voxtral --model /models/voxtral/int5

基准测试

测量于 2026-07-22,使用 80 条英语 FLEURS 朗读语音(共 759.56 秒),在配备 48 GB 内存、运行 macOS 26.5.2 的 Apple M5 Pro 上完成。每个变体都以 release 构建在独立进程中运行。

VariantBundleWERΔ WERMean RTFOverall ×RTFootprint
FP168.71 GiB4.633%0.13058.05×10,568 MiB
INT53.77 GiB4.744%+0.110 pp0.073914.47×6,012 MiB
INT85.18 GiB4.578%-0.055 pp0.090611.79×7,233 MiB

物理占用是与部署相关的统一内存指标,因为 MLX 可能会内存映射权重文件。FLEURS 为英语朗读语音:这些数字不代表在对话、电话、嘈杂或多说话人音频上的同等表现。

模型链接

实现说明