Voxtral Mini 3B 2507

Esta página da Soniqo documenta Voxtral Mini 3B 2507 conforme a implementação local em speech-swift / speech-core. Os links do Hugging Face ficam abaixo das notas de integração.

Página interna primeiro

Cards e menus apontam primeiro para cá; os links do modelo fonte e dos bundles continuam disponíveis nesta página.

Visão geral

ModeloVoxtral Mini 3B 2507
PapelHigh-accuracy multilingual offline speech-to-text
BackendNative MLX on Apple Silicon
SaídaPlain-text transcription
IdiomasEnglish, French, German, Spanish, Italian, Portuguese, Dutch, and Hindi
LicençaApache-2.0
StatusPublished FP16, INT5, and INT8 bundles; INT5 is the default
FonteMistral Voxtral Mini 3B 2507
Produto SwiftVoxtralASR
CLI / runtimespeech transcribe --engine voxtral

Uso

O trecho abaixo reflete a API ou comando atual exposto por speech-swift.

# INT5 is the default.
speech transcribe recording.wav --engine voxtral

# Select another published precision and pass a language hint.
speech transcribe recording.wav --engine voxtral --model int8 --language fr

# --model also accepts a Hugging Face model ID or a local directory.
speech transcribe recording.wav --engine voxtral --model /models/voxtral/int5

Benchmark

Medido em 2026-07-22 sobre 80 enunciados de fala lida em inglês do FLEURS (759,56 segundos no total), num Apple M5 Pro com 48 GB de memória e macOS 26.5.2. Cada variante rodou no próprio processo a partir de uma compilação release.

VariantBundleWERΔ WERMean RTFOverall ×RTFootprint
FP168.71 GiB4.633%0.13058.05×10,568 MiB
INT53.77 GiB4.744%+0.110 pp0.073914.47×6,012 MiB
INT85.18 GiB4.578%-0.055 pp0.090611.79×7,233 MiB

A pegada física é a métrica de memória unificada relevante para implantação, porque o MLX pode mapear em memória os arquivos de pesos. FLEURS é fala lida em inglês: estes números não afirmam paridade em áudio conversacional, telefônico, ruidoso ou com muitos falantes.

Links do modelo

Notas de implementação