Voxtral Mini 3B 2507

Cette page Soniqo documente Voxtral Mini 3B 2507 tel qu'il est implémenté dans speech-swift / speech-core. Les liens Hugging Face sont placés après les notes d'intégration.

Page interne d'abord

Les cartes et menus pointent d'abord ici; les liens vers le modèle source et les bundles restent disponibles sur cette page.

Aperçu

ModèleVoxtral Mini 3B 2507
RôleHigh-accuracy multilingual offline speech-to-text
BackendNative MLX on Apple Silicon
SortiePlain-text transcription
LanguesEnglish, French, German, Spanish, Italian, Portuguese, Dutch, and Hindi
LicenceApache-2.0
ÉtatPublished FP16, INT5, and INT8 bundles; INT5 is the default
SourceMistral Voxtral Mini 3B 2507
Produit SwiftVoxtralASR
CLI / runtimespeech transcribe --engine voxtral

Utilisation

L'extrait ci-dessous suit l'API ou la commande actuellement exposée par speech-swift.

# INT5 is the default.
speech transcribe recording.wav --engine voxtral

# Select another published precision and pass a language hint.
speech transcribe recording.wav --engine voxtral --model int8 --language fr

# --model also accepts a Hugging Face model ID or a local directory.
speech transcribe recording.wav --engine voxtral --model /models/voxtral/int5

Benchmark

Mesuré le 2026-07-22 sur 80 énoncés de parole lue en anglais issus de FLEURS (759,56 secondes au total), sur un Apple M5 Pro doté de 48 Go de mémoire sous macOS 26.5.2. Chaque variante s'est exécutée dans son propre processus à partir d'une compilation release.

VariantBundleWERΔ WERMean RTFOverall ×RTFootprint
FP168.71 GiB4.633%0.13058.05×10,568 MiB
INT53.77 GiB4.744%+0.110 pp0.073914.47×6,012 MiB
INT85.18 GiB4.578%-0.055 pp0.090611.79×7,233 MiB

L'empreinte physique est la mesure de mémoire unifiée pertinente pour le déploiement, car MLX peut mapper les fichiers de poids en mémoire. FLEURS est de la parole lue en anglais : ces chiffres ne prétendent pas à la parité sur de l'audio conversationnel, téléphonique, bruité ou à nombreux locuteurs.

Liens du modèle

Notes d'implémentation