Voxtral Mini 3B 2507

この Soniqo ページは、ローカルの speech-swift / speech-core 実装にある Voxtral Mini 3B 2507 を説明します。Hugging Face バンドルへのリンクは統合メモの後にあります。

まずサイト内ページへ

ランディングカードとドキュメントメニューは先にこのページへ向け、ソースモデルとバンドルのリンクは本ページ内に残します。

概要

モデルVoxtral Mini 3B 2507
役割High-accuracy multilingual offline speech-to-text
バックエンドNative MLX on Apple Silicon
出力Plain-text transcription
言語English, French, German, Spanish, Italian, Portuguese, Dutch, and Hindi
ライセンスApache-2.0
状態Published FP16, INT5, and INT8 bundles; INT5 is the default
ソースMistral Voxtral Mini 3B 2507
Swift プロダクトVoxtralASR
CLI / ランタイムspeech transcribe --engine voxtral

使い方

以下のスニペットは、現在の speech-swift リポジトリが公開している API またはコマンドに合わせています。

# INT5 is the default.
speech transcribe recording.wav --engine voxtral

# Select another published precision and pass a language hint.
speech transcribe recording.wav --engine voxtral --model int8 --language fr

# --model also accepts a Hugging Face model ID or a local directory.
speech transcribe recording.wav --engine voxtral --model /models/voxtral/int5

ベンチマーク

2026-07-22 に、英語 FLEURS の朗読音声 80 発話(合計 759.56 秒)を、48 GB メモリの Apple M5 Pro(macOS 26.5.2)で測定しました。各バリアントは release ビルドの独立したプロセスで実行しています。

VariantBundleWERΔ WERMean RTFOverall ×RTFootprint
FP168.71 GiB4.633%0.13058.05×10,568 MiB
INT53.77 GiB4.744%+0.110 pp0.073914.47×6,012 MiB
INT85.18 GiB4.578%-0.055 pp0.090611.79×7,233 MiB

物理フットプリントは配備上意味を持つユニファイドメモリの指標です。MLX が重みファイルをメモリマップする場合があるためです。FLEURS は英語の朗読音声であり、これらの数値は会話音声、電話音声、雑音環境、話者の多い音声での同等性を主張するものではありません。

モデルリンク

実装メモ