भाषा पहचान

SpeechBrain ECAPA VoxLingua107 से डिवाइस पर बोली गई भाषा पहचानें। Swift रनटाइम नेटिव MLX और संकलित Core ML दोनों का समर्थन करता है और 107 भाषा लेबल रैंक करता है।

आर्किटेक्चर

ऑडियो को 16 kHz पर री-सैंपल करके SpeechBrain से सटीक मेल खाने वाले 60-बिन लॉग-मेल फ्रंटएंड से गुज़ारा जाता है। समय-माध्य सामान्यीकरण के बाद ECAPA-TDNN एनकोडर और 107-वर्ग क्लासिफ़ायर चलता है।

CLI

speech language-id recording.wav
speech language-id recording.wav --engine coreml --top 3
speech language-id recording.wav --json

MLX डिफ़ॉल्ट है। संकलित मॉडल के लिए --engine coreml, उम्मीदवारों की संख्या के लिए --top और मशीन-पठनीय आउटपुट के लिए --json उपयोग करें।

Swift API

import SpeechLanguageID

let identifier = try await SpeechLanguageIdentifier.fromPretrained(engine: .mlx)
let result = try identifier.identify(
    audio: samples,
    sampleRate: sampleRate,
    topK: 5
)
print(result.best?.label.code ?? "unknown")

लंबी रिकॉर्डिंग

हर मॉडल कॉल लगभग 30 सेकंड तक विश्लेषण करती है। लंबी रिकॉर्डिंग को बिना ओवरलैप वाली विंडो में बाँटकर अवधि-भारित संभावनाएँ जोड़ी जाती हैं।

बंद लेबल-समूह मॉडल

मॉडल हमेशा ज्ञात लेबलों में से एक को रैंक करता है। उसका कॉन्फ़िडेंस अज्ञात भाषा डिटेक्टर नहीं है। मौन, संगीत, कोड-स्विचिंग और असमर्थित भाषाओं के लिए VAD और कैलिब्रेटेड रिजेक्शन नीति जोड़ें।

Hugging Face

CLI: language-id