भाषा पहचान
SpeechBrain ECAPA VoxLingua107 से डिवाइस पर बोली गई भाषा पहचानें। Swift रनटाइम नेटिव MLX और संकलित Core ML दोनों का समर्थन करता है और 107 भाषा लेबल रैंक करता है।
आर्किटेक्चर
ऑडियो को 16 kHz पर री-सैंपल करके SpeechBrain से सटीक मेल खाने वाले 60-बिन लॉग-मेल फ्रंटएंड से गुज़ारा जाता है। समय-माध्य सामान्यीकरण के बाद ECAPA-TDNN एनकोडर और 107-वर्ग क्लासिफ़ायर चलता है।
CLI
speech language-id recording.wav
speech language-id recording.wav --engine coreml --top 3
speech language-id recording.wav --json
MLX डिफ़ॉल्ट है। संकलित मॉडल के लिए --engine coreml, उम्मीदवारों की संख्या के लिए --top और मशीन-पठनीय आउटपुट के लिए --json उपयोग करें।
Swift API
import SpeechLanguageID
let identifier = try await SpeechLanguageIdentifier.fromPretrained(engine: .mlx)
let result = try identifier.identify(
audio: samples,
sampleRate: sampleRate,
topK: 5
)
print(result.best?.label.code ?? "unknown")
लंबी रिकॉर्डिंग
हर मॉडल कॉल लगभग 30 सेकंड तक विश्लेषण करती है। लंबी रिकॉर्डिंग को बिना ओवरलैप वाली विंडो में बाँटकर अवधि-भारित संभावनाएँ जोड़ी जाती हैं।
मॉडल हमेशा ज्ञात लेबलों में से एक को रैंक करता है। उसका कॉन्फ़िडेंस अज्ञात भाषा डिटेक्टर नहीं है। मौन, संगीत, कोड-स्विचिंग और असमर्थित भाषाओं के लिए VAD और कैलिब्रेटेड रिजेक्शन नीति जोड़ें।