ओपन-सोर्स · Apache 2.0 · पूरी तरह ऑफ़लाइन

ऑन-डिवाइस स्पीच।
असली प्रोडक्ट्स के लिए।

डायराइज़्ड ट्रांसक्रिप्शन, ज़ीरो-शॉट वॉइस क्लोनिंग, लॉन्ग-फ़ॉर्म स्पीच सिंथेसिस — Apple Silicon, Android, Windows, और एम्बेडेड Linux पर। कोई क्लाउड API नहीं, कोई प्रति-मिनट कीमत नहीं, कोई डेटा डिवाइस से बाहर नहीं।

Apple · Homebrew
brew install speech
Android · Gradle
implementation("audio.soniqo:speech:0.0.9")
नवीनतम लेख और वीडियो
सभी पोस्ट
YouTube · 2 मिनट 33 सेकंड

MacBook पर फुल-डुप्लेक्स, असली टूल कॉल करते हुए

NVIDIA Nemotron VoiceChat 11B को स्थानीय रूप से चलाने वाला वास्तविक सत्र: एक बोला गया टर्न, वाक्य के बीच में टोकाटाकी, और Apple Reminders में एक पूर्ण MCP टूल कॉल। M5 Pro पर RTF 0.92, और कुछ भी मशीन से बाहर नहीं जाता।

देखें
YouTube · 90 सेकंड

पूरा ऑफ़लाइन वॉइस एजेंट Android पर 1.2 GB में

बोलिए — Android कर देगा: आवाज़ से असली डिवाइस एक्शन और बोले गए जवाब तक का पूरा कमांड लूप, एक ही फ़ोन पर 1.2 GB RAM में। Silero VAD, Parakeet STT, FunctionGemma टूल कॉल और Pocket TTS।

देखें
YouTube · 4 मिनट

MacBook पर लोकल स्पीच AI — 4 मिनट का लाइब्रेरी टूर

4 मिनट का ओपन-सोर्स लाइब्रेरी टूर: Nemotron Streaming से रियलटाइम ट्रांसक्रिप्शन, PersonaPlex से लोकल स्पीच-टू-स्पीच और VoxCPM2 से 48 kHz क्लोनिंग — सब लैपटॉप पर।

देखें
7 जुलाई 2026 · Soniqo का ब्लॉग

डिवाइस पर वॉइस एजेंट: एक पाइपलाइन, तीन मेमोरी बजट

फ़ोन और Mac पर VAD → STT → LLM → TTS · iPhone ~1.2 GB · S23 ~1.5 GB · डेस्कटॉप <4 GB

वही VAD → STT → LLM → TTS एजेंट पाइपलाइन iPhone, Galaxy S23 और Mac पर — हर बजट की मापी गई मेमोरी के साथ।

पढ़ें
आप क्या बना सकते हैं

तीन ऑन-डिवाइस यूज़-केस ग्रुप।

हर ग्रुप में कई सब-यूज़-केस होते हैं जो Soniqo कॉम्पोनेंट्स से जुड़े होते हैं। ऑडियो डालिए, बातचीत, ट्रांसक्रिप्ट या जेनरेट की हुई आवाज़ पाइए — लोकल, रियल-टाइम में।

सभी कॉम्पोनेंट्स

तीस से ज़्यादा मॉडल। एक ही स्टैक।

ऊपर की यूज़-केस पाइपलाइन्स इन्हीं मॉडल्स से बनी हैं। किसी भी कॉम्पोनेंट का आर्किटेक्चर, CLI, Swift API और बेंचमार्क देखने के लिए उसे चुनिए। सभी Apple Silicon पर चलते हैं, ज़्यादातर Android और Linux पर भी।

टेक्स्ट-टू-स्पीच