Entra voz. Sai voz.
Uma única API para voz.
Transcreva áudio com etiquetas de locutor e gere fala natural por uma única API compatível com OpenAI. Feita para agentes de voz e criadores. Na nossa nuvem, nos seus servidores ou no dispositivo.
A referência da API e a documentação estão em inglês.
Entender a fala — e gerá-la.
O Steno transforma áudio em transcrições atribuídas. O Vox transforma texto em fala natural com vozes predefinidas integradas. Mesma chave, mesma cobrança, mesma URL base.
Fala para texto com diarização, identificação de locutores e marcas de tempo por palavra. Nosso modelo ajustado cobre 25+ idiomas e seus dialetos regionais — palavra por palavra. Detecção automática ou dica explícita.
Texto para fala natural, como arquivo completo ou em streaming de baixa latência para uso ao vivo. Escolha entre vozes predefinidas integradas pela API de áudio compatível com OpenAI.
Você chama cada modelo pelo nome Soniqo; nós seguimos melhorando o que roda por baixo sem você mudar uma linha.
Encaixe o Soniqo no seu stack de agentes.
Steno e Vox seguem o formato da API de áudio da OpenAI — um framework como o LiveKit funciona apontando para a nossa URL base. Sem plugin próprio, com PCM em streaming no ritmo que os runtimes de agentes esperam.
# LiveKit Agents — Soniqo TTS with no custom plugin
from livekit.plugins import openai
tts = openai.TTS(
base_url="https://api.soniqo.audio/v1",
api_key="sk_...", # sent as Authorization: Bearer
model="tts-1",
voice="af_heart", # built-in Soniqo preset
response_format="pcm", # low-latency 24 kHz stream
)Qualquer stack que já use a API de áudio da OpenAI funciona igual — troque a URL base e mantenha seu código.
Tudo para lançar recursos de voz.
Diarização, cobertura de dialetos, compatibilidade direta e uma cobrança que agrupa tudo — em transcrição e síntese.
Cada fala volta rotulada com o locutor. Registre perfis uma vez e obtenha identidades nomeadas estáveis em reuniões, entrevistas e gravações de chamadas.
25+ idiomas com dialetos regionais no modelo principal, mais um modelo de cauda longa com 1.600+ idiomas (híndi, árabe, indonésio, vietnamita e mais). Autodetecção ou dica explícita.
Código escrito para a API de áudio da OpenAI funciona no Soniqo mudando uma linha — a URL base. Envie a chave como Bearer ou X-Api-Key. Sem reescrever cliente, sem migrar SDK.
Transcrição a US$ 0,24 por hora de áudio — fala para texto, diarização e ID de locutor incluídos. Síntese a US$ 0,22 por minuto gerado. Cobrança por segundo, sem mínimos.
Entre com Google ou GitHub no console, ou gere chaves de API de longa duração para tráfego servidor-a-servidor. Hash Argon2, restritas à sua conta, revogáveis a qualquer momento.
Uma fila durável com confirmação explícita e chaves de idempotência. Uma preempção nunca perde nem cobra duas vezes um job — o razão é a fonte da verdade.
Nuvem, on-premise ou no dispositivo — os mesmos modelos.
Comece na API gerenciada. Migre para a sua infraestrutura quando a conformidade exigir. Ou rode na borda com os SDKs open source. Os modelos viajam com você.
Gerenciada e medida por segundo de áudio. Entre, pegue uma chave e chame o endpoint — nada para hospedar. É o que você está vendo.
Todo o stack dentro da sua rede. Áudio e transcrições nunca saem da sua infraestrutura — para requisitos regulados, air-gapped e de residência de dados. SLAs sob medida e ajuste de modelos por cliente.
Leve a voz para a borda com nossos SDKs open source — speech-swift para Apple, speech-core para Linux / Windows / macOS / Android — com adaptações de modelo para o seu hardware. Sem ida e volta à rede.
Uma chamada para transcrever — uma para falar.
Ao entrar, você terá saldo inicial e uma chave de API. A transcrição é um upload HTTP; a síntese devolve áudio pronto para o alto-falante.
# Transcribe with diarization (Soniqo Steno)
curl -X POST https://api.soniqo.audio/v1/transcribe \
-H "Authorization: Bearer $SONIQO_API_KEY" \
-F "[email protected]"
# -> a job id; poll /v1/transcribe/<id> for the attributed transcript
# Synthesize speech (Soniqo Vox)
curl -X POST https://api.soniqo.audio/v1/audio/speech \
-H "Authorization: Bearer $SONIQO_API_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"Hello from Soniqo.","voice":"nova"}' \
--output hello.wavJá usa o SDK da OpenAI? Troque a base URL e seu código atual funciona:
from openai import OpenAI
client = OpenAI(
base_url="https://api.soniqo.audio/v1",
api_key="<your-soniqo-api-key>",
)
# Transcription
with open("meeting.wav", "rb") as f:
print(client.audio.transcriptions.create(model="whisper-1", file=f).text)
# Synthesis
client.audio.speech.create(
model="tts-1", voice="nova", input="Hello from Soniqo.",
).stream_to_file("hello.wav")Preço simples, por segundo.
Os mesmos modelos, a mesma API — de graça.
A nuvem é conveniência. Se quiser controle total, latência no dispositivo ou custo zero por minuto, rode a biblioteca open source no seu hardware. Apache 2.0, nada sai das suas máquinas.
Os mesmos modelos de transcrição, separação de locutores e síntese, empacotados para plataformas Apple com adaptações no dispositivo. API Swift, instalação via Homebrew, Apache 2.0.
Um motor C++ multiplataforma para Linux, Windows, macOS e Android — transcrição, diarização, ID de locutor e streaming em tempo real na CPU. Apache 2.0.
