Soniqo Cloud · Plataforma de IA de voz

Entra voz. Sai voz.
Uma única API para voz.

Transcreva áudio com etiquetas de locutor e gere fala natural por uma única API compatível com OpenAI. Feita para agentes de voz e criadores. Na nossa nuvem, nos seus servidores ou no dispositivo.

US$ 10/mês de crédito grátis · transcrição US$ 0,24/h · síntese US$ 0,22/min · ou rode a biblioteca OSS de graça

A referência da API e a documentação estão em inglês.

Duas capacidades, uma API

Entender a fala — e gerá-la.

O Steno transforma áudio em transcrições atribuídas. O Vox transforma texto em fala natural com vozes predefinidas integradas. Mesma chave, mesma cobrança, mesma URL base.

Soniqo Steno
Transcrição

Fala para texto com diarização, identificação de locutores e marcas de tempo por palavra. Nosso modelo ajustado cobre 25+ idiomas e seus dialetos regionais — palavra por palavra. Detecção automática ou dica explícita.

Soniqo Vox
Síntese de voz

Texto para fala natural, como arquivo completo ou em streaming de baixa latência para uso ao vivo. Escolha entre vozes predefinidas integradas pela API de áudio compatível com OpenAI.

Você chama cada modelo pelo nome Soniqo; nós seguimos melhorando o que roda por baixo sem você mudar uma linha.

Agentes de voz

Encaixe o Soniqo no seu stack de agentes.

Steno e Vox seguem o formato da API de áudio da OpenAI — um framework como o LiveKit funciona apontando para a nossa URL base. Sem plugin próprio, com PCM em streaming no ritmo que os runtimes de agentes esperam.

# LiveKit Agents — Soniqo TTS with no custom plugin
from livekit.plugins import openai

tts = openai.TTS(
    base_url="https://api.soniqo.audio/v1",
    api_key="sk_...",          # sent as Authorization: Bearer
    model="tts-1",
    voice="af_heart",          # built-in Soniqo preset
    response_format="pcm",     # low-latency 24 kHz stream
)

Qualquer stack que já use a API de áudio da OpenAI funciona igual — troque a URL base e mantenha seu código.

O que está incluído

Tudo para lançar recursos de voz.

Diarização, cobertura de dialetos, compatibilidade direta e uma cobrança que agrupa tudo — em transcrição e síntese.

Locutores atribuídos

Cada fala volta rotulada com o locutor. Registre perfis uma vez e obtenha identidades nomeadas estáveis em reuniões, entrevistas e gravações de chamadas.

Idiomas e dialetos

25+ idiomas com dialetos regionais no modelo principal, mais um modelo de cauda longa com 1.600+ idiomas (híndi, árabe, indonésio, vietnamita e mais). Autodetecção ou dica explícita.

Compatível com OpenAI

Código escrito para a API de áudio da OpenAI funciona no Soniqo mudando uma linha — a URL base. Envie a chave como Bearer ou X-Api-Key. Sem reescrever cliente, sem migrar SDK.

Pague por segundo de áudio

Transcrição a US$ 0,24 por hora de áudio — fala para texto, diarização e ID de locutor incluídos. Síntese a US$ 0,22 por minuto gerado. Cobrança por segundo, sem mínimos.

Chaves de API + OAuth

Entre com Google ou GitHub no console, ou gere chaves de API de longa duração para tráfego servidor-a-servidor. Hash Argon2, restritas à sua conta, revogáveis a qualquer momento.

Jobs at-least-once

Uma fila durável com confirmação explícita e chaves de idempotência. Uma preempção nunca perde nem cobra duas vezes um job — o razão é a fonte da verdade.

Implante em qualquer lugar

Nuvem, on-premise ou no dispositivo — os mesmos modelos.

Comece na API gerenciada. Migre para a sua infraestrutura quando a conformidade exigir. Ou rode na borda com os SDKs open source. Os modelos viajam com você.

API na nuvem

Gerenciada e medida por segundo de áudio. Entre, pegue uma chave e chame o endpoint — nada para hospedar. É o que você está vendo.

On-premise

Todo o stack dentro da sua rede. Áudio e transcrições nunca saem da sua infraestrutura — para requisitos regulados, air-gapped e de residência de dados. SLAs sob medida e ajuste de modelos por cliente.

SDK no dispositivo

Leve a voz para a borda com nossos SDKs open source — speech-swift para Apple, speech-core para Linux / Windows / macOS / Android — com adaptações de modelo para o seu hardware. Sem ida e volta à rede.

Início rápido

Uma chamada para transcrever — uma para falar.

Ao entrar, você terá saldo inicial e uma chave de API. A transcrição é um upload HTTP; a síntese devolve áudio pronto para o alto-falante.

# Transcribe with diarization (Soniqo Steno)
curl -X POST https://api.soniqo.audio/v1/transcribe \
  -H "Authorization: Bearer $SONIQO_API_KEY" \
  -F "[email protected]"
# -> a job id; poll /v1/transcribe/<id> for the attributed transcript

# Synthesize speech (Soniqo Vox)
curl -X POST https://api.soniqo.audio/v1/audio/speech \
  -H "Authorization: Bearer $SONIQO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"Hello from Soniqo.","voice":"nova"}' \
  --output hello.wav

Já usa o SDK da OpenAI? Troque a base URL e seu código atual funciona:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.soniqo.audio/v1",
    api_key="<your-soniqo-api-key>",
)

# Transcription
with open("meeting.wav", "rb") as f:
    print(client.audio.transcriptions.create(model="whisper-1", file=f).text)

# Synthesis
client.audio.speech.create(
    model="tts-1", voice="nova", input="Hello from Soniqo.",
).stream_to_file("hello.wav")
Preços

Preço simples, por segundo.

Grátis
$10
de crédito grátis todo mês. Suficiente para avaliar sem pagar — sem cartão para começar.
Steno · transcrição
$0.24 / hora de áudio
Fala para texto com diarização, ID de locutor e dialetos — tudo junto, sem adicionais. Cobrança por segundo, sem mínimos.
Vox · síntese
$0.22 / minuto
Texto para fala com vozes predefinidas integradas. Por minuto de áudio gerado, cobrado por segundo, sem mínimos.
Enterprise
Sob medida
Faixas de volume, instalação on-premise, SLAs sob medida, ajuste de modelos por cliente. Fale conosco.
Ou rode você mesmo

Os mesmos modelos, a mesma API — de graça.

A nuvem é conveniência. Se quiser controle total, latência no dispositivo ou custo zero por minuto, rode a biblioteca open source no seu hardware. Apache 2.0, nada sai das suas máquinas.

speech-swift

Os mesmos modelos de transcrição, separação de locutores e síntese, empacotados para plataformas Apple com adaptações no dispositivo. API Swift, instalação via Homebrew, Apache 2.0.

speech-core

Um motor C++ multiplataforma para Linux, Windows, macOS e Android — transcrição, diarização, ID de locutor e streaming em tempo real na CPU. Apache 2.0.