Ir para o conteúdo

Voz e áudio (TTS)

POST /v1/audio/speech: texto vira voz (TTS) ou trilha/efeito sonoro — compatível com o formato da OpenAI.

Atualizado em 01 de set. de 2026

Duas famílias no mesmo endpoint:

  • Voz (TTS)minimax/speech-28-hd, inworld/tts-1.5-max: texto vira fala, em 3–5 segundos, com escolha de voz.
  • Áudio generativostability-ai/stable-audio-2/2.5/3: descrição vira música ou efeito sonoro.

O texto vai em prompt — e, por compatibilidade com a OpenAI, input e text são aceitos como sinônimos.

POSThttps://api.hinow.ai/v1/audio/speechBearer

Converte texto em fala (ou gera áudio) e devolve a URL pública do arquivo.

Parâmetros

  • modelstring· bodyobrigatório

    `minimax/speech-28-hd`, `inworld/tts-1.5-max` (voz) ou `stability-ai/stable-audio-2` (música/efeitos).

  • promptstring· bodyobrigatório

    O texto a falar — ou, nos modelos de áudio, a descrição do som. Aliases aceitos: `input` (formato OpenAI) e `text`.

  • voicestring· body

    Voz do modelo (ex.: `Ashley` no inworld). `voice_id` também é aceito.

  • speednumber· body

    Velocidade da fala (0.5–2.0, conforme o modelo).

  • output_formatstring· body

    Formato do arquivo (padrão `mp3`).

  • durationnumber· body

    Nos modelos de áudio generativo: duração do trecho em segundos.

  • asyncboolean· body

    `true` para o modo assíncrono — útil nos modelos de áudio, que demoram mais.

Respostas

200Áudio gerado
{
  "success": true,
  "data": {
    "urls": ["https://s3.us1-stlouis.hinow.ai/hi-storage/text_to_audio/.../fala.mp3"],
    "model": "inworld/tts-1.5-max",
    "category": "text_to_audio",
    "cost": { "amount": 0.000728, "currency": "USD" }
  }
}
400Modelo incompatível com o endpoint, ou texto ausente
502Provedor falhou — a mensagem de erro traz a causa
voz em 3–5s (medido: US$ 0,0007 por frase no inworld)bash
curl -X POST https://api.hinow.ai/v1/audio/speech \
  -H "Authorization: Bearer hi_SUA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "inworld/tts-1.5-max",
    "input": "Perfeito! Seu pedido foi confirmado e chega amanhã.",
    "voice": "Ashley"
  }'

A transcrição (fala → texto) é o caminho inverso, em POST /v1/audio/transcriptions.