Voz e áudio (TTS)
POST /v1/audio/speech: texto vira voz (TTS) ou trilha/efeito sonoro — compatível com o formato da OpenAI.
Atualizado em 01 de set. de 2026
Duas famílias no mesmo endpoint:
- Voz (TTS) —
minimax/speech-28-hd,inworld/tts-1.5-max: texto vira fala, em 3–5 segundos, com escolha de voz. - Áudio generativo —
stability-ai/stable-audio-2/2.5/3: descrição vira música ou efeito sonoro.
O texto vai em prompt — e, por compatibilidade com a OpenAI, input e text são aceitos como sinônimos.
https://api.hinow.ai/v1/audio/speechBearerConverte texto em fala (ou gera áudio) e devolve a URL pública do arquivo.
Parâmetros
modelstring· bodyobrigatório`minimax/speech-28-hd`, `inworld/tts-1.5-max` (voz) ou `stability-ai/stable-audio-2` (música/efeitos).
promptstring· bodyobrigatórioO texto a falar — ou, nos modelos de áudio, a descrição do som. Aliases aceitos: `input` (formato OpenAI) e `text`.
voicestring· bodyVoz do modelo (ex.: `Ashley` no inworld). `voice_id` também é aceito.
speednumber· bodyVelocidade da fala (0.5–2.0, conforme o modelo).
output_formatstring· bodyFormato do arquivo (padrão `mp3`).
durationnumber· bodyNos modelos de áudio generativo: duração do trecho em segundos.
asyncboolean· body`true` para o modo assíncrono — útil nos modelos de áudio, que demoram mais.
Respostas
{
"success": true,
"data": {
"urls": ["https://s3.us1-stlouis.hinow.ai/hi-storage/text_to_audio/.../fala.mp3"],
"model": "inworld/tts-1.5-max",
"category": "text_to_audio",
"cost": { "amount": 0.000728, "currency": "USD" }
}
}curl -X POST https://api.hinow.ai/v1/audio/speech \
-H "Authorization: Bearer hi_SUA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "inworld/tts-1.5-max",
"input": "Perfeito! Seu pedido foi confirmado e chega amanhã.",
"voice": "Ashley"
}'A transcrição (fala → texto) é o caminho inverso, em POST /v1/audio/transcriptions.

