Preços
Quanto custa cada modelo, por milhão de tokens, e como estimar o custo de uma carga real.
Atualizado em 10 de ago. de 2026
Os modelos de texto são cobrados pelo número de tokens processados. Tokens de entrada incluem as instruções, mensagens e demais conteúdos enviados; tokens de saída correspondem ao que o modelo gera. Os valores abaixo estão em dólar por 1 milhão de tokens.
Nem tudo é cobrado assim: imagem sai por unidade gerada, áudio por minuto e embedding só pela entrada. Cada caso tem a sua seção nesta página.
| Modelo | Entrada | Saída |
|---|---|---|
hinow/himax | US$ 2,26 | US$ 9,00 |
hinow/hinova | US$ 0,69 | US$ 7,49 |
hinow/higenesis | US$ 0,22 | US$ 0,98 |
Consulte o catálogo em produção
Preços e disponibilidade podem mudar. Use GET https://api.hinow.ai/v1/models para ler o valor vigente e as modalidades liberadas para a sua conta.
| Modelo | Entrada | Saída | Especialidade |
|---|---|---|---|
hinow/hivision | US$ 1,00 | US$ 3,00 | Leitura de imagem dedicada |
hinow/hicode | US$ 0,49 | US$ 5,48 | Geração e transformação de código |
O hinow/hivision é indicado quando a entrada é predominantemente visual. O hinow/hicode é uma opção especializada para automações de código. Compare os dois com os modelos HINOW de uso geral quando a tarefa combinar texto, regras de negócio e código.
| Modelo | Preço | Cobrança |
|---|---|---|
hinow/himegia | US$ 0,082 por imagem | Por imagem gerada ou editada |
O hinow/himegia cobra por imagem, não por token: US$ 0,082 — o mesmo valor para criar e para editar, com prompt curto ou longo, em qualquer proporção e formato. Cada resposta do POST https://api.hinow.ai/v1/images traz o campo cost com o valor exato da chamada. O uso guiado está em Geração de imagem.
| Modelo | Preço | Cobrança |
|---|---|---|
hinow/hiembed | US$ 0,05 por 1M de tokens | Só entrada |
O hinow/hiembed cobra apenas a entrada: US$ 0,05 por milhão de tokens. Não há preço de saída porque o que volta é um vetor, não texto gerado — na resposta, usage traz prompt_tokens e nada de completion_tokens.
A conta pende para a indexação, não para a busca: vetorizar 2 milhões de tokens custa US$ 0,10, uma vez; depois disso cada consulta custa só o embedding da pergunta — uma frase de 10 tokens sai por US$ 0,0000005. O uso guiado está em Embeddings.
| Modelo | Preço | Cobrança |
|---|---|---|
hinow/hivox | US$ 0,05 por minuto | Proporcional à duração do áudio |
O hinow/hivox cobra por duração, não por token: US$ 0,05 por minuto de áudio, o mesmo valor para qualquer formato e qualquer idioma falado. A resposta traz duration em segundos, e é dele que sai a conta, proporcional — 8,54 segundos custaram US$ 0,0071.
Na ordem de grandeza que importa ao planejar: uma reunião de uma hora custa US$ 3,00; cem chamadas de atendimento de cinco minutos, US$ 25,00. O uso guiado está em Transcrição de áudio.
A disponibilidade pode variar por conta. Consulte o catálogo em tempo de execução para obter os identificadores, modalidades, endpoints e preços atualmente disponíveis:
curl https://api.hinow.ai/v1/models \
-H "Authorization: Bearer $HINOW_API_KEY"{
"data": [
{
"id": "hinow/himax",
"category": ["text_to_text"],
"cost": { "type": "mtoken", "input": 2.26, "output": 9 },
"endpoint": "/v1/chat/completions"
}
]
}O preço vigente vem na API
O GET https://api.hinow.ai/v1/models devolve cost.input e cost.output por milhão de tokens para cada modelo. Use esses campos em calculadoras, painéis de consumo e seletores de modelo para evitar uma cópia desatualizada da tabela.
O custo de uma chamada é tokens de entrada × preço de entrada + tokens de saída × preço de saída. As respostas de Chat Completions incluem usage com as duas contagens. Registre esse campo para medir o custo real de cada fluxo:
"usage": { "prompt_tokens": 132, "completion_tokens": 60, "total_tokens": 192 }Nesse exemplo, a chamada ao hinow/hinova custa 132 × 0,69/1M + 60 × 7,49/1M, aproximadamente US$ 0,00054. Em streaming, consuma o fluxo até o evento final para registrar o usage retornado pela API.
- Use o modelo adequado à tarefa. Comece com HiNova, meça a qualidade e migre para HiMax ou HiGenesis quando o resultado justificar a troca.
- Defina o tamanho esperado. Uma instrução como “responda em até 60 palavras” orienta o estilo e reduz saídas desnecessariamente longas. Valide o limite na aplicação quando ele for obrigatório.
- Reduza o histórico. Em conversas longas, cada chamada reenvia mensagens anteriores. Resuma ou remova turnos que não alteram mais a resposta.
max_tokenscomo rede de segurança. Ele corta no meio da frase (finish_reason: "length"), então use-o como teto operacional, não como única forma de controlar o tamanho.
Qual modelo para qual tarefa
Os pontos fortes de cada modelo e onde cada um rende mais.

