Geração de imagem
Criar e editar imagens com o HiMegia: prompt, edição, texto na cena e personagem consistente.
Atualizado em 09 de ago. de 2026
O hinow/himegia cria e edita imagens a partir de uma descrição em texto. É o modelo de imagem da plataforma: respeita pedidos longos, escreve texto legível dentro da cena e mantém o mesmo personagem de uma imagem para a outra.
Ele responde em POST https://api.hinow.ai/v1/images, com a mesma chave e a mesma base URL do resto da API. O preço é por imagem — US$ 0,082, o mesmo para criar e para editar, em qualquer proporção.
Descreva a cena no prompt e escolha a proporção em parameters:
curl https://api.hinow.ai/v1/images \
-H "Authorization: Bearer $HINOW_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "hinow/himegia",
"prompt": "Uma garrafa de azeite de vidro escuro com rótulo em branco, sobre uma mesa de madeira rústica em uma cozinha, com uma janela desfocada ao fundo e uma tigela de azeitonas ao lado. Luz natural lateral, sombra definida à direita da garrafa. Fotografia de produto em ambiente, 50mm.",
"parameters": { "aspect_ratio": "1:1", "output_format": "jpeg" }
}'import os, requests
resposta = requests.post(
"https://api.hinow.ai/v1/images",
headers={"Authorization": f"Bearer {os.environ['HINOW_API_KEY']}"},
json={
"model": "hinow/himegia",
"prompt": "Uma garrafa de azeite de vidro escuro com rótulo em branco, "
"sobre uma mesa de madeira rústica em uma cozinha, com uma "
"janela desfocada ao fundo e uma tigela de azeitonas ao lado. "
"Luz natural lateral, sombra definida à direita da garrafa. "
"Fotografia de produto em ambiente, 50mm.",
"parameters": {"aspect_ratio": "1:1", "output_format": "jpeg"},
},
)
print(resposta.json()["data"]["urls"][0])A resposta traz a URL da imagem pronta e o custo da chamada:
{
"success": true,
"data": {
"urls": ["https://s3.us1-stlouis.hinow.ai/hi-storage/text_to_image/.../8c9ab329.jpg"],
"thumbnail_url": "https://s3.us1-stlouis.hinow.ai/hi-storage/text_to_image/.../8c9ab329_thumb.webp",
"model": "hinow/himegia",
"operation": "generate",
"cost": { "amount": 0.082, "currency": "USD", "value_type": "per_image" },
"metadata": { "format": "image/jpeg", "size": 236652 }
},
"request_id": "83d88c3e-6219-4efd-a6fb-6fed0df29c23"
}Três campos importam no dia a dia:
urls— a imagem gerada, servida pelo armazenamento da plataforma. Baixe e guarde do seu lado o que for para produção.operation—generatequando o modelo criou do zero;editingquando trabalhou sobre uma imagem enviada.cost— o valor exato da chamada, na própria resposta. É daqui que sai a conciliação.
Uma chamada devolve uma imagem. Para variações, dispare chamadas em paralelo — cada uma é independente.
O tempo de resposta é de outra escala
Gerar imagem leva segundos, não milissegundos — de poucos segundos em pedidos simples a trinta ou mais em cenas elaboradas. Configure timeouts generosos e, em interface, mostre o estado de progresso em vez de bloquear a tela.
A qualidade do resultado acompanha a qualidade do pedido — e a margem é grande. Um prompt de três palavras volta rápido com uma imagem genérica; a mesma ideia descrita por inteiro volta como uma composição de outra categoria, pelo mesmo preço.
Compare os dois pedidos:
um cachorroRetrato fotográfico de um border collie adulto sentado em um campo ao
entardecer, contraluz dourado recortando o pelo, olhar atento para a
esquerda do quadro, profundidade de campo rasa com bokeh de gramíneas,
lente 85mm f/1.8, textura de pelo nítida, fotografia ultra realistaO primeiro devolve um cachorro qualquer em um gramado qualquer. O segundo devolve exatamente a foto descrita: o contraluz recortando o pelo, o olhar para a esquerda, o desfoque de 85mm. O modelo lê o pedido inteiro e compõe a cena a partir dele — então o pedido é o lugar de dizer tudo o que importa.
O que um bom pedido cobre:
- O assunto e o que é obrigatório. Quantidades exatas funcionam quando ditas com ênfase: "exatamente três frascos, não mais que três".
- A luz. "Luz lateral dura vindo da esquerda, sombras longas" muda a imagem mais que qualquer adjetivo.
- O enquadramento. "Corpo inteiro, fotografada de longe", "vista aérea", "câmera em leve ângulo lateral".
- O material e a técnica. "Traço de guache com textura de papel", "render 3D com materiais fisicamente corretos", "fotografia 35mm com grão sutil".
- O que não pode aparecer. Negativas explícitas são respeitadas: "sem texto na embalagem", "sem outros objetos".
Um pedido que usa tudo isso ao mesmo tempo — contagem exata, posição, luz e negativas:
Exatamente três frascos de perfume de vidro âmbar, não mais que três,
alinhados lado a lado sobre uma superfície cinza-clara lisa e uniforme.
O frasco do meio está ligeiramente à frente dos outros dois. Exatamente
um ramo de alecrim, apenas um, caído na frente do frasco da esquerda.
Luz lateral dura vindo da esquerda, sombras longas projetadas para a
direita. Fundo cinza-claro liso, sem mármore, sem outros objetos.
Still de produto, alto contraste.Não existe um estilo fixo da geração: fotografia de produto, ilustração editorial, vetor flat, render 3D e storyboard cinematográfico saem do mesmo modelo — o estilo vem do que você descreve.
Letras nascem junto com a cena: na perspectiva da superfície, com a luz do ambiente, no material certo — inclusive em superfície curva, em ângulo e em tamanho pequeno:
Fotografia de rua realista de um muro urbano coberto de cartazes
lambe-lambe sobrepostos e rasgados. No centro, em foco, um cartaz de
show impresso em serigrafia: fundo azul-marinho com ilustração
geométrica de montanhas de inverno, o título "FESTIVAL DE INVERNO" em
tipografia bold condensada branca impressa no papel, e abaixo, em
letras menores, "12 DE JULHO - SÃO PAULO". Escreva cada palavra
exatamente como está, sem erros de ortografia. O papel tem textura
real: vincos, bolhas de cola, cantos rasgados. Luz urbana de fim de
tarde, fotografia 35mm com grão sutil, profundidade de campo rasa.Duas práticas seguram o resultado: coloque o texto entre aspas e peça que ele saia "exatamente como está, sem erros de ortografia". Além do alfabeto latino, o modelo escreve em chinês, japonês, coreano, árabe e hebraico — a mesma peça sai em vários mercados sem refazer a arte.
Boa parte do trabalho real não é criar do nada — é pegar uma imagem que existe e mudar uma coisa nela. Envie a imagem em images e escreva a instrução no prompt:
{
"model": "hinow/himegia",
"prompt": "Troque o fundo por um estúdio claro e uniforme. Mantenha a garrafa, o rótulo, a tigela de azeitonas e a sombra exatamente como estão, sem alterar nada neles.",
"images": ["https://exemplo.com/produtos/garrafa-azeite.jpg"],
"parameters": { "aspect_ratio": "1:1" }
}A regra da edição: o que você não mencionou continua como estava. A garrafa volta idêntica — mesmo rótulo, mesma tigela, mesma sombra — sobre o fundo novo. A resposta marca a operação com "operation": "editing", e o preço é o mesmo da geração.
O images aceita URL pública ou a imagem em base64 (data:), e mais de uma referência quando a cena combina elementos de origens diferentes.
Gerar uma imagem bonita é uma coisa; gerar a décima com o mesmo rosto é outra — e é aí que campanha, catálogo e narrativa costumam quebrar. Descrever a mesma pessoa duas vezes não resolve: sai alguém parecido, não a mesma pessoa.
O caminho é gerar o personagem uma vez e usar essa imagem como referência nas seguintes:
- Gere a referência — um retrato de corpo inteiro, fundo neutro, luz uniforme, com os traços que identificam a pessoa descritos com precisão (uma pinta, o tom da pele, o corte de cabelo).
- Cada nova cena é uma edição sobre ela — a referência vai em
imagese o prompt abre fixando o que não muda:
Mantenha exatamente a mesma pessoa da imagem de referência: mesmo rosto,
mesmos traços, mesma pele, a mesma pinta acima do lábio direito.
Ela [a cena nova: figurino, cenário, luz, enquadramento...]Figurino, penteado, cenário e luz mudam a cada cena; o rosto permanece. É esse o fluxo para catálogo de produto, campanha com um mesmo rosto, storyboard e material de marca.
Nove proporções, do quadrado de rede social ao ultrawide de capa — a composição já nasce no formato final, sem corte depois:
| Parâmetro | Valores | Padrão |
|---|---|---|
aspect_ratio | 1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 21:9, 9:21 | 1:1 |
output_format | jpeg, png, webp | jpeg |
num_inference_steps | 20, 25, 28, 30, 35, 40 | 28 |
guidance_scale | 1.5, 2.0, 2.5, 3.0, 3.5 | 2.5 |
Os dois últimos são ajuste fino: mais passos de inferência refinam o detalhe em troca de tempo; o guidance_scale regula o quanto a geração se prende à letra do pedido. Os padrões resolvem a grande maioria dos casos — mexa neles depois que o prompt estiver certo, não antes.
A API não valida o pedido por você
Valores de proporção fora da lista não devolvem erro — a chamada gera na proporção suportada mais próxima. E um pedido sem prompt também não é recusado: gera uma imagem qualquer e cobra por ela. Valide os dois do seu lado antes de enviar.
Cada chamada custa US$ 0,082, e pronto: gerar ou editar, prompt curto ou longo, qualquer proporção, qualquer formato. Não há cobrança por token nem tarifa por tamanho — o campo cost de cada resposta confirma o valor.
A previsibilidade muda o planejamento: mil imagens custam US$ 82,00, antes de você gerar a primeira.

