Ir para o conteúdo

Geração de imagem

Criar e editar imagens com o HiMegia: prompt, edição, texto na cena e personagem consistente.

Atualizado em 09 de ago. de 2026

O hinow/himegia cria e edita imagens a partir de uma descrição em texto. É o modelo de imagem da plataforma: respeita pedidos longos, escreve texto legível dentro da cena e mantém o mesmo personagem de uma imagem para a outra.

Ele responde em POST https://api.hinow.ai/v1/images, com a mesma chave e a mesma base URL do resto da API. O preço é por imagem — US$ 0,082, o mesmo para criar e para editar, em qualquer proporção.

A primeira imagem

Descreva a cena no prompt e escolha a proporção em parameters:

curl https://api.hinow.ai/v1/images \
  -H "Authorization: Bearer $HINOW_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hinow/himegia",
    "prompt": "Uma garrafa de azeite de vidro escuro com rótulo em branco, sobre uma mesa de madeira rústica em uma cozinha, com uma janela desfocada ao fundo e uma tigela de azeitonas ao lado. Luz natural lateral, sombra definida à direita da garrafa. Fotografia de produto em ambiente, 50mm.",
    "parameters": { "aspect_ratio": "1:1", "output_format": "jpeg" }
  }'
O resultado: a janela desfocada, a tigela, a sombra à direita — a cena inteira do pedido.

A resposta traz a URL da imagem pronta e o custo da chamada:

{
  "success": true,
  "data": {
    "urls": ["https://s3.us1-stlouis.hinow.ai/hi-storage/text_to_image/.../8c9ab329.jpg"],
    "thumbnail_url": "https://s3.us1-stlouis.hinow.ai/hi-storage/text_to_image/.../8c9ab329_thumb.webp",
    "model": "hinow/himegia",
    "operation": "generate",
    "cost": { "amount": 0.082, "currency": "USD", "value_type": "per_image" },
    "metadata": { "format": "image/jpeg", "size": 236652 }
  },
  "request_id": "83d88c3e-6219-4efd-a6fb-6fed0df29c23"
}

Três campos importam no dia a dia:

  • urls — a imagem gerada, servida pelo armazenamento da plataforma. Baixe e guarde do seu lado o que for para produção.
  • operationgenerate quando o modelo criou do zero; editing quando trabalhou sobre uma imagem enviada.
  • cost — o valor exato da chamada, na própria resposta. É daqui que sai a conciliação.

Uma chamada devolve uma imagem. Para variações, dispare chamadas em paralelo — cada uma é independente.

O tempo de resposta é de outra escala

Gerar imagem leva segundos, não milissegundos — de poucos segundos em pedidos simples a trinta ou mais em cenas elaboradas. Configure timeouts generosos e, em interface, mostre o estado de progresso em vez de bloquear a tela.

Descreva a cena inteira

A qualidade do resultado acompanha a qualidade do pedido — e a margem é grande. Um prompt de três palavras volta rápido com uma imagem genérica; a mesma ideia descrita por inteiro volta como uma composição de outra categoria, pelo mesmo preço.

Compare os dois pedidos:

prompt-vago.txt
um cachorro
prompt-completo.txt
Retrato fotográfico de um border collie adulto sentado em um campo ao
entardecer, contraluz dourado recortando o pelo, olhar atento para a
esquerda do quadro, profundidade de campo rasa com bokeh de gramíneas,
lente 85mm f/1.8, textura de pelo nítida, fotografia ultra realista

O primeiro devolve um cachorro qualquer em um gramado qualquer. O segundo devolve exatamente a foto descrita: o contraluz recortando o pelo, o olhar para a esquerda, o desfoque de 85mm. O modelo lê o pedido inteiro e compõe a cena a partir dele — então o pedido é o lugar de dizer tudo o que importa.

O que um bom pedido cobre:

  • O assunto e o que é obrigatório. Quantidades exatas funcionam quando ditas com ênfase: "exatamente três frascos, não mais que três".
  • A luz. "Luz lateral dura vindo da esquerda, sombras longas" muda a imagem mais que qualquer adjetivo.
  • O enquadramento. "Corpo inteiro, fotografada de longe", "vista aérea", "câmera em leve ângulo lateral".
  • O material e a técnica. "Traço de guache com textura de papel", "render 3D com materiais fisicamente corretos", "fotografia 35mm com grão sutil".
  • O que não pode aparecer. Negativas explícitas são respeitadas: "sem texto na embalagem", "sem outros objetos".

Um pedido que usa tudo isso ao mesmo tempo — contagem exata, posição, luz e negativas:

prompt.txt
Exatamente três frascos de perfume de vidro âmbar, não mais que três,
alinhados lado a lado sobre uma superfície cinza-clara lisa e uniforme.
O frasco do meio está ligeiramente à frente dos outros dois. Exatamente
um ramo de alecrim, apenas um, caído na frente do frasco da esquerda.
Luz lateral dura vindo da esquerda, sombras longas projetadas para a
direita. Fundo cinza-claro liso, sem mármore, sem outros objetos.
Still de produto, alto contraste.
Três frascos, um ramo, a luz da esquerda: cada cláusula do pedido está na imagem.

Não existe um estilo fixo da geração: fotografia de produto, ilustração editorial, vetor flat, render 3D e storyboard cinematográfico saem do mesmo modelo — o estilo vem do que você descreve.

Texto dentro da imagem

Letras nascem junto com a cena: na perspectiva da superfície, com a luz do ambiente, no material certo — inclusive em superfície curva, em ângulo e em tamanho pequeno:

prompt.txt
Fotografia de rua realista de um muro urbano coberto de cartazes
lambe-lambe sobrepostos e rasgados. No centro, em foco, um cartaz de
show impresso em serigrafia: fundo azul-marinho com ilustração
geométrica de montanhas de inverno, o título "FESTIVAL DE INVERNO" em
tipografia bold condensada branca impressa no papel, e abaixo, em
letras menores, "12 DE JULHO - SÃO PAULO". Escreva cada palavra
exatamente como está, sem erros de ortografia. O papel tem textura
real: vincos, bolhas de cola, cantos rasgados. Luz urbana de fim de
tarde, fotografia 35mm com grão sutil, profundidade de campo rasa.
As letras nascem impressas no papel: na perspectiva do cartaz, com os vincos e a luz da cena.

Duas práticas seguram o resultado: coloque o texto entre aspas e peça que ele saia "exatamente como está, sem erros de ortografia". Além do alfabeto latino, o modelo escreve em chinês, japonês, coreano, árabe e hebraico — a mesma peça sai em vários mercados sem refazer a arte.

Edição sobre a sua imagem

Boa parte do trabalho real não é criar do nada — é pegar uma imagem que existe e mudar uma coisa nela. Envie a imagem em images e escreva a instrução no prompt:

{
  "model": "hinow/himegia",
  "prompt": "Troque o fundo por um estúdio claro e uniforme. Mantenha a garrafa, o rótulo, a tigela de azeitonas e a sombra exatamente como estão, sem alterar nada neles.",
  "images": ["https://exemplo.com/produtos/garrafa-azeite.jpg"],
  "parameters": { "aspect_ratio": "1:1" }
}
A garrafa da primeira chamada, editada: fundo novo; garrafa, rótulo, tigela e sombra intactos.

A regra da edição: o que você não mencionou continua como estava. A garrafa volta idêntica — mesmo rótulo, mesma tigela, mesma sombra — sobre o fundo novo. A resposta marca a operação com "operation": "editing", e o preço é o mesmo da geração.

O images aceita URL pública ou a imagem em base64 (data:), e mais de uma referência quando a cena combina elementos de origens diferentes.

O mesmo personagem em todas as cenas

Gerar uma imagem bonita é uma coisa; gerar a décima com o mesmo rosto é outra — e é aí que campanha, catálogo e narrativa costumam quebrar. Descrever a mesma pessoa duas vezes não resolve: sai alguém parecido, não a mesma pessoa.

O caminho é gerar o personagem uma vez e usar essa imagem como referência nas seguintes:

  1. Gere a referência — um retrato de corpo inteiro, fundo neutro, luz uniforme, com os traços que identificam a pessoa descritos com precisão (uma pinta, o tom da pele, o corte de cabelo).
  2. Cada nova cena é uma edição sobre ela — a referência vai em images e o prompt abre fixando o que não muda:
A referência: fundo neutro, luz uniforme e os traços que identificam a pessoa.
prompt-da-cena.txt
Mantenha exatamente a mesma pessoa da imagem de referência: mesmo rosto,
mesmos traços, mesma pele, a mesma pinta acima do lábio direito.

Ela [a cena nova: figurino, cenário, luz, enquadramento...]
Uma das cenas geradas a partir da referência: feira de rua, lenço no cabelo — o mesmo rosto.

Figurino, penteado, cenário e luz mudam a cada cena; o rosto permanece. É esse o fluxo para catálogo de produto, campanha com um mesmo rosto, storyboard e material de marca.

Proporções, formatos e parâmetros

Nove proporções, do quadrado de rede social ao ultrawide de capa — a composição já nasce no formato final, sem corte depois:

ParâmetroValoresPadrão
aspect_ratio1:1, 16:9, 9:16, 4:3, 3:4, 3:2, 2:3, 21:9, 9:211:1
output_formatjpeg, png, webpjpeg
num_inference_steps20, 25, 28, 30, 35, 4028
guidance_scale1.5, 2.0, 2.5, 3.0, 3.52.5

Os dois últimos são ajuste fino: mais passos de inferência refinam o detalhe em troca de tempo; o guidance_scale regula o quanto a geração se prende à letra do pedido. Os padrões resolvem a grande maioria dos casos — mexa neles depois que o prompt estiver certo, não antes.

Composição em 21:9: a cena já nasce panorâmica, sem corte depois.

A API não valida o pedido por você

Valores de proporção fora da lista não devolvem erro — a chamada gera na proporção suportada mais próxima. E um pedido sem prompt também não é recusado: gera uma imagem qualquer e cobra por ela. Valide os dois do seu lado antes de enviar.

Quanto custa

Cada chamada custa US$ 0,082, e pronto: gerar ou editar, prompt curto ou longo, qualquer proporção, qualquer formato. Não há cobrança por token nem tarifa por tamanho — o campo cost de cada resposta confirma o valor.

A previsibilidade muda o planejamento: mil imagens custam US$ 82,00, antes de você gerar a primeira.

Próximos passos