Ir para o conteúdo

Avaliação de modelos

Compare modelos e prompts com casos reais e critérios mensuráveis.

Atualizado em 09 de ago. de 2026

A melhor escolha depende da sua aplicação. Uma avaliação reúne entradas representativas, uma definição objetiva de sucesso e medições operacionais para comparar modelos e versões de prompt.

Monte um conjunto representativo

  • Casos comuns que concentram o volume.
  • Casos difíceis em que o erro tem maior impacto.
  • Entradas incompletas, ambíguas ou fora do escopo.
  • Casos de segurança, permissão e formato obrigatório.
  • Exemplos recentes, sem dados pessoais desnecessários.
DimensãoExemplos
QualidadeCorreção, cobertura, aderência às fontes e utilidade
FormatoJSON válido, campos obrigatórios, limites e idioma
OperaçãoTempo de resposta, falhas, tentativas e tokens
NegócioResolução, revisão humana e custo por tarefa concluída
  1. 1

    Crie uma linha de base

    Registre o resultado do modelo e do prompt usados hoje.

  2. 2

    Mude uma variável por vez

    Compare modelos com o mesmo prompt ou prompts com o mesmo modelo.

  3. 3

    Revise amostras

    Combine verificações automáticas e revisão humana.

  4. 4

    Monitore em produção

    Acompanhe qualidade, custo e falhas; atualize o conjunto com novos casos.

Benchmarks gerais não substituem seus dados

Use resultados externos para formar hipóteses. A decisão de produção deve refletir entradas, critérios e riscos do seu negócio.

Escolha os candidatos

Selecione os modelos que entrarão na avaliação.