Contra os modelos grandes, a comparação de preço é tão desigual que quase atrapalha: fica fácil concluir coisa errada a partir de um número. O Claude Haiku 4.5 muda isso. Ele é o modelo mais barato da Anthropic, foi feito para tarefas de alto volume e é usado, no mundo real, para exatamente o trabalho que o Jev faz.
Por isso esta é a comparação mais justa em custo deste site — e a mais interessante, porque com a distância de preço menor sobra a diferença que realmente decide: o contrato de saída.
A tarefa
Classificar um volume alto de itens curtos com um rótulo de um conjunto fechado e uma nota de gravidade. Moderação de post, triagem de mensagem, rotulagem de passagem para busca. Um item entra, dois ou três valores saem, milhões de vezes por mês.
O contrato de cada lado
| Claude Haiku 4.5 (Anthropic) | Jev (jev-1.13.0) | |
|---|---|---|
| Feito para | Texto, com foco em custo e velocidade | Decisão tipada para software |
| O que devolve | Texto; JSON se você pedir e validar | Opção, nota ou probabilidade, tipadas por construção |
| Como se lê a incerteza | Não vem por padrão; exige pedir e confiar no que voltou | Distribuição de probabilidades e confiança em Choice e Score |
| Entrada por milhão de tokens | US$ 1,00 | US$ 0,042 |
| Saída por milhão de tokens | US$ 5,00 | gratuita |
| Latência declarada | 3 a 329 segundos de ponta a ponta para modelos de fronteira, segundo a TypeSafe | 70 a 500 milissegundos, segundo a TypeSafe |
Os preços da Anthropic vêm da página oficial de preços da empresa, lidos em 18 de setembro de 2026, no nível padrão, contexto curto, sem cache e sem desconto de lote. O preço do Jev vem da documentação da TypeSafe.
A comparação usa só tokens de entrada, porque é o que o Jev cobra, e por isso é conservadora a favor do Haiku: a saída dele custa cinco vezes a entrada, e no Jev a saída é gratuita. Na entrada, a razão é de cerca de 24 vezes — a menor deste site. E, como em todas as páginas: preço não é capacidade, porque o Haiku escreve texto e o Jev só decide.
O que a TypeSafe mediu contra o Haiku
Existe uma medição pública, e ela é honesta o suficiente para citar com os dois resultados.
No cookbook oficial de autoconsistência em Choices, oito perguntas de moderação
sobre um post de fronteira foram repetidas 15 vezes em cada condição. Com a
política de devolver incerto abaixo de 0,60 de probabilidade no rótulo do
topo:
| Condição | Concordância de decisão | Devolveu incerto | Ações conflitantes |
|---|---|---|---|
| Haiku 4.5, temperatura 0 | 100% | 0% | 0 |
| Haiku 4.5, temperatura padrão | 86,7% | 0,8% | 2 |
| Jev | 99,2% | 25,8% | 0 |
O cookbook escreve, dentro do próprio gráfico, que 100% de repetibilidade não implica estar correto e que o experimento não mede acurácia. Ele também publica o desvio padrão das probabilidades: 0,0098 de média no Jev, contra 0,0012 no Haiku a temperatura 0 e de 0,0245 a 0,0543 nas outras condições de LLM.
A leitura sóbria é esta: com temperatura 0 o Haiku repete mais, e a temperatura padrão custa quase 14 pontos de concordância. O Jev não se absteve por incapacidade — ele se absteve porque o desenho lhe dá onde colocar a dúvida, e 25,8% é o tamanho da fronteira naquele post. Esse é o assunto de revisão humana.
Onde o Jev ganha
A resposta é tipada por construção, não por validação. Você define as opções na pergunta, então a saída não pode cair fora do conjunto. Com o Haiku você pede JSON, valida, trata a falha e tenta de novo.
A incerteza vem sem pedir. Choice e Score trazem a distribuição inteira e a confiança. É o que permite escrever a faixa de revisão em vez de inferir dúvida de um texto.
Perguntar mais é quase de graça. O conteúdo entra uma vez e as perguntas são avaliadas em paralelo contra ele. Com o Haiku, empilhar perguntas no mesmo prompt tem custo de qualidade conhecido.
A saída é gratuita. Em uma tarefa de classificação a saída é curta, então isso importa menos que parece — mas ainda é parte da conta em custo por decisão.
Onde o Claude Haiku 4.5 ganha
Ele escreve. Se depois de classificar você quer uma frase de resumo, uma
resposta ao usuário ou um rótulo novo que não estava na lista, o Haiku faz e o
Jev não. A documentação diz que o jev-1.13 não é treinado para gerar texto.
Ele aceita o espaço aberto. Descobrir categorias, nomear um tema que apareceu esta semana, lidar com um domínio que você ainda não modelou: tudo isso exige gerar, não escolher.
Ele repetiu mais no experimento com temperatura 0. É um resultado real, publicado pelo fornecedor concorrente, e seria desonesto esconder. Com a ressalva que o próprio cookbook faz: repetibilidade não é acurácia.
Ele aceita mais tipos de entrada. O jev-1.13 aceita texto apenas.
Ele é um fornecedor a menos. Se o time já usa Anthropic, adicionar a TypeSafe custa integração, chave, observabilidade e mais uma dependência. Com 24 vezes de diferença em um volume pequeno, essa conta pode não fechar.
A distância de custo pode não importar. Cem mil classificações de mil tokens somam 100 milhões de tokens de entrada: US$ 100 no Haiku, US$ 4,20 no Jev. Se esse delta não muda nada no seu orçamento, escolha pelo contrato de saída, não pelo preço.
Como escolher
- Se a saída é texto para uma pessoa, não é Jev.
- Se a saída é uma decisão tipada e você precisa da incerteza como número, é Jev — e este é o motivo principal, não o preço.
- Se o volume é alto o bastante para 24 vezes virar dinheiro de verdade, o preço passa a pesar também.
- Se o volume é baixo e o time já usa Anthropic, o Haiku é uma escolha defensável, e dizer o contrário seria vender alguma coisa.
Para ver a classificação com incerteza aplicada a uma tarefa, veja classificar com confiança. Para testar com um texto em português, use o playground. O índice está em comparativos.
Perguntas frequentes
Por que esta é a comparação mais justa?
Porque o Haiku 4.5 é o modelo mais barato da Anthropic e é usado para exatamente o mesmo tipo de trabalho: classificar em volume. Nos preços lidos em 18/09/2026, a entrada dele é cerca de 24 vezes a do Jev, contra 119 vezes do Opus 5. Com a distância menor, o argumento de custo deixa de dominar e a discussão fica no contrato de saída.
Quanto custa a entrada de cada um?
Nos preços de tabela lidos em 18/09/2026, o Claude Haiku 4.5 custa US$ 1,00 por milhão de tokens de entrada e US$ 5,00 por milhão de saída, segundo a página de preços da Anthropic. O Jev cobra US$ 0,042 por milhão de entrada e nada na saída, segundo a documentação da TypeSafe.
Há alguma medição pública comparando os dois?
Há uma, de repetibilidade, publicada pela TypeSafe. No cookbook de autoconsistência em Choices, o Haiku com temperatura 0 marcou 100% de concordância de decisão em 15 repetições e nunca se absteve; o Jev marcou 99,2% e devolveu incerto em 25,8% das respostas. O próprio cookbook avisa que isso mede repetibilidade, não acurácia.
Então o Haiku é mais consistente?
Naquele experimento, com temperatura 0, ele repetiu mais. Mas repetir sempre a mesma resposta não é o mesmo que estar certo, e o cookbook escreve isso dentro do próprio gráfico. Com a temperatura padrão da API, o mesmo Haiku caiu para 86,7% de concordância de política.
Quando escolher o Haiku?
Quando a saída precisa ser texto, quando a entrada não é só texto, quando você precisa de um espaço de resposta aberto, ou quando manter um fornecedor a menos vale mais que a diferença de custo e de contrato.