“Mas funciona em português?” É a primeira pergunta de todo time brasileiro diante de uma ferramenta de IA. Foi a primeira que nos ocorreu ao ler o anúncio do Jev, e é a razão de este site existir. Esta página documenta como respondemos a ela — com metodologia aberta e números reais, não com impressões.
Por que a pergunta importa
A documentação oficial do Jev é escrita em inglês primeiro. Os exemplos são ingleses, os guias são ingleses e o produto está em acesso antecipado, o que significa que a maioria dos relatos públicos vem de quem testa em inglês. Para um time no Brasil, adotar uma peça dessas no meio do fluxo de produção exige saber uma coisa simples: texto brasileiro de verdade recebe decisões calibradas?
A aposta da TypeSafe é que sim — o modelo avalia o state que você enviar, no
idioma que você enviar, e as perguntas (as instructions) também podem ser escritas
em português. Mas aposta do fabricante é ponto de partida, não resposta. Nenhuma
avaliação pública por idioma foi divulgada até onde lemos. A lacuna é nossa de
preencher.
Há também o lado econômico. Se o Jev funciona bem com tickets de suporte, avaliações de produto e comentários brasileiros, setores inteiros ganham uma ferramenta de triagem barata e rápida. Se não funciona, é melhor saber antes de escrever uma linha de integração. Por isso testamos antes de opinar.
Nossa metodologia
O protocolo é deliberadamente simples e reproduzível:
- Estado fixo em português. Usamos quatro textos de referência, escritos à mão para parecerem casos reais: um ticket de suporte, uma avaliação de produto, um lead de vendas e um comentário para moderação. Os quatro estão no playground para você rodar com um clique.
- Perguntas fixas em português. As mesmas seis perguntas em toda execução: duas Choice (categoria e sentimento), duas Noul (quer cancelar? menciona prazo?) e duas Score (urgência e risco de churn), todas definidas com critérios em português.
- Uma única chamada. As seis perguntas vão juntas na mesma requisição, como a documentação recomenda — avaliadas em paralelo e isoladas entre si.
- Medição no servidor. A latência é cronometrada entre o servidor chamar a API oficial e receber a resposta. O número de tokens de entrada e o custo estimado em reais vêm junto, calculados com os preços públicos.
- Registro de probabilidades e confiança. Para cada pergunta, guardamos a distribuição de probabilidade completa e o valor de confiança. Estabilidade entre execuções repetidas faz parte do registro — decisões iguais para entradas iguais é parte do que estamos verificando.
Nada disso é científico no sentido de paper. É engenharia de avaliação: entrada fixa, saída medida, diferença explicada. Quando um resultado surpreender, o caminho é repetir a execução e investigar — não descartar.
A demo ao vivo: teste você mesmo
O nosso playground roda exatamente o protocolo acima. Você escolhe um dos quatro textos de referência (ou cola o seu), clica em analisar e vê as seis decisões com barras de probabilidade, medidores de 0 a 1, cartões de nota com confiança, a latência medida no servidor, os tokens de entrada e o custo estimado em reais.
A diferença entre o playground e esta página é o registro: lá é uma execução, aqui é a série. A página de primitivas explica o que cada tipo de pergunta devolve e por que as probabilidades importam tanto.
Resultados ao vivo
Execução de 2026-09-18, com as mesmas seis perguntas que o playground envia: duas de Choice, duas de Noul e duas de Score, todas escritas em português. A latência é o tempo de ida e volta medido por quem chamou, portanto inclui a rede. Nenhum número desta seção foi escrito sem vir de uma execução real.
Suporte técnico com pressa
802 msBoa tarde. Fiz a atualização ontem e agora o sistema não abre mais, dá erro de conexão. Sou cliente há três anos e nunca vi isso. Preciso de uma solução hoje porque a equipe toda está parada.
- Categoria
- Dúvida técnica 100% confiança 100%
- Sentimento
- Negativo (100%)
- Menciona prazo
- 0,98
- Urgência
- 3,98 de 5 confiança 0,98
- Risco de churn
- 2,23 de 5
Categoria e sentimento sem dúvida, prazo quase certo e urgência alta — o texto diz “hoje” e “equipe parada”.
Elogio espontâneo
758 msGente, só passando para agradecer! O suporte de vocês resolveu meu problema em dez minutos e a moça foi super atenciosa. Recomendei para dois colegas de trabalho.
- Categoria
- Elogio 100% confiança 100%
- Sentimento
- Positivo (100%)
- Menciona prazo
- 0,43
- Urgência
- 0,00 de 5 confiança 1,00
- Risco de churn
- 0,00 de 5
Urgência e churn no zero absoluto, com confiança máxima. É o tipo de mensagem que um sistema pode arquivar sem fila.
Cobrança indevida com menção ao Procon
270 msA fatura deste mês veio com um valor que não reconheço e ninguém me explica de onde vem essa diferença. Quero o estorno da cobrança indevida ou vou registrar reclamação no Procon.
- Categoria
- Cobrança 100% confiança 100%
- Sentimento
- Negativo (100%)
- Menciona prazo
- 0,20
- Urgência
- 2,62 de 5 confiança 0,63
- Risco de churn
- 3,13 de 5
A ameaça de Procon subiu o churn para 3,13, mas a pergunta de cancelamento ficou baixa (0,17): o modelo separou “reclamar” de “cancelar”. A confiança de 0,63 na urgência é o aviso de que esse caso merece regra própria.
Ironia brasileira
538 msAh, perfeito, mais uma semana esperando o retorno de vocês. Nota dez para o atendimento, viu? Nunca vi tanta eficiência na minha vida.
- Categoria
- Outro 79% confiança 72%
- Sentimento
- Negativo (98%)
- Menciona prazo
- 0,25
- Urgência
- 0,77 de 5 confiança 0,49
- Risco de churn
- 2,39 de 5
O teste mais interessante: “nota dez” e “tanta eficiência” são elogios literais, e o modelo marcou sentimento negativo com 98%. A ironia passou. Em troca, a categoria ficou em “Outro” com 79% e confiança 0,72 — ele viu que o texto não encaixa bem em nenhuma categoria da lista, e disse isso no número.
Regionalismo e fala coloquial
377 msOxe, baixei o aplicativo e num abre de jeito nenhum, fica só rodando aquela bolinha. Meu celular é simples mas os outros apps abrem tudo direitinho. Dá uma força aí, por favor.
- Categoria
- Dúvida técnica 100% confiança 100%
- Sentimento
- Negativo (100%)
- Menciona prazo
- 0,14
- Urgência
- 2,38 de 5 confiança 0,70
- Risco de churn
- 2,08 de 5
“Oxe”, “num abre” e “aquela bolinha” não apareceram em nenhuma descrição das opções, e a classificação saiu com 100%. O português informal do Brasil não confundiu o modelo neste caso.
Quando a chave de acesso estiver ativa, esta seção passa a exibir a tabela com: latência média e máxima observada por execução, distribuição de probabilidade das seis perguntas para cada texto de referência, valores de confiança e custo por análise em reais. Cada linha carrega a data da execução.
O que já sabemos sem executar
Três coisas são verificáveis hoje, sem chave de API:
- O formato de entrada aceita
stateeinstructionsem qualquer idioma — não há parâmetro de idioma na API oficial, o texto simplesmente vai. - Os preços são por token, não por idioma: US$ 0,042 por milhão de tokens de entrada e saída gratuita, segundo os números publicados pela TypeSafe. O custo em reais não depende do idioma do texto.
- As três primitivas são simétricas para qualquer idioma: a garantia de tipo vale porque as saídas possíveis são definidas na pergunta, não porque o texto é inglês.
O que ninguém pode afirmar sem executar é a calibração com texto em português: se as probabilidades ficam concentradas e estáveis como nos exemplos da documentação. É exatamente isso que a seção acima vai medir.
Perguntas frequentes
O Jev entende português?
O state pode ser texto em qualquer idioma, inclusive português, e as instruções das perguntas também aceitam português. O que ainda não existe publicamente é uma avaliação oficial do desempenho por idioma — por isso este site mantém testes próprios.
Quando os resultados ao vivo saem?
Assim que o acesso à API estiver configurado neste site. A seção de resultados ao vivo desta página já está reservada e marcada no código; nenhum número será publicado sem vir de uma execução real.
Como vocês testam?
Enviamos o mesmo state em português com as mesmas seis perguntas pela API oficial, medimos a latência no servidor e registramos probabilidades e confiança de cada resposta. O mesmo conjunto roda no playground para você conferir.
Por que testar em português se a documentação é em inglês?
Porque a documentação não mede o que interessa ao time brasileiro: se textos reais em português — tickets, avaliações, comentários — recebem decisões calibradas e estáveis. Isso só se responde executando.