Há uma confusão que aparece na primeira semana de qualquer projeto com o Jev e custa caro na terceira: tratar probabilidade e confiança como sinônimos de “quanto o modelo tem certeza”. São duas grandezas diferentes, calculadas de formas diferentes, e uma delas nem existe em todas as primitivas.
O que cada uma é
Probabilidade é a aposta distribuída. Em um Choice, você recebe um valor por opção, e eles somam 1. Em um Score, um valor por nível. Em um Noul, um número só — a probabilidade de a resposta ser sim.
Confiança é uma estatística sobre a forma dessa distribuição. Concentrada em um resultado, confiança alta; espalhada entre resultados, confiança baixa. A documentação diz isso de maneira direta: a confiança colapsa a forma da distribuição em um número de 0 a 1 para você poder aplicar um limiar sem fazer a conta.
A consequência é que Choice e Score têm confiança; Noul não tem. Não é omissão, é definição: não existe forma de distribuição em um valor escalar.
| O que devolve | Tem confiança? | |
|---|---|---|
| Choice | probabilities por opção (soma 1) + choice | sim |
| Score | probabilities por nível + score + legend | sim |
| Noul | noul, de 0 a 1 | não |
Dois exemplos que mostram a diferença
Imagine um Choice com três opções. Na resposta A, as probabilidades são 0,90,
0,05 e 0,05: uma opção domina, a confiança é alta. Na resposta B, elas são 0,40,
0,35 e 0,25: a primeira opção ainda ganha, o campo choice traz o mesmo tipo de
valor, e a confiança é baixa, porque nenhuma opção se destaca.
Agora repare no que um limiar sobre a probabilidade da opção vencedora faria: em 0,40 ele reprovaria a resposta B, e em 0,35 aprovaria. Só que o número 0,40 não significa “provavelmente certo” — significa “esta opção levou a maior fatia de uma aposta dividida”. A documentação descreve a leitura correta: confiança baixa em um Choice costuma significar que nenhuma opção é vencedora clara, e em um Score que os níveis estão ambíguos, são multidimensionais, ou o state não tem o que basta.
Onde a confusão custa dinheiro
A página oficial de limites do jev-1.13 traz o caso mais instrutivo do
assunto. A mesma pergunta — “o cliente está pedindo reembolso?” — feita como
Noul e como Choice de sim e não, sobre o ticket “I’m not happy with the fit.
What are my options here?”:
Noul noul | Choice yes | Choice no | Choice confidence |
|---|---|---|---|
| 0,22 | 0,01 | 0,99 | 0,97 |
Os números comparáveis são noul e probabilities["yes"], e mesmo eles estão
longe um do outro. A documentação vai além e avisa: não é óbvio como interpretar
a confiança de um Choice aplicada a uma pergunta Noul, nem o contrário. Um
limiar ajustado em cima de um Noul não se transporta para o Choice equivalente.
O segundo caso é a negação. No ticket “I was charged twice for the same order. Can someone look into this?”, o Noul “pediu reembolso” deu 0,72 e o Noul “pediu algo diferente de reembolso” deu 0,47. A soma é 1,19. A documentação explica o motivo estrutural: um Choice é relativo — resolve qual opção — e cada Noul é absoluto, podendo ser baixo para todas. Por isso a orientação oficial é não depender de identidades aritméticas entre perguntas separadas. Essa e as outras oito arestas estão em limites do Jev.
Como cada uma vira decisão no código
Com Choice e Score, use confiança para o portão e a distribuição para o diagnóstico. O portão é o que decide agir, confirmar ou escalar — a mecânica está em roteamento por confiança. A distribuição é o que você guarda para entender depois por que a resposta saiu assim.
Com Noul, use uma banda em vez de um corte. Sem confiança, a dúvida aparece
no meio da escala. O cookbook oficial de autoconsistência ilustra devolver não
abaixo de 0,30, incerto de 0,30 a 0,70 inclusive e sim acima de 0,70,
mandando o incerto para uma pessoa. A receita avisa que a banda é ilustrativa e
não um limiar otimizado.
Com a nota de um Score, não interpole. A página de Score é explícita: os
níveis do jev-1.13 são fracos em calibração numérica. Dá para checar se a nota
passa de um limiar; não dá para reconstruir um valor exato entre dois níveis.
O que nenhuma das duas promete
Nem probabilidade nem confiança dizem que uma resposta específica está correta. A documentação repete isso em mais de um lugar: modelos System One são treinados para decisões calibradas, e a calibração é medida em grupos de previsões. O que a calibração promete é uma correspondência agregada — desfechos com 0,8 devendo acontecer cerca de 80% das vezes. Esse contrato, e o que ele significa para quem decide, está em decisões calibradas.
Vale um último aviso da própria TypeSafe: ela descreve a confiança como um
padrão conveniente que serve à maioria dos casos, e diz que a distribuição
completa vai na resposta porque, dependendo do que você avalia, outra medida
pode servir melhor. Ou seja, confidence é um atalho bom, não uma verdade
canônica.
Por onde continuar
O conceito de confiança inteiro, com as três faixas e o que cada uma faz, está em confiança. A escolha entre uma pergunta relativa e várias absolutas está em qual primitiva usar. E o vocabulário completo, em ordem alfabética, está em glossário.
Perguntas frequentes
Qual é a diferença em uma frase?
A probabilidade diz quanto o modelo aposta em cada resultado; a confiança resume, em um número de 0 a 1, o quanto essa aposta está concentrada em um resultado só.
Por que Noul não tem confiança?
Porque confiança é uma estatística calculada sobre uma distribuição, e Noul devolve um número só: a probabilidade de a resposta ser sim. A dúvida de um Noul aparece no próprio valor, quando ele fica perto do meio da escala.
Posso reaproveitar um limiar de Noul em um Choice de sim e não?
Não. A página oficial de limites do jev-1.13 mostra o mesmo ticket com noul 0,22 e, na versão Choice, 0,01 para sim, 0,99 para não e confiança 0,97. Os números não são comparáveis, e a documentação recomenda explicitamente não carregar um limiar de uma primitiva para a outra.
A soma de um Noul e da sua negação dá 1?
Não necessariamente. O exemplo oficial mostra 0,72 para 'pediu reembolso' e 0,47 para 'pediu outra coisa' no mesmo ticket, somando 1,19. Cada Noul é uma pergunta absoluta e independente, não a face de uma mesma moeda.
Confiança alta prova que a resposta está certa?
Não. A documentação diz que a calibração é medida em grupos de previsões e não garante que uma resposta individual esteja correta. Confiança alta significa distribuição concentrada, e no agregado isso corresponde a acertar mais.
Devo usar confiança ou a distribuição inteira?
Comece pela confiança, que é o atalho que a TypeSafe calcula para você. A própria documentação diz que ela é um padrão conveniente e que a distribuição completa vai na resposta justamente porque outra medida pode servir melhor ao seu caso.