//Conceito

Probabilidade não é confiança: a diferença prática

Uma resposta com probabilidade 0,9 e outra com confiança 0,9 não dizem a mesma coisa. Uma delas nem existe em Noul.

Há uma confusão que aparece na primeira semana de qualquer projeto com o Jev e custa caro na terceira: tratar probabilidade e confiança como sinônimos de “quanto o modelo tem certeza”. São duas grandezas diferentes, calculadas de formas diferentes, e uma delas nem existe em todas as primitivas.

O que cada uma é

Probabilidade é a aposta distribuída. Em um Choice, você recebe um valor por opção, e eles somam 1. Em um Score, um valor por nível. Em um Noul, um número só — a probabilidade de a resposta ser sim.

Confiança é uma estatística sobre a forma dessa distribuição. Concentrada em um resultado, confiança alta; espalhada entre resultados, confiança baixa. A documentação diz isso de maneira direta: a confiança colapsa a forma da distribuição em um número de 0 a 1 para você poder aplicar um limiar sem fazer a conta.

A consequência é que Choice e Score têm confiança; Noul não tem. Não é omissão, é definição: não existe forma de distribuição em um valor escalar.

O que devolveTem confiança?
Choiceprobabilities por opção (soma 1) + choicesim
Scoreprobabilities por nível + score + legendsim
Noulnoul, de 0 a 1não

Dois exemplos que mostram a diferença

Imagine um Choice com três opções. Na resposta A, as probabilidades são 0,90, 0,05 e 0,05: uma opção domina, a confiança é alta. Na resposta B, elas são 0,40, 0,35 e 0,25: a primeira opção ainda ganha, o campo choice traz o mesmo tipo de valor, e a confiança é baixa, porque nenhuma opção se destaca.

Agora repare no que um limiar sobre a probabilidade da opção vencedora faria: em 0,40 ele reprovaria a resposta B, e em 0,35 aprovaria. Só que o número 0,40 não significa “provavelmente certo” — significa “esta opção levou a maior fatia de uma aposta dividida”. A documentação descreve a leitura correta: confiança baixa em um Choice costuma significar que nenhuma opção é vencedora clara, e em um Score que os níveis estão ambíguos, são multidimensionais, ou o state não tem o que basta.

Onde a confusão custa dinheiro

A página oficial de limites do jev-1.13 traz o caso mais instrutivo do assunto. A mesma pergunta — “o cliente está pedindo reembolso?” — feita como Noul e como Choice de sim e não, sobre o ticket “I’m not happy with the fit. What are my options here?”:

Noul noulChoice yesChoice noChoice confidence
0,220,010,990,97

Os números comparáveis são noul e probabilities["yes"], e mesmo eles estão longe um do outro. A documentação vai além e avisa: não é óbvio como interpretar a confiança de um Choice aplicada a uma pergunta Noul, nem o contrário. Um limiar ajustado em cima de um Noul não se transporta para o Choice equivalente.

O segundo caso é a negação. No ticket “I was charged twice for the same order. Can someone look into this?”, o Noul “pediu reembolso” deu 0,72 e o Noul “pediu algo diferente de reembolso” deu 0,47. A soma é 1,19. A documentação explica o motivo estrutural: um Choice é relativo — resolve qual opção — e cada Noul é absoluto, podendo ser baixo para todas. Por isso a orientação oficial é não depender de identidades aritméticas entre perguntas separadas. Essa e as outras oito arestas estão em limites do Jev.

Como cada uma vira decisão no código

Com Choice e Score, use confiança para o portão e a distribuição para o diagnóstico. O portão é o que decide agir, confirmar ou escalar — a mecânica está em roteamento por confiança. A distribuição é o que você guarda para entender depois por que a resposta saiu assim.

Com Noul, use uma banda em vez de um corte. Sem confiança, a dúvida aparece no meio da escala. O cookbook oficial de autoconsistência ilustra devolver não abaixo de 0,30, incerto de 0,30 a 0,70 inclusive e sim acima de 0,70, mandando o incerto para uma pessoa. A receita avisa que a banda é ilustrativa e não um limiar otimizado.

Com a nota de um Score, não interpole. A página de Score é explícita: os níveis do jev-1.13 são fracos em calibração numérica. Dá para checar se a nota passa de um limiar; não dá para reconstruir um valor exato entre dois níveis.

O que nenhuma das duas promete

Nem probabilidade nem confiança dizem que uma resposta específica está correta. A documentação repete isso em mais de um lugar: modelos System One são treinados para decisões calibradas, e a calibração é medida em grupos de previsões. O que a calibração promete é uma correspondência agregada — desfechos com 0,8 devendo acontecer cerca de 80% das vezes. Esse contrato, e o que ele significa para quem decide, está em decisões calibradas.

Vale um último aviso da própria TypeSafe: ela descreve a confiança como um padrão conveniente que serve à maioria dos casos, e diz que a distribuição completa vai na resposta porque, dependendo do que você avalia, outra medida pode servir melhor. Ou seja, confidence é um atalho bom, não uma verdade canônica.

Por onde continuar

O conceito de confiança inteiro, com as três faixas e o que cada uma faz, está em confiança. A escolha entre uma pergunta relativa e várias absolutas está em qual primitiva usar. E o vocabulário completo, em ordem alfabética, está em glossário.

Perguntas frequentes

Qual é a diferença em uma frase?

A probabilidade diz quanto o modelo aposta em cada resultado; a confiança resume, em um número de 0 a 1, o quanto essa aposta está concentrada em um resultado só.

Por que Noul não tem confiança?

Porque confiança é uma estatística calculada sobre uma distribuição, e Noul devolve um número só: a probabilidade de a resposta ser sim. A dúvida de um Noul aparece no próprio valor, quando ele fica perto do meio da escala.

Posso reaproveitar um limiar de Noul em um Choice de sim e não?

Não. A página oficial de limites do jev-1.13 mostra o mesmo ticket com noul 0,22 e, na versão Choice, 0,01 para sim, 0,99 para não e confiança 0,97. Os números não são comparáveis, e a documentação recomenda explicitamente não carregar um limiar de uma primitiva para a outra.

A soma de um Noul e da sua negação dá 1?

Não necessariamente. O exemplo oficial mostra 0,72 para 'pediu reembolso' e 0,47 para 'pediu outra coisa' no mesmo ticket, somando 1,19. Cada Noul é uma pergunta absoluta e independente, não a face de uma mesma moeda.

Confiança alta prova que a resposta está certa?

Não. A documentação diz que a calibração é medida em grupos de previsões e não garante que uma resposta individual esteja correta. Confiança alta significa distribuição concentrada, e no agregado isso corresponde a acertar mais.

Devo usar confiança ou a distribuição inteira?

Comece pela confiança, que é o atalho que a TypeSafe calcula para você. A própria documentação diz que ela é um padrão conveniente e que a distribuição completa vai na resposta justamente porque outra medida pode servir melhor ao seu caso.

Quer dominar decisões com IA em português? O curso da comunidade está em pré-venda.

Garantir pré-venda por R$ 499,00

Pré-venda: R$ 499,00 · Após o lançamento: R$ 799,00