Boa parte do valor da documentação do Jev não está nas páginas de conceito: está nos cookbooks. São dezoito experimentos executados, com código, números e gráficos. Traduzimos treze como receitas e transformamos dois em padrões de arquitetura, porque descrevem uma forma e não uma tarefa.
Este texto é um panorama editorial: o que esse conjunto prova, onde ele é honesto e o que a escolha de publicar fracassos diz sobre a maturidade da documentação. O índice traduzido está em receitas.
Os ganhos grandes, e o que sustenta cada um
Perguntas paralelas. O experimento mais citado e o de mecanismo mais
simples: treze perguntas sobre um artigo longo, em uma chamada ou em treze.
Resultado publicado: 12,2 vezes mais barato e 10,0 vezes mais rápido, sem
mudança nas respostas. Ele não prova que o modelo é bom; prova que a
arquitetura do produto cobra o state uma vez. Em
perguntas paralelas.
Reordenação de busca. Quarenta consultas jurídicas, listas de trinta candidatos montadas por BM25 sobre 3.565 passagens. A acurácia em primeiro lugar foi de 5% para 18%, e entre os dez primeiros de 38% para 62%. O detalhe honesto do cookbook: a passagem correta estava entre as trinta em 100% das consultas, ou seja, a camada de baixo fez o trabalho dela e a reordenação atacou um topo realmente ruim. Em reranking de busca.
Busca linha a linha. 218 ids de linha pontuados em uma requisição. A lição que ficou não é o desempenho: é a separação entre “esta linha é a mais parecida” e “o documento contém resposta”. Uma consulta sobre arbitragem recebeu existência 0,14 enquanto a melhor linha marcava 0,86 de relevância. Em busca linha a linha.
A receita que publica o próprio estrago
A de escolha de skill é a mais interessante do conjunto inteiro, e é a que mais respeito merece.
A tarefa: escolher no máximo uma skill entre as 182 do catálogo Hermes da Nous Research, para um turno de agente. A avaliação usou 488 pedidos.
Os números principais são bons. O agente sozinho errava a skill em 16,8% dos casos e carregava skill desnecessária em 9,8%; com a sugestão, isso caiu para 7,3% e 4,0% — cerca de 2,3 e 2,4 vezes menos.
E aí vêm os três números que quase nenhuma documentação publicaria:
- Dos 315 pedidos cobertos por alguma skill, a sugestão corrigiu 37 e estragou 7. O ganho é líquido, e o estrago é nomeado.
- Existe um piso. Injetando a resposta correta à mão, o erro não vai a zero: fica em 2,5% e 1,2%. Ou seja, parte do problema não é do seletor, é do agente.
- Um caso concreto de falha. Um pedido para publicar no Mastodon, sem skill correspondente no catálogo, ainda recebeu a sugestão da skill de outra rede social, com encaixe 0,56.
Publicar o piso de erro é o gesto mais incomum dos três. Ele impede o leitor de atribuir ao produto uma melhoria que pertence a outra parte do sistema. A tradução está em escolher skill de agente.
Outras honestidades espalhadas pelo conjunto
A cascata de extração publica resultados internos sobre 100 prompts e diz, no mesmo parágrafo, que o gráfico é um retrato histórico cujos custos não foram recalculados na taxa atual do Jev. Virou padrão em cascata de extração.
As duas receitas de autoconsistência medem repetibilidade e avisam, dentro do próprio gráfico, que 100% de repetibilidade não implica estar correto. Uma delas mostra um concorrente à frente: Claude Haiku 4.5 a temperatura 0 marcou 100% de concordância contra 99,2% do Jev. Está em Jev vs Claude Haiku 4.5.
A receita de recuperação de estrutura conta uma troca de redação que mudou tudo: com a pergunta “as duas linhas são do mesmo parágrafo”, todos os itens de lista sem marcador passaram de 0,75 e as listas colapsaram em 12 blocos; com “esta linha continua a frase”, os mesmos itens ficaram entre 0,05 e 0,22 e a estrutura saiu certa, com 17 blocos. É o melhor argumento existente a favor de critérios que separam.
Onde as fontes se contradizem
Um panorama honesto precisa registrar isto também, e nós registramos em vez de escolher o número mais bonito.
Perguntas paralelas. A página de primitivas cita 11,5 vezes mais barato e 9,6 vezes mais rápido; a receita publica 12,2 e 10,0. Usamos os números da receita e dizemos de onde vêm.
Recuperação de estrutura. O código do cookbook imprime US$ 0,0003 para a execução, e o texto do mesmo cookbook afirma US$ 0,0015 em dois lugares. Citamos o valor impresso pelo código e anotamos a divergência.
Versão do modelo. Vários cookbooks declaram rodar no jev-1.12, enquanto a
versão atual é jev-1.13.0. Quando o cookbook declara a versão, nós a citamos
junto com o número.
Nada disso desqualifica a documentação. São sinais de material escrito por gente, revisado em ritmo de produto novo. O que importa é que as duas versões estão públicas e dá para conferir.
O que o conjunto diz sobre a maturidade
Três leituras.
A documentação aposta em experimento, não em promessa. Dezoito cookbooks com código executado é um jeito caro de documentar e um jeito difícil de mentir.
Ela assume a fronteira. Somada à página de falhas declaradas — comentada em um fabricante que publica os próprios defeitos — a impressão é de um produto que prefere filtrar a venda a inflar a expectativa.
Ela ainda é jovem. As divergências de número entre páginas, a mistura de versões e a ausência de qualquer avaliação por idioma mostram material em construção. Foi por causa da última lacuna que este site existe, e a nossa tentativa de preencher parte dela está em português.
O índice do blog está em blog.
Perguntas frequentes
Quantas receitas oficiais existem?
O índice oficial lista 18 cookbooks. Nós traduzimos e comentamos treze como receitas, e transformamos duas em padrões de arquitetura — cascata de extração e beam search hierárquico — porque descrevem uma forma, não uma tarefa.
Qual receita mostra o maior ganho?
A de perguntas paralelas: 12,2 vezes mais barato e 10,0 vezes mais rápido ao juntar 13 perguntas numa chamada em vez de 13 chamadas, sem mudança nas respostas. A de reordenação também é forte: acurácia em primeiro lugar de 5% para 18%.
Alguma receita admite fracasso?
Sim, e mais de uma. A de escolha de skill publica que a sugestão corrigiu 37 pedidos e estragou 7, que existe um piso de erro de 2,5% mesmo com a resposta certa, e que um pedido sobre Mastodon recebeu a sugestão de uma skill de outra rede.
Os cookbooks rodam na versão atual do modelo?
Vários declaram rodar no jev-1.12, enquanto a versão atual é a jev-1.13.0. Quando um cookbook declara a versão, nós a citamos junto com o número, porque comparar resultados entre versões sem dizer qual foi usada não significa nada.
Vale ler os cookbooks originais?
Vale, e são a melhor parte da documentação. Nossas páginas traduzem, contextualizam para o Brasil e apontam divergências entre fontes, mas o código executado e os gráficos estão nos originais.