Quando um time descobre que um modelo genérico erra nas particularidades do domínio, o reflexo é conhecido: “vamos treinar com os nossos dados”. Com o Jev esse caminho não existe, e vale entender o que isso significa — porque é uma limitação real e, ao mesmo tempo, o motivo de a adoção ser mais rápida.
A tarefa
Fazer o modelo julgar segundo as regras da sua empresa, que não são as regras de ninguém mais: o que conta como “cliente de risco” aqui, o que é “severidade 3” no seu produto, qual documento é “conforme” na sua área regulada.
O contrato de cada lado
| Fine-tuning de um LLM | Jev (jev-1.13.0) | |
|---|---|---|
| Como o modelo aprende o seu domínio | Pesos ajustados com os seus exemplos rotulados | Nada é ajustado; o domínio entra no state e nos criteria |
| O que você precisa ter antes | Um conjunto rotulado, e quanto maior melhor | Uma rubrica escrita em uma frase por opção ou nível |
| Tempo até a primeira versão | Coleta, rotulagem, treino e avaliação | Uma chamada |
| Custo de mudar a regra | Novo treino e nova avaliação | Editar um texto e rodar de novo |
| Onde a regra fica registrada | Implícita nos pesos | Explícita no repositório, com histórico |
| Isolamento dos seus dados | Um modelo seu | Os mesmos pesos para todas as contas; a TypeSafe declara não treinar com requisições nem respostas de clientes |
| Entrada por milhão de tokens | Depende do fornecedor e do modelo base | US$ 0,042, com saída gratuita |
Onde o Jev ganha
O tempo até a primeira versão. Não há coleta, não há rotulagem, não há espera de treino. Você escreve as opções e chama. Para a maioria dos times, esse é o argumento que decide, porque a alternativa costuma morrer na fase de rotular.
A regra fica legível. O criteria é a política escrita. Quando alguém
pergunta “por que este caso foi classificado assim”, a resposta é um parágrafo
que dá para ler, discutir e mudar — não um vetor de pesos. Como escrever esse
texto está em
critérios que separam.
Mudar a rubrica é uma linha de diff. Regra de negócio muda toda hora: um nível novo de severidade, uma categoria que se divide em duas. Com pesos ajustados, cada mudança é um ciclo de treino e avaliação. Aqui é uma edição de texto, revisável em pull request.
Você não precisa de dados rotulados para começar. Precisa deles depois, para medir — e isso continua valendo. Mas a ordem inverte: você começa a produzir e usa a produção para gerar o conjunto de avaliação.
A calibração vem pronta. A documentação descreve o treino como RLCD, voltado a decisões com probabilidade calibrada, com a ressalva publicada de que a calibração é medida em grupos de previsões. Obter calibração confiável em um modelo recém-ajustado é trabalho à parte.
Onde o fine-tuning ganha
Quando o seu rótulo não cabe em texto. Existem julgamentos que a equipe faz
bem e não consegue explicar: “este lead parece nosso”, “este texto tem a nossa
voz”. Se ninguém consegue escrever a regra, não há criteria para escrever — e
milhares de exemplos rotulados carregam o padrão que a frase não carrega.
Quando você já tem os dados rotulados. Um histórico de dez anos de casos decididos por especialistas é um ativo caro. Um modelo ajustado extrai dele coisas que uma rubrica de três linhas não extrai.
Quando custo por chamada e latência dominam tudo. Um modelo pequeno ajustado e servido na sua infraestrutura pode ficar abaixo de qualquer preço de API e responder em poucos milissegundos, sem sair da rede.
Quando o dado não pode sair. Restrição regulatória ou contratual que exige processamento local elimina a API da discussão, independentemente de qualquer comparação técnica.
Quando você precisa de um espaço de saída que não é fechado. Ajustar um modelo generativo para escrever no formato e no tom da sua empresa é um caso em que o Jev não compete: ele não gera texto.
Quando a tarefa não é System One. A página oficial de limites lista os nove
modos de falha declarados do jev-1.13, e várias tarefas — indireção longa,
aritmética, geração — não melhoram por nenhum ajuste de pergunta. Estão em
limites do Jev.
O meio-termo que costuma ser a resposta
Existe um terceiro caminho, e ele é oficial. A documentação sugere decompor julgamentos amplos em perguntas atômicas e combinar as saídas no código — e remete ao cookbook de autopesquisa, em que as probabilidades do Jev viram features de um modelo supervisionado clássico.
É a combinação mais interessante dos dois mundos: o Jev transforma texto em colunas numéricas, e o seu modelo treinado aprende os pesos com os seus rótulos. Você fica com a rubrica legível e com o aprendizado sobre os seus dados. Os números desse experimento estão em Jev vs um classificador treinado.
Como escolher
- Se você não tem dados rotulados, comece pelo Jev. Não há decisão a tomar.
- Se você consegue escrever a regra em uma frase por opção, o Jev provavelmente basta, e a regra escrita vale por si.
- Se o julgamento é tácito e você tem histórico rotulado, fine-tuning tem argumento real.
- Se você quer os dois, use o Jev como extrator de features e treine o seu modelo em cima — em vez de ajustar um modelo de linguagem inteiro.
- Se o dado não pode sair da sua rede, a discussão acabou antes de começar.
O índice desta seção fica em comparativos, e a conta de custo em preço.
Perguntas frequentes
Dá para fazer fine-tuning do Jev?
Não. A documentação oficial é explícita: o Jev não é ajustado nem adaptado com LoRA usando dados de cliente, é treinado com RLCD para devolver decisões calibradas, e os mesmos pesos servem todas as contas.
Como eu adapto o modelo ao meu domínio, então?
Pela requisição. A documentação aponta três caminhos: colocar o seu conteúdo e material de referência no state, codificar as regras e os casos de borda nas instructions e nos criteria de cada pergunta, e decompor julgamentos amplos em perguntas atômicas combinadas no seu código.
A TypeSafe treina com as minhas requisições?
A documentação declara que o Jev não é treinado com requisições nem respostas de clientes, e remete à página legal para o acordo de tratamento de dados, a política de privacidade e a retenção zero de dados para clientes empresariais.
Quando fine-tuning ainda vale a pena?
Quando o seu rótulo não é explicável em texto, quando você tem muitos exemplos rotulados e nenhuma rubrica escrita, quando precisa de latência ou custo menores do que uma chamada de API oferece, ou quando o modelo precisa rodar dentro da sua infraestrutura.
E se eu já tenho um modelo ajustado funcionando?
Não troque por troca. O caminho de menor risco é usar o Jev nas decisões que o modelo ajustado não cobre, ou como verificador em cima dele, e comparar em dados seus antes de mover qualquer coisa que já funciona.