//Comparativo

Jev vs fine-tuning: adaptar sem treinar pesos

Não existe versão do Jev treinada com os seus dados. Os mesmos pesos servem todas as contas, e o que você escreve na pergunta é a personalização inteira.

Quando um time descobre que um modelo genérico erra nas particularidades do domínio, o reflexo é conhecido: “vamos treinar com os nossos dados”. Com o Jev esse caminho não existe, e vale entender o que isso significa — porque é uma limitação real e, ao mesmo tempo, o motivo de a adoção ser mais rápida.

A tarefa

Fazer o modelo julgar segundo as regras da sua empresa, que não são as regras de ninguém mais: o que conta como “cliente de risco” aqui, o que é “severidade 3” no seu produto, qual documento é “conforme” na sua área regulada.

O contrato de cada lado

Fine-tuning de um LLMJev (jev-1.13.0)
Como o modelo aprende o seu domínioPesos ajustados com os seus exemplos rotuladosNada é ajustado; o domínio entra no state e nos criteria
O que você precisa ter antesUm conjunto rotulado, e quanto maior melhorUma rubrica escrita em uma frase por opção ou nível
Tempo até a primeira versãoColeta, rotulagem, treino e avaliaçãoUma chamada
Custo de mudar a regraNovo treino e nova avaliaçãoEditar um texto e rodar de novo
Onde a regra fica registradaImplícita nos pesosExplícita no repositório, com histórico
Isolamento dos seus dadosUm modelo seuOs mesmos pesos para todas as contas; a TypeSafe declara não treinar com requisições nem respostas de clientes
Entrada por milhão de tokensDepende do fornecedor e do modelo baseUS$ 0,042, com saída gratuita

Onde o Jev ganha

O tempo até a primeira versão. Não há coleta, não há rotulagem, não há espera de treino. Você escreve as opções e chama. Para a maioria dos times, esse é o argumento que decide, porque a alternativa costuma morrer na fase de rotular.

A regra fica legível. O criteria é a política escrita. Quando alguém pergunta “por que este caso foi classificado assim”, a resposta é um parágrafo que dá para ler, discutir e mudar — não um vetor de pesos. Como escrever esse texto está em critérios que separam.

Mudar a rubrica é uma linha de diff. Regra de negócio muda toda hora: um nível novo de severidade, uma categoria que se divide em duas. Com pesos ajustados, cada mudança é um ciclo de treino e avaliação. Aqui é uma edição de texto, revisável em pull request.

Você não precisa de dados rotulados para começar. Precisa deles depois, para medir — e isso continua valendo. Mas a ordem inverte: você começa a produzir e usa a produção para gerar o conjunto de avaliação.

A calibração vem pronta. A documentação descreve o treino como RLCD, voltado a decisões com probabilidade calibrada, com a ressalva publicada de que a calibração é medida em grupos de previsões. Obter calibração confiável em um modelo recém-ajustado é trabalho à parte.

Onde o fine-tuning ganha

Quando o seu rótulo não cabe em texto. Existem julgamentos que a equipe faz bem e não consegue explicar: “este lead parece nosso”, “este texto tem a nossa voz”. Se ninguém consegue escrever a regra, não há criteria para escrever — e milhares de exemplos rotulados carregam o padrão que a frase não carrega.

Quando você já tem os dados rotulados. Um histórico de dez anos de casos decididos por especialistas é um ativo caro. Um modelo ajustado extrai dele coisas que uma rubrica de três linhas não extrai.

Quando custo por chamada e latência dominam tudo. Um modelo pequeno ajustado e servido na sua infraestrutura pode ficar abaixo de qualquer preço de API e responder em poucos milissegundos, sem sair da rede.

Quando o dado não pode sair. Restrição regulatória ou contratual que exige processamento local elimina a API da discussão, independentemente de qualquer comparação técnica.

Quando você precisa de um espaço de saída que não é fechado. Ajustar um modelo generativo para escrever no formato e no tom da sua empresa é um caso em que o Jev não compete: ele não gera texto.

Quando a tarefa não é System One. A página oficial de limites lista os nove modos de falha declarados do jev-1.13, e várias tarefas — indireção longa, aritmética, geração — não melhoram por nenhum ajuste de pergunta. Estão em limites do Jev.

O meio-termo que costuma ser a resposta

Existe um terceiro caminho, e ele é oficial. A documentação sugere decompor julgamentos amplos em perguntas atômicas e combinar as saídas no código — e remete ao cookbook de autopesquisa, em que as probabilidades do Jev viram features de um modelo supervisionado clássico.

É a combinação mais interessante dos dois mundos: o Jev transforma texto em colunas numéricas, e o seu modelo treinado aprende os pesos com os seus rótulos. Você fica com a rubrica legível e com o aprendizado sobre os seus dados. Os números desse experimento estão em Jev vs um classificador treinado.

Como escolher

  • Se você não tem dados rotulados, comece pelo Jev. Não há decisão a tomar.
  • Se você consegue escrever a regra em uma frase por opção, o Jev provavelmente basta, e a regra escrita vale por si.
  • Se o julgamento é tácito e você tem histórico rotulado, fine-tuning tem argumento real.
  • Se você quer os dois, use o Jev como extrator de features e treine o seu modelo em cima — em vez de ajustar um modelo de linguagem inteiro.
  • Se o dado não pode sair da sua rede, a discussão acabou antes de começar.

O índice desta seção fica em comparativos, e a conta de custo em preço.

Perguntas frequentes

Dá para fazer fine-tuning do Jev?

Não. A documentação oficial é explícita: o Jev não é ajustado nem adaptado com LoRA usando dados de cliente, é treinado com RLCD para devolver decisões calibradas, e os mesmos pesos servem todas as contas.

Como eu adapto o modelo ao meu domínio, então?

Pela requisição. A documentação aponta três caminhos: colocar o seu conteúdo e material de referência no state, codificar as regras e os casos de borda nas instructions e nos criteria de cada pergunta, e decompor julgamentos amplos em perguntas atômicas combinadas no seu código.

A TypeSafe treina com as minhas requisições?

A documentação declara que o Jev não é treinado com requisições nem respostas de clientes, e remete à página legal para o acordo de tratamento de dados, a política de privacidade e a retenção zero de dados para clientes empresariais.

Quando fine-tuning ainda vale a pena?

Quando o seu rótulo não é explicável em texto, quando você tem muitos exemplos rotulados e nenhuma rubrica escrita, quando precisa de latência ou custo menores do que uma chamada de API oferece, ou quando o modelo precisa rodar dentro da sua infraestrutura.

E se eu já tenho um modelo ajustado funcionando?

Não troque por troca. O caminho de menor risco é usar o Jev nas decisões que o modelo ajustado não cobre, ou como verificador em cima dele, e comparar em dados seus antes de mover qualquer coisa que já funciona.

Quer dominar decisões com IA em português? O curso da comunidade está em pré-venda.

Garantir pré-venda por R$ 499,00

Pré-venda: R$ 499,00 · Após o lançamento: R$ 799,00