← Todos os posts

Onde eu colocaria o Jev: RAG agêntico e carro autônomo

19 de setembro de 2026 · 6 min de leitura

Eu já escrevi aqui sobre o que é o Jev e como funciona o tal do System One Model, então não vou repetir a parte técnica. Se você ainda não leu, começa por ali e depois volta, porque hoje eu quero falar de outra coisa: onde eu colocaria esse troço para trabalhar.

Deixa eu começar pelo que me incomodou.

O exemplo que a TypeSafe escolheu para mostrar o Jev foi a IA jogando Doom. Para quem jogou Doom é bonitinho de ver, e eu entendo o motivo da escolha: ali a máquina precisa tomar decisão imediata, e as respostas saem entre 300 e 500 milissegundos, muito rápido mesmo.

Mas eu achei o exemplo tacanho. Não pelo que ele mostra, e sim pelo que ele deixa de mostrar. Quem assiste pensa que aquilo é brinquedo de demo, e não percebe que o mesmo mecanismo resolve problema sério que a gente tem hoje e não consegue resolver de outro jeito.

O Jev é uma máquina de decisão

Guarda essa frase, porque é assim que eu entendo o produto: o Jev é uma máquina de decisão, e a decisão dele é baseada em um texto.

A vantagem está em como ele é montado. Ele é uma rede neural que você prepara antes de usar, preparada para as respostas que ela tem que dar. Como as respostas são muito pontuais, você passa um texto e ele devolve na hora, como se fosse um comando.

Repare na assimetria, porque é ela que muda tudo: a entrada é complexa, a saída é simples. Ele entende a pergunta inteira, com todo o contexto que ela carrega, mas não precisa escrever parágrafo nenhum de volta. Ele precisa escolher.

Entra um texto inteiro, com todo o contexto, e sai uma escolha única entre as opções que o desenvolvedor declarou antes. A entrada é complexa, a saída é uma palavra.
Entra um texto inteiro, com todo o contexto, e sai uma escolha única entre as opções que o desenvolvedor declarou antes. A entrada é complexa, a saída é uma palavra.

A primeira aplicação: a porta do RAG agêntico

Essa é a que salta aos olhos.

Lembra do RAG agêntico? A gente coloca uma camada de agente na frente das camadas do RAG. E por que a gente faz isso? Porque às vezes o sistema não fala sobre uma base de conhecimento só, ele fala sobre várias.

Vou dar o exemplo que eu uso em aula. Imagina um agente que conversa sobre direito e sobre medicina. Chega uma pergunta sobre jurisprudência de assalto à mão armada. A primeira camada olha aquilo e define o assunto: isso aqui é direito. Então o fluxo vai para o RAG do direito. Chega outra pergunta, sobre vacina e penicilina, e a mesma camada responde: medicina. E o fluxo vai para a outra base.

A pergunta chega, o Jev classifica o assunto e direciona o fluxo para a base vetorial certa. Só depois dessa decisão é que o RAG busca e a LLM responde.
A pergunta chega, o Jev classifica o assunto e direciona o fluxo para a base vetorial certa. Só depois dessa decisão é que o RAG busca e a LLM responde.

Perceba que o primeiro agente do RAG agêntico não está ali para responder nada ao usuário. Ele existe para direcionar o fluxo. A entrada é complexa, porque ele precisa entender a pergunta de verdade, mas a resposta dele é uma palavra só: direito ou medicina. A partir dessa decisão é que se carrega a base de dados efetiva.

Tá vendo como essa tarefa tem exatamente a cara do Jev?

E o ganho vem em dois lugares. O primeiro é o tempo. Como ele responde muito rápido, é como se aquela barreira agêntica deixasse de existir. Hoje você sente a camada de roteamento: o sistema fica com aquela demora antes de começar a responder, e quem está do outro lado acha que travou. Com o Jev, ela some da percepção de quem usa.

O segundo é o custo. O consumo de entrada dele é menor, então a decisão sai muito mais barata do que mandar a mesma pergunta para uma LLM completa só para ela dizer uma palavra. E olha que é isso que a gente faz hoje.

Eu vou fazer um vídeo sobre isso, porque merece.

A segunda: o texto que o carro autônomo ignora

Essa aqui é a que mais me animou, e eu preciso confessar o motivo: eu sou apaixonado por carro autônomo. Tem uma playlist inteira sobre isso no canal, e na Universidade Federal a gente tem projetos na área.

Deixa eu te contar qual é o problema.

Na visão computacional do carro, a câmera lê o mundo o tempo todo. Reconhecer uma placa de pare, um semáforo, uma faixa, isso já está resolvido, porque são símbolos. O problema começa quando a placa tem texto de verdade, aquelas de obra, de desvio, de restrição com horário, de aviso temporário.

E o que acontece hoje com essas placas? Normalmente elas são simplesmente ignoradas.

Não é falta de vontade. É que depois de ler o texto alguém precisa decidir o que fazer com ele, e nesse ponto você fica entre duas opções ruins: a LLM completa não processa rápido o suficiente para um carro em movimento, e a LLM pequena o bastante para rodar ali dentro não é boa o bastante para você confiar.

A câmera captura a placa, a visão computacional extrai o texto, o Jev decide o que fazer e a ação acontece. A LLM entra depois, fora do caminho crítico.
A câmera captura a placa, a visão computacional extrai o texto, o Jev decide o que fazer e a ação acontece. A LLM entra depois, fora do caminho crítico.

Agora pensa no Jev nesse buraco. Rodando numa máquina suficientemente boa, mas pequena, ele te dá uma resposta rápida a partir de um texto um pouco maior. O caminho fica assim: a câmera captura, a visão computacional extrai o texto, o Jev decide o que aquilo significa para o carro, e a ação acontece. Se ainda for preciso explicar ou registrar alguma coisa em linguagem, aí sim entra a LLM, que já não está mais no caminho crítico.

Vale o aviso, e eu faço questão de ser claro: eu não estou dizendo que o Jev vai dirigir carro, nem que ele entra na parte crítica de segurança. O controle e os mecanismos de segurança continuam exatamente onde sempre estiveram. O que eu estou dizendo é que existe um pedaço de informação que hoje a gente joga fora, e que talvez pare de ser jogado fora.

O que fica

Junta as duas aplicações e você vê o padrão: nas duas, o trabalho é entender um texto e escolher um caminho, não produzir linguagem.

Esse tipo de tarefa está em todo lugar nos nossos sistemas, e a gente vinha resolvendo com o martelo errado, mandando uma LLM inteira escrever uma palavra para o código interpretar depois.

É essa a brecha que o Jev ocupa. E é por isso que eu acho o Doom um exemplo pequeno para o que a coisa é.

Se você trabalha com RAG e quer entender a camada de roteamento a fundo, o livro de RAG está em physia.com.br/rag, e é lá que eu explico o RAG agêntico em detalhe.