Em novembro de 2023, a Corregedoria do Conselho Nacional de Justiça passou a investigar um juiz federal que tinha assinado uma decisão com p...
Token 01
Precedentes que nunca existiram
A parte que perdeu a causa leu a sentença com atenção e estranhou as citações. Os julgados atribuídos ao Superior Tribunal de Justiça tinham número, relator e trechos entre aspas — e não existiam. O advogado levou o caso à corregedoria regional, o juiz federal da 1ª Região atribuiu a pesquisa a um servidor e falou em "mero equívoco" causado pela sobrecarga de trabalho, e o corregedor Néviton Guedes resumiu o que havia acontecido: "A ferramenta de IA generativa, utilizada como assistente de minuta de ato judicial, apresentou como resultado de pesquisa jurisprudencial precedentes inexistentes" (CNJ abre…, 2023, não paginado). Era novembro de 2023, e o Conselho Nacional de Justiça abriu investigação.
O episódio não foi um acidente isolado. O pesquisador Damien Charlotin mantém uma base aberta com decisões judiciais do mundo todo em que o tribunal constatou conteúdo inventado por IA — quase sempre citações falsas. Em 23 de setembro de 2026, a base somava 2 077 casos, 41 deles no Brasil (Charlotin, 2026). Advogados, peritos, partes sem advogado e juízes aparecem na lista.
A pergunta interessante não é "como alguém confia numa máquina dessas?". É outra: como uma mesma tecnologia consegue escrever um parágrafo impecável e, na frase seguinte, inventar um precedente com a mesma calma? A resposta está no modo como esses sistemas são construídos — e entender isso é o que separa quem usa a IA generativa com proveito de quem é usado por ela.
Esta postagem continua a conversa de Entenda o que é IA, aprendizagem de máquina, deep learning, LLM, que apresentou a IA generativa como uma das "bonecas russas" dentro do aprendizado profundo, e de Como a máquina aprende, que mostrou como uma rede ajusta seus pesos. Aqui, a pergunta é o que acontece quando a rede, em vez de classificar, produz.
Token 02
Duas máquinas, uma mesma ideia
Todo modelo generativo faz, no fundo, a mesma coisa: aprende, a partir de muitos exemplos, como os dados costumam ser — que palavras aparecem juntas, que cores e formas convivem numa foto — e depois sorteia exemplos novos que se parecem com os de treino. Um modelo de linguagem, na definição clássica dos livros-texto, é uma distribuição de probabilidade sobre sequências de palavras (Russell; Norvig, 2021). Gerar é amostrar dessa distribuição.
O campo é mais amplo do que o chat deixa ver, e o que distingue uma família de modelos generativos de outra é o jeito de aprender e de sortear. Os autocodificadores variacionais (VAEs) aprendem a comprimir cada exemplo num código compacto e a gerar dados novos a partir de códigos sorteados (Kingma; Welling, 2013). As redes adversárias generativas (GANs) põem duas redes para competir — uma falsifica, a outra tenta flagrar a falsificação — (Goodfellow et al., 2014) e lideraram a geração de imagens na segunda metade da década de 2010. Os modelos autorregressivos geram uma parte por vez, cada uma condicionada às anteriores. E os modelos de difusão, que superaram as GANs em qualidade de imagem por volta de 2021 (Dhariwal; Nichol, 2021), tornaram-se a abordagem central na geração de imagens. Há ainda híbridos e outras arquiteturas.
IA generativa, portanto, não é sinônimo de LLM: os grandes modelos de linguagem são uma família dentro do campo — hoje, majoritariamente Transformers autorregressivos. Esta postagem se concentra nas duas famílias que dominam o uso cotidiano. A capa mostra as duas máquinas produzindo a mesma cena, um gato num telhado, por caminhos opostos:
A terceira ficha é a que interessa para o caso do juiz — e ela vai voltar. Antes, vale abrir cada máquina.
Token 03
Modelos de linguagem: a arte de prever o próximo token
Um LLM (large language model, "grande modelo de linguagem") não lê letras nem palavras inteiras: lê tokens, pedaços de texto que podem ser uma palavra inteira ("gato"), um fragmento de palavra, um caractere ou um sinal de pontuação. A divisão exata depende do tokenizador de cada modelo; em geral, palavras comuns viram um token só, e palavras longas ou raras são quebradas em vários. Cada token vira uma lista de números. Os LLMs generativos autorregressivos — a família do GPT e da maioria dos assistentes de conversa atuais — aprendem a responder a uma única pergunta, bilhões de vezes: dado tudo o que veio antes, qual é a distribuição de probabilidade do próximo token?
Essa fase se chama pré-treinamento. O modelo lê uma quantidade enorme de texto, tenta adivinhar cada token seguinte, compara o palpite com o que de fato vinha e ajusta seus parâmetros — os pesos da rede — para errar um pouco menos da próxima vez. É a mesma descida do gradiente de Como a máquina aprende, só que numa escala de centenas de bilhões de parâmetros.
O limite da metáfora
"Prever o próximo token" descreve a tarefa de treino, não o que acontece por dentro. Não é consultar uma tabela de frases prontas, nem contar quantas vezes uma sequência apareceu na internet — isso era o que faziam os antigos modelos de n-gramas. Para prever bem o próximo token em textos de todo tipo, a rede precisa construir representações internas de sintaxe, de relações entre conceitos, de estilo e de contexto; por isso "autocompletar gigante" subestima o que esses modelos fazem. O erro oposto também é comum: representações ricas não equivalem a compreensão no sentido humano, e é nesse intervalo que mora boa parte do debate da área (volte a ele no Token 05).
A peça que mudou tudo: atenção
A arquitetura por trás de praticamente todos os LLMs atuais é o Transformer, proposto em 2017 por pesquisadores do Google para tradução automática (Vaswani et al., 2017). Sua peça mais conhecida é o mecanismo de atenção: para montar a representação de cada token, o modelo calcula o quanto cada um dos outros tokens é relevante para ele. Em "o gato subiu no telhado porque ele estava com medo", é esse cálculo que permite relacionar "ele" a "gato", e não a "telhado". Na prática, isso acontece em várias "cabeças" de atenção em paralelo e se repete em dezenas de camadas, cada uma captando relações diferentes — não existe uma única "porcentagem de importância" por palavra.
Mas o Transformer não é só atenção. Cada bloco combina a atenção com uma rede neural comum (feed-forward), conexões residuais e normalização, e a entrada recebe uma codificação da posição de cada token, porque a atenção, sozinha, não sabe a ordem das palavras (Vaswani et al., 2017). Como esses cálculos podem ser feitos em paralelo, o Transformer tornou viável treinar modelos muito maiores do que as redes recorrentes anteriores permitiam.
O Transformer original tinha duas metades: um codificador, que lê a frase inteira de entrada, e um decodificador, que escreve a tradução token a token. Os modelos que vieram depois ficaram com uma delas, com a outra ou com as duas. O BERT, do Google, usa só o codificador e é pré-treinado adivinhando tokens mascarados no meio da frase, olhando para os dois lados (Devlin et al., 2019); não é um gerador de texto. O GPT usa só o decodificador. O T5 manteve as duas metades e tratou toda tarefa como transformar um texto em outro (Raffel et al., 2020).
Quadro 1 — Três arquiteturas derivadas do Transformer, com exemplo clássico e uso característico
| Arquitetura | Exemplo clássico | Como lê o texto no treino | Uso característico |
|---|---|---|---|
| Só codificador (encoder-only) | BERT | Nos dois sentidos, adivinhando tokens mascarados | Representação e classificação: busca semântica, triagem de documentos, análise de sentimento |
| Só decodificador (decoder-only) | Família GPT | Só o que veio antes, prevendo o próximo token | Geração autorregressiva: assistentes de conversa, código |
| Codificador-decodificador | Transformer original; T5 | Codificador lê a entrada inteira; decodificador gera a saída token a token | Transformar uma sequência em outra: tradução, resumo |
Fonte: elaborado pelo autor com base em Vaswani et al. (2017), Devlin et al. (2019), Brown et al. (2020) e Raffel et al. (2020).Nota: "prever o próximo token" descreve os modelos autorregressivos (decodificadores), não todo modelo de linguagem nem todo Transformer. O Transformer de 2017 não é a arquitetura exata dos assistentes atuais.
Em 2020, o GPT-3, com 175 bilhões de parâmetros, mostrou um efeito que surpreendeu a própria área: bastava colocar alguns exemplos de uma tarefa no próprio texto de entrada para o modelo executá-la, sem nenhum novo treinamento — a aprendizagem em contexto (Brown et al., 2020). Nascia ali, na prática, a engenharia de prompts.
De completar textos a seguir instruções
Um modelo só pré-treinado é um excelente completador de textos, não um assistente: se você escreve "Explique a fotossíntese para uma criança", ele pode continuar com "Explique a respiração celular para uma criança", porque listas de exercícios são textos comuns na internet. O que transformou completadores em assistentes foi uma segunda etapa, o ajuste fino: primeiro com exemplos de instruções e boas respostas escritas por pessoas, depois com o RLHF (reinforcement learning from human feedback, aprendizado por reforço a partir de feedback humano), em que avaliadores ordenam respostas e o modelo é recompensado por produzir as preferidas. O resultado mais citado desse trabalho é eloquente: as respostas de um modelo ajustado com 1,3 bilhão de parâmetros foram preferidas às do GPT-3 original, com 175 bilhões — cem vezes maior (Ouyang et al., 2022).
Duas ressalvas completam essa história. A primeira: tamanho não é tudo. Um estudo da DeepMind mostrou que muitos LLMs estavam subtreinados para o seu porte: com o mesmo orçamento de computação, o Chinchilla, com 70 bilhões de parâmetros e cerca de quatro vezes mais dados de treino, superou modelos de 175 a 530 bilhões de parâmetros (Hoffmann et al., 2022). O que pesa é o equilíbrio entre parâmetros, dados e computação — e parâmetros não são fatos armazenados, são pesos que codificam padrões de forma distribuída. A segunda ressalva está no quadro abaixo.
Não confunda: modelo de linguagem, LLM e assistente
Modelo de linguagem é qualquer modelo que atribui probabilidades a sequências de texto — dos antigos modelos de n-gramas, que contavam sequências de palavras, às redes neurais atuais (Russell; Norvig, 2021).
LLM é um modelo de linguagem neural de grande porte, hoje quase sempre um Transformer. Em si, é um conjunto de pesos: recebe tokens e devolve probabilidades.
Assistente conversacional — ChatGPT, Gemini, Claude, no sentido em que as pessoas os usam — é um sistema construído em volta de um ou mais LLMs, com instruções de sistema, histórico da conversa, filtros de segurança e, cada vez mais, busca, memória persistente e ferramentas. Quando alguém diz que "o ChatGPT errou", quem errou foi esse sistema inteiro — e é nele que entram as soluções do Token 08.
Onde entra o acaso
Na hora de responder, o modelo não "escolhe a palavra certa". A figura abaixo resume, de forma esquemática, o caminho que cada token percorre durante a geração:
Figura 1 — Do texto ao próximo token: o caminho simplificado de um LLM autorregressivo na inferência
Fonte: elaborado pelo autor com base em Vaswani et al. (2017) e Brown et al. (2020).Nota: visão esquemática e simplificada. Pré-treinamento e ajuste fino, que definem os pesos usados nas etapas 3 a 5, acontecem antes e não fazem parte deste ciclo.
Na etapa 7 há duas escolhas básicas. A decodificação gulosa pega sempre o token mais provável: é determinística e tende a produzir texto previsível. A amostragem sorteia um token de acordo com as probabilidades, e um parâmetro chamado temperatura controla o quanto esse sorteio é conservador: temperatura baixa concentra a chance no favorito; temperatura alta espalha a chance entre as alternativas, e o texto fica mais variado — e mais arriscado. Chamar a temperatura de "botão da criatividade" é só uma metáfora: tecnicamente, ela apenas achata ou afia a distribuição.
Gerar texto é girar uma roleta viciada a cada token. O botão da temperatura não muda o que o modelo sabe: muda o tamanho das fatias na hora do sorteio. Ilustração gerada por IA.
O laboratório abaixo usa distribuições fictícias, escritas à mão para fins didáticos, mas o mecanismo é o de verdade: probabilidades por token, reajustadas pela temperatura, e a escolha — gulosa ou por sorteio. Experimente as três frases. A terceira é a mais importante.
Laboratório 1 · a roleta do próximo token
O gato subiu no ▁
Temperatura 1,0: o favorito leva 52% das chances. Clique em sortear.
Repare no que acontece na terceira frase: o modelo não tem nenhum favorito claro, porque não sabe o título. Mesmo assim, qualquer token sorteado começa uma frase perfeitamente gramatical — "Modelagem de…", "Contribuições para…" — e o texto segue fluente. Uma distribuição achatada é o retrato estatístico de "não sei"; o problema é que o sorteio transforma esse "não sei" numa resposta com cara de certeza.
Token 04
Modelos de difusão: esculpir uma imagem no ruído
Gerar uma imagem pixel a pixel, da esquerda para a direita, como um LLM gera texto, é possível mas lento e pouco natural: numa foto, o céu do canto de cima depende tanto do chão quanto o chão depende do céu. Os modelos de difusão atacam o problema de outro jeito, e a ideia é quase uma brincadeira.
No treino, pega-se uma imagem de verdade e se acrescenta a ela, em muitos pequenos passos, um ruído aleatório — como o chuvisco de uma TV fora do ar — até que, no último passo, não sobre nada da imagem original. No trabalho que popularizou a técnica, são mil passos (Ho; Jain; Abbeel, 2020). A rede é então treinada para a tarefa inversa: olhar uma imagem suja e estimar qual parte dela é ruído. Se ela sabe estimar o ruído, sabe removê-lo um pouco.
Para criar uma imagem nova, basta partir de ruído puro, sorteado, e aplicar a rede passo a passo. Cada passo tira um pouco da sujeira e deixa aparecer um pouco mais de estrutura, até sobrar uma imagem que nunca existiu, mas que tem a "cara" das imagens de treino.
A geração por difusão lida da esquerda para a direita: do ruído à imagem, um passo de limpeza por vez. O treino fez o caminho contrário, sujando imagens reais. Ilustração gerada por IA.
Trabalhar diretamente com milhões de pixels custa caro. O salto que tornou a difusão popular foi fazer esse processo num espaço latente: um codificador comprime a imagem numa representação bem menor, a difusão acontece ali, e um decodificador devolve os pixels no fim. O mesmo trabalho acrescentou camadas de atenção cruzada, que permitem que um texto — o prompt — oriente cada passo da limpeza (Rombach et al., 2022). É essa combinação, liberada em código aberto, que deu origem ao Stable Diffusion e que está por trás de boa parte dos geradores de imagem atuais. Repare que a atenção, a peça central dos LLMs, reaparece aqui como a ponte entre palavras e pixels.
No laboratório abaixo, arraste o controle ou clique em gerar. A fórmula aplicada é a do processo de difusão, com um cronograma de ruído em mil passos, mas há uma trapaça didática, e é bom dizê-la de saída: aqui a imagem final já é conhecida, e a animação apenas mostra a mistura de sinal e ruído em cada passo. Num modelo de verdade, a rede não conhece o destino — ela estima, a cada passo, o que é ruído, e por isso cada sorteio inicial produz uma imagem diferente.
Laboratório 2 · do ruído à imagem
sinal 0% · ruído 100% (proporção da variância)
Passo 1000: só ruído. Nenhum pixel ainda carrega informação da imagem.
Brinque com o controle perto do fim: nos últimos cem passos a imagem muda pouco, e nos primeiros cem quase nada se vê. A difusão decide primeiro a composição geral e só no fim os detalhes — o que ajuda a entender por que mãos, dedos e letras, que são detalhes pequenos e muito regrados, estão entre as coisas que esses modelos mais erram.
A fronteira está ficando borrada
A divisão "texto é autorregressivo, imagem é difusão" já não é uma lei. Há modelos de difusão para texto: o LLaDA, com 8 bilhões de parâmetros, parte de uma frase toda mascarada e vai revelando os tokens em paralelo, com desempenho comparável a um LLM autorregressivo do mesmo porte em várias tarefas — e se sai melhor justamente num tipo de pergunta "de trás para a frente" que costuma derrubar os modelos tradicionais (Nie et al., 2025). O Jev, da TypeSafe, discutido aqui no blog, também abandona a geração token a token para devolver decisões com probabilidade calibrada. E, no caminho inverso, vários geradores de imagem recentes usam Transformers dentro do processo de difusão.
Quadro 2 — Comparação entre modelos de linguagem autorregressivos e modelos de difusão
| Aspecto | Modelo de linguagem autorregressivo | Modelo de difusão |
|---|---|---|
| O que gera, tipicamente | Texto, código, dados estruturados | Imagens, áudio, vídeo |
| Como gera | Um token por vez, da esquerda para a direita, sem revisar o que já saiu | A obra inteira de uma vez, refinada em dezenas a milhares de passos de limpeza |
| O que aprende no treino | Prever o próximo token | Estimar o ruído presente numa imagem suja |
| Onde entra o acaso | No sorteio de cada token (temperatura) | No ruído inicial (semente) e em cada passo |
| Peça central | Transformer com atenção | Rede que estima ruído (U-Net ou Transformer), em geral num espaço latente, guiada por atenção cruzada ao texto |
| Erro característico | Fato inventado com fluência (alucinação) | Detalhe implausível: dedos a mais, letras deformadas, objetos fundidos |
Fonte: elaborado pelo autor com base em Vaswani et al. (2017), Brown et al. (2020), Ho, Jain e Abbeel (2020) e Rombach et al. (2022).Nota: a divisão é típica, não absoluta; há modelos de difusão para texto e geradores de imagem autorregressivos.
Token 05
O que eles fazem bem — e onde tropeçam
Como leram quantidades de texto que nenhum ser humano leria em mil vidas, os LLMs são muito bons no que depende de forma e de padrões frequentes: reescrever num tom diferente, resumir, traduzir, explicar um conceito comum de três maneiras, gerar e comentar código, extrair campos de um documento, sugerir estrutura para um texto. A aprendizagem em contexto faz com que se adaptem a tarefas novas com poucos exemplos. Os de difusão fazem o equivalente com imagens: estilos, composições, variações e retoques.
Os limites vêm do mesmo lugar que as capacidades. Vale conhecer os principais, porque cada um pede um cuidado diferente:
- Conhecimento congelado. O modelo sabe o que estava nos dados até a data de corte do treino. Se não estiver ligado a uma busca ou a documentos, ele não "consulta" nada: responde com o que ficou nos parâmetros.
- Nenhum verificador embutido. Gerar e checar são operações diferentes. O modelo produz o texto mais provável; a probabilidade de uma frase soar bem não é a probabilidade de ela ser verdadeira.
- Conhecimento que só vai num sentido. Modelos treinados com frases do tipo "A é B" muitas vezes não aprendem que "B é A". Num teste com perguntas sobre pais de celebridades, o GPT-4 acertou 79% no sentido direto e só 33% no inverso — a maldição da reversão (Berglund et al., 2023). Com a informação dada no próprio prompt, o problema desaparece.
- Tokens não são letras. Como o modelo enxerga pedaços de palavras, tarefas triviais para nós — contar letras, inverter uma palavra, fazer contas longas de cabeça — podem falhar de maneiras que parecem absurdas.
- Janela de contexto finita. Tudo o que o modelo "vê" numa conversa cabe numa janela de contexto. Ela é grande, mas não é memória: o que saiu dela, ou ficou perdido no meio dela, pesa pouco, como detalhado em Afinal, o que é um prompt?.
- Forma sem compreensão garantida. Uma crítica influente sustenta que um sistema treinado só com a forma da linguagem pode imitar o sentido sem tê-lo, como um "papagaio estocástico", e aponta custos ambientais e vieses herdados dos dados (Bender et al., 2021). Não é consenso — muitos pesquisadores veem nos modelos atuais representações internas ricas —, mas é um bom antídoto contra a tentação de atribuir intenção a uma máquina que fala bem.
Nada disso impede usos sérios, inclusive em ciência, como discutido em Terence Tao e o paradoxo da IA com a ciência. Mas todos apontam para o mesmo cuidado: quanto mais uma tarefa depende de um fato específico e verificável, menos o texto gerado deve ser tratado como prova.
Token 06
Alucinação: fluência sem lastro
Chama-se alucinação o conteúdo gerado que soa plausível mas é falso ou não tem apoio nas fontes fornecidas. O termo é metafórico e tem críticos — não há percepção, e muito menos intenção de enganar —, mas pegou. Uma revisão abrangente da literatura separa dois grandes grupos (Huang et al., 2024):
Quadro 3 — Tipos de alucinação em modelos de linguagem, com exemplos
| Grupo | Tipo | Exemplo |
|---|---|---|
| Factualidade (contra o mundo) | Fabricação | Citar um acórdão, um artigo ou um livro que não existe |
| Inconsistência factual | Atribuir a lei certa ao ano errado, ou a descoberta certa ao cientista errado | |
| Fidelidade (contra o pedido ou o contexto) | À instrução | Pedir um resumo em português e receber a resposta em inglês |
| Ao contexto | Resumir um documento incluindo uma cláusula que ele não tem | |
| Lógica | Fazer um raciocínio passo a passo correto e tirar uma conclusão que não decorre dele |
Fonte: elaborado pelo autor com base na taxonomia de Huang et al. (2024); exemplos do autor.
Por que acontece — e por que não é um mistério
Um trabalho de pesquisadores da OpenAI e do Georgia Tech, de 2025, propõe uma explicação que ajuda muito a organizar o assunto (Kalai et al., 2025). A tese tem duas partes.
A primeira está no pré-treinamento. Gerar uma frase válida é, estatisticamente, pelo menos tão difícil quanto classificar se uma frase é válida — e há fatos que nenhum classificador acertaria, porque não têm padrão: a data de aniversário de uma pessoa pouco conhecida, o título de uma tese. Se um fato aparece uma única vez nos dados de treino, não há como o modelo distinguir o verdadeiro dos inventados. Os autores dão um exemplo: se 20% das datas de aniversário aparecem uma única vez nos dados de pré-treinamento, é de esperar que o modelo base erre em pelo menos 20% das perguntas sobre aniversários. Alucinações não precisam ser misteriosas: nascem como erros comuns de classificação.
A segunda parte está no que vem depois, e é a mais incômoda. Os modelos são ajustados e comparados em avaliações que, quase sempre, dão ponto para a resposta certa e zero tanto para a errada quanto para "não sei". Nessas condições, chutar sempre compensa. É exatamente o raciocínio do estudante numa prova de múltipla escolha sem desconto por erro.
Se errar e dizer "não sei" valem o mesmo zero, a estratégia ótima é nunca dizer "não sei". Os modelos aprenderam a mesma lição que gerações de vestibulandos. Ilustração gerada por IA.
A própria OpenAI publicou uma comparação entre dois de seus modelos num teste de perguntas factuais curtas, o SimpleQA, que ilustra o efeito (OpenAI, 2025):
Tabela 1 — Distribuição das respostas de dois modelos da OpenAI no teste SimpleQA, 2025
| Resultado da resposta | gpt-5-thinking-mini (%) | o4-mini (%) |
|---|---|---|
| Absteve-se ("não sei") | 52 | 1 |
| Acertou | 22 | 24 |
| Errou | 26 | 75 |
| Total | 100 | 100 |
Fonte: elaborado pelo autor com base em OpenAI (2025).Nota: SimpleQA é um conjunto de perguntas factuais de resposta curta; os nomes dos modelos foram mantidos como na fonte. Totais conferidos pelo autor.
Pelo placar tradicional, que só olha a taxa de acerto, o o4-mini "ganha": 24% contra 22%. Mas ele erra três vezes mais. O painel abaixo mostra as duas colunas que importam lado a lado:
A proposta dos autores é mudar a regra da prova: declarar, na própria instrução, um limiar de confiança t e descontar t/(1 − t) pontos por resposta errada, mantendo zero para "não sei". Com t = 0,5, um erro custa 1 ponto; com t = 0,75, custa 3; com t = 0,9, custa 9 (Kalai et al., 2025). Assim, responder só compensa quando a chance de acerto passa do limiar — e um modelo bem calibrado passa a ter motivo para dizer "não sei". Faça as contas você mesmo:
Laboratório 3 · chutar ou dizer "não sei"?
Na correção tradicional, errar custa zero: responder rende +0,30 e ganha de "não sei". Chutar compensa.
Nenhuma instrução elimina a alucinação, porque ela nasce na estatística do treino. Mas regras de avaliação, de uso e de conferência podem parar de recompensá-la — e isso vale tanto para quem treina modelos quanto para quem corrige trabalhos escritos com eles.
E nas imagens?
Os modelos de difusão também "alucinam", no sentido de produzir detalhes plausíveis e errados. As ilustrações desta postagem foram geradas por IA e conferidas letra por letra em alta resolução. A da prova, acima, precisou de quatro gerações: nas primeiras, a letra C apareceu duas vezes na folha de respostas, letras surgiram fora dos círculos e cartazes ao fundo ganharam palavras que não existem. A solução foi trocar a folha por plaquinhas — menos texto, menos chance de erro. É a mesma lição dos precedentes inventados: o gerador não confere; alguém precisa conferir.
Token 07
Engenharia de prompts, em uma página
Se o modelo gera o que é provável dado o contexto, a forma mais barata de melhorar a resposta é melhorar o contexto. Essa é toda a lógica da engenharia de prompts. O assunto já foi tratado em profundidade aqui no blog — no Guia completo de engenharia de prompt e, com o olhar de 2026, em Afinal, o que é um prompt?, que mostra por que a área passou a falar em engenharia de contexto. Vale, então, só o essencial.
Uma revisão sistemática catalogou 58 técnicas de prompt para modelos de linguagem e outras 40 para outras mídias (Schulhoff et al., 2025). A boa notícia é que quase todas são variações de poucos princípios, os mesmos que a documentação dos fabricantes recomenda — clareza e exemplos, estrutura, papel, espaço para raciocinar e encadeamento de etapas (Anthropic, 2026):
- Diga o que quer, para quem e em que formato. O modelo não sabe que você é professor, que o texto é para o primeiro semestre, nem que precisa caber numa lâmina.
- Mostre exemplos. Dois ou três pares de entrada e saída ensinam mais que um parágrafo de instruções — é a aprendizagem em contexto de Brown et al. (2020) em ação.
- Separe as partes. Instrução, material de apoio e formato de saída em blocos identificados (títulos, marcadores, tags) reduzem confusão.
- Dê espaço para raciocinar. Pedir etapas intermediárias — a cadeia de pensamento — melhorou muito o desempenho em problemas de várias etapas (Wei et al., 2022). Nos modelos de raciocínio atuais, isso já vem embutido e pode ser ajustado por parâmetro.
- Quebre tarefas grandes. Pesquisar, rascunhar e revisar em chamadas separadas costuma render mais que tudo de uma vez.
- Autorize o "não sei" e exija lastro. É o princípio anti-alucinação: fornecer o texto-base, pedir que a resposta cite o trecho usado e deixar explícito que "não encontrei no material" é uma resposta aceitável.
O mesmo pedido, duas vezes
Antes: "Me dê jurisprudência sobre acúmulo de cargos de professor."
Depois: "Você vai me ajudar a organizar uma pesquisa. Abaixo, entre as marcas <documentos>, estão cinco ementas que eu mesmo copiei do site do tribunal. Com base apenas nelas, liste as teses sobre acúmulo de cargos de professor, citando o número do processo de cada uma. Se uma tese não estiver nas ementas, não a inclua. Se as ementas não bastarem, diga o que falta pesquisar."
O segundo prompt não deixa o modelo mais inteligente. Ele muda a tarefa de lembrar para ler — e ler é o que o modelo faz melhor.
Duas ressalvas de quem usa isso todo dia. Primeiro, antes de lapidar o prompt, defina o que é uma boa resposta e como você vai testá-la; nem toda falha se resolve com prompt, e às vezes trocar de modelo resolve custo ou latência com menos esforço (Anthropic, 2026). Segundo, prompts de imagem seguem os mesmos princípios, com um acréscimo: descreva a cena, o estilo e a luz, e seja explícito sobre o texto — as ilustrações daqui são geradas com uma frase de abertura fixa, "os únicos textos que aparecem na imagem, e nenhum outro, são…", justamente para conter a tendência a inventar letreiros.
Token 08
Além do prompt: outras formas de usar um LLM
O chat é só a interface mais visível. Nos sistemas que funcionam bem em organizações, o LLM raramente trabalha sozinho, de cabeça. As formas de uso mais importantes, cada uma respondendo a um limite do Token 05, são estas:
Consultar antes de responder. A geração aumentada por recuperação, RAG (retrieval-augmented generation), combina o modelo com uma busca: antes de gerar, o sistema recupera trechos relevantes de uma base de documentos e os coloca no contexto. O trabalho original mostrou que essa combinação de memória "paramétrica" (os pesos) com memória "não paramétrica" (o índice de documentos) gera respostas mais específicas e mais factuais, com a vantagem de permitir apontar a fonte (Lewis et al., 2020). A busca, em geral, é semântica: textos viram embeddings, vetores que ficam próximos quando os sentidos são próximos, e o sistema procura os vizinhos mais próximos da pergunta — exatamente o tipo de busca aproximada em grafos discutido em Busca aplicada.
Em vez de responder de memória, o modelo consulta a gaveta de fontes e mostra o trecho — e alguém confere com a lupa. A caixa de ferramentas sobre a mesa é a outra metade da história. Ilustração gerada por IA.
Usar ferramentas e agir. Um modelo que não faz contas bem pode chamar uma calculadora; um que não sabe a data pode consultar uma agenda. Intercalar raciocínio e ação — pensar, chamar uma ferramenta, ler o resultado, pensar de novo — é a base dos agentes (Yao et al., 2023). Para padronizar essas conexões, foi proposto em 2024 o MCP (Model Context Protocol, protocolo de contexto de modelo), um padrão aberto para ligar assistentes a repositórios de dados, ferramentas de trabalho e ambientes de desenvolvimento (Anthropic, 2024). Com ferramentas vem um risco novo, a injeção de prompt: um documento ou página lido pelo agente pode conter instruções escondidas que ele passa a seguir.
Ajustar o modelo. Quando o que falta não é informação, mas comportamento — um formato fixo, um vocabulário técnico, um tom de voz —, o ajuste fino com exemplos próprios pode valer a pena. Ele não é um bom jeito de "ensinar fatos novos": para isso, RAG costuma ser mais barato e mais fácil de atualizar.
Integrar por programa. Pela API, o modelo vira um componente de software: classifica chamados, extrai dados de notas fiscais em formato estruturado, gera rascunhos em lote. Nesses usos, a saída é validada por código antes de seguir adiante — e modelos especializados em decidir, como o Jev, disputam espaço com os LLMs de conversa.
Quadro 4 — Formas de uso de modelos de linguagem, segundo o problema que resolvem e o que não resolvem
| Forma de uso | Quando usar | O que não resolve |
|---|---|---|
| Prompt bem estruturado | Sempre; é o primeiro passo e o mais barato | Falta de informação que o modelo não tem |
| Prompt com exemplos | Formato ou critério difícil de descrever em palavras | Tarefas que exigem fatos atualizados |
| RAG (consulta a documentos) | Respostas que precisam de fonte, de dados internos ou recentes | Documentos ruins ou mal recuperados; ainda exige conferência |
| Ferramentas e agentes | Contas, buscas, ações em sistemas, tarefas de várias etapas | Erros que se acumulam entre etapas; risco de injeção de prompt |
| Ajuste fino | Comportamento estável: formato, tom, vocabulário de um domínio | Conhecimento que muda com frequência |
| Integração por API | Processos repetitivos, com saída validada por código | Decisões que exigem responsabilidade humana |
Fonte: elaborado pelo autor com base em Brown et al. (2020), Lewis et al. (2020), Ouyang et al. (2022), Yao et al. (2023) e Anthropic (2024; 2026).
A última linha do quadro não é retórica. Desde março de 2025, uma resolução do CNJ admite que magistrados e servidores usem LLMs e outras ferramentas de IA generativa "como ferramentas de auxílio à gestão ou de apoio à decisão", mas veda seu uso "como instrumento autônomo de tomada de decisões judiciais" e mantém o magistrado integralmente responsável pelo que assina (Conselho Nacional de Justiça, 2025, art. 19). A regra resume bem o lugar da IA generativa em qualquer trabalho intelectual: auxiliar, sim; autora do que você assina, não. Na universidade, é o mesmo espírito do guia da UNESCO para o uso do ChatGPT no ensino superior e das diretrizes para o uso ético da IA generativa já comentados aqui.
Aplicação prática
Seis conferências antes de usar um texto gerado
Marque os itens conforme conseguir cumpri-los na próxima vez em que usar um LLM para algo que vai assinar — um parecer, um relatório, um plano de aula, um trabalho.
0 de 6 — comece separando forma de fato.
Token de parada
De volta à sentença
Releia o caso do início com o que foi visto até aqui. O servidor pediu jurisprudência a um modelo de linguagem, ou seja, pediu que ele lembrasse fatos específicos, raros e verificáveis — o tipo exato de fato que aparece poucas vezes nos dados e que a estatística do treino não consegue separar do inventado. O modelo, ajustado num mundo em que "não sei" vale zero, não disse "não sei". Sorteou, token a token, precedentes com a forma perfeita de precedentes. E ninguém, entre a tela e a assinatura, abriu o site do tribunal.
Nenhuma dessas etapas exige má-fé, e é isso que torna o caso didático. A falha não foi da máquina nem da pessoa isoladamente: foi de um processo em que ninguém tinha a tarefa de conferir. O mesmo processo existe, em escala menor, em cada trabalho acadêmico, relatório técnico e plano de aula escrito com ajuda de IA.
Na sua área, quais são as informações que um modelo de linguagem produziria com a forma perfeita e o conteúdo inventado — e quem, no seu fluxo de trabalho, tem hoje a tarefa de abrir a fonte?
Leia também
Para continuar no Brasil Acadêmico:
- Afinal, o que é inteligência artificial? — o ponto de partida da série.
- Entenda o que é IA, aprendizagem de máquina, deep learning, LLM — os conjuntos aninhados, de IA a LLM.
- Como a máquina aprende — neurônios, pesos e retropropagação.
- Afinal, o que é um prompt? — da engenharia de prompt à engenharia de contexto.
- Jev: modelo de IA da TypeSafe que decide em vez de conversar — probabilidade calibrada em vez de texto.
- Terence Tao e o paradoxo da IA com a ciência — quando a eficácia atrapalha.
- Tecnologias emergentes na comunicação e A cibercultura da Web 1.0 à web das IAs — a IA generativa como fenômeno de mídia.
- Pesquisa aplicada: método científico, fontes e normas — por que "fontes na mesa".
- MIT: como o cérebro se beneficia quando você usa IA da forma certa e Para entender a IA, tudo o que você precisa é de… planilhas — dois clássicos da casa.
Nota do autor: o caso que abre e fecha o texto foi reconstituído a partir da cobertura jornalística de novembro de 2023; o nome do magistrado não é citado de propósito, porque o interesse aqui é o processo, não a pessoa, e porque as reportagens divergem em detalhes como o número de precedentes inventados. Os números da base de Damien Charlotin mudam quase diariamente; os citados correspondem à atualização de 23 de setembro de 2026 e incluem apenas decisões em que o tribunal constatou o uso de conteúdo inventado. As distribuições do Laboratório 1 são fictícias, escritas à mão para ilustrar o mecanismo; não foram extraídas de nenhum modelo. O Laboratório 2 aplica a fórmula do processo direto de difusão com um cronograma cosseno de mil passos a uma imagem desenhada por código, já conhecida; a barra de mistura mostra a proporção da variância atribuída ao sinal e ao ruído, e a animação não é uma geração de verdade. O Laboratório 3 reproduz a regra de pontuação proposta por Kalai et al. (2025), com o desconto calculado pela fórmula t/(1 − t); a versão consultada do artigo lista, para t = 0,75, um desconto de 2 pontos, valor que não confere com a própria fórmula (0,75/0,25 = 3) — adotou-se o resultado da fórmula. A Tabela 1 foi transcrita da página da OpenAI; os valores são os divulgados pela empresa e não foram reproduzidos de forma independente. A frase "alucinações não precisam ser misteriosas", destacada no Token 06, parafraseia o resumo de Kalai et al. (2025). Os artigos científicos são citados nas versões de acesso aberto do arXiv, conforme o critério desta série; vários foram publicados depois em anais e periódicos (Vaswani et al. e Brown et al. na NeurIPS; Rombach et al. na CVPR 2022; Berglund et al. na ICLR 2024; Huang et al. na ACM Transactions on Information Systems). A página de documentação da Anthropic não traz data explícita; o ano da referência é o do acesso. Esta versão foi revista após uma avaliação independente: foram explicitados que "prever o próximo token" descreve os modelos autorregressivos (com o BERT como contraexemplo), a diferença entre modelo de linguagem, LLM e assistente, os componentes do Transformer além da atenção, as demais famílias de modelos generativos e o papel conjunto de parâmetros, dados e computação; a sugestão de um tokenizador interativo não foi adotada porque uma segmentação escrita à mão poderia ensinar divisões que nenhum tokenizador real produz. O BERT é citado pela versão do arXiv (a publicação revisada saiu nos anais da NAACL 2019), e o Chinchilla, pela pré-publicação (publicado depois na NeurIPS 2022). As ilustrações foram geradas por IA com o Gemini (Nano Banana), em estilo de animação 3D, e conferidas visualmente; nenhuma retrata pessoa real.
Glossário
Termos técnicos em ordem alfabética. Os termos com sublinhado pontilhado no texto trazem até aqui; o botão ao lado do verbete leva de volta.
- Agente
- Sistema em que um modelo de linguagem, em vez de só responder, planeja e executa ações em etapas: chama ferramentas, lê os resultados e decide o próximo passo. Token 08
- Ajuste fino
- Treino adicional de um modelo já pré-treinado com um conjunto menor e específico de exemplos, para mudar seu comportamento — seguir instruções, adotar um formato, dominar um vocabulário. Tokens 03 e 08
- Alucinação
- Conteúdo gerado que soa plausível, mas é falso ou não tem apoio no material fornecido. Divide-se em problemas de factualidade (contra o mundo) e de fidelidade (contra o pedido ou o contexto). Token 06
- Aprendizagem em contexto (few-shot)
- Capacidade de um modelo executar uma tarefa nova a partir de alguns exemplos colocados no próprio prompt, sem alterar seus parâmetros. Token 03
- Atenção
- Mecanismo que, para cada token, calcula a relevância dos outros tokens na construção da sua representação, em várias "cabeças" e camadas. Calcula relações; não equivale a compreensão. É a peça mais conhecida do Transformer; na forma de atenção cruzada, liga o texto do prompt à imagem nos modelos de difusão. Tokens 03 e 04
- Autorregressivo
- Modelo que gera uma sequência uma parte por vez, cada parte condicionada às anteriores. Os LLMs da família GPT são autorregressivos: produzem um token de cada vez, da esquerda para a direita. Token 03
- Cadeia de pensamento (chain-of-thought)
- Técnica de pedir, ou treinar o modelo para produzir, etapas intermediárias de raciocínio antes da resposta final. Melhora o desempenho em problemas de várias etapas. Token 07
- Calibração
- Propriedade de um modelo cujas probabilidades correspondem às frequências reais de acerto: quando diz "80% de chance", acerta cerca de 80% das vezes. Token 06
- Codificador e decodificador
- As duas metades do Transformer original. O codificador (encoder) lê a entrada inteira e produz representações; o decodificador (decoder) gera a saída token a token. BERT usa só o primeiro; GPT, só o segundo; T5, os dois. Token 03
- Decodificação gulosa
- Estratégia de geração que escolhe sempre o token mais provável. É determinística; a alternativa é a amostragem, que sorteia de acordo com as probabilidades. Token 03
- Embedding
- Representação de um texto, imagem ou outro dado como vetor de números, construída de modo que itens de sentido parecido fiquem próximos. Base da busca semântica usada no RAG. Token 08
- Espaço latente
- Representação comprimida dos dados, aprendida por uma rede codificadora. Nos modelos de difusão latente, a remoção de ruído acontece nesse espaço menor, e um decodificador devolve os pixels no fim. Token 04
- GAN (generative adversarial network)
- "Rede adversária generativa": par de redes treinadas em competição, uma gerando exemplos falsos e outra tentando distingui-los dos verdadeiros. Liderou a geração de imagens até ser superada pela difusão. Token 02
- IA generativa
- Ramo da inteligência artificial dedicado a modelos que produzem conteúdo novo — texto, imagem, áudio, vídeo, código — amostrando de uma distribuição aprendida a partir de exemplos. Token 01
- Injeção de prompt
- Ataque em que instruções maliciosas são escondidas num conteúdo que o modelo vai ler (uma página, um e-mail, um documento), fazendo-o agir contra a intenção de quem o usa. Token 08
- Janela de contexto
- Quantidade máxima de tokens que o modelo considera de uma vez: instruções, histórico da conversa, documentos e a própria resposta. O que fica fora dela não influencia a geração. Token 05
- LLM (large language model)
- "Grande modelo de linguagem": modelo de linguagem neural de grande porte, em geral um Transformer com bilhões de parâmetros. Os generativos, como a família GPT, são autorregressivos: pré-treinados para prever o próximo token. Não se confunde com o assistente (ChatGPT, Gemini, Claude), que é um sistema construído em volta dele. Token 03
- Logits
- Pontuações brutas que o modelo atribui a cada token do vocabulário antes da função softmax, que as converte em probabilidades. A temperatura divide os logits antes dessa conversão. Token 03
- Maldição da reversão
- Falha em que um modelo treinado com afirmações do tipo "A é B" não consegue responder a perguntas no sentido "B é A". Desaparece quando a informação está no próprio prompt. Token 05
- MCP (Model Context Protocol)
- "Protocolo de contexto de modelo": padrão aberto, lançado em 2024, para conectar assistentes de IA a fontes de dados e ferramentas por meio de servidores e clientes padronizados. Token 08
- Modelo de difusão
- Modelo generativo treinado para remover ruído de imagens progressivamente sujas. Gera partindo de ruído puro e aplicando essa limpeza em muitos passos. Token 04
- Parâmetro
- Cada um dos números ajustáveis de uma rede neural (os pesos). O tamanho de um modelo costuma ser expresso em bilhões de parâmetros, mas eles não são fatos armazenados, e mais parâmetros não bastam sem dados e computação proporcionais. Token 03
- Pré-treinamento
- Primeira e mais cara fase de treino de um LLM: prever o próximo token em enormes volumes de texto. Dá ao modelo conhecimento e fluência, mas não o hábito de seguir instruções. Token 03
- RAG (retrieval-augmented generation)
- "Geração aumentada por recuperação": arquitetura que busca trechos relevantes numa base de documentos e os coloca no contexto antes de o modelo gerar a resposta, o que permite apontar a fonte. Token 08
- RLHF (reinforcement learning from human feedback)
- "Aprendizado por reforço a partir de feedback humano": etapa de ajuste em que pessoas comparam respostas do modelo e ele é otimizado para produzir as preferidas. Token 03
- Ruído (gaussiano)
- Valores aleatórios, sorteados de uma distribuição normal, somados à imagem no treino dos modelos de difusão. Visualmente, parece o chuvisco de uma TV fora do ar. Token 04
- Temperatura
- Parâmetro do sorteio do próximo token. Valores baixos concentram a chance nos tokens mais prováveis; valores altos espalham a chance e deixam o texto mais variado e mais arriscado. Token 03
- Token
- Unidade de texto processada pelo modelo: uma palavra, parte de uma palavra ou um sinal. Custos, limites de contexto e velocidade de geração são medidos em tokens. Token 03
- Transformer
- Arquitetura de rede neural proposta em 2017 para tradução, com codificador e decodificador. Cada bloco combina atenção multicabeça, rede feed-forward, conexões residuais e normalização, com codificação de posição na entrada. Suas variantes são a base dos LLMs atuais e de muitos geradores de imagem. Token 03
- VAE (variational autoencoder)
- "Autocodificador variacional": modelo que aprende a comprimir dados num espaço de códigos contínuo e a gerar exemplos novos decodificando códigos sorteados. Precursor dos espaços latentes usados na difusão. Token 02
Referências
- ANTHROPIC. Introducing the Model Context Protocol. Anthropic, San Francisco, 25 nov. 2024. Disponível em: https://www.anthropic.com/news/model-context-protocol. Acesso em: 24 set. 2026.
- ANTHROPIC. Prompt engineering overview. San Francisco: Claude Platform Docs, 2026. Disponível em: https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/overview. Acesso em: 24 set. 2026.
- BENDER, Emily M.; GEBRU, Timnit; McMILLAN-MAJOR, Angelina; SHMITCHELL, Shmargaret. On the dangers of stochastic parrots: can language models be too big? In: ACM CONFERENCE ON FAIRNESS, ACCOUNTABILITY, AND TRANSPARENCY, 2021, [on-line]. Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency. Nova York: ACM, 2021. p. 610-623. DOI: 10.1145/3442188.3445922. Disponível em: https://dl.acm.org/doi/10.1145/3442188.3445922. Acesso em: 24 set. 2026.
- BERGLUND, Lukas et al. The reversal curse: LLMs trained on "A is B" fail to learn "B is A". [S. l.]: arXiv, 2023. Pré-publicação arXiv:2309.12288. Disponível em: https://arxiv.org/abs/2309.12288. Acesso em: 24 set. 2026.
- BROWN, Tom B. et al. Language models are few-shot learners. [S. l.]: arXiv, 2020. Pré-publicação arXiv:2005.14165. Disponível em: https://arxiv.org/abs/2005.14165. Acesso em: 24 set. 2026.
- CHARLOTIN, Damien. AI hallucination cases database. [S. l.], 2026. Base de dados. Atualizada em 23 set. 2026. Disponível em: https://www.damiencharlotin.com/hallucinations/. Acesso em: 24 set. 2026.
- CNJ abre investigação contra juiz que usou ChatGPT para escrever decisão. CartaCapital, São Paulo, 13 nov. 2023. Disponível em: https://www.cartacapital.com.br/justica/cnj-abre-investigacao-contra-juiz-que-usou-chatgpt-para-escrever-decisao/. Acesso em: 24 set. 2026.
- CONSELHO NACIONAL DE JUSTIÇA (Brasil). Resolução nº 615, de 11 de março de 2025. Estabelece diretrizes para o desenvolvimento, utilização e governança de soluções desenvolvidas com recursos de inteligência artificial no Poder Judiciário. DJe/CNJ, Brasília, DF, n. 54, p. 2-17, 14 mar. 2025. Disponível em: https://atos.cnj.jus.br/atos/detalhar/6001. Acesso em: 24 set. 2026.
- DEVLIN, Jacob; CHANG, Ming-Wei; LEE, Kenton; TOUTANOVA, Kristina. BERT: pre-training of deep bidirectional transformers for language understanding. [S. l.]: arXiv, 2019. Pré-publicação arXiv:1810.04805v2. Disponível em: https://arxiv.org/abs/1810.04805. Acesso em: 24 set. 2026.
- DHARIWAL, Prafulla; NICHOL, Alex. Diffusion models beat GANs on image synthesis. [S. l.]: arXiv, 2021. Pré-publicação arXiv:2105.05233. Disponível em: https://arxiv.org/abs/2105.05233. Acesso em: 24 set. 2026.
- GOODFELLOW, Ian J. et al. Generative adversarial networks. [S. l.]: arXiv, 2014. Pré-publicação arXiv:1406.2661. Disponível em: https://arxiv.org/abs/1406.2661. Acesso em: 24 set. 2026.
- HO, Jonathan; JAIN, Ajay; ABBEEL, Pieter. Denoising diffusion probabilistic models. [S. l.]: arXiv, 2020. Pré-publicação arXiv:2006.11239. Disponível em: https://arxiv.org/abs/2006.11239. Acesso em: 24 set. 2026.
- HOFFMANN, Jordan et al. Training compute-optimal large language models. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2203.15556. Disponível em: https://arxiv.org/abs/2203.15556. Acesso em: 24 set. 2026.
- HUANG, Lei et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. [S. l.]: arXiv, 2024. Pré-publicação arXiv:2311.05232v2. Disponível em: https://arxiv.org/abs/2311.05232. Acesso em: 24 set. 2026.
- KALAI, Adam Tauman; NACHUM, Ofir; VEMPALA, Santosh S.; ZHANG, Edwin. Why language models hallucinate. [S. l.]: arXiv, 2025. Pré-publicação arXiv:2509.04664. Disponível em: https://arxiv.org/abs/2509.04664. Acesso em: 24 set. 2026.
- KINGMA, Diederik P.; WELLING, Max. Auto-encoding variational Bayes. [S. l.]: arXiv, 2013. Pré-publicação arXiv:1312.6114. Disponível em: https://arxiv.org/abs/1312.6114. Acesso em: 24 set. 2026.
- LEWIS, Patrick et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. [S. l.]: arXiv, 2020. Pré-publicação arXiv:2005.11401. Disponível em: https://arxiv.org/abs/2005.11401. Acesso em: 24 set. 2026.
- NIE, Shen et al. Large language diffusion models. [S. l.]: arXiv, 2025. Pré-publicação arXiv:2502.09992. Disponível em: https://arxiv.org/abs/2502.09992. Acesso em: 24 set. 2026.
- OPENAI. Why language models hallucinate. OpenAI, San Francisco, 5 set. 2025. Disponível em: https://openai.com/index/why-language-models-hallucinate/. Acesso em: 24 set. 2026.
- OUYANG, Long et al. Training language models to follow instructions with human feedback. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2203.02155. Disponível em: https://arxiv.org/abs/2203.02155. Acesso em: 24 set. 2026.
- RAFFEL, Colin et al. Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of Machine Learning Research, [s. l.], v. 21, n. 140, p. 1-67, 2020. Disponível em: https://jmlr.org/papers/v21/20-074.html. Acesso em: 24 set. 2026.
- ROMBACH, Robin et al. High-resolution image synthesis with latent diffusion models. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2112.10752v2. Disponível em: https://arxiv.org/abs/2112.10752. Acesso em: 24 set. 2026.
- RUSSELL, Stuart; NORVIG, Peter. Artificial intelligence: a modern approach. 4. ed. Hoboken: Pearson, 2021.
- SCHULHOFF, Sander et al. The prompt report: a systematic survey of prompt engineering techniques. [S. l.]: arXiv, 2025. Pré-publicação arXiv:2406.06608v6. Disponível em: https://arxiv.org/abs/2406.06608. Acesso em: 24 set. 2026.
- VASWANI, Ashish et al. Attention is all you need. [S. l.]: arXiv, 2017. Pré-publicação arXiv:1706.03762. Disponível em: https://arxiv.org/abs/1706.03762. Acesso em: 24 set. 2026.
- WEI, Jason et al. Chain-of-thought prompting elicits reasoning in large language models. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2201.11903. Disponível em: https://arxiv.org/abs/2201.11903. Acesso em: 24 set. 2026.
- YAO, Shunyu et al. ReAct: synergizing reasoning and acting in language models. [S. l.]: arXiv, 2023. Pré-publicação arXiv:2210.03629. Disponível em: https://arxiv.org/abs/2210.03629. Acesso em: 24 set. 2026.
Comentários