Fundamentos de IA generativa: modelos de linguagem e de difusão

Compartilhar

Em novembro de 2023, a Corregedoria do Conselho Nacional de Justiça passou a investigar um juiz federal que tinha assinado uma decisão com p...

Em novembro de 2023, a Corregedoria do Conselho Nacional de Justiça passou a investigar um juiz federal que tinha assinado uma decisão com precedentes do Superior Tribunal de Justiça que nunca existiram: haviam sido redigidos, com toda a segurança, por um modelo de linguagem. O caso é uma boa porta de entrada para entender a inteligência artificial generativa por dentro. Esta postagem explica como funcionam as duas famílias que dominam a área — os modelos de linguagem, que escrevem prevendo o próximo pedaço de texto, e os modelos de difusão, que pintam removendo ruído —, o que eles fazem bem, onde tropeçam e por que "alucinam". Depois, reúne o que a engenharia de prompts ainda ensina e as outras formas de usar um LLM, da consulta a fontes aos agentes com ferramentas, com três laboratórios interativos para ver a teoria funcionando na tela.
Ateliê noturno em estilo de animação 3D: à esquerda, uma máquina de escrever de latão imprime fichas de madeira com as palavras o, gato, subiu, no, enquanto a ficha telhado desce brilhando; à direita, um braço mecânico pinta sobre uma tela de chuvisco colorido a imagem de um gato num telhado ao luar; no centro, um gato laranja observa

Token 01

Precedentes que nunca existiram

A parte que perdeu a causa leu a sentença com atenção e estranhou as citações. Os julgados atribuídos ao Superior Tribunal de Justiça tinham número, relator e trechos entre aspas — e não existiam. O advogado levou o caso à corregedoria regional, o juiz federal da 1ª Região atribuiu a pesquisa a um servidor e falou em "mero equívoco" causado pela sobrecarga de trabalho, e o corregedor Néviton Guedes resumiu o que havia acontecido: "A ferramenta de IA generativa, utilizada como assistente de minuta de ato judicial, apresentou como resultado de pesquisa jurisprudencial precedentes inexistentes" (CNJ abre…, 2023, não paginado). Era novembro de 2023, e o Conselho Nacional de Justiça abriu investigação.

O episódio não foi um acidente isolado. O pesquisador Damien Charlotin mantém uma base aberta com decisões judiciais do mundo todo em que o tribunal constatou conteúdo inventado por IA — quase sempre citações falsas. Em 23 de setembro de 2026, a base somava 2 077 casos, 41 deles no Brasil (Charlotin, 2026). Advogados, peritos, partes sem advogado e juízes aparecem na lista.

A pergunta interessante não é "como alguém confia numa máquina dessas?". É outra: como uma mesma tecnologia consegue escrever um parágrafo impecável e, na frase seguinte, inventar um precedente com a mesma calma? A resposta está no modo como esses sistemas são construídos — e entender isso é o que separa quem usa a IA generativa com proveito de quem é usado por ela.

Esta postagem continua a conversa de Entenda o que é IA, aprendizagem de máquina, deep learning, LLM, que apresentou a IA generativa como uma das "bonecas russas" dentro do aprendizado profundo, e de Como a máquina aprende, que mostrou como uma rede ajusta seus pesos. Aqui, a pergunta é o que acontece quando a rede, em vez de classificar, produz.

Token 02

Duas máquinas, uma mesma ideia

Todo modelo generativo faz, no fundo, a mesma coisa: aprende, a partir de muitos exemplos, como os dados costumam ser — que palavras aparecem juntas, que cores e formas convivem numa foto — e depois sorteia exemplos novos que se parecem com os de treino. Um modelo de linguagem, na definição clássica dos livros-texto, é uma distribuição de probabilidade sobre sequências de palavras (Russell; Norvig, 2021). Gerar é amostrar dessa distribuição.

O campo é mais amplo do que o chat deixa ver, e o que distingue uma família de modelos generativos de outra é o jeito de aprender e de sortear. Os autocodificadores variacionais (VAEs) aprendem a comprimir cada exemplo num código compacto e a gerar dados novos a partir de códigos sorteados (Kingma; Welling, 2013). As redes adversárias generativas (GANs) põem duas redes para competir — uma falsifica, a outra tenta flagrar a falsificação — (Goodfellow et al., 2014) e lideraram a geração de imagens na segunda metade da década de 2010. Os modelos autorregressivos geram uma parte por vez, cada uma condicionada às anteriores. E os modelos de difusão, que superaram as GANs em qualidade de imagem por volta de 2021 (Dhariwal; Nichol, 2021), tornaram-se a abordagem central na geração de imagens. Há ainda híbridos e outras arquiteturas.

IA generativa, portanto, não é sinônimo de LLM: os grandes modelos de linguagem são uma família dentro do campo — hoje, majoritariamente Transformers autorregressivos. Esta postagem se concentra nas duas famílias que dominam o uso cotidiano. A capa mostra as duas máquinas produzindo a mesma cena, um gato num telhado, por caminhos opostos:

modelo de linguagemEscreve da esquerda para a direitaOlha tudo o que já foi escrito e escolhe o próximo pedaço de texto. Depois repete, agora com esse pedaço incluído. Uma decisão por vez, sem voltar atrás.
modelo de difusãoPinta tudo ao mesmo tempoComeça de um quadro de puro ruído e, em muitos passos, remove um pouco da sujeira em todos os pontos de uma vez, até sobrar uma imagem.
em comumPlausível não é verdadeiroOs dois produzem o que é provável dado o que viram no treino. Nenhum dos dois tem, de fábrica, um mecanismo para checar se o resultado corresponde ao mundo.

A terceira ficha é a que interessa para o caso do juiz — e ela vai voltar. Antes, vale abrir cada máquina.

Token 03

Modelos de linguagem: a arte de prever o próximo token

Um LLM (large language model, "grande modelo de linguagem") não lê letras nem palavras inteiras: lê tokens, pedaços de texto que podem ser uma palavra inteira ("gato"), um fragmento de palavra, um caractere ou um sinal de pontuação. A divisão exata depende do tokenizador de cada modelo; em geral, palavras comuns viram um token só, e palavras longas ou raras são quebradas em vários. Cada token vira uma lista de números. Os LLMs generativos autorregressivos — a família do GPT e da maioria dos assistentes de conversa atuais — aprendem a responder a uma única pergunta, bilhões de vezes: dado tudo o que veio antes, qual é a distribuição de probabilidade do próximo token?

Essa fase se chama pré-treinamento. O modelo lê uma quantidade enorme de texto, tenta adivinhar cada token seguinte, compara o palpite com o que de fato vinha e ajusta seus parâmetros — os pesos da rede — para errar um pouco menos da próxima vez. É a mesma descida do gradiente de Como a máquina aprende, só que numa escala de centenas de bilhões de parâmetros.

O limite da metáfora

"Prever o próximo token" descreve a tarefa de treino, não o que acontece por dentro. Não é consultar uma tabela de frases prontas, nem contar quantas vezes uma sequência apareceu na internet — isso era o que faziam os antigos modelos de n-gramas. Para prever bem o próximo token em textos de todo tipo, a rede precisa construir representações internas de sintaxe, de relações entre conceitos, de estilo e de contexto; por isso "autocompletar gigante" subestima o que esses modelos fazem. O erro oposto também é comum: representações ricas não equivalem a compreensão no sentido humano, e é nesse intervalo que mora boa parte do debate da área (volte a ele no Token 05).

A peça que mudou tudo: atenção

A arquitetura por trás de praticamente todos os LLMs atuais é o Transformer, proposto em 2017 por pesquisadores do Google para tradução automática (Vaswani et al., 2017). Sua peça mais conhecida é o mecanismo de atenção: para montar a representação de cada token, o modelo calcula o quanto cada um dos outros tokens é relevante para ele. Em "o gato subiu no telhado porque ele estava com medo", é esse cálculo que permite relacionar "ele" a "gato", e não a "telhado". Na prática, isso acontece em várias "cabeças" de atenção em paralelo e se repete em dezenas de camadas, cada uma captando relações diferentes — não existe uma única "porcentagem de importância" por palavra.

Mas o Transformer não é só atenção. Cada bloco combina a atenção com uma rede neural comum (feed-forward), conexões residuais e normalização, e a entrada recebe uma codificação da posição de cada token, porque a atenção, sozinha, não sabe a ordem das palavras (Vaswani et al., 2017). Como esses cálculos podem ser feitos em paralelo, o Transformer tornou viável treinar modelos muito maiores do que as redes recorrentes anteriores permitiam.

O Transformer original tinha duas metades: um codificador, que lê a frase inteira de entrada, e um decodificador, que escreve a tradução token a token. Os modelos que vieram depois ficaram com uma delas, com a outra ou com as duas. O BERT, do Google, usa só o codificador e é pré-treinado adivinhando tokens mascarados no meio da frase, olhando para os dois lados (Devlin et al., 2019); não é um gerador de texto. O GPT usa só o decodificador. O T5 manteve as duas metades e tratou toda tarefa como transformar um texto em outro (Raffel et al., 2020).

Quadro 1 — Três arquiteturas derivadas do Transformer, com exemplo clássico e uso característico

ArquiteturaExemplo clássicoComo lê o texto no treinoUso característico
Só codificador (encoder-only)BERTNos dois sentidos, adivinhando tokens mascaradosRepresentação e classificação: busca semântica, triagem de documentos, análise de sentimento
Só decodificador (decoder-only)Família GPTSó o que veio antes, prevendo o próximo tokenGeração autorregressiva: assistentes de conversa, código
Codificador-decodificadorTransformer original; T5Codificador lê a entrada inteira; decodificador gera a saída token a tokenTransformar uma sequência em outra: tradução, resumo

Fonte: elaborado pelo autor com base em Vaswani et al. (2017), Devlin et al. (2019), Brown et al. (2020) e Raffel et al. (2020).Nota: "prever o próximo token" descreve os modelos autorregressivos (decodificadores), não todo modelo de linguagem nem todo Transformer. O Transformer de 2017 não é a arquitetura exata dos assistentes atuais.

Em 2020, o GPT-3, com 175 bilhões de parâmetros, mostrou um efeito que surpreendeu a própria área: bastava colocar alguns exemplos de uma tarefa no próprio texto de entrada para o modelo executá-la, sem nenhum novo treinamento — a aprendizagem em contexto (Brown et al., 2020). Nascia ali, na prática, a engenharia de prompts.

De completar textos a seguir instruções

Um modelo só pré-treinado é um excelente completador de textos, não um assistente: se você escreve "Explique a fotossíntese para uma criança", ele pode continuar com "Explique a respiração celular para uma criança", porque listas de exercícios são textos comuns na internet. O que transformou completadores em assistentes foi uma segunda etapa, o ajuste fino: primeiro com exemplos de instruções e boas respostas escritas por pessoas, depois com o RLHF (reinforcement learning from human feedback, aprendizado por reforço a partir de feedback humano), em que avaliadores ordenam respostas e o modelo é recompensado por produzir as preferidas. O resultado mais citado desse trabalho é eloquente: as respostas de um modelo ajustado com 1,3 bilhão de parâmetros foram preferidas às do GPT-3 original, com 175 bilhões — cem vezes maior (Ouyang et al., 2022).

Duas ressalvas completam essa história. A primeira: tamanho não é tudo. Um estudo da DeepMind mostrou que muitos LLMs estavam subtreinados para o seu porte: com o mesmo orçamento de computação, o Chinchilla, com 70 bilhões de parâmetros e cerca de quatro vezes mais dados de treino, superou modelos de 175 a 530 bilhões de parâmetros (Hoffmann et al., 2022). O que pesa é o equilíbrio entre parâmetros, dados e computação — e parâmetros não são fatos armazenados, são pesos que codificam padrões de forma distribuída. A segunda ressalva está no quadro abaixo.

Não confunda: modelo de linguagem, LLM e assistente

Modelo de linguagem é qualquer modelo que atribui probabilidades a sequências de texto — dos antigos modelos de n-gramas, que contavam sequências de palavras, às redes neurais atuais (Russell; Norvig, 2021).

LLM é um modelo de linguagem neural de grande porte, hoje quase sempre um Transformer. Em si, é um conjunto de pesos: recebe tokens e devolve probabilidades.

Assistente conversacional — ChatGPT, Gemini, Claude, no sentido em que as pessoas os usam — é um sistema construído em volta de um ou mais LLMs, com instruções de sistema, histórico da conversa, filtros de segurança e, cada vez mais, busca, memória persistente e ferramentas. Quando alguém diz que "o ChatGPT errou", quem errou foi esse sistema inteiro — e é nele que entram as soluções do Token 08.

Onde entra o acaso

Na hora de responder, o modelo não "escolhe a palavra certa". A figura abaixo resume, de forma esquemática, o caminho que cada token percorre durante a geração:

Figura 1 — Do texto ao próximo token: o caminho simplificado de um LLM autorregressivo na inferência

Fonte: elaborado pelo autor com base em Vaswani et al. (2017) e Brown et al. (2020).Nota: visão esquemática e simplificada. Pré-treinamento e ajuste fino, que definem os pesos usados nas etapas 3 a 5, acontecem antes e não fazem parte deste ciclo.

Na etapa 7 há duas escolhas básicas. A decodificação gulosa pega sempre o token mais provável: é determinística e tende a produzir texto previsível. A amostragem sorteia um token de acordo com as probabilidades, e um parâmetro chamado temperatura controla o quanto esse sorteio é conservador: temperatura baixa concentra a chance no favorito; temperatura alta espalha a chance entre as alternativas, e o texto fica mais variado — e mais arriscado. Chamar a temperatura de "botão da criatividade" é só uma metáfora: tecnicamente, ela apenas achata ou afia a distribuição.

Robô de latão gira uma roleta de parque de diversões com quatro fatias de tamanhos diferentes: telhado ocupa metade, muro um quarto, árvore e sofá fatias menores; no peito do robô, um botão giratório com a plaquinha temperatura

Gerar texto é girar uma roleta viciada a cada token. O botão da temperatura não muda o que o modelo sabe: muda o tamanho das fatias na hora do sorteio. Ilustração gerada por IA.

O laboratório abaixo usa distribuições fictícias, escritas à mão para fins didáticos, mas o mecanismo é o de verdade: probabilidades por token, reajustadas pela temperatura, e a escolha — gulosa ou por sorteio. Experimente as três frases. A terceira é a mais importante.

Laboratório 1 · a roleta do próximo token

O gato subiu no ▁

telhado52%
muro22%
sofá12%
árvore8%
carro4%
piano2%

Temperatura 1,0: o favorito leva 52% das chances. Clique em sortear.

Repare no que acontece na terceira frase: o modelo não tem nenhum favorito claro, porque não sabe o título. Mesmo assim, qualquer token sorteado começa uma frase perfeitamente gramatical — "Modelagem de…", "Contribuições para…" — e o texto segue fluente. Uma distribuição achatada é o retrato estatístico de "não sei"; o problema é que o sorteio transforma esse "não sei" numa resposta com cara de certeza.

Token 04

Modelos de difusão: esculpir uma imagem no ruído

Gerar uma imagem pixel a pixel, da esquerda para a direita, como um LLM gera texto, é possível mas lento e pouco natural: numa foto, o céu do canto de cima depende tanto do chão quanto o chão depende do céu. Os modelos de difusão atacam o problema de outro jeito, e a ideia é quase uma brincadeira.

No treino, pega-se uma imagem de verdade e se acrescenta a ela, em muitos pequenos passos, um ruído aleatório — como o chuvisco de uma TV fora do ar — até que, no último passo, não sobre nada da imagem original. No trabalho que popularizou a técnica, são mil passos (Ho; Jain; Abbeel, 2020). A rede é então treinada para a tarefa inversa: olhar uma imagem suja e estimar qual parte dela é ruído. Se ela sabe estimar o ruído, sabe removê-lo um pouco.

Para criar uma imagem nova, basta partir de ruído puro, sorteado, e aplicar a rede passo a passo. Cada passo tira um pouco da sujeira e deixa aparecer um pouco mais de estrutura, até sobrar uma imagem que nunca existiu, mas que tem a "cara" das imagens de treino.

Robô de latão numa escadinha limpa com um pano a quarta de cinco telas penduradas lado a lado: a primeira é só chuvisco colorido, com a plaquinha ruído; nas seguintes, um ipê-amarelo florido vai surgindo até ficar nítido na quinta tela, com a plaquinha imagem

A geração por difusão lida da esquerda para a direita: do ruído à imagem, um passo de limpeza por vez. O treino fez o caminho contrário, sujando imagens reais. Ilustração gerada por IA.

Trabalhar diretamente com milhões de pixels custa caro. O salto que tornou a difusão popular foi fazer esse processo num espaço latente: um codificador comprime a imagem numa representação bem menor, a difusão acontece ali, e um decodificador devolve os pixels no fim. O mesmo trabalho acrescentou camadas de atenção cruzada, que permitem que um texto — o prompt — oriente cada passo da limpeza (Rombach et al., 2022). É essa combinação, liberada em código aberto, que deu origem ao Stable Diffusion e que está por trás de boa parte dos geradores de imagem atuais. Repare que a atenção, a peça central dos LLMs, reaparece aqui como a ponte entre palavras e pixels.

No laboratório abaixo, arraste o controle ou clique em gerar. A fórmula aplicada é a do processo de difusão, com um cronograma de ruído em mil passos, mas há uma trapaça didática, e é bom dizê-la de saída: aqui a imagem final já é conhecida, e a animação apenas mostra a mistura de sinal e ruído em cada passo. Num modelo de verdade, a rede não conhece o destino — ela estima, a cada passo, o que é ruído, e por isso cada sorteio inicial produz uma imagem diferente.

Laboratório 2 · do ruído à imagem

sinal 0% · ruído 100% (proporção da variância)

Passo 1000: só ruído. Nenhum pixel ainda carrega informação da imagem.

Brinque com o controle perto do fim: nos últimos cem passos a imagem muda pouco, e nos primeiros cem quase nada se vê. A difusão decide primeiro a composição geral e só no fim os detalhes — o que ajuda a entender por que mãos, dedos e letras, que são detalhes pequenos e muito regrados, estão entre as coisas que esses modelos mais erram.

A fronteira está ficando borrada

A divisão "texto é autorregressivo, imagem é difusão" já não é uma lei. Há modelos de difusão para texto: o LLaDA, com 8 bilhões de parâmetros, parte de uma frase toda mascarada e vai revelando os tokens em paralelo, com desempenho comparável a um LLM autorregressivo do mesmo porte em várias tarefas — e se sai melhor justamente num tipo de pergunta "de trás para a frente" que costuma derrubar os modelos tradicionais (Nie et al., 2025). O Jev, da TypeSafe, discutido aqui no blog, também abandona a geração token a token para devolver decisões com probabilidade calibrada. E, no caminho inverso, vários geradores de imagem recentes usam Transformers dentro do processo de difusão.

Quadro 2 — Comparação entre modelos de linguagem autorregressivos e modelos de difusão

AspectoModelo de linguagem autorregressivoModelo de difusão
O que gera, tipicamenteTexto, código, dados estruturadosImagens, áudio, vídeo
Como geraUm token por vez, da esquerda para a direita, sem revisar o que já saiuA obra inteira de uma vez, refinada em dezenas a milhares de passos de limpeza
O que aprende no treinoPrever o próximo tokenEstimar o ruído presente numa imagem suja
Onde entra o acasoNo sorteio de cada token (temperatura)No ruído inicial (semente) e em cada passo
Peça centralTransformer com atençãoRede que estima ruído (U-Net ou Transformer), em geral num espaço latente, guiada por atenção cruzada ao texto
Erro característicoFato inventado com fluência (alucinação)Detalhe implausível: dedos a mais, letras deformadas, objetos fundidos

Fonte: elaborado pelo autor com base em Vaswani et al. (2017), Brown et al. (2020), Ho, Jain e Abbeel (2020) e Rombach et al. (2022).Nota: a divisão é típica, não absoluta; há modelos de difusão para texto e geradores de imagem autorregressivos.

Token 05

O que eles fazem bem — e onde tropeçam

Como leram quantidades de texto que nenhum ser humano leria em mil vidas, os LLMs são muito bons no que depende de forma e de padrões frequentes: reescrever num tom diferente, resumir, traduzir, explicar um conceito comum de três maneiras, gerar e comentar código, extrair campos de um documento, sugerir estrutura para um texto. A aprendizagem em contexto faz com que se adaptem a tarefas novas com poucos exemplos. Os de difusão fazem o equivalente com imagens: estilos, composições, variações e retoques.

Os limites vêm do mesmo lugar que as capacidades. Vale conhecer os principais, porque cada um pede um cuidado diferente:

  • Conhecimento congelado. O modelo sabe o que estava nos dados até a data de corte do treino. Se não estiver ligado a uma busca ou a documentos, ele não "consulta" nada: responde com o que ficou nos parâmetros.
  • Nenhum verificador embutido. Gerar e checar são operações diferentes. O modelo produz o texto mais provável; a probabilidade de uma frase soar bem não é a probabilidade de ela ser verdadeira.
  • Conhecimento que só vai num sentido. Modelos treinados com frases do tipo "A é B" muitas vezes não aprendem que "B é A". Num teste com perguntas sobre pais de celebridades, o GPT-4 acertou 79% no sentido direto e só 33% no inverso — a maldição da reversão (Berglund et al., 2023). Com a informação dada no próprio prompt, o problema desaparece.
  • Tokens não são letras. Como o modelo enxerga pedaços de palavras, tarefas triviais para nós — contar letras, inverter uma palavra, fazer contas longas de cabeça — podem falhar de maneiras que parecem absurdas.
  • Janela de contexto finita. Tudo o que o modelo "vê" numa conversa cabe numa janela de contexto. Ela é grande, mas não é memória: o que saiu dela, ou ficou perdido no meio dela, pesa pouco, como detalhado em Afinal, o que é um prompt?.
  • Forma sem compreensão garantida. Uma crítica influente sustenta que um sistema treinado só com a forma da linguagem pode imitar o sentido sem tê-lo, como um "papagaio estocástico", e aponta custos ambientais e vieses herdados dos dados (Bender et al., 2021). Não é consenso — muitos pesquisadores veem nos modelos atuais representações internas ricas —, mas é um bom antídoto contra a tentação de atribuir intenção a uma máquina que fala bem.

Nada disso impede usos sérios, inclusive em ciência, como discutido em Terence Tao e o paradoxo da IA com a ciência. Mas todos apontam para o mesmo cuidado: quanto mais uma tarefa depende de um fato específico e verificável, menos o texto gerado deve ser tratado como prova.

Token 06

Alucinação: fluência sem lastro

Chama-se alucinação o conteúdo gerado que soa plausível mas é falso ou não tem apoio nas fontes fornecidas. O termo é metafórico e tem críticos — não há percepção, e muito menos intenção de enganar —, mas pegou. Uma revisão abrangente da literatura separa dois grandes grupos (Huang et al., 2024):

Quadro 3 — Tipos de alucinação em modelos de linguagem, com exemplos

GrupoTipoExemplo
Factualidade (contra o mundo)FabricaçãoCitar um acórdão, um artigo ou um livro que não existe
Inconsistência factualAtribuir a lei certa ao ano errado, ou a descoberta certa ao cientista errado
Fidelidade (contra o pedido ou o contexto)À instruçãoPedir um resumo em português e receber a resposta em inglês
Ao contextoResumir um documento incluindo uma cláusula que ele não tem
LógicaFazer um raciocínio passo a passo correto e tirar uma conclusão que não decorre dele

Fonte: elaborado pelo autor com base na taxonomia de Huang et al. (2024); exemplos do autor.

Por que acontece — e por que não é um mistério

Um trabalho de pesquisadores da OpenAI e do Georgia Tech, de 2025, propõe uma explicação que ajuda muito a organizar o assunto (Kalai et al., 2025). A tese tem duas partes.

A primeira está no pré-treinamento. Gerar uma frase válida é, estatisticamente, pelo menos tão difícil quanto classificar se uma frase é válida — e há fatos que nenhum classificador acertaria, porque não têm padrão: a data de aniversário de uma pessoa pouco conhecida, o título de uma tese. Se um fato aparece uma única vez nos dados de treino, não há como o modelo distinguir o verdadeiro dos inventados. Os autores dão um exemplo: se 20% das datas de aniversário aparecem uma única vez nos dados de pré-treinamento, é de esperar que o modelo base erre em pelo menos 20% das perguntas sobre aniversários. Alucinações não precisam ser misteriosas: nascem como erros comuns de classificação.

A segunda parte está no que vem depois, e é a mais incômoda. Os modelos são ajustados e comparados em avaliações que, quase sempre, dão ponto para a resposta certa e zero tanto para a errada quanto para "não sei". Nessas condições, chutar sempre compensa. É exatamente o raciocínio do estudante numa prova de múltipla escolha sem desconto por erro.

Robô de latão numa sala de aula ergue uma plaquinha de madeira com a letra C, com uma gota de óleo na testa e sorriso nervoso, enquanto uma plaquinha com Não sei fica esquecida na carteira; no quadro-verde, a giz, Erro: zero e Não sei: zero

Se errar e dizer "não sei" valem o mesmo zero, a estratégia ótima é nunca dizer "não sei". Os modelos aprenderam a mesma lição que gerações de vestibulandos. Ilustração gerada por IA.

A própria OpenAI publicou uma comparação entre dois de seus modelos num teste de perguntas factuais curtas, o SimpleQA, que ilustra o efeito (OpenAI, 2025):

Tabela 1 — Distribuição das respostas de dois modelos da OpenAI no teste SimpleQA, 2025

Resultado da respostagpt-5-thinking-mini (%)o4-mini (%)
Absteve-se ("não sei")521
Acertou2224
Errou2675
Total100100

Fonte: elaborado pelo autor com base em OpenAI (2025).Nota: SimpleQA é um conjunto de perguntas factuais de resposta curta; os nomes dos modelos foram mantidos como na fonte. Totais conferidos pelo autor.

Pelo placar tradicional, que só olha a taxa de acerto, o o4-mini "ganha": 24% contra 22%. Mas ele erra três vezes mais. O painel abaixo mostra as duas colunas que importam lado a lado:

A proposta dos autores é mudar a regra da prova: declarar, na própria instrução, um limiar de confiança t e descontar t/(1 − t) pontos por resposta errada, mantendo zero para "não sei". Com t = 0,5, um erro custa 1 ponto; com t = 0,75, custa 3; com t = 0,9, custa 9 (Kalai et al., 2025). Assim, responder só compensa quando a chance de acerto passa do limiar — e um modelo bem calibrado passa a ter motivo para dizer "não sei". Faça as contas você mesmo:

Laboratório 3 · chutar ou dizer "não sei"?

Pontos esperados se responder+0,30
Pontos se disser "não sei"0,00

Na correção tradicional, errar custa zero: responder rende +0,30 e ganha de "não sei". Chutar compensa.

Nenhuma instrução elimina a alucinação, porque ela nasce na estatística do treino. Mas regras de avaliação, de uso e de conferência podem parar de recompensá-la — e isso vale tanto para quem treina modelos quanto para quem corrige trabalhos escritos com eles.

E nas imagens?

Os modelos de difusão também "alucinam", no sentido de produzir detalhes plausíveis e errados. As ilustrações desta postagem foram geradas por IA e conferidas letra por letra em alta resolução. A da prova, acima, precisou de quatro gerações: nas primeiras, a letra C apareceu duas vezes na folha de respostas, letras surgiram fora dos círculos e cartazes ao fundo ganharam palavras que não existem. A solução foi trocar a folha por plaquinhas — menos texto, menos chance de erro. É a mesma lição dos precedentes inventados: o gerador não confere; alguém precisa conferir.

Token 07

Engenharia de prompts, em uma página

Se o modelo gera o que é provável dado o contexto, a forma mais barata de melhorar a resposta é melhorar o contexto. Essa é toda a lógica da engenharia de prompts. O assunto já foi tratado em profundidade aqui no blog — no Guia completo de engenharia de prompt e, com o olhar de 2026, em Afinal, o que é um prompt?, que mostra por que a área passou a falar em engenharia de contexto. Vale, então, só o essencial.

Uma revisão sistemática catalogou 58 técnicas de prompt para modelos de linguagem e outras 40 para outras mídias (Schulhoff et al., 2025). A boa notícia é que quase todas são variações de poucos princípios, os mesmos que a documentação dos fabricantes recomenda — clareza e exemplos, estrutura, papel, espaço para raciocinar e encadeamento de etapas (Anthropic, 2026):

  • Diga o que quer, para quem e em que formato. O modelo não sabe que você é professor, que o texto é para o primeiro semestre, nem que precisa caber numa lâmina.
  • Mostre exemplos. Dois ou três pares de entrada e saída ensinam mais que um parágrafo de instruções — é a aprendizagem em contexto de Brown et al. (2020) em ação.
  • Separe as partes. Instrução, material de apoio e formato de saída em blocos identificados (títulos, marcadores, tags) reduzem confusão.
  • Dê espaço para raciocinar. Pedir etapas intermediárias — a cadeia de pensamento — melhorou muito o desempenho em problemas de várias etapas (Wei et al., 2022). Nos modelos de raciocínio atuais, isso já vem embutido e pode ser ajustado por parâmetro.
  • Quebre tarefas grandes. Pesquisar, rascunhar e revisar em chamadas separadas costuma render mais que tudo de uma vez.
  • Autorize o "não sei" e exija lastro. É o princípio anti-alucinação: fornecer o texto-base, pedir que a resposta cite o trecho usado e deixar explícito que "não encontrei no material" é uma resposta aceitável.

O mesmo pedido, duas vezes

Antes: "Me dê jurisprudência sobre acúmulo de cargos de professor."

Depois: "Você vai me ajudar a organizar uma pesquisa. Abaixo, entre as marcas <documentos>, estão cinco ementas que eu mesmo copiei do site do tribunal. Com base apenas nelas, liste as teses sobre acúmulo de cargos de professor, citando o número do processo de cada uma. Se uma tese não estiver nas ementas, não a inclua. Se as ementas não bastarem, diga o que falta pesquisar."

O segundo prompt não deixa o modelo mais inteligente. Ele muda a tarefa de lembrar para ler — e ler é o que o modelo faz melhor.

Duas ressalvas de quem usa isso todo dia. Primeiro, antes de lapidar o prompt, defina o que é uma boa resposta e como você vai testá-la; nem toda falha se resolve com prompt, e às vezes trocar de modelo resolve custo ou latência com menos esforço (Anthropic, 2026). Segundo, prompts de imagem seguem os mesmos princípios, com um acréscimo: descreva a cena, o estilo e a luz, e seja explícito sobre o texto — as ilustrações daqui são geradas com uma frase de abertura fixa, "os únicos textos que aparecem na imagem, e nenhum outro, são…", justamente para conter a tendência a inventar letreiros.

Token 08

Além do prompt: outras formas de usar um LLM

O chat é só a interface mais visível. Nos sistemas que funcionam bem em organizações, o LLM raramente trabalha sozinho, de cabeça. As formas de uso mais importantes, cada uma respondendo a um limite do Token 05, são estas:

Consultar antes de responder. A geração aumentada por recuperação, RAG (retrieval-augmented generation), combina o modelo com uma busca: antes de gerar, o sistema recupera trechos relevantes de uma base de documentos e os coloca no contexto. O trabalho original mostrou que essa combinação de memória "paramétrica" (os pesos) com memória "não paramétrica" (o índice de documentos) gera respostas mais específicas e mais factuais, com a vantagem de permitir apontar a fonte (Lewis et al., 2020). A busca, em geral, é semântica: textos viram embeddings, vetores que ficam próximos quando os sentidos são próximos, e o sistema procura os vizinhos mais próximos da pergunta — exatamente o tipo de busca aproximada em grafos discutido em Busca aplicada.

Numa biblioteca, um robô de latão abre a gaveta de um fichário com a etiqueta Fontes e aponta um trecho destacado em amarelo num livro aberto, que um estudante confere com uma lupa; sobre a mesa, uma caixa de ferramentas com régua e compasso

Em vez de responder de memória, o modelo consulta a gaveta de fontes e mostra o trecho — e alguém confere com a lupa. A caixa de ferramentas sobre a mesa é a outra metade da história. Ilustração gerada por IA.

Usar ferramentas e agir. Um modelo que não faz contas bem pode chamar uma calculadora; um que não sabe a data pode consultar uma agenda. Intercalar raciocínio e ação — pensar, chamar uma ferramenta, ler o resultado, pensar de novo — é a base dos agentes (Yao et al., 2023). Para padronizar essas conexões, foi proposto em 2024 o MCP (Model Context Protocol, protocolo de contexto de modelo), um padrão aberto para ligar assistentes a repositórios de dados, ferramentas de trabalho e ambientes de desenvolvimento (Anthropic, 2024). Com ferramentas vem um risco novo, a injeção de prompt: um documento ou página lido pelo agente pode conter instruções escondidas que ele passa a seguir.

Ajustar o modelo. Quando o que falta não é informação, mas comportamento — um formato fixo, um vocabulário técnico, um tom de voz —, o ajuste fino com exemplos próprios pode valer a pena. Ele não é um bom jeito de "ensinar fatos novos": para isso, RAG costuma ser mais barato e mais fácil de atualizar.

Integrar por programa. Pela API, o modelo vira um componente de software: classifica chamados, extrai dados de notas fiscais em formato estruturado, gera rascunhos em lote. Nesses usos, a saída é validada por código antes de seguir adiante — e modelos especializados em decidir, como o Jev, disputam espaço com os LLMs de conversa.

Quadro 4 — Formas de uso de modelos de linguagem, segundo o problema que resolvem e o que não resolvem

Forma de usoQuando usarO que não resolve
Prompt bem estruturadoSempre; é o primeiro passo e o mais baratoFalta de informação que o modelo não tem
Prompt com exemplosFormato ou critério difícil de descrever em palavrasTarefas que exigem fatos atualizados
RAG (consulta a documentos)Respostas que precisam de fonte, de dados internos ou recentesDocumentos ruins ou mal recuperados; ainda exige conferência
Ferramentas e agentesContas, buscas, ações em sistemas, tarefas de várias etapasErros que se acumulam entre etapas; risco de injeção de prompt
Ajuste finoComportamento estável: formato, tom, vocabulário de um domínioConhecimento que muda com frequência
Integração por APIProcessos repetitivos, com saída validada por códigoDecisões que exigem responsabilidade humana

Fonte: elaborado pelo autor com base em Brown et al. (2020), Lewis et al. (2020), Ouyang et al. (2022), Yao et al. (2023) e Anthropic (2024; 2026).

A última linha do quadro não é retórica. Desde março de 2025, uma resolução do CNJ admite que magistrados e servidores usem LLMs e outras ferramentas de IA generativa "como ferramentas de auxílio à gestão ou de apoio à decisão", mas veda seu uso "como instrumento autônomo de tomada de decisões judiciais" e mantém o magistrado integralmente responsável pelo que assina (Conselho Nacional de Justiça, 2025, art. 19). A regra resume bem o lugar da IA generativa em qualquer trabalho intelectual: auxiliar, sim; autora do que você assina, não. Na universidade, é o mesmo espírito do guia da UNESCO para o uso do ChatGPT no ensino superior e das diretrizes para o uso ético da IA generativa já comentados aqui.

Aplicação prática

Seis conferências antes de usar um texto gerado

Marque os itens conforme conseguir cumpri-los na próxima vez em que usar um LLM para algo que vai assinar — um parecer, um relatório, um plano de aula, um trabalho.

0 de 6 — comece separando forma de fato.

Token de parada

De volta à sentença

Releia o caso do início com o que foi visto até aqui. O servidor pediu jurisprudência a um modelo de linguagem, ou seja, pediu que ele lembrasse fatos específicos, raros e verificáveis — o tipo exato de fato que aparece poucas vezes nos dados e que a estatística do treino não consegue separar do inventado. O modelo, ajustado num mundo em que "não sei" vale zero, não disse "não sei". Sorteou, token a token, precedentes com a forma perfeita de precedentes. E ninguém, entre a tela e a assinatura, abriu o site do tribunal.

Nenhuma dessas etapas exige má-fé, e é isso que torna o caso didático. A falha não foi da máquina nem da pessoa isoladamente: foi de um processo em que ninguém tinha a tarefa de conferir. O mesmo processo existe, em escala menor, em cada trabalho acadêmico, relatório técnico e plano de aula escrito com ajuda de IA.

Na sua área, quais são as informações que um modelo de linguagem produziria com a forma perfeita e o conteúdo inventado — e quem, no seu fluxo de trabalho, tem hoje a tarefa de abrir a fonte?

Leia também

Para continuar no Brasil Acadêmico:

Nota do autor: o caso que abre e fecha o texto foi reconstituído a partir da cobertura jornalística de novembro de 2023; o nome do magistrado não é citado de propósito, porque o interesse aqui é o processo, não a pessoa, e porque as reportagens divergem em detalhes como o número de precedentes inventados. Os números da base de Damien Charlotin mudam quase diariamente; os citados correspondem à atualização de 23 de setembro de 2026 e incluem apenas decisões em que o tribunal constatou o uso de conteúdo inventado. As distribuições do Laboratório 1 são fictícias, escritas à mão para ilustrar o mecanismo; não foram extraídas de nenhum modelo. O Laboratório 2 aplica a fórmula do processo direto de difusão com um cronograma cosseno de mil passos a uma imagem desenhada por código, já conhecida; a barra de mistura mostra a proporção da variância atribuída ao sinal e ao ruído, e a animação não é uma geração de verdade. O Laboratório 3 reproduz a regra de pontuação proposta por Kalai et al. (2025), com o desconto calculado pela fórmula t/(1 − t); a versão consultada do artigo lista, para t = 0,75, um desconto de 2 pontos, valor que não confere com a própria fórmula (0,75/0,25 = 3) — adotou-se o resultado da fórmula. A Tabela 1 foi transcrita da página da OpenAI; os valores são os divulgados pela empresa e não foram reproduzidos de forma independente. A frase "alucinações não precisam ser misteriosas", destacada no Token 06, parafraseia o resumo de Kalai et al. (2025). Os artigos científicos são citados nas versões de acesso aberto do arXiv, conforme o critério desta série; vários foram publicados depois em anais e periódicos (Vaswani et al. e Brown et al. na NeurIPS; Rombach et al. na CVPR 2022; Berglund et al. na ICLR 2024; Huang et al. na ACM Transactions on Information Systems). A página de documentação da Anthropic não traz data explícita; o ano da referência é o do acesso. Esta versão foi revista após uma avaliação independente: foram explicitados que "prever o próximo token" descreve os modelos autorregressivos (com o BERT como contraexemplo), a diferença entre modelo de linguagem, LLM e assistente, os componentes do Transformer além da atenção, as demais famílias de modelos generativos e o papel conjunto de parâmetros, dados e computação; a sugestão de um tokenizador interativo não foi adotada porque uma segmentação escrita à mão poderia ensinar divisões que nenhum tokenizador real produz. O BERT é citado pela versão do arXiv (a publicação revisada saiu nos anais da NAACL 2019), e o Chinchilla, pela pré-publicação (publicado depois na NeurIPS 2022). As ilustrações foram geradas por IA com o Gemini (Nano Banana), em estilo de animação 3D, e conferidas visualmente; nenhuma retrata pessoa real.

Glossário

Termos técnicos em ordem alfabética. Os termos com sublinhado pontilhado no texto trazem até aqui; o botão ao lado do verbete leva de volta.

Agente
Sistema em que um modelo de linguagem, em vez de só responder, planeja e executa ações em etapas: chama ferramentas, lê os resultados e decide o próximo passo. Token 08
Ajuste fino
Treino adicional de um modelo já pré-treinado com um conjunto menor e específico de exemplos, para mudar seu comportamento — seguir instruções, adotar um formato, dominar um vocabulário. Tokens 03 e 08
Alucinação
Conteúdo gerado que soa plausível, mas é falso ou não tem apoio no material fornecido. Divide-se em problemas de factualidade (contra o mundo) e de fidelidade (contra o pedido ou o contexto). Token 06
Aprendizagem em contexto (few-shot)
Capacidade de um modelo executar uma tarefa nova a partir de alguns exemplos colocados no próprio prompt, sem alterar seus parâmetros. Token 03
Atenção
Mecanismo que, para cada token, calcula a relevância dos outros tokens na construção da sua representação, em várias "cabeças" e camadas. Calcula relações; não equivale a compreensão. É a peça mais conhecida do Transformer; na forma de atenção cruzada, liga o texto do prompt à imagem nos modelos de difusão. Tokens 03 e 04
Autorregressivo
Modelo que gera uma sequência uma parte por vez, cada parte condicionada às anteriores. Os LLMs da família GPT são autorregressivos: produzem um token de cada vez, da esquerda para a direita. Token 03
Cadeia de pensamento (chain-of-thought)
Técnica de pedir, ou treinar o modelo para produzir, etapas intermediárias de raciocínio antes da resposta final. Melhora o desempenho em problemas de várias etapas. Token 07
Calibração
Propriedade de um modelo cujas probabilidades correspondem às frequências reais de acerto: quando diz "80% de chance", acerta cerca de 80% das vezes. Token 06
Codificador e decodificador
As duas metades do Transformer original. O codificador (encoder) lê a entrada inteira e produz representações; o decodificador (decoder) gera a saída token a token. BERT usa só o primeiro; GPT, só o segundo; T5, os dois. Token 03
Decodificação gulosa
Estratégia de geração que escolhe sempre o token mais provável. É determinística; a alternativa é a amostragem, que sorteia de acordo com as probabilidades. Token 03
Embedding
Representação de um texto, imagem ou outro dado como vetor de números, construída de modo que itens de sentido parecido fiquem próximos. Base da busca semântica usada no RAG. Token 08
Espaço latente
Representação comprimida dos dados, aprendida por uma rede codificadora. Nos modelos de difusão latente, a remoção de ruído acontece nesse espaço menor, e um decodificador devolve os pixels no fim. Token 04
GAN (generative adversarial network)
"Rede adversária generativa": par de redes treinadas em competição, uma gerando exemplos falsos e outra tentando distingui-los dos verdadeiros. Liderou a geração de imagens até ser superada pela difusão. Token 02
IA generativa
Ramo da inteligência artificial dedicado a modelos que produzem conteúdo novo — texto, imagem, áudio, vídeo, código — amostrando de uma distribuição aprendida a partir de exemplos. Token 01
Injeção de prompt
Ataque em que instruções maliciosas são escondidas num conteúdo que o modelo vai ler (uma página, um e-mail, um documento), fazendo-o agir contra a intenção de quem o usa. Token 08
Janela de contexto
Quantidade máxima de tokens que o modelo considera de uma vez: instruções, histórico da conversa, documentos e a própria resposta. O que fica fora dela não influencia a geração. Token 05
LLM (large language model)
"Grande modelo de linguagem": modelo de linguagem neural de grande porte, em geral um Transformer com bilhões de parâmetros. Os generativos, como a família GPT, são autorregressivos: pré-treinados para prever o próximo token. Não se confunde com o assistente (ChatGPT, Gemini, Claude), que é um sistema construído em volta dele. Token 03
Logits
Pontuações brutas que o modelo atribui a cada token do vocabulário antes da função softmax, que as converte em probabilidades. A temperatura divide os logits antes dessa conversão. Token 03
Maldição da reversão
Falha em que um modelo treinado com afirmações do tipo "A é B" não consegue responder a perguntas no sentido "B é A". Desaparece quando a informação está no próprio prompt. Token 05
MCP (Model Context Protocol)
"Protocolo de contexto de modelo": padrão aberto, lançado em 2024, para conectar assistentes de IA a fontes de dados e ferramentas por meio de servidores e clientes padronizados. Token 08
Modelo de difusão
Modelo generativo treinado para remover ruído de imagens progressivamente sujas. Gera partindo de ruído puro e aplicando essa limpeza em muitos passos. Token 04
Parâmetro
Cada um dos números ajustáveis de uma rede neural (os pesos). O tamanho de um modelo costuma ser expresso em bilhões de parâmetros, mas eles não são fatos armazenados, e mais parâmetros não bastam sem dados e computação proporcionais. Token 03
Pré-treinamento
Primeira e mais cara fase de treino de um LLM: prever o próximo token em enormes volumes de texto. Dá ao modelo conhecimento e fluência, mas não o hábito de seguir instruções. Token 03
RAG (retrieval-augmented generation)
"Geração aumentada por recuperação": arquitetura que busca trechos relevantes numa base de documentos e os coloca no contexto antes de o modelo gerar a resposta, o que permite apontar a fonte. Token 08
RLHF (reinforcement learning from human feedback)
"Aprendizado por reforço a partir de feedback humano": etapa de ajuste em que pessoas comparam respostas do modelo e ele é otimizado para produzir as preferidas. Token 03
Ruído (gaussiano)
Valores aleatórios, sorteados de uma distribuição normal, somados à imagem no treino dos modelos de difusão. Visualmente, parece o chuvisco de uma TV fora do ar. Token 04
Temperatura
Parâmetro do sorteio do próximo token. Valores baixos concentram a chance nos tokens mais prováveis; valores altos espalham a chance e deixam o texto mais variado e mais arriscado. Token 03
Token
Unidade de texto processada pelo modelo: uma palavra, parte de uma palavra ou um sinal. Custos, limites de contexto e velocidade de geração são medidos em tokens. Token 03
Transformer
Arquitetura de rede neural proposta em 2017 para tradução, com codificador e decodificador. Cada bloco combina atenção multicabeça, rede feed-forward, conexões residuais e normalização, com codificação de posição na entrada. Suas variantes são a base dos LLMs atuais e de muitos geradores de imagem. Token 03
VAE (variational autoencoder)
"Autocodificador variacional": modelo que aprende a comprimir dados num espaço de códigos contínuo e a gerar exemplos novos decodificando códigos sorteados. Precursor dos espaços latentes usados na difusão. Token 02

Referências

  1. ANTHROPIC. Introducing the Model Context Protocol. Anthropic, San Francisco, 25 nov. 2024. Disponível em: https://www.anthropic.com/news/model-context-protocol. Acesso em: 24 set. 2026.
  2. ANTHROPIC. Prompt engineering overview. San Francisco: Claude Platform Docs, 2026. Disponível em: https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/overview. Acesso em: 24 set. 2026.
  3. BENDER, Emily M.; GEBRU, Timnit; McMILLAN-MAJOR, Angelina; SHMITCHELL, Shmargaret. On the dangers of stochastic parrots: can language models be too big? In: ACM CONFERENCE ON FAIRNESS, ACCOUNTABILITY, AND TRANSPARENCY, 2021, [on-line]. Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency. Nova York: ACM, 2021. p. 610-623. DOI: 10.1145/3442188.3445922. Disponível em: https://dl.acm.org/doi/10.1145/3442188.3445922. Acesso em: 24 set. 2026.
  4. BERGLUND, Lukas et al. The reversal curse: LLMs trained on "A is B" fail to learn "B is A". [S. l.]: arXiv, 2023. Pré-publicação arXiv:2309.12288. Disponível em: https://arxiv.org/abs/2309.12288. Acesso em: 24 set. 2026.
  5. BROWN, Tom B. et al. Language models are few-shot learners. [S. l.]: arXiv, 2020. Pré-publicação arXiv:2005.14165. Disponível em: https://arxiv.org/abs/2005.14165. Acesso em: 24 set. 2026.
  6. CHARLOTIN, Damien. AI hallucination cases database. [S. l.], 2026. Base de dados. Atualizada em 23 set. 2026. Disponível em: https://www.damiencharlotin.com/hallucinations/. Acesso em: 24 set. 2026.
  7. CNJ abre investigação contra juiz que usou ChatGPT para escrever decisão. CartaCapital, São Paulo, 13 nov. 2023. Disponível em: https://www.cartacapital.com.br/justica/cnj-abre-investigacao-contra-juiz-que-usou-chatgpt-para-escrever-decisao/. Acesso em: 24 set. 2026.
  8. CONSELHO NACIONAL DE JUSTIÇA (Brasil). Resolução nº 615, de 11 de março de 2025. Estabelece diretrizes para o desenvolvimento, utilização e governança de soluções desenvolvidas com recursos de inteligência artificial no Poder Judiciário. DJe/CNJ, Brasília, DF, n. 54, p. 2-17, 14 mar. 2025. Disponível em: https://atos.cnj.jus.br/atos/detalhar/6001. Acesso em: 24 set. 2026.
  9. DEVLIN, Jacob; CHANG, Ming-Wei; LEE, Kenton; TOUTANOVA, Kristina. BERT: pre-training of deep bidirectional transformers for language understanding. [S. l.]: arXiv, 2019. Pré-publicação arXiv:1810.04805v2. Disponível em: https://arxiv.org/abs/1810.04805. Acesso em: 24 set. 2026.
  10. DHARIWAL, Prafulla; NICHOL, Alex. Diffusion models beat GANs on image synthesis. [S. l.]: arXiv, 2021. Pré-publicação arXiv:2105.05233. Disponível em: https://arxiv.org/abs/2105.05233. Acesso em: 24 set. 2026.
  11. GOODFELLOW, Ian J. et al. Generative adversarial networks. [S. l.]: arXiv, 2014. Pré-publicação arXiv:1406.2661. Disponível em: https://arxiv.org/abs/1406.2661. Acesso em: 24 set. 2026.
  12. HO, Jonathan; JAIN, Ajay; ABBEEL, Pieter. Denoising diffusion probabilistic models. [S. l.]: arXiv, 2020. Pré-publicação arXiv:2006.11239. Disponível em: https://arxiv.org/abs/2006.11239. Acesso em: 24 set. 2026.
  13. HOFFMANN, Jordan et al. Training compute-optimal large language models. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2203.15556. Disponível em: https://arxiv.org/abs/2203.15556. Acesso em: 24 set. 2026.
  14. HUANG, Lei et al. A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions. [S. l.]: arXiv, 2024. Pré-publicação arXiv:2311.05232v2. Disponível em: https://arxiv.org/abs/2311.05232. Acesso em: 24 set. 2026.
  15. KALAI, Adam Tauman; NACHUM, Ofir; VEMPALA, Santosh S.; ZHANG, Edwin. Why language models hallucinate. [S. l.]: arXiv, 2025. Pré-publicação arXiv:2509.04664. Disponível em: https://arxiv.org/abs/2509.04664. Acesso em: 24 set. 2026.
  16. KINGMA, Diederik P.; WELLING, Max. Auto-encoding variational Bayes. [S. l.]: arXiv, 2013. Pré-publicação arXiv:1312.6114. Disponível em: https://arxiv.org/abs/1312.6114. Acesso em: 24 set. 2026.
  17. LEWIS, Patrick et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. [S. l.]: arXiv, 2020. Pré-publicação arXiv:2005.11401. Disponível em: https://arxiv.org/abs/2005.11401. Acesso em: 24 set. 2026.
  18. NIE, Shen et al. Large language diffusion models. [S. l.]: arXiv, 2025. Pré-publicação arXiv:2502.09992. Disponível em: https://arxiv.org/abs/2502.09992. Acesso em: 24 set. 2026.
  19. OPENAI. Why language models hallucinate. OpenAI, San Francisco, 5 set. 2025. Disponível em: https://openai.com/index/why-language-models-hallucinate/. Acesso em: 24 set. 2026.
  20. OUYANG, Long et al. Training language models to follow instructions with human feedback. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2203.02155. Disponível em: https://arxiv.org/abs/2203.02155. Acesso em: 24 set. 2026.
  21. RAFFEL, Colin et al. Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of Machine Learning Research, [s. l.], v. 21, n. 140, p. 1-67, 2020. Disponível em: https://jmlr.org/papers/v21/20-074.html. Acesso em: 24 set. 2026.
  22. ROMBACH, Robin et al. High-resolution image synthesis with latent diffusion models. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2112.10752v2. Disponível em: https://arxiv.org/abs/2112.10752. Acesso em: 24 set. 2026.
  23. RUSSELL, Stuart; NORVIG, Peter. Artificial intelligence: a modern approach. 4. ed. Hoboken: Pearson, 2021.
  24. SCHULHOFF, Sander et al. The prompt report: a systematic survey of prompt engineering techniques. [S. l.]: arXiv, 2025. Pré-publicação arXiv:2406.06608v6. Disponível em: https://arxiv.org/abs/2406.06608. Acesso em: 24 set. 2026.
  25. VASWANI, Ashish et al. Attention is all you need. [S. l.]: arXiv, 2017. Pré-publicação arXiv:1706.03762. Disponível em: https://arxiv.org/abs/1706.03762. Acesso em: 24 set. 2026.
  26. WEI, Jason et al. Chain-of-thought prompting elicits reasoning in large language models. [S. l.]: arXiv, 2022. Pré-publicação arXiv:2201.11903. Disponível em: https://arxiv.org/abs/2201.11903. Acesso em: 24 set. 2026.
  27. YAO, Shunyu et al. ReAct: synergizing reasoning and acting in language models. [S. l.]: arXiv, 2023. Pré-publicação arXiv:2210.03629. Disponível em: https://arxiv.org/abs/2210.03629. Acesso em: 24 set. 2026.

Comentários

BLOGGER

$show=mobile

Nuvem de Categorias


Coluna Gastroturismo
Nome

#existepesquisanobrasil,2,Abelha,3,Acessibilidade,25,Acessórios,2,Acidente,52,Acústica,16,Adestramento,5,Administração,48,Aerodinâmica,4,Aeronáutica,9,África,7,Agência Bori,1,Agência Brasil,25,Agência FAPESP,5,Agência Fiocruz,6,Agência Porvir,1,Agência Senado,2,Agência USP,5,Agnotologia,1,Agricultura,7,Agropecuária,4,AirBNB,1,Albert Einstein,1,Alcoolismo,9,Alemanha,10,Alemão,4,Alerta,2,Algoritmo,9,Alimento,1,Alzheimer,4,Amazon,5,Amazônia,5,América Latina,1,Análise Combinatória,1,Análise de Texto,2,Anatomia,8,Android,3,Angola,1,Animação,52,Animais de Estimação,6,Animal,2,Antropologia,14,Apicultura,9,App,9,Apple,5,Apresentação,4,aquário,1,Argentina,4,Armamento,1,Arqueologia,6,arquitetura,33,Arte,173,Astrobiologia,3,Astrofísica,4,Astronomia,36,Ativismo,35,Áudio,3,Audio FX,2,Áustria,1,Autismo,2,Auto-ajuda,10,Automobilismo,17,Automóvel,22,aventura,3,Aviação,5,Aviônica,8,Bahia,2,Balonismo,3,Banco Central,1,Banco de Dados,5,Beber e Dirigir,1,biblioteconomia,6,Bicicleta,1,Biografia,18,Biologia,176,Biologia Marinha,15,bioquímica,7,Biotecnologia,25,Bitcoin,2,Blog,29,Blogger,33,Boato,6,Bomba,1,Botânica,6,BRASA,1,BRASA Leads,1,Brasil,41,Brasília,17,BRIC,1,Browser,11,Bugs,3,CAD,3,Calor,2,Caltech,1,Câmera lenta,1,Campanha,47,Canadá,1,cardiologia,16,Carnaval,2,carreira,3,Cartografia,3,Casemods,1,Caso Isabella Nardoni,1,Caso Snowden,1,Ceará,1,Celebridades,6,celular,24,Células-Tronco,5,Cérebro,2,Charge,22,ChatGPT,2,China,23,Cibercultura,3,Ciclovia,1,Cidadania,40,Ciência,226,Cinema,70,Climatologia,3,Clip,1,Cliparts,1,Cloud computing,4,Coaching,12,Comédia,2,competência,2,Complemento de dois,1,Comportamento,277,Computação,103,Computação em grade,5,Computação forense,3,Computação Gráfica,140,Computação Móvel,1,Computação Quântica,1,Comunicação e Marketing,157,Concurso,2,Concurso Cultural de Natal,1,Concursos Público,2,Concursos Públicos,4,Conectômica,1,Conferência,1,Congresso em Foco,1,Conspiração,2,Consumidor,7,Consumismo,3,contabilidade,2,Contos,55,Copa do Mundo,26,Cordel,3,Coreia do Norte,1,Coreia do Sul,1,Corpo,2,Coruja,1,cosmética,3,Cosmologia,21,Covid-19,99,Crash Course,1,Criança,1,Criatividade,4,Crime,49,Crime Digital,9,crise,11,crise econômica,8,Croácia,1,crônica,6,crônicas,5,Cronologia,1,CSS,3,Cuba,4,Culinária,8,Cultura,19,Curiosidades,113,custos fixo,1,custos variáveis,1,Dale Dougherty,2,Dança,6,DAO,1,Darwin,12,Davos,1,Debate,3,Decoração,1,demência,1,Demografia,3,Denúncia,12,Dermatologia,6,Desastre Natural,14,Descoberta,2,Desenho instrucional,19,Desenvolvimento de jogos,18,Desenvolvimento Pessoal,1,Design,34,Design Instrucional,19,Destaque,9,Dia das Mães,1,Dia do professor,1,diabetes,6,Dicas,66,Didática,1,Dieta,4,Dinamarca,1,diplomacia,3,Direito,188,Direito Eleitoral,2,Direito Internacional,30,Direito Militar,1,Direito Trabalhista,1,Direito Tributário,2,Direitos Autorais,4,Direitos Humanos,39,Disney,8,Distrito Federal,4,Documentário,72,Doutorado,1,download,3,Drogas,7,Drone,3,Dubai,1,e-Book,2,e-governo,2,EBC,1,Ecologia,89,Economia,120,Editoração Eletrônica,1,Educação,428,Educação a Distância,190,Educação Corporativa,6,educação física,19,Educação sexual,6,Efeitos Sonoros,4,Egiptologia,2,Eleições,30,Eleições 2014,12,Eleições 2018,5,Eleições 2020,2,Eleições 2022,1,Eletricidade,10,eletrônica,4,Elon Musk,1,Em Operários,1,Embrapa,4,empreendedorismo,7,enciclopédia,1,endocrinologia,6,Enem,3,Energia,17,Energia Alternativa,18,Energia Nuclear,12,Enfermagem,1,Engenharia,71,Engenharia Agrícola,1,Engenharia Civil,6,Engenharia de materiais,18,Engenharia de Software,17,Engenharia Genética,32,Engenharia Mecânica,2,Enretenimento,1,Ensino a Distância,11,Ensino Superior,5,Entomologia,7,Entretenimento,47,Entrevista,91,Entrevista.,1,Epidemiologia,70,Epistemologia,1,Equador,1,Escândalo,6,Escritório,1,ESMPU,1,Espaço,74,Espanha,1,Espanhol,2,Espeleologia,1,Espetáculo,8,Espionagem,20,Esporte,44,Estação,1,Estágio,2,Estatísticas,40,Estética,1,estrutura de dados,1,Ética,32,EUA,20,Europa,2,Evento,59,Evolução,5,Exercícios físicos,2,Exobiologia,3,experiência,43,fábulas,3,Facebook,20,Família,1,Farmacologia,25,Favo,1,Feminismo,2,Férias,1,Ferramentas,15,FIFA,2,Filantropia,4,Filmes,20,Filosofia,50,Finep,2,Finlândia,3,Fintech,1,Firefox,1,Física,119,Física Quântica,4,Fisiologia,10,Fisioterapia,6,Flagrante,2,Flamengo,1,Folclore,3,Fome,1,Fomento,1,Fonética,1,Fonoaudiologia,7,Fotografia,46,Fotos em 360 graus,6,França,10,Francês,4,Frase,3,Fraude,5,Freeware,75,Futebol,38,Futurologia,95,gadget,87,gadgets,1,Gafe,2,Gamificação,8,Gastroenterologia,5,Gastronomia,9,Gastroturismo,7,Geek,2,Genética,46,Geofísica,1,Geografia,57,Geologia,12,Geometria,6,geopolítica,23,Gerenciamento do Tempo,2,Geriatria,13,Gestão de Competências,3,Gestão de Configuração,2,Gestão de Pessoas,12,Gestão de Projetos,28,Gestão do conhecimento,7,Ginecologia,3,Glass,1,Golpe de Estado,1,Google,81,Governo,4,GPS,1,Gradiente,1,gramática,15,Gravidez,1,Grécia,1,Grécia Antiga,2,Guerra,43,Guerra Civil,2,Guinness,1,H2,2,Haiti,3,hardware,39,Henry Ford,1,História,219,HIV,1,Hololens,2,homenagem,46,Horologia,1,HPV,1,HTML,6,Humor,213,Humor Negro,9,IBGE,3,IBM,4,ICIJ,2,Idioma,57,IESB,2,IHC,8,ilo,29,ilusão,36,ilusionismo,5,Imagem 3D,16,Imagens,7,Imagine Cup,1,Império Romano,8,Imprensa,34,Impressora 3D,22,Imunologia,8,Incêndio,2,Inclusão digital,8,Índia,4,Índios,1,Infectologia,36,Infográfico,57,Informática,38,Inglaterra,4,Inglês,26,Inovação,208,Inspiração,1,Inteligência Artificial,185,intercâmbio,1,Interface,206,Interfaces Hápticas,24,Internacional,23,Internacionalização da Amazônia,3,Internet,168,Internet das Coisas,2,Inundação,2,Invenção,20,Inventos,6,iPad,1,IPEA,1,iphone,3,Irã,3,Iraque,1,Israel,7,Itália,2,Japão,5,Java,2,Java.,2,jogos,12,Jogos de Tabuleiro,5,Jogos educativos,20,Jogos Olímpicos,10,Jornalismo,72,José Saramago,1,Justiça,4,Ken Robinson,1,Kinect,10,Le Monde Diplomatique Brasil,9,Le Monde Diplomatique Brasil,1,Letras,2,Lexicografia,5,Liderança,4,Life Hacking,20,línguas estrangeiras,3,Linguística,11,Literatura,59,Livro,73,Lógica,26,Logística,4,Loterias,4,Lua,1,Maçonaria,4,Malásia,2,Malvinas,2,Malware,1,Mapa,96,Mário Sérgio Conti,1,Marte,4,Mastologia,1,Matemática,85,Matemática Financeira,1,maternidade,1,MEC,1,Mecânica,8,Mecânica dos Fluidos,2,Mecatrônica,47,Medalha Fields,1,Medicina,569,Medicina Esportiva,2,Medicina Veterinária,4,Meio Ambiente,131,Mel,1,melanoma,1,Memória,5,memorização,4,Mente,4,Mercado de Trabalho,85,mercosul,1,Mestrado,4,Metaverso,2,meteorologia,12,Metodologia Científica,62,México,1,Microbiologia,4,Microsoft,16,Mídia Social,62,Militar,16,Mineralogia,1,Mistério,3,MIT,15,Mitologia,2,Mobilidade,1,Mobilidade Urbana,9,Moçambique,1,Moda,1,MonaVie,1,Montanhismo,1,Moodle,7,Mossad,1,Motivação,1,Movimento Maker,3,MSF,1,Mudança Climática,30,Mulher,4,Multimídia,14,museu,16,Música,90,MVC,1,Nanotecnologia,37,Nasa,19,Natação,2,Natal,17,Natureza,2,Nefrologia,1,Negócios,31,Netflix,1,Neurociência,97,Neurologia,81,Nicolelis,1,Nordeste,2,Noruega,2,notícias,8,Novidades,18,Novo Enem,2,Números,2,Nutrição,75,Obama,1,Obesidade,11,Observatório da Imprensa,27,Obstetrícia,4,OCDE,1,Oceanografia,7,odontologia,10,Offshore Leaks,2,oftalmologia,11,Olimpíadas,9,oncologia,50,ONU,10,OpenAI,1,Opinião,107,Óptica,17,Oracle,1,Oriente Médio,5,Orkut,2,Ornitologia,1,ortografia,3,Ortopedia,4,Ótica,9,Otorrinolaringologia,2,Oxfam,3,Pacifismo,1,Paginadores,1,paleontologia,4,Palestina,1,Paquistão,1,Pará,2,Paraguai,2,parkinson,2,Passeio virtual,1,Patinação,1,Paulo Freire,1,Pedagogia,8,Pediatria,6,Pensamentos,3,performance,3,Periférico,1,Pesca,2,Pesquisa,267,Petição,1,Petrobrás,10,Petróleo,13,Photoshop,5,Pirataria,7,planilha de custo,1,Playstation 3,2,Plebiscito,3,Pneumologia,1,Podcast,7,Poesia,29,Política,324,Polônia,1,Portugal,9,português,20,Pós-graduação,2,Pré-sal,5,Prêmio Nobel,7,primatologia,1,Primeira Guerra Mundial,2,privacidade,27,produtividade,8,professor Hamilton Alves,2,Programa Gratuito,4,Programação,79,Projeção Mapeada,1,Projeto Truco,2,Promoção,1,Propaganda,5,Psicanálise,1,Psicologia,286,Psicologia Animal,26,Psiquiatria,17,Pública,14,publicidade,19,Publieditorial,6,PUC Minas,1,Quadrinhos,11,Quads,5,Qualidade,5,Qualidade de Vida,12,química,34,REA,2,realidade aumentada,47,realidade diminuída,2,Realidade Misturada,5,Realidade Virtual,50,Reconhecimento de imagem,12,Reconhecimento de voz,3,Recorde,1,Recoverit,1,Recuperar vídeos,1,Redação,1,redes,12,Referência,5,Referendo,1,Reforma Política,3,Reino Unido,2,Relacionamento,2,Relações Internacionais,41,Religião,44,Responsabilidade Social,4,Retrospectiva,1,Review,15,Rio 2016,6,Rio de Janeiro,3,Rio Grande do Norte,1,Rio Grande do Sul,1,Robert Oppenheimer,3,Robô,49,robótica,52,Roda Viva,49,Roma,6,roteiro,1,RSA,1,RTP,1,Rússia,6,Samsung,1,Sanitarismo,5,Santa Catarina,1,São Paulo,5,Saúde,626,Savant,1,Segunda Guerra Mundial,27,Segurança,130,Segurança da Informação,70,Seleção Natural,3,Séries,2,serviço,1,Serviço Online,1,Sexologia,2,sexualidade,5,Show,7,SIGGRAPH,1,Simulação,37,Singularity University,1,Síria,3,Sismologia,2,Sistema operacional,4,Sistemas de Numeração,1,Sites de Busca,22,Sociedade,5,Sociologia,55,Software,34,Software Livre,24,Sol,2,Sono,4,Sony,3,SOPA,2,Star Wars,1,Startup,2,Steve Cutts,1,Steve Jobs,1,Suécia,3,Sugestão de presentes,67,Sun,1,supercomputadores,2,Sustentabilidade,5,Tabagismo,6,Taiwan,1,Talento precoce,1,Taxas Equivalentes,1,Taxidermia,1,Teatro,27,Técnicas de Estudo,3,Tecnologia,605,Tecnologia da Informação,31,TED,448,TED-Ed,48,TedMed,2,TEDx,5,TEDx Rio+20,1,TEDxAmazônia,1,TEDxAsaSul,1,Telefonia,61,Televisão,45,Temas,1,Tempo,2,Tendência,1,Tendências,13,Teologia,6,teoria das supercordas,1,Teoria dos Jogos,1,Terremoto,9,Terrorismo,15,Tesla,1,Testes,17,Thaís Victer,2,ticker,2,TikTok,1,Tipologia,8,Tomada de Decisão,1,tradução,5,Trânsito,12,transporte,59,Tributo,3,Trigonometria,1,Tubarão,2,Tunísia,1,Turismo,30,Tutorial,23,Twitter,10,Uber,7,Ucrânia,11,UFC,1,UFES,1,UFG,2,UFMG,1,ufologia,5,UFRJ,3,UFSC,1,UNB,1,UNESCO,1,Unicamp,4,UNIFESP,1,UNIP,1,universidade,6,Universidade Corporativa,1,Universidade da Califórnica,1,Universidade da Geórgia,1,Universidade da Pensilvânia,1,Universidade de Brasília,1,Universidade de Cambridge,2,Universidade de Chicago,1,Universidade de Columbia,1,Universidade de Michigan,1,Universidade de Princeton,1,Universidade de Rochester,1,Universidade de Washington,3,University College London,1,Urbanismo,26,Urologia,2,URSS,1,User Experience,1,USP,11,Utilidade Pública,4,Utilitário,3,Vale,1,Vaticano,1,Veículo Autônomo,9,Venezuela,1,Ventriloquismo,2,Verão,1,vestibular,3,Vestimenta,1,Vida Digital,7,Vida Moderna,18,Vida Selvagem,10,Videogame,120,Vídeos,990,Vídeos 360,1,Vietnã,1,Violência,5,Vírus,18,Visão Computacional,10,Vôlei,1,Vulcanologia,8,Watergate Política,1,WCIT 2016,2,WCIT 2017,1,Web,1,Web 2.0,29,Web Application,161,Web Semântica,2,Web Seminar,1,webdesign,13,Webinar,2,widget,2,WikiLeaks,37,Wikipedia,4,Windows,5,Xadrez,2,YouTube,6,Zika,1,Zimbábue,1,Zoologia,59,
ltr
item
Brasil Acadêmico: Fundamentos de IA generativa: modelos de linguagem e de difusão
Fundamentos de IA generativa: modelos de linguagem e de difusão
https://blogger.googleusercontent.com/img/a/AVvXsEgmFAs8p14sYsgevCQfacaWcnutgTdUwxawaZDBtThIMeXm29MBYolr9zqfitACzltTBB_NPbypaGvWc8qnbmWfuKgyDDRh5esIP6pWPvwPl5hQBBgWq-Uz0jvEbYRHyZYfsAvgV5c1gr-2gSTxtfcW0LifAkkJlKx3qy8j7fHeKX4nmPnbCF8re9LgV2M
https://blogger.googleusercontent.com/img/a/AVvXsEgmFAs8p14sYsgevCQfacaWcnutgTdUwxawaZDBtThIMeXm29MBYolr9zqfitACzltTBB_NPbypaGvWc8qnbmWfuKgyDDRh5esIP6pWPvwPl5hQBBgWq-Uz0jvEbYRHyZYfsAvgV5c1gr-2gSTxtfcW0LifAkkJlKx3qy8j7fHeKX4nmPnbCF8re9LgV2M=s72-c
Brasil Acadêmico
http://blog.brasilacademico.com/2026/09/fundamentos-de-ia-generativa-modelos-de.html?m=0
http://blog.brasilacademico.com/?m=0
http://blog.brasilacademico.com/
http://blog.brasilacademico.com/2026/09/fundamentos-de-ia-generativa-modelos-de.html
true
3049085869098582068
UTF-8
Todos os posts carregados Nenhum post encontrado Ver todos Saiba mais Responder Cancelar resposta Apagar Por Início Páginas POSTS Ver todos Especialmente para você Categoria Arquivo Busca Todos os posts Nenhum post coincide com sua busca Início Domingo Segunda Terça Quarta Quinta Sexta Sábado Dom Seg Ter Qua Qui Sex Sáb Janeiro Fevereiro Março Abril Maio Junho Julho Agosto Setembro Outubro Novembro Dezembro Jan Fev Mar Abr Maio Jun Jul Ago Set Out Nov Dez Agora 1 minuto atrás $$1$$ minutos atrás 1 hora atrás $$1$$ horas atrás Ontem $$1$$ dias atrás $$1$$ semanas atrás Mais de 5 semanas atrás Seguidores Seguir Conteúdo PREMIUM fechado Passo 1: Compartilhar com a rede social Passo 2: Clique no link da sua rede social Copiar todo código Selecionar todo código Todos os código copiados para a memória Não posso copiar o código / textos, favor teclar [CTRL]+[C] (ou CMD+C no Mac) para copiar Tabela de Conteúdo