Em 1959, um engenheiro da IBM publicou um artigo mostrando que um programa de damas, rodando num computador de válvulas, podia aprender a jo...
Lance 01
Um tabuleiro, três professores
No fim dos anos 1950, Arthur Samuel, engenheiro da IBM, decidiu ensinar damas a um computador. Não era capricho: as damas tinham tudo de que um pesquisador precisava: regras simples, nenhum elemento de sorte, um objetivo claro e um número de posições possíveis grande demais para ser examinado uma a uma. Em julho de 1959, ele publicou os resultados, obtidos num IBM 704, e a conclusão do resumo era ousada: um computador pode ser programado para aprender a jogar damas melhor do que quem escreveu o programa, num tempo "notavelmente curto" — oito a dez horas de jogo de máquina (Samuel, 1959).
O artigo de Samuel descreve duas formas de aprender. A primeira, que ele chamou de rote learning (aprendizado por memorização), guardava em fita magnética as posições já analisadas e suas avaliações; quando a mesma posição reaparecia, o programa não precisava calculá-la de novo e podia, com isso, enxergar mais longe. A fita chegou a ter mais de 53 mil posições. A segunda forma era a que mais o interessava: o programa avaliava cada posição com uma soma ponderada de características do tabuleiro — vantagem de peças, mobilidade, controle do centro — e ia ajustando sozinho os pesos dessa soma conforme jogava. Das 38 características que Samuel programou, 16 entravam na fórmula de cada vez, e o próprio programa trocava as menos úteis por outras (Samuel, 1959).
Um computador de válvulas, uma fita magnética e um tabuleiro de damas: o laboratório onde o aprendizado de máquina ganhou seus primeiros resultados públicos. Personagem fictício. Ilustração gerada por IA.
O detalhe mais saboroso está na maneira como o programa treinava. Samuel o fazia jogar contra si mesmo, em dois papéis, que batizou de Alfa e Beta. Alfa ajustava os pesos da sua fórmula a cada lance; Beta mantinha a fórmula fixa durante a partida inteira. Se Alfa vencesse, Beta adotava a fórmula de Alfa; se perdesse, Alfa levava uma "marca preta". Mais tarde, Samuel passou a exigir uma maioria de vitórias antes da troca. E havia ainda um terceiro recurso: o programa podia acompanhar partidas de livro, fornecidas em cartões ou em fita, comparando seus lances com os que os mestres haviam considerado melhores (Samuel, 1959).
Repare no que está escondido nessas páginas de 1959. As partidas de livro são um gabarito: alguém mostra a resposta certa e o programa tenta imitá-la. O jogo contra si mesmo é aprendizado por tentativa, erro e resultado: ninguém diz qual lance era bom; só se sabe, lá no fim, quem venceu. E a regra "se Alfa ganhar, Beta herda sua fórmula" é uma pequena seleção: a versão que funciona melhor sobrevive e passa adiante. Três professores diferentes num único tabuleiro — e é exatamente desse trio, mais um quarto, que trata esta postagem.
Alerta metodológico: a frase que Samuel não escreveu
Em muitas apostilas e slides, o aprendizado de máquina aparece definido como "o campo de estudo que dá aos computadores a habilidade de aprender sem serem explicitamente programados", com a assinatura de Arthur Samuel e o ano de 1959. Conferimos o artigo de 1959 do começo ao fim: a frase não está lá. O que está lá é uma ideia parecida, dita de forma mais modesta — programar computadores para aprender com a experiência deveria, com o tempo, eliminar a necessidade de boa parte do esforço de programação detalhada (Samuel, 1959). A definição famosa pode até resumir bem o espírito do trabalho, mas, sem fonte primária, ela não deve ser citada como se fosse dele.
Uma definição que tem fonte, e que é muito mais útil na prática, é a do professor Tom Mitchell: "diz-se que um programa de computador aprende com a experiência E, em relação a uma classe de tarefas T e a uma medida de desempenho P, se seu desempenho nas tarefas de T, medido por P, melhora com a experiência E." (Mitchell, 1997, p. 2, tradução nossa). No programa de Samuel, T é jogar damas, P é a proporção de partidas vencidas e E são as partidas jogadas contra si mesmo. A definição obriga a responder três perguntas antes de dizer que uma máquina "aprende": aprende a fazer o quê, medido como e a partir de qual experiência.
Nove anos antes de Samuel, Alan Turing já havia antecipado os dois caminhos que fecham o nosso mapa. No mesmo artigo em que propôs o "jogo da imitação", ele sugeriu que, em vez de programar uma mente adulta, seria mais fácil programar uma "mente infantil" e educá-la, associando sinais de recompensa e de punição aos eventos que os precederam — exatamente a lógica do aprendizado por reforço. E comparou o processo de aperfeiçoar essa máquina à evolução: a estrutura da máquina faria o papel do material hereditário; as mudanças, o das mutações; e o julgamento do experimentador, o da seleção natural (Turing, 1950).
Quatro maneiras de melhorar com a experiência — com gabarito, sem gabarito, com recompensa e por seleção. O mesmo robô, quatro professores. Ilustração gerada por IA.
O Quadro 1 resume o mapa. A pergunta que separa os quatro paradigmas é sempre a mesma: que tipo de sinal a máquina recebe para saber se está melhorando?
Quadro 1 — Quatro paradigmas de aprendizado e adaptação, segundo o sinal que orienta a melhora
| Paradigma | O sinal que a máquina recebe | O que ela produz | No tabuleiro de Samuel |
|---|---|---|---|
| Supervisionado | A resposta certa de cada exemplo (o rótulo) | Um modelo que prevê a resposta para casos novos | Partidas de livro: imitar o lance dos mestres |
| Não supervisionado | Nenhum: só os dados, sem respostas | Grupos, padrões, regularidades, anomalias | Descobrir sozinho "tipos" de posição parecidos |
| Por reforço | Uma recompensa numérica, muitas vezes atrasada | Uma política: o que fazer em cada situação | Jogar contra si mesmo e saber só no fim quem venceu |
| Evolucionário | A aptidão de cada candidato numa população | Soluções melhores a cada geração | Beta herda a fórmula de Alfa quando Alfa vence |
Fonte: elaborado pelo autor com base em Samuel (1959), Russell e Norvig (2022), Sutton e Barto (2018) e Eiben e Smith (2015).Nota: a computação evolucionária não é, a rigor, um tipo de aprendizado de máquina, e sim uma família de métodos de otimização inspirados na evolução; aparece no quadro porque também é uma forma de melhorar com a experiência e porque as duas áreas se cruzam com frequência (Lance 08).
Lance 02
Aprender é ajustar botões — e passar na prova surpresa
Antes de separar os paradigmas, vale fixar o vocabulário comum a todos. O aprendizado de máquina é o ramo da inteligência artificial que constrói sistemas capazes de melhorar seu desempenho a partir de dados ou de experiência, em vez de receber todas as regras prontas — o contrário dos sistemas especialistas que vimos em Lógica formal e representação do conhecimento e em Sistemas de inferência e raciocínio, cujo conhecimento era escrito à mão por especialistas (Russell; Norvig, 2022).
Todo aprendizado de máquina tem quatro peças. Os dados são exemplos descritos por atributos — numa fruta, o diâmetro e a doçura; numa posição de damas, a vantagem de peças e a mobilidade. O modelo é a fórmula que transforma atributos em resposta: no caso de Samuel, a soma ponderada que avaliava o tabuleiro. Os parâmetros são os "botões" ajustáveis desse modelo — os pesos da soma. E o critério diz se o ajuste melhorou ou piorou as coisas: um erro a diminuir, uma recompensa a aumentar, uma aptidão a maximizar (Faceli et al., 2025). Aprender, nesse sentido técnico, é procurar os valores dos botões que melhoram o critério.
O teste de verdade, porém, não é ir bem nos exemplos que a máquina já viu, e sim nos que ela ainda não viu. É a generalização. Samuel percebeu isso na prática: a memorização das 53 mil posições ajudava na abertura e no final, mas não resolvia o meio do jogo, em que as posições quase nunca se repetem; para isso, ele estimou que precisaria de uma fita com pelo menos vinte vezes mais posições (Samuel, 1959). Quem só decora vai mal na prova surpresa. Quando um modelo se ajusta tanto aos exemplos de treino que passa a reproduzir até o ruído deles, dizemos que houve sobreajuste (overfitting). Por isso, os dados costumam ser separados em treino e teste — um assunto que o post Como a máquina aprende explora em detalhe, junto com o funcionamento interno das redes neurais.
Para não confundir os nomes
Inteligência artificial é o campo inteiro; aprendizado de máquina é um dos seus ramos; aprendizado profundo (deep learning) é a parte do aprendizado de máquina que usa redes neurais com muitas camadas. Os paradigmas deste post atravessam essas camadas: há redes profundas treinadas de forma supervisionada, não supervisionada e por reforço — e há redes cujos pesos são encontrados por evolução. Se a hierarquia ainda estiver nebulosa, o post Entenda o que é IA, aprendizagem de máquina, deep learning e LLM organiza os termos.
Lance 03
Supervisionado: aprender com gabarito
No aprendizado supervisionado, cada exemplo de treino vem com a resposta certa, chamada rótulo: este e-mail é spam; esta radiografia mostra pneumonia; esta casa foi vendida por tal valor. O algoritmo procura uma função que leve dos atributos ao rótulo e que continue acertando em exemplos novos (Russell; Norvig, 2022). É o professor com o gabarito na mão.
Quando o rótulo é uma categoria — spam ou não spam, pequi ou mangaba —, a tarefa se chama classificação. Quando é um número — o preço de um imóvel, a nota de uma redação, o consumo de energia de amanhã —, chama-se regressão. A fronteira entre as duas é a natureza da resposta, não a do algoritmo: muitos métodos servem para ambas.
Exemplos rotulados: cada caixote vem com a resposta certa. A pergunta do aprendizado supervisionado é o que fazer com o fruto da etiqueta "?". Ilustração gerada por IA.
O método supervisionado mais fácil de visualizar é o k-NN (k-nearest neighbors, "os k vizinhos mais próximos"). Ele quase não treina: guarda todos os exemplos rotulados e, quando chega um caso novo, procura os k exemplos mais parecidos e faz uma votação. Se, entre os três frutos mais próximos do fruto misterioso, dois são mangabas e um é cagaita, o palpite é mangaba. Simples assim — e você vai poder testar isso no Laboratório 1, mais adiante, mudando o valor de k e vendo a resposta mudar junto.
O preço do gabarito
A força do aprendizado supervisionado é também o seu custo: alguém precisa produzir os rótulos. O exemplo mais famoso é o ImageNet, uma base de imagens cujas categorias foram conferidas por pessoas contratadas pela plataforma Amazon Mechanical Turk, que confirmavam, imagem a imagem, se o objeto da categoria estava mesmo ali. A competição anual de reconhecimento organizada em torno dela, a ILSVRC, usava cerca de 1,2 milhão de imagens de treino em mil categorias (Russakovsky et al., 2015). A Tabela 1 mostra o que aconteceu com o erro das equipes vencedoras entre 2010 e 2014.
Tabela 1 — Erro top-5 da equipe vencedora na tarefa de classificação de imagens da ILSVRC — 2010-2014
| Ano | Equipe vencedora | Erro top-5 (%) | Variação em relação ao ano anterior (p.p.) |
|---|---|---|---|
| 2010 | NEC | 28,2 | – |
| 2011 | XRCE | 25,8 | −2,4 |
| 2012 | SuperVision | 16,4 | −9,4 |
| 2013 | Clarifai | 11,7 | −4,7 |
| 2014 | GoogLeNet | 6,7 | −5,0 |
Fonte: elaborado pelo autor com base em Russakovsky et al. (2015).Notas: 1. Resultados das equipes vencedoras usando apenas os dados de treino fornecidos pela competição. 2. O erro top-5 é a proporção de imagens em que a categoria correta não aparece entre os cinco palpites do modelo. 3. Variação calculada pelo autor, em pontos percentuais (p.p.).
A queda brusca de 2012 é o momento que muita gente aponta como o início da onda atual de aprendizado profundo: a equipe SuperVision, da Universidade de Toronto, venceu com uma rede neural convolucional, e o erro caiu quase dez pontos de uma vez. Mas repare no que tornou isso possível: mais de um milhão de exemplos rotulados por gente de carne e osso. O aprendizado supervisionado é poderoso exatamente na medida em que existe um gabarito grande, confiável e representativo — e herda os vieses de quem o produziu.
Lance 04
Não supervisionado: achar ordem sem ninguém dizer qual é
E quando não há gabarito? No aprendizado não supervisionado, a máquina recebe só os dados — sem rótulos — e precisa descobrir estrutura neles: grupos de exemplos parecidos, direções em que os dados variam mais, combinações que se repetem, casos que destoam (Faceli et al., 2025). Ninguém diz quantas espécies de fruto existem na pilha, nem quais são. A máquina tem de perceber, sozinha, que alguns frutos se parecem mais entre si do que com os outros.
Agrupar sem nomes: o robô liga as estrelas que estão perto umas das outras e marca o centro de cada grupo — sem saber como cada constelação se chama. Ilustração gerada por IA.
A tarefa mais conhecida é o agrupamento (clustering), e o algoritmo mais conhecido de agrupamento é o k-means (k-médias), nome cunhado por James MacQueen num artigo de 1967 (MacQueen, 1967). A ideia cabe em três passos. Escolha quantos grupos você quer, k, e sorteie k pontos para servirem de centro provisório. Depois, alterne duas operações até nada mudar: (1) cada exemplo passa a pertencer ao grupo do centro mais próximo; (2) cada centro se muda para a média dos exemplos do seu grupo — o centroide. É o que o robô da ilustração faz com as estrelas: ele não sabe o nome de nenhuma constelação, mas encontra os aglomerados.
Três avisos honestos sobre o k-means. Primeiro, você escolhe o k, e o algoritmo vai encontrar k grupos mesmo que os dados não tenham grupo nenhum. Segundo, o resultado depende do sorteio inicial: rodando de novo, a resposta pode mudar. Terceiro — o mais importante —, o algoritmo encontra grupos, mas quem dá sentido aos grupos é um ser humano: o k-means nunca vai dizer "este é o grupo das mangabas"; vai dizer "estes dez frutos se parecem". O Laboratório 1 permite ver os três avisos acontecendo.
Além do agrupamento, o aprendizado não supervisionado inclui a redução de dimensionalidade (resumir dezenas de atributos em poucos, preservando o essencial, para visualizar ou acelerar outros algoritmos), a detecção de anomalias (achar a transação de cartão que não se parece com nenhuma outra) e a mineração de regras de associação (descobrir que certos itens costumam aparecer juntos no mesmo carrinho de compras).
A lenda da cerveja e das fraldas
Talvez você já tenha ouvido que uma rede de supermercados descobriu, minerando dados, que homens que compravam fraldas no fim da tarde também levavam cerveja — e que passou a colocar as duas coisas lado a lado, faturando alto. A história verdadeira, reconstituída pelo professor Daniel Power, é bem mais modesta: em 1992, uma equipe da Teradata analisou cerca de 1,2 milhão de cestas de compras de 25 drogarias da rede Osco e encontrou que, entre 17h e 19h, cerveja e fraldas apareciam juntas com frequência. A rede nunca mudou os produtos de lugar por causa disso (Power, 2002). O padrão existia; a decisão de negócio, não. É uma boa lição sobre o não supervisionado: achar um padrão é a parte fácil; saber se ele significa algo e se vale agir sobre ele continua sendo trabalho humano.
Segmentar pessoas em grupos também tem implicações éticas. Os mesmos algoritmos que agrupam frutos agrupam eleitores, consumidores e estudantes — às vezes a partir de dados que eles nem sabiam ter cedido, como mostram os posts Privacidade hackeada: o escândalo da Cambridge Analytica e Dados pessoais, privacidade e LGPD. Um grupo descoberto por um algoritmo não é uma categoria natural; é uma escolha de atributos, de distância e de k.
Uma variante que ganhou enorme importância é o aprendizado autossupervisionado: a máquina fabrica o próprio gabarito a partir dos dados brutos, escondendo um pedaço do exemplo e tentando adivinhá-lo — por exemplo, prever a próxima palavra de um texto. Não há rótulo humano, mas a tarefa tem resposta certa. É assim que os grandes modelos de linguagem fazem a maior parte do seu treinamento, como descrito em Fundamentos de IA generativa.
Laboratório 1 — A banca da feira, com e sem etiqueta
Trinta frutos do cerrado, medidos por diâmetro e doçura (dados fictícios, só para o exercício). No modo com etiqueta, cada fruto tem a sua espécie e você faz o papel do fruto misterioso: clique em qualquer ponto do gráfico para colocá-lo ali e veja o k-NN votar. No modo sem etiqueta, as espécies somem e o k-means tenta reencontrar os grupos sozinho, passo a passo.
Laboratório 1 · a banca da feira
pequi cagaita mangaba fruto misterioso
Clique em qualquer ponto do gráfico para colocar ali o fruto misterioso; o k-NN vai procurar os vizinhos mais próximos e votar.
Experimente colocar o fruto misterioso na fronteira entre cagaitas e mangabas e mude o k: com k = 1, a resposta depende de um único vizinho, que pode ser um ponto fora da curva; com k maior, a votação fica mais estável, mas pode passar a ouvir vizinhos distantes demais. No modo sem etiqueta, rode o k-means com k = 3 várias vezes: na maioria das vezes, os grupos coincidem quase perfeitamente com as espécies — mas o algoritmo nunca soube que espécies existiam. Agora rode com k = 2 ou 4: ele obedece e encontra dois ou quatro grupos, com a mesma convicção.
Lance 05
Por reforço: aprender com a recompensa que chega depois
Voltemos ao Alfa e ao Beta de Samuel. Ninguém dizia ao programa qual lance era bom; ele só sabia, ao fim da partida, se tinha ganhado. Esse é o território do aprendizado por reforço: um agente interage com um ambiente, observa o estado em que está, escolhe uma ação e recebe de volta um novo estado e uma recompensa — um número que diz se aquilo foi bom ou ruim. O objetivo do agente é maximizar a recompensa acumulada ao longo do tempo, e não a do próximo passo (Sutton; Barto, 2018). Se a linguagem de estados e ações soa familiar, é porque é a mesma do post Formulação de problemas e espaço de estados — com a diferença de que, agora, o agente não conhece o mapa de antemão: precisa descobri-lo andando.
Tentativa, erro e recompensa: as quedas também ensinam, desde que o agente consiga descobrir quais escolhas levaram a elas. Ilustração gerada por IA.
O que o agente aprende é uma política: uma regra que diz que ação tomar em cada estado. Para chegar lá, a maioria dos métodos estima uma função de valor — quanto de recompensa futura se pode esperar a partir de cada estado, ou de cada par estado-ação. Três dificuldades tornam o reforço diferente dos paradigmas anteriores (Sutton; Barto, 2018):
- A recompensa chega atrasada. Uma partida de damas tem dezenas de lances e um único resultado. Qual lance mereceu o crédito pela vitória? É o problema da atribuição de crédito, que Samuel já enfrentava ao falar da dificuldade de atribuir crédito a posições "muito distantes" na cadeia de lances (Samuel, 1959).
- É preciso escolher entre explorar e aproveitar. Repetir o que já deu certo garante uma recompensa razoável; testar algo novo pode revelar algo melhor — ou pior. É o dilema da exploração e aproveitamento. A solução mais simples é a ε-gulosa: na maior parte das vezes, fazer o que parece melhor; numa pequena fração ε das vezes, fazer algo ao acaso.
- Os dados dependem das ações. No supervisionado, os exemplos já estão na mesa. No reforço, o agente fabrica a própria experiência, e uma política ruim gera experiências ruins.
O algoritmo clássico para aprender valores sem conhecer o ambiente é o Q-learning, proposto por Chris Watkins em 1989. Ele mantém uma tabela Q(s, a) com uma estimativa do valor de cada ação em cada estado e, a cada passo, corrige essa estimativa na direção da recompensa recebida somada ao valor do melhor passo seguinte (Sutton; Barto, 2018):
Q(s, a) ← Q(s, a) + α · [ r + γ · max Q(s', a') − Q(s, a) ]
Lida em português: o novo palpite sobre o valor de fazer a em s é o palpite antigo, corrigido por uma fração α (a taxa de aprendizado) da diferença entre o que de fato aconteceu — a recompensa r mais o melhor valor estimado no estado seguinte s' — e o que se esperava. O fator de desconto γ, entre 0 e 1, diz quanto o agente se importa com o futuro. Repetida ao longo de muitos episódios, essa pequena correção faz a recompensa da chegada "escorrer" para trás, de estado em estado, até o ponto de partida. É a resposta matemática ao problema de Samuel — e você vai vê-la escorrer no Laboratório 2.
Dos tabuleiros aos chatbots
Os jogos foram, por décadas, o laboratório preferido do reforço. A linha do tempo abaixo reúne alguns marcos; clique em cada ano.
aprendizado por reforço evolução busca, sem aprendizado
1959 · Damas: o programa de Samuel
Num IBM 704, o programa de Arthur Samuel memoriza posições, ajusta sozinho os pesos da sua fórmula jogando contra si mesmo e, em 8 a 10 horas de jogo, passa a jogar melhor do que seu autor (Samuel, 1959).
Dois casos da linha do tempo merecem uma segunda olhada. O AlphaGo, de 2016, começou supervisionado: redes neurais treinadas com 30 milhões de lances de partidas de jogadores experientes, até prever o lance humano em 57% das vezes. Só depois passou a jogar milhares de partidas entre as próprias redes, aprendendo por reforço (Hassabis, 2016). Um ano depois, o AlphaZero dispensou a primeira etapa: partindo de jogo aleatório e sem nenhum conhecimento além das regras, chegou a nível sobre-humano em xadrez, shogi e go em até 24 horas de treino, derrotando programas campeões de cada jogo (Silver et al., 2017). Do livro de partidas ao autojogo puro: o mesmo trajeto que Samuel esboçou em 1959, agora em escala industrial.
O reforço também está por trás do jeito educado dos assistentes de conversa. O processo descrito pela OpenAI em 2022 combina os paradigmas em sequência: primeiro, ajuste supervisionado com demonstrações escritas por pessoas; depois, um modelo de recompensa treinado com rankings de respostas feitos por avaliadores humanos; por fim, aprendizado por reforço para maximizar essa recompensa. Nas avaliações dos autores, as respostas de um modelo assim treinado, com 1,3 bilhão de parâmetros, foram preferidas às do GPT-3 original, com 175 bilhões — cem vezes maior (Ouyang et al., 2022). A técnica ficou conhecida como RLHF (reinforcement learning from human feedback, aprendizado por reforço a partir de retorno humano).
Cuidado com o que você recompensa
Há um risco que acompanha o reforço como uma sombra: o agente otimiza a recompensa que você escreveu, não a que você quis dizer. Em 2016, pesquisadores da OpenAI treinaram um agente para o jogo de corrida de barcos CoastRunners, recompensando-o pelos pontos do placar — que vinham, entre outras coisas, de acertar alvos ao longo da pista. O agente descobriu uma lagoa isolada onde podia girar em círculos e derrubar repetidamente três alvos que reapareciam. Pegava fogo, batia em outros barcos, andava na contramão e nunca terminava a corrida — e mesmo assim fazia, em média, 20% mais pontos que jogadores humanos (Clark; Amodei, 2016).
Recompensa mal especificada: a lancha maximiza pontos girando na lagoa e nunca cruza a linha de chegada. A coruja não está convencida. Ilustração gerada por IA.
O nome técnico para isso é hacking de recompensa, e ele não é um defeito exótico: é a consequência natural de otimizar com força um objetivo mal especificado. Quem trabalha com educação conhece a versão humana do fenômeno — basta premiar a quantidade de páginas para receber trabalhos inchados. Vale também para redes sociais que otimizam o engajamento, tema de Redes sociais: estrutura, algoritmos e economia da atenção.
Lance 06
Computação evolucionária: deixar a seleção fazer o trabalho
O quarto professor não ensina ninguém em particular. Ele trabalha com uma multidão. A computação evolucionária é uma família de métodos de otimização que imitam, de forma muito simplificada, a evolução por seleção natural: mantém-se uma população de soluções candidatas; as melhores têm mais chance de "reproduzir"; os filhos herdam e misturam características dos pais, com pequenas variações aleatórias; e, geração após geração, a população tende a melhorar (Eiben; Smith, 2015). Não há gabarito, não há recompensa a cada passo, não há derivada a calcular: só é preciso saber comparar quem é melhor.
A ideia foi descoberta várias vezes, de forma independente, nos anos 1960 e 1970. Em Berlim, Ingo Rechenberg e Hans-Paul Schwefel desenvolveram as estratégias evolutivas para otimizar peças de engenharia; nos Estados Unidos, Lawrence Fogel e colegas propuseram a programação evolutiva; e, na Universidade de Michigan, John Holland formulou os algoritmos genéticos, sistematizados no livro Adaptation in natural and artificial systems (Adaptação em sistemas naturais e artificiais), de 1975 (Holland, 1992). No início dos anos 1990, John Koza acrescentou a programação genética, que evolui programas inteiros. Hoje, essas correntes são tratadas como dialetos de uma mesma área (Eiben; Smith, 2015).
O algoritmo genético em sete peças
O algoritmo genético empresta da biologia um vocabulário inteiro, resumido no Quadro 2. Mas atenção: as palavras são metáforas, e o algoritmo é bem mais simples que a genética de verdade.
Quadro 2 — Correspondência entre termos da biologia e do algoritmo genético
| Na biologia | No algoritmo genético | No labirinto do Laboratório 2 |
|---|---|---|
| Indivíduo | Uma solução candidata | Um plano de 20 movimentos |
| Cromossomo | A codificação da solução, em geral uma sequência | A lista ↑ ↓ ← → … dos 20 movimentos |
| Gene | Uma posição da sequência | O 7.º movimento, por exemplo |
| Alelo | O valor que um gene assume | ↑, ↓, ← ou → |
| Aptidão | A nota que mede a qualidade da solução | Chegou à toca? Com quantos passos? Ficou longe? |
| Seleção natural | Escolha dos pais, favorecendo os mais aptos | Torneio entre três planos sorteados |
| Reprodução sexuada | Cruzamento: combinar trechos de dois pais | Primeira parte de um plano + segunda parte do outro |
| Mutação | Alteração aleatória de genes | Trocar um movimento por outro, ao acaso |
| Geração | Uma rodada completa de avaliação e reprodução | Um clique em "1 geração" |
Fonte: elaborado pelo autor com base em Holland (1992) e Eiben e Smith (2015).
Seleção, cruzamento e mutação: os três operadores que movem um algoritmo genético. Os colares de contas fazem o papel dos cromossomos. Ilustração gerada por IA.
Por que isso funciona? Não há garantia de achar a melhor solução, e o algoritmo pode estacionar num ótimo local. Mas ele tem duas virtudes práticas. A primeira é a exigência mínima: basta saber avaliar uma solução, mesmo que a avaliação seja uma simulação demorada, cheia de ruído e impossível de derivar. A segunda é o paralelismo natural: cada indivíduo da população pode ser avaliado num processador diferente. Para quem quiser ir fundo — da roleta ao elitismo, passando pelo enxame de partículas, pela colônia de formigas, pela antena da NASA desenhada por evolução e pelo teorema que estraga a festa —, o post Computação evolucionária traz um laboratório completo para montar e sabotar um algoritmo genético peça por peça.
Criaturas que ninguém desenhou
Um dos resultados mais encantadores da área veio da computação gráfica. Em 1994, Karl Sims apresentou criaturas virtuais feitas de blocos articulados, num mundo com física simulada, cujos corpos e "sistemas nervosos" eram codificados num genoma e evoluíam juntos. Ninguém desenhava as criaturas: a aptidão era simplesmente a distância percorrida nadando, andando ou pulando, ou a capacidade de seguir um alvo. Depois de muitas gerações, surgiam nadadores serpenteantes, saltadores e rastejadores de formas que nenhum animador teria imaginado (Sims, 1994).
Da geração 1 à geração 100: ninguém desenha o corpo das criaturas; a aptidão — chegar ao cubo verde — faz o trabalho. Ilustração gerada por IA.
Lance 07
Laboratório 2: o mesmo labirinto, dois jeitos de melhorar
Agora é a sua vez de comparar dois professores lado a lado. O labirinto abaixo tem um ponto de partida, a toca da coruja-buraqueira (a chegada) e um buraco que encerra a tentativa. No modo aprender, um agente de Q-learning anda pelo labirinto: perde 1 ponto por passo, ganha 20 ao chegar à toca e perde 20 se cair no buraco. As setas mostram a política que ele aprendeu até agora, e a cor de cada casa, o valor que ele atribui a ela. No modo evoluir, uma população de 40 planos de 20 movimentos é avaliada, selecionada, cruzada e mutada; o desenho mostra o trajeto do melhor plano da geração.
Laboratório 2 · aprender × evoluir
Gráfico de evolução: aparece quando o treino começa.
Modo aprender: clique em “1 episódio” para ver o agente tatear o labirinto, ou em “+50 episódios” para acelerar.
Brinque um pouco e repare em três diferenças, que valem muito além deste labirinto:
- Política × plano. O Q-learning termina com uma seta em cada casa: se o agente for posto em outro lugar, ele sabe o que fazer. O algoritmo genético termina com um plano, bom para aquele ponto de partida; mude a largada e o plano perde o sentido. (Dá para evoluir políticas em vez de planos — é o que faz a neuroevolução, no próximo lance.)
- Nota por passo × nota final. O agente de reforço recebe um sinal a cada movimento e o usa para corrigir a tabela no ato. O algoritmo genético só olha a nota do plano inteiro, depois de executado. É menos informação por tentativa — e, ainda assim, funciona.
- Exploração com ε × exploração com mutação. Zere os dois e teste: com ε = 0, o agente tende a repetir o primeiro caminho que encontra; com mutação 0%, a população perde diversidade e estaciona. Sem variação, nenhum dos dois aprende nada novo.
Lance 08
Aprender ou evoluir? Quando os caminhos se cruzam
Os paradigmas não são times rivais. As melhores histórias da área acontecem justamente quando eles se misturam. Voltemos às damas. No fim dos anos 1990, David Fogel e Kumar Chellapilla fizeram redes neurais jogarem damas umas contra as outras. As redes recebiam apenas o tabuleiro — 32 entradas, uma para cada casa jogável — e começavam com pesos aleatórios; as perdedoras eram eliminadas, e as vencedoras geravam filhas com pequenas mutações nos pesos. Depois de centenas de gerações, sem que ninguém lhes ensinasse estratégia, as redes jogavam em nível de especialista (It's…, 2000). O programa ficou conhecido como Blondie24, nome do perfil com que disputava partidas contra humanos na internet, e a história virou livro (Fogel, 2002). É a regra Alfa-Beta de Samuel levada às últimas consequências.
Evoluir os pesos — e até a arquitetura — de redes neurais é a neuroevolução. Um dos métodos mais influentes, o NEAT, começa com redes mínimas e deixa a evolução acrescentar neurônios e conexões aos poucos, protegendo as inovações recentes para que não sejam eliminadas antes de amadurecer (Stanley; Miikkulainen, 2002). Em 2017, pesquisadores da OpenAI mostraram que estratégias evolutivas podiam competir com o aprendizado por reforço em tarefas difíceis justamente por causa do paralelismo: usando 1.440 núcleos de processamento, ensinaram um boneco humanoide simulado a andar em 10 minutos, e obtiveram resultados competitivos na maioria dos jogos de Atari com cerca de uma hora de treino (Salimans et al., 2017).
A evolução também ajuda a projetar as próprias redes que aprendem de forma supervisionada. Na busca de arquitetura neural, um algoritmo procura automaticamente a "planta" de uma rede. Em 2019, uma equipe do Google comparou evolução e aprendizado por reforço nessa tarefa: uma variante de seleção por torneio que favorece os indivíduos mais jovens chegou a resultados mais depressa, com o mesmo hardware, sobretudo no início da busca, e a rede encontrada, a AmoebaNet-A, atingiu 83,9% de acurácia no ImageNet (Real et al., 2019). Um algoritmo evolucionário escolhendo a arquitetura de uma rede que depois aprende com gabarito: dois professores trabalhando em turnos.
Quadro 3 — Comparação entre aprendizado por reforço e computação evolucionária como formas de melhorar com a experiência
| Aspecto | Por reforço | Evolucionário |
|---|---|---|
| Quem melhora | Um agente, ao longo da própria vida | Uma população, ao longo das gerações |
| Sinal usado | Recompensa a cada passo ou ao fim do episódio | Aptidão do indivíduo inteiro, depois de avaliado |
| O que se ajusta | Valores e política, por pequenas correções | Genomas, por seleção, cruzamento e mutação |
| Precisa de derivadas? | Não necessariamente, mas os métodos profundos usam gradientes | Não: basta comparar notas |
| Ponto forte | Aproveita melhor cada experiência; reage no meio do episódio | Paralelismo fácil; tolera avaliações ruidosas, lentas ou "caixa-preta" |
| Ponto fraco | Atribuição de crédito difícil; sensível à especificação da recompensa | Gasta muitas avaliações; pode estacionar cedo sem diversidade |
| Exemplo marcante | AlphaZero, RLHF | Criaturas de Sims, Blondie24, AmoebaNet |
Fonte: elaborado pelo autor com base em Sutton e Barto (2018), Eiben e Smith (2015), Salimans et al. (2017) e Real et al. (2019).Nota: as fronteiras são porosas — a neuroevolução usa evolução para resolver problemas de reforço, e as estratégias evolutivas de Salimans et al. (2017) foram propostas justamente como alternativa ao reforço.
Há, por fim, um lembrete que vale para os quatro paradigmas: nenhum deles é o melhor para todos os problemas. Se uma regra simples resolve, uma regra simples basta; se há um gabarito confiável, o supervisionado costuma ser o caminho mais barato; se só é possível avaliar o resultado final de uma solução, a evolução entra em campo; se há decisões em sequência e retorno ao longo do tempo, o reforço é o candidato natural. Saber escolher é metade do trabalho — e é o que o Laboratório 3 vai pedir de você.
Aplicação prática
Qual professor chamar para o seu problema?
Oito problemas reais, quatro paradigmas. Para cada caso, escolha o que melhor se aplica; a explicação aparece em seguida.
Laboratório 3 · qual paradigma?
0 de 8 respondidos · 0 acertos
Um provedor de e-mail treina um filtro com milhões de mensagens que os próprios usuários marcaram como spam ou não spam.
Uma loja virtual quer dividir 50 mil clientes em perfis de compra, sem ter nenhuma categoria definida de antemão.
Um robô aspirador ganha pontos por área limpa, perde pontos ao bater em móveis e melhora sua rota a cada faxina.
Engenheiros testam milhares de formatos de antena num simulador, combinam trechos dos melhores e introduzem pequenas alterações a cada rodada.
Uma imobiliária usa o histórico de vendas para estimar o preço de um apartamento a partir da área, do bairro e do número de vagas.
Um banco quer sinalizar transações de cartão muito diferentes do padrão de cada cliente, sem ter uma lista de fraudes confirmadas.
Um programa aprende xadrez jogando milhões de partidas contra si mesmo, sabendo apenas as regras.
Uma faculdade monta a grade de horários do semestre gerando muitas grades candidatas, mantendo as que têm menos choques e recombinando-as.
Na educação, os quatro aparecem com frequência maior do que se imagina. Um corretor automático de redações treinado com textos já corrigidos por professores é supervisionado — e repete os critérios, e os vieses, de quem corrigiu. Agrupar estudantes por padrões de acesso ao ambiente virtual de aprendizagem é não supervisionado — e os grupos precisam de interpretação pedagógica e de cuidado com dados pessoais. Um sistema que escolhe o próximo exercício conforme o desempenho do aluno pode ser modelado como reforço — e corre o risco de "hackear" a métrica, oferecendo só exercícios fáceis que garantem acertos. E montar a grade de horários de uma faculdade sem choques de sala nem de professor é um problema clássico de otimização para algoritmos genéticos. Antes de escolher, percorra a lista abaixo.
0 de 6 — comece pela tarefa, pela medida e pela experiência.
Fim de jogo
O jogo que ensinou as máquinas a aprender terminou empatado
O tabuleiro de Samuel teve um desfecho curioso. Em 1992, o campeão mundial Marion Tinsley venceu por pouco o programa canadense Chinook numa disputa de título; na revanche de 1994, Tinsley abandonou o match por problemas de saúde e morreu oito meses depois. A equipe de Jonathan Schaeffer, na Universidade de Alberta, continuou trabalhando: desde 1989, dezenas de computadores calcularam quase sem parar, e o banco de dados de finais chegou a 3,9 × 1013 posições com dez peças ou menos. Em 2007, a equipe anunciou que as damas estavam resolvidas: num jogo com cerca de 5 × 1020 posições possíveis, o jogo perfeito dos dois lados leva ao empate (Schaeffer et al., 2007).
Fim de jogo: com jogo perfeito dos dois lados, damas termina empatado. O robô que aprende e o robô que evoluiu se cumprimentam. Ilustração gerada por IA.
Há uma ironia deliciosa nisso. O jogo que serviu de berço ao aprendizado de máquina não foi resolvido por aprendizado, e sim por busca exaustiva e bancos de dados gigantescos — a mesma família de técnicas dos posts sobre busca cega, busca informada e busca aplicada. Não há contradição: aprender serve quando não dá para calcular tudo, e calcular serve quando dá. Go, com muito mais posições do que damas, só caiu quando aprendizado e busca passaram a trabalhar juntos.
Talvez seja essa a melhor lição do tabuleiro de Samuel. O gabarito dos mestres, a nota que chega no fim da partida, os padrões que se escondem nos dados e a seleção dos que funcionam melhor não são escolas rivais, e sim ferramentas numa mesma caixa. A inteligência — humana ou artificial — está menos em qualquer uma delas do que em saber qual pegar.
E no seu trabalho, quem faz o papel de professor: alguém com o gabarito na mão, os próprios dados, uma nota que só chega no fim ou a seleção, ao longo do tempo, do que funciona melhor?
Leia também
Para continuar no Brasil Acadêmico:
- Como a máquina aprende — o perceptron, a retropropagação e o aprendizado supervisionado por dentro.
- Computação evolucionária — o algoritmo genético peça por peça, enxames, formigas e a antena da NASA.
- Entenda o que é IA, aprendizagem de máquina, deep learning e LLM — o vocabulário básico da série.
- Afinal, o que é inteligência artificial? — o ponto de partida.
- Formulação de problemas e espaço de estados — estados e ações, a linguagem que o reforço herda.
- Busca cega, busca informada e busca aplicada — o caminho pelo qual as damas foram resolvidas.
- Lógica formal e representação do conhecimento e Sistemas de inferência e raciocínio — a IA que recebe regras em vez de aprendê-las.
- Fundamentos de IA generativa — autossupervisão, modelos de linguagem e de difusão.
- Jev: o modelo de IA que decide em vez de conversar — quando a IA precisa agir, e não só responder.
- Terence Tao e o paradoxo da IA com a ciência — eficácia não é o mesmo que compreensão.
- Redes sociais: estrutura, algoritmos e economia da atenção, Privacidade hackeada e Dados pessoais, privacidade e LGPD — o que acontece quando os algoritmos otimizam e agrupam pessoas.
- E os outros mais de 180 posts sobre Inteligência Artificial que o blog já trazia antes do tema virar hype (modinha)🦉
Nota do autor critérios, fontes e simplificações — clique para abrir
Os dados de Samuel (IBM 704, oito a dez horas de jogo, mais de 53 mil posições na fita, 38 características com 16 em uso, o arranjo Alfa-Beta, as partidas de livro em cartões ou fita) foram conferidos no texto integral do artigo de 1959, disponível em cópia digitalizada aberta. A definição "aprender sem ser explicitamente programado", atribuída a ele em muitos materiais, não foi encontrada nesse artigo; por isso, não foi citada como sua. A frase de Mitchell foi traduzida pelo autor, assim como os trechos e títulos de obras em inglês mencionados no texto.
A interpretação das três "sementes" no trabalho de Samuel (gabarito, recompensa e seleção) é do autor, como recurso didático; Samuel não usava esses nomes. Sutton e Barto (2018) reconhecem o programa de damas de Samuel como precursor dos métodos de diferença temporal do aprendizado por reforço.
A Tabela 1 traz os vencedores da tarefa de classificação da ILSVRC usando apenas os dados de treino fornecidos, conforme Russakovsky et al. (2015). A atribuição da equipe SuperVision à Universidade de Toronto e a descrição do modelo como rede convolucional treinada em GPU são informações amplamente documentadas na literatura da área. A acurácia de 83,9% da AmoebaNet-A refere-se à métrica top-1, a convenção usual, embora o resumo de Real et al. (2019) não use esse rótulo explicitamente.
Os números do Blondie24 vêm de reportagem de 2000 da HPCwire e do livro de Fogel (2002); o artigo científico original (Chellapilla e Fogel, 2001, IEEE Transactions on Evolutionary Computation) não é de acesso aberto. O livro de Holland é citado pela edição de 1992 da MIT Press, a disponível em livraria; a primeira edição é de 1975. Os resultados do AlphaGo foram tomados do comunicado oficial de 2016; o artigo da revista Nature não é de acesso aberto.
Os laboratórios são deliberadamente simplificados. Os frutos do Laboratório 1 são fictícios (diâmetro e doçura gerados para formar três grupos), e as distâncias são medidas no gráfico, isto é, depois de pôr as duas medidas numa escala comparável. No Laboratório 2, o Q-learning usa α = 0,5, γ = 0,95, recompensa −1 por passo, +20 na toca e −20 no buraco, com no máximo 80 passos por episódio; o algoritmo genético usa população de 40, cromossomos de 20 movimentos, seleção por torneio de três, cruzamento de um ponto (taxa de 90%), elitismo de dois indivíduos e aptidão igual a 100 mais 3 pontos por movimento poupado quando chega à toca, ou 60 menos 4 pontos por casa de distância quando não chega, com penalidade de 30 por cair no buraco. Como ambos usam sorteios, cada execução é diferente.
Vocabulário
Os termos marcados com sublinhado pontilhado ao longo do texto levam até aqui; o botão ao lado do verbete leva de volta.
- Agente
- No aprendizado por reforço, quem toma as decisões: observa o estado do ambiente, escolhe ações e recebe recompensas. Lance 05
- Agrupamento (clustering)
- Tarefa não supervisionada de dividir os exemplos em grupos de elementos parecidos entre si, sem rótulos prévios. Lance 04
- Algoritmo genético
- Método de otimização formulado por John Holland que evolui uma população de soluções codificadas como cromossomos, usando seleção, cruzamento e mutação. Lance 06
- Aprendizado autossupervisionado
- Variante em que a própria máquina cria o gabarito a partir dos dados brutos — por exemplo, escondendo a próxima palavra de um texto e tentando adivinhá-la. Base do pré-treinamento dos grandes modelos de linguagem. Lance 04
- Aprendizado de máquina
- Ramo da inteligência artificial que constrói sistemas capazes de melhorar seu desempenho numa tarefa a partir de dados ou de experiência, em vez de receber todas as regras prontas. Lance 02
- Aprendizado não supervisionado
- Paradigma em que a máquina recebe dados sem rótulos e procura estrutura neles: grupos, padrões, associações, anomalias. Lance 04
- Aprendizado por reforço
- Paradigma em que um agente aprende por tentativa e erro, interagindo com um ambiente e recebendo recompensas numéricas, com o objetivo de maximizar a recompensa acumulada. Lance 05
- Aprendizado supervisionado
- Paradigma em que cada exemplo de treino traz a resposta certa (rótulo) e a máquina aprende a prever essa resposta para casos novos. Lance 03
- Aptidão (fitness)
- Nota que mede a qualidade de uma solução candidata num algoritmo evolucionário; define o que "melhor" significa. Lance 06
- Atribuição de crédito
- Problema de descobrir quais ações, entre muitas, foram responsáveis por uma recompensa que só chegou depois. Lance 05
- Atributo (feature)
- Cada característica usada para descrever um exemplo: o diâmetro de uma fruta, a mobilidade numa posição de damas. Lance 02
- Busca de arquitetura neural (NAS)
- Do inglês neural architecture search: procura automática da estrutura de uma rede neural (camadas, conexões), feita por evolução, reforço ou outros métodos. Lance 08
- Centroide
- Ponto médio de um grupo de exemplos; no k-means, cada grupo é representado pelo seu centroide. Lance 04
- Classificação
- Tarefa supervisionada em que a resposta é uma categoria (spam ou não spam, pequi ou mangaba). Lance 03
- Computação evolucionária
- Família de métodos de otimização inspirados na evolução por seleção natural, que trabalham com populações de soluções: algoritmos genéticos, estratégias evolutivas, programação evolutiva e programação genética. Lance 06
- Cromossomo
- Num algoritmo genético, a codificação de uma solução candidata, em geral uma sequência de símbolos (os genes). Lance 06
- Cruzamento (crossover)
- Operador que combina trechos dos cromossomos de dois pais para gerar um filho. Lance 06
- Detecção de anomalias
- Tarefa de encontrar exemplos que destoam do padrão dos demais, como uma transação de cartão incomum. Lance 04
- Elitismo
- Estratégia que copia os melhores indivíduos de uma geração diretamente para a seguinte, para que a melhor solução encontrada não se perca. Lance 06
- Episódio
- Uma tentativa completa no aprendizado por reforço, do estado inicial até um estado final (vitória, derrota, chegada) ou até um limite de passos. Lance 05
- Erro top-5
- Proporção de imagens em que a categoria correta não está entre os cinco palpites mais prováveis do modelo; métrica usada na competição ImageNet. Lance 03
- Estratégias evolutivas
- Corrente da computação evolucionária criada em Berlim nos anos 1960, voltada a otimizar parâmetros numéricos com mutações aleatórias e seleção. Lance 06
- Exploração e aproveitamento
- Dilema entre repetir o que já deu certo (aproveitar) e testar o desconhecido em busca de algo melhor (explorar). A estratégia ε-gulosa explora numa fração ε das vezes. Lance 05
- Fator de desconto (γ)
- Número entre 0 e 1 que define quanto uma recompensa futura vale hoje; perto de 1, o agente é paciente; perto de 0, imediatista. Lance 05
- Função de valor
- Estimativa da recompensa futura que se pode esperar a partir de um estado (ou de um par estado-ação) seguindo uma política. Lance 05
- Generalização
- Capacidade de um modelo de acertar em exemplos que não viu durante o treino; é o verdadeiro objetivo do aprendizado. Lance 02
- Hacking de recompensa
- Quando um agente maximiza a recompensa especificada de um jeito que contraria a intenção de quem a especificou, como a lancha que gira em círculos em vez de terminar a corrida. Lance 05
- k-means (k-médias)
- Algoritmo de agrupamento que alterna entre atribuir cada exemplo ao centro mais próximo e mover cada centro para a média do seu grupo, até estabilizar. Lance 04
- k-NN (k-nearest neighbors)
- Método supervisionado que classifica um caso novo pela votação dos k exemplos rotulados mais parecidos com ele. Lance 03
- Mutação
- Operador que altera ao acaso um ou mais genes de um cromossomo, trazendo variação à população. Lance 06
- Neuroevolução
- Uso de algoritmos evolucionários para encontrar os pesos e, às vezes, a arquitetura de redes neurais, como no NEAT. Lance 08
- Parâmetro
- Valor ajustável de um modelo, aprendido a partir dos dados — os "botões" que o treino gira, como os pesos de uma soma ponderada. Lance 02
- Política
- Regra que diz ao agente qual ação tomar em cada estado; é o produto final do aprendizado por reforço. Lance 05
- Programação genética
- Variante da computação evolucionária, difundida por John Koza nos anos 1990, em que os indivíduos são programas de computador. Lance 06
- Q-learning
- Algoritmo de aprendizado por reforço, proposto por Chris Watkins em 1989, que aprende uma tabela de valores Q(s, a) para cada ação em cada estado sem precisar de um modelo do ambiente. Lance 05
- Recompensa
- Sinal numérico que o ambiente devolve ao agente depois de cada ação, indicando se o resultado foi bom ou ruim. Lance 05
- Redução de dimensionalidade
- Técnicas que resumem muitos atributos em poucos, preservando o essencial, para visualizar dados ou acelerar outros algoritmos. Lance 04
- Regras de associação
- Padrões do tipo "quem compra X também costuma comprar Y", minerados de bases de transações sem rótulos. Lance 04
- Regressão
- Tarefa supervisionada em que a resposta é um número, como o preço de um imóvel. Lance 03
- RLHF
- Do inglês reinforcement learning from human feedback: aprendizado por reforço com um modelo de recompensa treinado a partir de avaliações humanas; usado para ajustar modelos de linguagem. Lance 05
- Rótulo
- A resposta certa associada a um exemplo de treino no aprendizado supervisionado. Lance 03
- Seleção (por roleta ou por torneio)
- Escolha dos pais num algoritmo evolucionário. Na roleta, a chance é proporcional à aptidão; no torneio, sorteia-se um pequeno grupo e vence o melhor dele. Lance 06
- Sobreajuste (overfitting)
- Quando o modelo se ajusta tanto aos exemplos de treino que reproduz até o ruído deles e passa a errar em casos novos. Lance 02
Referências
- CLARK, Jack; AMODEI, Dario. Faulty reward functions in the wild. OpenAI, San Francisco, 21 dez. 2016. Disponível em: https://openai.com/index/faulty-reward-functions/. Acesso em: 7 out. 2026.
- EIBEN, A. E.; SMITH, J. E. Introduction to evolutionary computing. 2. ed. Berlin: Springer, 2015.
- FACELI, Katti; LORENA, Ana Carolina; GAMA, João; ALMEIDA, Tiago Agostinho de; CARVALHO, André Carlos Ponce de Leon Ferreira de. Inteligência artificial: uma abordagem de aprendizado de máquina. 3. ed. Rio de Janeiro: LTC, 2025.
- FOGEL, David B. Blondie24: playing at the edge of AI. San Francisco: Morgan Kaufmann, 2002.
- HASSABIS, Demis. AlphaGo: using machine learning to master the ancient game of Go. The Keyword, Mountain View, 27 jan. 2016. Disponível em: https://blog.google/technology/ai/alphago-machine-learning-game-go/. Acesso em: 7 out. 2026.
- HOLLAND, John H. Adaptation in natural and artificial systems: an introductory analysis with applications to biology, control, and artificial intelligence. Cambridge, MA: MIT Press, 1992. Publicado originalmente em 1975.
- IT’S only checkers, but the computer taught itself. HPCwire, [s. l.], 28 jul. 2000. Disponível em: https://www.hpcwire.com/2000/07/28/its-only-checkers-but-the-computer-taught-itself/. Acesso em: 7 out. 2026.
- MACQUEEN, J. Some methods for classification and analysis of multivariate observations. In: BERKELEY SYMPOSIUM ON MATHEMATICAL STATISTICS AND PROBABILITY, 5., 1965-1966, Berkeley. Proceedings [...]. Berkeley: University of California Press, 1967. v. 1, p. 281-297. Disponível em: https://projecteuclid.org/euclid.bsmsp/1200512992. Acesso em: 7 out. 2026.
- MITCHELL, Tom M. Machine learning. New York: McGraw-Hill, 1997.
- OUYANG, Long et al. Training language models to follow instructions with human feedback. arXiv, Ithaca, 4 mar. 2022. Preprint arXiv:2203.02155. Disponível em: https://arxiv.org/abs/2203.02155. Acesso em: 7 out. 2026.
- POWER, D. J. Ask Dan!: What is the "true story" about data mining, beer and diapers? DSS News, [s. l.], v. 3, n. 23, 10 nov. 2002. Disponível em: https://dssresources.com/newsletters/66.php. Acesso em: 7 out. 2026.
- REAL, Esteban; AGGARWAL, Alok; HUANG, Yanping; LE, Quoc V. Regularized evolution for image classifier architecture search. arXiv, Ithaca, 2019. Preprint arXiv:1802.01548v7, versão aceita na AAAI Conference on Artificial Intelligence, 33., 2019. Disponível em: https://arxiv.org/abs/1802.01548. Acesso em: 7 out. 2026.
- RUSSAKOVSKY, Olga et al. ImageNet large scale visual recognition challenge. International Journal of Computer Vision, [s. l.], v. 115, n. 3, p. 211-252, 2015. DOI: 10.1007/s11263-015-0816-y. Disponível em: https://arxiv.org/abs/1409.0575. Acesso em: 7 out. 2026.
- RUSSELL, Stuart J.; NORVIG, Peter. Inteligência artificial: uma abordagem moderna. 4. ed. Rio de Janeiro: LTC, 2022.
- SALIMANS, Tim; HO, Jonathan; CHEN, Xi; SIDOR, Szymon; SUTSKEVER, Ilya. Evolution strategies as a scalable alternative to reinforcement learning. arXiv, Ithaca, 2017. Preprint arXiv:1703.03864v2. Disponível em: https://arxiv.org/abs/1703.03864. Acesso em: 7 out. 2026.
- SAMUEL, Arthur L. Some studies in machine learning using the game of checkers. IBM Journal of Research and Development, Armonk, v. 3, n. 3, p. 210-229, jul. 1959. DOI: 10.1147/rd.33.0210. Disponível em: https://people.csail.mit.edu/brooks/idocs/Samuel.pdf. Acesso em: 7 out. 2026.
- SCHAEFFER, Jonathan et al. Checkers is solved. Science, Washington, v. 317, n. 5844, p. 1518-1522, 14 set. 2007. DOI: 10.1126/science.1144079. Disponível em: https://webdocs.cs.ualberta.ca/~chinook/publications/solving_checkers.html. Acesso em: 7 out. 2026.
- SILVER, David et al. Mastering chess and shogi by self-play with a general reinforcement learning algorithm. arXiv, Ithaca, 5 dez. 2017. Preprint arXiv:1712.01815. Disponível em: https://arxiv.org/abs/1712.01815. Acesso em: 7 out. 2026.
- SIMS, Karl. Evolving virtual creatures. In: ANNUAL CONFERENCE ON COMPUTER GRAPHICS AND INTERACTIVE TECHNIQUES, 21., 1994, Orlando. Computer Graphics: SIGGRAPH 94 Proceedings. New York: ACM, 1994. p. 15-22. Disponível em: https://www.karlsims.com/papers/siggraph94.pdf. Acesso em: 7 out. 2026.
- STANLEY, Kenneth O.; MIIKKULAINEN, Risto. Evolving neural networks through augmenting topologies. Evolutionary Computation, Cambridge, MA, v. 10, n. 2, p. 99-127, 2002. Disponível em: https://nn.cs.utexas.edu/downloads/papers/stanley.ec02.pdf. Acesso em: 7 out. 2026.
- SUTTON, Richard S.; BARTO, Andrew G. Reinforcement learning: an introduction. 2. ed. Cambridge, MA: MIT Press, 2018. Disponível em: http://incompleteideas.net/book/the-book-2nd.html. Acesso em: 7 out. 2026.
- TURING, A. M. Computing machinery and intelligence. Mind, Oxford, v. 59, n. 236, p. 433-460, out. 1950. DOI: 10.1093/mind/LIX.236.433. Disponível em: https://academic.oup.com/mind/article/LIX/236/433/986238. Acesso em: 7 out. 2026.










Comentários