Aprendizado de máquina e computação evolucionária: aprendizado supervisionado, não supervisionado, por reforço e algoritmos genéticos

Compartilhar

Em 1959, um engenheiro da IBM publicou um artigo mostrando que um programa de damas, rodando num computador de válvulas, podia aprender a jo...

Em 1959, um engenheiro da IBM publicou um artigo mostrando que um programa de damas, rodando num computador de válvulas, podia aprender a jogar melhor do que a pessoa que o escreveu — e em apenas oito a dez horas de partidas. Arthur Samuel ajudou a popularizar um nome para esse feito: aprendizado de máquina. Mais de seis décadas depois, aquele mesmo tabuleiro ainda serve de mapa para entender as quatro maneiras pelas quais uma máquina pode melhorar com a experiência: com gabarito (aprendizado supervisionado), sem gabarito (não supervisionado), com recompensa (por reforço) e por uma seleção natural simulada (computação evolucionária e algoritmos genéticos). Esta postagem apresenta os conceitos básicos de cada uma, com casos reais — do ImageNet ao AlphaZero, da lancha que aprendeu a trapacear às criaturas virtuais que evoluíram para nadar —, um vocabulário ao final e três laboratórios interativos: uma banca de frutos do cerrado para classificar e agrupar, um labirinto resolvido ora por aprendizado por reforço, ora por algoritmo genético, e um teste para descobrir qual paradigma serve para cada problema.
Salão de clube de damas ao entardecer em estilo de animação 3D: dois robôs de latão de olhos azuis jogam damas um contra o outro; o da esquerda estuda um livro aberto, o da direita faz um lance; ao fundo, numa estante, uma fileira de pequenos robôs parecidos, com pequenas variações, ligados por cordões dourados como uma árvore genealógica; em primeiro plano, uma estatueta de coruja-buraqueira com capelo e a plaquinha de latão Brasil Acadêmico

Lance 01

Um tabuleiro, três professores

No fim dos anos 1950, Arthur Samuel, engenheiro da IBM, decidiu ensinar damas a um computador. Não era capricho: as damas tinham tudo de que um pesquisador precisava: regras simples, nenhum elemento de sorte, um objetivo claro e um número de posições possíveis grande demais para ser examinado uma a uma. Em julho de 1959, ele publicou os resultados, obtidos num IBM 704, e a conclusão do resumo era ousada: um computador pode ser programado para aprender a jogar damas melhor do que quem escreveu o programa, num tempo "notavelmente curto" — oito a dez horas de jogo de máquina (Samuel, 1959).

O artigo de Samuel descreve duas formas de aprender. A primeira, que ele chamou de rote learning (aprendizado por memorização), guardava em fita magnética as posições já analisadas e suas avaliações; quando a mesma posição reaparecia, o programa não precisava calculá-la de novo e podia, com isso, enxergar mais longe. A fita chegou a ter mais de 53 mil posições. A segunda forma era a que mais o interessava: o programa avaliava cada posição com uma soma ponderada de características do tabuleiro — vantagem de peças, mobilidade, controle do centro — e ia ajustando sozinho os pesos dessa soma conforme jogava. Das 38 características que Samuel programou, 16 entravam na fórmula de cada vez, e o próprio programa trocava as menos úteis por outras (Samuel, 1959).

Sala de computador do fim dos anos 1950 em estilo de animação 3D: armários cinzentos com unidades de fita magnética e painéis de luzes; um engenheiro fictício de óculos de armação grossa, camisa branca e gravata fina, move uma peça num tabuleiro de damas, surpreso, ao lado de uma folha de papel contínuo; sobre a mesa, uma caixa de madeira de cartões perfurados com a inscrição Brasil Acadêmico e uma estatueta de coruja-buraqueira com capelo

Um computador de válvulas, uma fita magnética e um tabuleiro de damas: o laboratório onde o aprendizado de máquina ganhou seus primeiros resultados públicos. Personagem fictício. Ilustração gerada por IA.

O detalhe mais saboroso está na maneira como o programa treinava. Samuel o fazia jogar contra si mesmo, em dois papéis, que batizou de Alfa e Beta. Alfa ajustava os pesos da sua fórmula a cada lance; Beta mantinha a fórmula fixa durante a partida inteira. Se Alfa vencesse, Beta adotava a fórmula de Alfa; se perdesse, Alfa levava uma "marca preta". Mais tarde, Samuel passou a exigir uma maioria de vitórias antes da troca. E havia ainda um terceiro recurso: o programa podia acompanhar partidas de livro, fornecidas em cartões ou em fita, comparando seus lances com os que os mestres haviam considerado melhores (Samuel, 1959).

Repare no que está escondido nessas páginas de 1959. As partidas de livro são um gabarito: alguém mostra a resposta certa e o programa tenta imitá-la. O jogo contra si mesmo é aprendizado por tentativa, erro e resultado: ninguém diz qual lance era bom; só se sabe, lá no fim, quem venceu. E a regra "se Alfa ganhar, Beta herda sua fórmula" é uma pequena seleção: a versão que funciona melhor sobrevive e passa adiante. Três professores diferentes num único tabuleiro — e é exatamente desse trio, mais um quarto, que trata esta postagem.

Alerta metodológico: a frase que Samuel não escreveu

Em muitas apostilas e slides, o aprendizado de máquina aparece definido como "o campo de estudo que dá aos computadores a habilidade de aprender sem serem explicitamente programados", com a assinatura de Arthur Samuel e o ano de 1959. Conferimos o artigo de 1959 do começo ao fim: a frase não está lá. O que está lá é uma ideia parecida, dita de forma mais modesta — programar computadores para aprender com a experiência deveria, com o tempo, eliminar a necessidade de boa parte do esforço de programação detalhada (Samuel, 1959). A definição famosa pode até resumir bem o espírito do trabalho, mas, sem fonte primária, ela não deve ser citada como se fosse dele.

Uma definição que tem fonte, e que é muito mais útil na prática, é a do professor Tom Mitchell: "diz-se que um programa de computador aprende com a experiência E, em relação a uma classe de tarefas T e a uma medida de desempenho P, se seu desempenho nas tarefas de T, medido por P, melhora com a experiência E." (Mitchell, 1997, p. 2, tradução nossa). No programa de Samuel, T é jogar damas, P é a proporção de partidas vencidas e E são as partidas jogadas contra si mesmo. A definição obriga a responder três perguntas antes de dizer que uma máquina "aprende": aprende a fazer o quê, medido como e a partir de qual experiência.

Nove anos antes de Samuel, Alan Turing já havia antecipado os dois caminhos que fecham o nosso mapa. No mesmo artigo em que propôs o "jogo da imitação", ele sugeriu que, em vez de programar uma mente adulta, seria mais fácil programar uma "mente infantil" e educá-la, associando sinais de recompensa e de punição aos eventos que os precederam — exatamente a lógica do aprendizado por reforço. E comparou o processo de aperfeiçoar essa máquina à evolução: a estrutura da máquina faria o papel do material hereditário; as mudanças, o das mutações; e o julgamento do experimentador, o da seleção natural (Turing, 1950).

Ilustração em quatro quadros em estilo de animação 3D com um robô de latão de olhos azuis; supervisionado: uma professora mostra cartões de frutas e aponta a resposta certa; não supervisionado: o robô separa sozinho pedrinhas coloridas em três montes; por reforço: o robô anda de skate diante de um placar com uma estrela acesa e outra apagada; evolucionário: uma família de robôs com pequenas variações, os mais ágeis subindo um pódio, ao lado de uma estatueta de coruja com capelo e a placa Brasil Acadêmico

Quatro maneiras de melhorar com a experiência — com gabarito, sem gabarito, com recompensa e por seleção. O mesmo robô, quatro professores. Ilustração gerada por IA.

O Quadro 1 resume o mapa. A pergunta que separa os quatro paradigmas é sempre a mesma: que tipo de sinal a máquina recebe para saber se está melhorando?

Quadro 1 — Quatro paradigmas de aprendizado e adaptação, segundo o sinal que orienta a melhora

ParadigmaO sinal que a máquina recebeO que ela produzNo tabuleiro de Samuel
SupervisionadoA resposta certa de cada exemplo (o rótulo)Um modelo que prevê a resposta para casos novosPartidas de livro: imitar o lance dos mestres
Não supervisionadoNenhum: só os dados, sem respostasGrupos, padrões, regularidades, anomaliasDescobrir sozinho "tipos" de posição parecidos
Por reforçoUma recompensa numérica, muitas vezes atrasadaUma política: o que fazer em cada situaçãoJogar contra si mesmo e saber só no fim quem venceu
EvolucionárioA aptidão de cada candidato numa populaçãoSoluções melhores a cada geraçãoBeta herda a fórmula de Alfa quando Alfa vence

Fonte: elaborado pelo autor com base em Samuel (1959), Russell e Norvig (2022), Sutton e Barto (2018) e Eiben e Smith (2015).Nota: a computação evolucionária não é, a rigor, um tipo de aprendizado de máquina, e sim uma família de métodos de otimização inspirados na evolução; aparece no quadro porque também é uma forma de melhorar com a experiência e porque as duas áreas se cruzam com frequência (Lance 08).

Lance 02

Aprender é ajustar botões — e passar na prova surpresa

Antes de separar os paradigmas, vale fixar o vocabulário comum a todos. O aprendizado de máquina é o ramo da inteligência artificial que constrói sistemas capazes de melhorar seu desempenho a partir de dados ou de experiência, em vez de receber todas as regras prontas — o contrário dos sistemas especialistas que vimos em Lógica formal e representação do conhecimento e em Sistemas de inferência e raciocínio, cujo conhecimento era escrito à mão por especialistas (Russell; Norvig, 2022).

Todo aprendizado de máquina tem quatro peças. Os dados são exemplos descritos por atributos — numa fruta, o diâmetro e a doçura; numa posição de damas, a vantagem de peças e a mobilidade. O modelo é a fórmula que transforma atributos em resposta: no caso de Samuel, a soma ponderada que avaliava o tabuleiro. Os parâmetros são os "botões" ajustáveis desse modelo — os pesos da soma. E o critério diz se o ajuste melhorou ou piorou as coisas: um erro a diminuir, uma recompensa a aumentar, uma aptidão a maximizar (Faceli et al., 2025). Aprender, nesse sentido técnico, é procurar os valores dos botões que melhoram o critério.

O teste de verdade, porém, não é ir bem nos exemplos que a máquina já viu, e sim nos que ela ainda não viu. É a generalização. Samuel percebeu isso na prática: a memorização das 53 mil posições ajudava na abertura e no final, mas não resolvia o meio do jogo, em que as posições quase nunca se repetem; para isso, ele estimou que precisaria de uma fita com pelo menos vinte vezes mais posições (Samuel, 1959). Quem só decora vai mal na prova surpresa. Quando um modelo se ajusta tanto aos exemplos de treino que passa a reproduzir até o ruído deles, dizemos que houve sobreajuste (overfitting). Por isso, os dados costumam ser separados em treino e teste — um assunto que o post Como a máquina aprende explora em detalhe, junto com o funcionamento interno das redes neurais.

Para não confundir os nomes

Inteligência artificial é o campo inteiro; aprendizado de máquina é um dos seus ramos; aprendizado profundo (deep learning) é a parte do aprendizado de máquina que usa redes neurais com muitas camadas. Os paradigmas deste post atravessam essas camadas: há redes profundas treinadas de forma supervisionada, não supervisionada e por reforço — e há redes cujos pesos são encontrados por evolução. Se a hierarquia ainda estiver nebulosa, o post Entenda o que é IA, aprendizagem de máquina, deep learning e LLM organiza os termos.

Lance 03

Supervisionado: aprender com gabarito

No aprendizado supervisionado, cada exemplo de treino vem com a resposta certa, chamada rótulo: este e-mail é spam; esta radiografia mostra pneumonia; esta casa foi vendida por tal valor. O algoritmo procura uma função que leve dos atributos ao rótulo e que continue acertando em exemplos novos (Russell; Norvig, 2022). É o professor com o gabarito na mão.

Quando o rótulo é uma categoria — spam ou não spam, pequi ou mangaba —, a tarefa se chama classificação. Quando é um número — o preço de um imóvel, a nota de uma redação, o consumo de energia de amanhã —, chama-se regressão. A fronteira entre as duas é a natureza da resposta, não a do algoritmo: muitos métodos servem para ambas.

Feira livre em estilo de animação 3D: numa banca de madeira com toldo listrado verde e branco onde se lê Brasil Acadêmico, três caixotes de frutos do cerrado com etiquetas de papel pardo escritas à mão — pequi, cagaita e mangaba —; o robô de latão de olhos azuis segura um fruto com uma etiqueta que tem só um ponto de interrogação; pendurada no toldo, uma placa redonda com a cabeça da coruja de capelo

Exemplos rotulados: cada caixote vem com a resposta certa. A pergunta do aprendizado supervisionado é o que fazer com o fruto da etiqueta "?". Ilustração gerada por IA.

O método supervisionado mais fácil de visualizar é o k-NN (k-nearest neighbors, "os k vizinhos mais próximos"). Ele quase não treina: guarda todos os exemplos rotulados e, quando chega um caso novo, procura os k exemplos mais parecidos e faz uma votação. Se, entre os três frutos mais próximos do fruto misterioso, dois são mangabas e um é cagaita, o palpite é mangaba. Simples assim — e você vai poder testar isso no Laboratório 1, mais adiante, mudando o valor de k e vendo a resposta mudar junto.

O preço do gabarito

A força do aprendizado supervisionado é também o seu custo: alguém precisa produzir os rótulos. O exemplo mais famoso é o ImageNet, uma base de imagens cujas categorias foram conferidas por pessoas contratadas pela plataforma Amazon Mechanical Turk, que confirmavam, imagem a imagem, se o objeto da categoria estava mesmo ali. A competição anual de reconhecimento organizada em torno dela, a ILSVRC, usava cerca de 1,2 milhão de imagens de treino em mil categorias (Russakovsky et al., 2015). A Tabela 1 mostra o que aconteceu com o erro das equipes vencedoras entre 2010 e 2014.

Tabela 1 — Erro top-5 da equipe vencedora na tarefa de classificação de imagens da ILSVRC — 2010-2014

AnoEquipe vencedoraErro top-5 (%)Variação em relação ao ano anterior (p.p.)
2010NEC28,2–
2011XRCE25,8−2,4
2012SuperVision16,4−9,4
2013Clarifai11,7−4,7
2014GoogLeNet6,7−5,0

Fonte: elaborado pelo autor com base em Russakovsky et al. (2015).Notas: 1. Resultados das equipes vencedoras usando apenas os dados de treino fornecidos pela competição. 2. O erro top-5 é a proporção de imagens em que a categoria correta não aparece entre os cinco palpites do modelo. 3. Variação calculada pelo autor, em pontos percentuais (p.p.).

A queda brusca de 2012 é o momento que muita gente aponta como o início da onda atual de aprendizado profundo: a equipe SuperVision, da Universidade de Toronto, venceu com uma rede neural convolucional, e o erro caiu quase dez pontos de uma vez. Mas repare no que tornou isso possível: mais de um milhão de exemplos rotulados por gente de carne e osso. O aprendizado supervisionado é poderoso exatamente na medida em que existe um gabarito grande, confiável e representativo — e herda os vieses de quem o produziu.

Lance 04

Não supervisionado: achar ordem sem ninguém dizer qual é

E quando não há gabarito? No aprendizado não supervisionado, a máquina recebe só os dados — sem rótulos — e precisa descobrir estrutura neles: grupos de exemplos parecidos, direções em que os dados variam mais, combinações que se repetem, casos que destoam (Faceli et al., 2025). Ninguém diz quantas espécies de fruto existem na pilha, nem quais são. A máquina tem de perceber, sozinha, que alguns frutos se parecem mais entre si do que com os outros.

Cena noturna em estilo de animação 3D num terraço de observatório no cerrado: sob um céu muito estrelado, o robô de latão de olhos azuis aponta uma varinha de luz para o céu e liga estrelas próximas em três grupos contornados por halos azul, verde e alaranjado, cada um com uma pequena cruz luminosa no centro; ao lado, um telescópio de latão com uma estatueta da cabeça da coruja de capelo e uma plaquinha com a inscrição Brasil Acadêmico

Agrupar sem nomes: o robô liga as estrelas que estão perto umas das outras e marca o centro de cada grupo — sem saber como cada constelação se chama. Ilustração gerada por IA.

A tarefa mais conhecida é o agrupamento (clustering), e o algoritmo mais conhecido de agrupamento é o k-means (k-médias), nome cunhado por James MacQueen num artigo de 1967 (MacQueen, 1967). A ideia cabe em três passos. Escolha quantos grupos você quer, k, e sorteie k pontos para servirem de centro provisório. Depois, alterne duas operações até nada mudar: (1) cada exemplo passa a pertencer ao grupo do centro mais próximo; (2) cada centro se muda para a média dos exemplos do seu grupo — o centroide. É o que o robô da ilustração faz com as estrelas: ele não sabe o nome de nenhuma constelação, mas encontra os aglomerados.

Três avisos honestos sobre o k-means. Primeiro, você escolhe o k, e o algoritmo vai encontrar k grupos mesmo que os dados não tenham grupo nenhum. Segundo, o resultado depende do sorteio inicial: rodando de novo, a resposta pode mudar. Terceiro — o mais importante —, o algoritmo encontra grupos, mas quem dá sentido aos grupos é um ser humano: o k-means nunca vai dizer "este é o grupo das mangabas"; vai dizer "estes dez frutos se parecem". O Laboratório 1 permite ver os três avisos acontecendo.

Além do agrupamento, o aprendizado não supervisionado inclui a redução de dimensionalidade (resumir dezenas de atributos em poucos, preservando o essencial, para visualizar ou acelerar outros algoritmos), a detecção de anomalias (achar a transação de cartão que não se parece com nenhuma outra) e a mineração de regras de associação (descobrir que certos itens costumam aparecer juntos no mesmo carrinho de compras).

A lenda da cerveja e das fraldas

Talvez você já tenha ouvido que uma rede de supermercados descobriu, minerando dados, que homens que compravam fraldas no fim da tarde também levavam cerveja — e que passou a colocar as duas coisas lado a lado, faturando alto. A história verdadeira, reconstituída pelo professor Daniel Power, é bem mais modesta: em 1992, uma equipe da Teradata analisou cerca de 1,2 milhão de cestas de compras de 25 drogarias da rede Osco e encontrou que, entre 17h e 19h, cerveja e fraldas apareciam juntas com frequência. A rede nunca mudou os produtos de lugar por causa disso (Power, 2002). O padrão existia; a decisão de negócio, não. É uma boa lição sobre o não supervisionado: achar um padrão é a parte fácil; saber se ele significa algo e se vale agir sobre ele continua sendo trabalho humano.

Segmentar pessoas em grupos também tem implicações éticas. Os mesmos algoritmos que agrupam frutos agrupam eleitores, consumidores e estudantes — às vezes a partir de dados que eles nem sabiam ter cedido, como mostram os posts Privacidade hackeada: o escândalo da Cambridge Analytica e Dados pessoais, privacidade e LGPD. Um grupo descoberto por um algoritmo não é uma categoria natural; é uma escolha de atributos, de distância e de k.

Uma variante que ganhou enorme importância é o aprendizado autossupervisionado: a máquina fabrica o próprio gabarito a partir dos dados brutos, escondendo um pedaço do exemplo e tentando adivinhá-lo — por exemplo, prever a próxima palavra de um texto. Não há rótulo humano, mas a tarefa tem resposta certa. É assim que os grandes modelos de linguagem fazem a maior parte do seu treinamento, como descrito em Fundamentos de IA generativa.

Laboratório 1 — A banca da feira, com e sem etiqueta

Trinta frutos do cerrado, medidos por diâmetro e doçura (dados fictícios, só para o exercício). No modo com etiqueta, cada fruto tem a sua espécie e você faz o papel do fruto misterioso: clique em qualquer ponto do gráfico para colocá-lo ali e veja o k-NN votar. No modo sem etiqueta, as espécies somem e o k-means tenta reencontrar os grupos sozinho, passo a passo.

Laboratório 1 · a banca da feira

vizinhos (k): clique no gráfico para mover o fruto misterioso
1 2 3 4 5 6 7 8 5 8 11 14 17 20 23 diâmetro (cm) doçura (°Brix) ?

pequi cagaita mangaba fruto misterioso

Clique em qualquer ponto do gráfico para colocar ali o fruto misterioso; o k-NN vai procurar os vizinhos mais próximos e votar.

Experimente colocar o fruto misterioso na fronteira entre cagaitas e mangabas e mude o k: com k = 1, a resposta depende de um único vizinho, que pode ser um ponto fora da curva; com k maior, a votação fica mais estável, mas pode passar a ouvir vizinhos distantes demais. No modo sem etiqueta, rode o k-means com k = 3 várias vezes: na maioria das vezes, os grupos coincidem quase perfeitamente com as espécies — mas o algoritmo nunca soube que espécies existiam. Agora rode com k = 2 ou 4: ele obedece e encontra dois ou quatro grupos, com a mesma convicção.

Lance 05

Por reforço: aprender com a recompensa que chega depois

Voltemos ao Alfa e ao Beta de Samuel. Ninguém dizia ao programa qual lance era bom; ele só sabia, ao fim da partida, se tinha ganhado. Esse é o território do aprendizado por reforço: um agente interage com um ambiente, observa o estado em que está, escolhe uma ação e recebe de volta um novo estado e uma recompensa — um número que diz se aquilo foi bom ou ruim. O objetivo do agente é maximizar a recompensa acumulada ao longo do tempo, e não a do próximo passo (Sutton; Barto, 2018). Se a linguagem de estados e ações soa familiar, é porque é a mesma do post Formulação de problemas e espaço de estados — com a diferença de que, agora, o agente não conhece o mapa de antemão: precisa descobri-lo andando.

Pista de skate ao entardecer em estilo de animação 3D: o robô de latão de olhos azuis desce uma rampa equilibrado num skate, com um balão verde com +1 acima dele; atrás, silhuetas translúcidas do mesmo robô caindo em tentativas anteriores, uma delas com um balão vermelho com −1; na lateral da rampa, um grafite colorido com a inscrição Brasil Acadêmico e a coruja de capelo

Tentativa, erro e recompensa: as quedas também ensinam, desde que o agente consiga descobrir quais escolhas levaram a elas. Ilustração gerada por IA.

O que o agente aprende é uma política: uma regra que diz que ação tomar em cada estado. Para chegar lá, a maioria dos métodos estima uma função de valor — quanto de recompensa futura se pode esperar a partir de cada estado, ou de cada par estado-ação. Três dificuldades tornam o reforço diferente dos paradigmas anteriores (Sutton; Barto, 2018):

  • A recompensa chega atrasada. Uma partida de damas tem dezenas de lances e um único resultado. Qual lance mereceu o crédito pela vitória? É o problema da atribuição de crédito, que Samuel já enfrentava ao falar da dificuldade de atribuir crédito a posições "muito distantes" na cadeia de lances (Samuel, 1959).
  • É preciso escolher entre explorar e aproveitar. Repetir o que já deu certo garante uma recompensa razoável; testar algo novo pode revelar algo melhor — ou pior. É o dilema da exploração e aproveitamento. A solução mais simples é a ε-gulosa: na maior parte das vezes, fazer o que parece melhor; numa pequena fração ε das vezes, fazer algo ao acaso.
  • Os dados dependem das ações. No supervisionado, os exemplos já estão na mesa. No reforço, o agente fabrica a própria experiência, e uma política ruim gera experiências ruins.

O algoritmo clássico para aprender valores sem conhecer o ambiente é o Q-learning, proposto por Chris Watkins em 1989. Ele mantém uma tabela Q(s, a) com uma estimativa do valor de cada ação em cada estado e, a cada passo, corrige essa estimativa na direção da recompensa recebida somada ao valor do melhor passo seguinte (Sutton; Barto, 2018):

Q(s, a) ← Q(s, a) + α · [ r + γ · max Q(s', a') − Q(s, a) ]

Lida em português: o novo palpite sobre o valor de fazer a em s é o palpite antigo, corrigido por uma fração α (a taxa de aprendizado) da diferença entre o que de fato aconteceu — a recompensa r mais o melhor valor estimado no estado seguinte s' — e o que se esperava. O fator de desconto γ, entre 0 e 1, diz quanto o agente se importa com o futuro. Repetida ao longo de muitos episódios, essa pequena correção faz a recompensa da chegada "escorrer" para trás, de estado em estado, até o ponto de partida. É a resposta matemática ao problema de Samuel — e você vai vê-la escorrer no Laboratório 2.

Dos tabuleiros aos chatbots

Os jogos foram, por décadas, o laboratório preferido do reforço. A linha do tempo abaixo reúne alguns marcos; clique em cada ano.

aprendizado por reforço evolução busca, sem aprendizado

1959 · Damas: o programa de Samuel

Num IBM 704, o programa de Arthur Samuel memoriza posições, ajusta sozinho os pesos da sua fórmula jogando contra si mesmo e, em 8 a 10 horas de jogo, passa a jogar melhor do que seu autor (Samuel, 1959).

Dois casos da linha do tempo merecem uma segunda olhada. O AlphaGo, de 2016, começou supervisionado: redes neurais treinadas com 30 milhões de lances de partidas de jogadores experientes, até prever o lance humano em 57% das vezes. Só depois passou a jogar milhares de partidas entre as próprias redes, aprendendo por reforço (Hassabis, 2016). Um ano depois, o AlphaZero dispensou a primeira etapa: partindo de jogo aleatório e sem nenhum conhecimento além das regras, chegou a nível sobre-humano em xadrez, shogi e go em até 24 horas de treino, derrotando programas campeões de cada jogo (Silver et al., 2017). Do livro de partidas ao autojogo puro: o mesmo trajeto que Samuel esboçou em 1959, agora em escala industrial.

O reforço também está por trás do jeito educado dos assistentes de conversa. O processo descrito pela OpenAI em 2022 combina os paradigmas em sequência: primeiro, ajuste supervisionado com demonstrações escritas por pessoas; depois, um modelo de recompensa treinado com rankings de respostas feitos por avaliadores humanos; por fim, aprendizado por reforço para maximizar essa recompensa. Nas avaliações dos autores, as respostas de um modelo assim treinado, com 1,3 bilhão de parâmetros, foram preferidas às do GPT-3 original, com 175 bilhões — cem vezes maior (Ouyang et al., 2022). A técnica ficou conhecida como RLHF (reinforcement learning from human feedback, aprendizado por reforço a partir de retorno humano).

Cuidado com o que você recompensa

Há um risco que acompanha o reforço como uma sombra: o agente otimiza a recompensa que você escreveu, não a que você quis dizer. Em 2016, pesquisadores da OpenAI treinaram um agente para o jogo de corrida de barcos CoastRunners, recompensando-o pelos pontos do placar — que vinham, entre outras coisas, de acertar alvos ao longo da pista. O agente descobriu uma lagoa isolada onde podia girar em círculos e derrubar repetidamente três alvos que reapareciam. Pegava fogo, batia em outros barcos, andava na contramão e nunca terminava a corrida — e mesmo assim fazia, em média, 20% mais pontos que jogadores humanos (Clark; Amodei, 2016).

Vista aérea em estilo de animação 3D de uma corrida de lanchinhas de brinquedo numa lagoa verde cercada de palmeiras: ao fundo, as lanchas seguem em fila para um pórtico inflável com a palavra CHEGADA; em primeiro plano, numa enseada, o robô de latão de olhos azuis gira em círculos com sua lancha soltando fumaça e chamas, batendo em boias douradas, rodeado de espuma em espiral; numa boia listrada, a inscrição Brasil Acadêmico e a coruja de capelo, desconfiada

Recompensa mal especificada: a lancha maximiza pontos girando na lagoa e nunca cruza a linha de chegada. A coruja não está convencida. Ilustração gerada por IA.

O nome técnico para isso é hacking de recompensa, e ele não é um defeito exótico: é a consequência natural de otimizar com força um objetivo mal especificado. Quem trabalha com educação conhece a versão humana do fenômeno — basta premiar a quantidade de páginas para receber trabalhos inchados. Vale também para redes sociais que otimizam o engajamento, tema de Redes sociais: estrutura, algoritmos e economia da atenção.

Lance 06

Computação evolucionária: deixar a seleção fazer o trabalho

O quarto professor não ensina ninguém em particular. Ele trabalha com uma multidão. A computação evolucionária é uma família de métodos de otimização que imitam, de forma muito simplificada, a evolução por seleção natural: mantém-se uma população de soluções candidatas; as melhores têm mais chance de "reproduzir"; os filhos herdam e misturam características dos pais, com pequenas variações aleatórias; e, geração após geração, a população tende a melhorar (Eiben; Smith, 2015). Não há gabarito, não há recompensa a cada passo, não há derivada a calcular: só é preciso saber comparar quem é melhor.

A ideia foi descoberta várias vezes, de forma independente, nos anos 1960 e 1970. Em Berlim, Ingo Rechenberg e Hans-Paul Schwefel desenvolveram as estratégias evolutivas para otimizar peças de engenharia; nos Estados Unidos, Lawrence Fogel e colegas propuseram a programação evolutiva; e, na Universidade de Michigan, John Holland formulou os algoritmos genéticos, sistematizados no livro Adaptation in natural and artificial systems (Adaptação em sistemas naturais e artificiais), de 1975 (Holland, 1992). No início dos anos 1990, John Koza acrescentou a programação genética, que evolui programas inteiros. Hoje, essas correntes são tratadas como dialetos de uma mesma área (Eiben; Smith, 2015).

O algoritmo genético em sete peças

O algoritmo genético empresta da biologia um vocabulário inteiro, resumido no Quadro 2. Mas atenção: as palavras são metáforas, e o algoritmo é bem mais simples que a genética de verdade.

Quadro 2 — Correspondência entre termos da biologia e do algoritmo genético

Na biologiaNo algoritmo genéticoNo labirinto do Laboratório 2
IndivíduoUma solução candidataUm plano de 20 movimentos
CromossomoA codificação da solução, em geral uma sequênciaA lista ↑ ↓ ← → … dos 20 movimentos
GeneUma posição da sequênciaO 7.º movimento, por exemplo
AleloO valor que um gene assume↑, ↓, ← ou →
AptidãoA nota que mede a qualidade da soluçãoChegou à toca? Com quantos passos? Ficou longe?
Seleção naturalEscolha dos pais, favorecendo os mais aptosTorneio entre três planos sorteados
Reprodução sexuadaCruzamento: combinar trechos de dois paisPrimeira parte de um plano + segunda parte do outro
MutaçãoAlteração aleatória de genesTrocar um movimento por outro, ao acaso
GeraçãoUma rodada completa de avaliação e reproduçãoUm clique em "1 geração"

Fonte: elaborado pelo autor com base em Holland (1992) e Eiben e Smith (2015).

peça 1CodificarEscrever cada solução como um cromossomo: bits, números, letras, uma permutação de cidades. Uma codificação ruim estraga todo o resto.
peça 2Gerar a populaçãoCriar dezenas ou centenas de indivíduos, quase sempre ao acaso. A diversidade inicial é o estoque de ideias da busca.
peça 3Medir a aptidãoDar uma nota a cada indivíduo com uma função de aptidão. É ela que define o que "melhor" quer dizer — e os mesmos riscos do hacking de recompensa valem aqui.
peça 4SelecionarEscolher os pais com seleção por roleta (chance proporcional à nota) ou por torneio (o melhor de um pequeno grupo sorteado).
peça 5CruzarCombinar trechos de dois pais num filho — o cruzamento. Se cada pai resolveu metade do problema, o filho pode herdar as duas metades boas.
peça 6MutarAlterar ao acaso um ou outro gene — a mutação — para trazer novidade e evitar que todos fiquem iguais cedo demais.
peça 7Guardar e repetirCopiar os melhores direto para a geração seguinte (elitismo) e repetir até um critério de parada: número de gerações, nota-alvo ou estagnação.
Oficina de relojoeiro em estilo de animação 3D: sobre uma bancada de madeira, três estações com plaquinhas — seleção, com três pequenos bonecos de metal num pódio dourado; cruzamento, com dois colares de contas coloridas cortados por uma tesourinha dourada no mesmo ponto; mutação, com um colar de contas vermelhas em que uma conta azul brilha com faíscas sob uma lupa manejada pelo robô de latão de olhos azuis; numa prateleira, uma caixa vermelha com a inscrição Brasil Acadêmico e uma estatueta da cabeça da coruja de capelo

Seleção, cruzamento e mutação: os três operadores que movem um algoritmo genético. Os colares de contas fazem o papel dos cromossomos. Ilustração gerada por IA.

Por que isso funciona? Não há garantia de achar a melhor solução, e o algoritmo pode estacionar num ótimo local. Mas ele tem duas virtudes práticas. A primeira é a exigência mínima: basta saber avaliar uma solução, mesmo que a avaliação seja uma simulação demorada, cheia de ruído e impossível de derivar. A segunda é o paralelismo natural: cada indivíduo da população pode ser avaliado num processador diferente. Para quem quiser ir fundo — da roleta ao elitismo, passando pelo enxame de partículas, pela colônia de formigas, pela antena da NASA desenhada por evolução e pelo teorema que estraga a festa —, o post Computação evolucionária traz um laboratório completo para montar e sabotar um algoritmo genético peça por peça.

Criaturas que ninguém desenhou

Um dos resultados mais encantadores da área veio da computação gráfica. Em 1994, Karl Sims apresentou criaturas virtuais feitas de blocos articulados, num mundo com física simulada, cujos corpos e "sistemas nervosos" eram codificados num genoma e evoluíam juntos. Ninguém desenhava as criaturas: a aptidão era simplesmente a distância percorrida nadando, andando ou pulando, ou a capacidade de seguir um alvo. Depois de muitas gerações, surgiam nadadores serpenteantes, saltadores e rastejadores de formas que nenhum animador teria imaginado (Sims, 1994).

Aquário-laboratório em estilo de animação 3D com piso quadriculado azul: à esquerda, perto de uma plaquinha geração 1, criaturas de blocos coloridos tombam desajeitadas; à direita, perto de uma plaquinha geração 100, criaturas de blocos de formas alongadas nadam e rastejam velozes rumo a um cubo verde luminoso; do lado de fora do vidro, o robô de latão de olhos azuis observa segurando uma prancheta com o adesivo Brasil Acadêmico e a coruja de capelo

Da geração 1 à geração 100: ninguém desenha o corpo das criaturas; a aptidão — chegar ao cubo verde — faz o trabalho. Ilustração gerada por IA.

Lance 07

Laboratório 2: o mesmo labirinto, dois jeitos de melhorar

Agora é a sua vez de comparar dois professores lado a lado. O labirinto abaixo tem um ponto de partida, a toca da coruja-buraqueira (a chegada) e um buraco que encerra a tentativa. No modo aprender, um agente de Q-learning anda pelo labirinto: perde 1 ponto por passo, ganha 20 ao chegar à toca e perde 20 se cair no buraco. As setas mostram a política que ele aprendeu até agora, e a cor de cada casa, o valor que ele atribui a ela. No modo evoluir, uma população de 40 planos de 20 movimentos é avaliada, selecionada, cruzada e mutada; o desenho mostra o trajeto do melhor plano da geração.

Laboratório 2 · aprender × evoluir

toca buraco início
episódios0
passos no último episódio—
seguindo só as setas (sem exploração)—

Gráfico de evolução: aparece quando o treino começa.

Modo aprender: clique em “1 episódio” para ver o agente tatear o labirinto, ou em “+50 episódios” para acelerar.

Brinque um pouco e repare em três diferenças, que valem muito além deste labirinto:

  • Política × plano. O Q-learning termina com uma seta em cada casa: se o agente for posto em outro lugar, ele sabe o que fazer. O algoritmo genético termina com um plano, bom para aquele ponto de partida; mude a largada e o plano perde o sentido. (Dá para evoluir políticas em vez de planos — é o que faz a neuroevolução, no próximo lance.)
  • Nota por passo × nota final. O agente de reforço recebe um sinal a cada movimento e o usa para corrigir a tabela no ato. O algoritmo genético só olha a nota do plano inteiro, depois de executado. É menos informação por tentativa — e, ainda assim, funciona.
  • Exploração com ε × exploração com mutação. Zere os dois e teste: com ε = 0, o agente tende a repetir o primeiro caminho que encontra; com mutação 0%, a população perde diversidade e estaciona. Sem variação, nenhum dos dois aprende nada novo.

Lance 08

Aprender ou evoluir? Quando os caminhos se cruzam

Os paradigmas não são times rivais. As melhores histórias da área acontecem justamente quando eles se misturam. Voltemos às damas. No fim dos anos 1990, David Fogel e Kumar Chellapilla fizeram redes neurais jogarem damas umas contra as outras. As redes recebiam apenas o tabuleiro — 32 entradas, uma para cada casa jogável — e começavam com pesos aleatórios; as perdedoras eram eliminadas, e as vencedoras geravam filhas com pequenas mutações nos pesos. Depois de centenas de gerações, sem que ninguém lhes ensinasse estratégia, as redes jogavam em nível de especialista (It's…, 2000). O programa ficou conhecido como Blondie24, nome do perfil com que disputava partidas contra humanos na internet, e a história virou livro (Fogel, 2002). É a regra Alfa-Beta de Samuel levada às últimas consequências.

Evoluir os pesos — e até a arquitetura — de redes neurais é a neuroevolução. Um dos métodos mais influentes, o NEAT, começa com redes mínimas e deixa a evolução acrescentar neurônios e conexões aos poucos, protegendo as inovações recentes para que não sejam eliminadas antes de amadurecer (Stanley; Miikkulainen, 2002). Em 2017, pesquisadores da OpenAI mostraram que estratégias evolutivas podiam competir com o aprendizado por reforço em tarefas difíceis justamente por causa do paralelismo: usando 1.440 núcleos de processamento, ensinaram um boneco humanoide simulado a andar em 10 minutos, e obtiveram resultados competitivos na maioria dos jogos de Atari com cerca de uma hora de treino (Salimans et al., 2017).

A evolução também ajuda a projetar as próprias redes que aprendem de forma supervisionada. Na busca de arquitetura neural, um algoritmo procura automaticamente a "planta" de uma rede. Em 2019, uma equipe do Google comparou evolução e aprendizado por reforço nessa tarefa: uma variante de seleção por torneio que favorece os indivíduos mais jovens chegou a resultados mais depressa, com o mesmo hardware, sobretudo no início da busca, e a rede encontrada, a AmoebaNet-A, atingiu 83,9% de acurácia no ImageNet (Real et al., 2019). Um algoritmo evolucionário escolhendo a arquitetura de uma rede que depois aprende com gabarito: dois professores trabalhando em turnos.

Quadro 3 — Comparação entre aprendizado por reforço e computação evolucionária como formas de melhorar com a experiência

AspectoPor reforçoEvolucionário
Quem melhoraUm agente, ao longo da própria vidaUma população, ao longo das gerações
Sinal usadoRecompensa a cada passo ou ao fim do episódioAptidão do indivíduo inteiro, depois de avaliado
O que se ajustaValores e política, por pequenas correçõesGenomas, por seleção, cruzamento e mutação
Precisa de derivadas?Não necessariamente, mas os métodos profundos usam gradientesNão: basta comparar notas
Ponto forteAproveita melhor cada experiência; reage no meio do episódioParalelismo fácil; tolera avaliações ruidosas, lentas ou "caixa-preta"
Ponto fracoAtribuição de crédito difícil; sensível à especificação da recompensaGasta muitas avaliações; pode estacionar cedo sem diversidade
Exemplo marcanteAlphaZero, RLHFCriaturas de Sims, Blondie24, AmoebaNet

Fonte: elaborado pelo autor com base em Sutton e Barto (2018), Eiben e Smith (2015), Salimans et al. (2017) e Real et al. (2019).Nota: as fronteiras são porosas — a neuroevolução usa evolução para resolver problemas de reforço, e as estratégias evolutivas de Salimans et al. (2017) foram propostas justamente como alternativa ao reforço.

Há, por fim, um lembrete que vale para os quatro paradigmas: nenhum deles é o melhor para todos os problemas. Se uma regra simples resolve, uma regra simples basta; se há um gabarito confiável, o supervisionado costuma ser o caminho mais barato; se só é possível avaliar o resultado final de uma solução, a evolução entra em campo; se há decisões em sequência e retorno ao longo do tempo, o reforço é o candidato natural. Saber escolher é metade do trabalho — e é o que o Laboratório 3 vai pedir de você.

Aplicação prática

Qual professor chamar para o seu problema?

Oito problemas reais, quatro paradigmas. Para cada caso, escolha o que melhor se aplica; a explicação aparece em seguida.

Laboratório 3 · qual paradigma?

0 de 8 respondidos · 0 acertos

  1. Um provedor de e-mail treina um filtro com milhões de mensagens que os próprios usuários marcaram como spam ou não spam.

  2. Uma loja virtual quer dividir 50 mil clientes em perfis de compra, sem ter nenhuma categoria definida de antemão.

  3. Um robô aspirador ganha pontos por área limpa, perde pontos ao bater em móveis e melhora sua rota a cada faxina.

  4. Engenheiros testam milhares de formatos de antena num simulador, combinam trechos dos melhores e introduzem pequenas alterações a cada rodada.

  5. Uma imobiliária usa o histórico de vendas para estimar o preço de um apartamento a partir da área, do bairro e do número de vagas.

  6. Um banco quer sinalizar transações de cartão muito diferentes do padrão de cada cliente, sem ter uma lista de fraudes confirmadas.

  7. Um programa aprende xadrez jogando milhões de partidas contra si mesmo, sabendo apenas as regras.

  8. Uma faculdade monta a grade de horários do semestre gerando muitas grades candidatas, mantendo as que têm menos choques e recombinando-as.

Na educação, os quatro aparecem com frequência maior do que se imagina. Um corretor automático de redações treinado com textos já corrigidos por professores é supervisionado — e repete os critérios, e os vieses, de quem corrigiu. Agrupar estudantes por padrões de acesso ao ambiente virtual de aprendizagem é não supervisionado — e os grupos precisam de interpretação pedagógica e de cuidado com dados pessoais. Um sistema que escolhe o próximo exercício conforme o desempenho do aluno pode ser modelado como reforço — e corre o risco de "hackear" a métrica, oferecendo só exercícios fáceis que garantem acertos. E montar a grade de horários de uma faculdade sem choques de sala nem de professor é um problema clássico de otimização para algoritmos genéticos. Antes de escolher, percorra a lista abaixo.

0 de 6 — comece pela tarefa, pela medida e pela experiência.

Fim de jogo

O jogo que ensinou as máquinas a aprender terminou empatado

O tabuleiro de Samuel teve um desfecho curioso. Em 1992, o campeão mundial Marion Tinsley venceu por pouco o programa canadense Chinook numa disputa de título; na revanche de 1994, Tinsley abandonou o match por problemas de saúde e morreu oito meses depois. A equipe de Jonathan Schaeffer, na Universidade de Alberta, continuou trabalhando: desde 1989, dezenas de computadores calcularam quase sem parar, e o banco de dados de finais chegou a 3,9 × 1013 posições com dez peças ou menos. Em 2007, a equipe anunciou que as damas estavam resolvidas: num jogo com cerca de 5 × 1020 posições possíveis, o jogo perfeito dos dois lados leva ao empate (Schaeffer et al., 2007).

Salão de clube de damas à noite em estilo de animação 3D, com luminárias pendentes e troféus ao fundo: sobre um tabuleiro de madeira com poucas peças, o robô de latão de olhos azuis aperta a mão de um robô alto e esguio de metal escuro com detalhes verdes em forma de folhas; ao lado, uma pequena lousa num cavalete com a palavra empate; numa cadeira, uma almofada bordada com a coruja de capelo e a inscrição Brasil Acadêmico

Fim de jogo: com jogo perfeito dos dois lados, damas termina empatado. O robô que aprende e o robô que evoluiu se cumprimentam. Ilustração gerada por IA.

Há uma ironia deliciosa nisso. O jogo que serviu de berço ao aprendizado de máquina não foi resolvido por aprendizado, e sim por busca exaustiva e bancos de dados gigantescos — a mesma família de técnicas dos posts sobre busca cega, busca informada e busca aplicada. Não há contradição: aprender serve quando não dá para calcular tudo, e calcular serve quando dá. Go, com muito mais posições do que damas, só caiu quando aprendizado e busca passaram a trabalhar juntos.

Talvez seja essa a melhor lição do tabuleiro de Samuel. O gabarito dos mestres, a nota que chega no fim da partida, os padrões que se escondem nos dados e a seleção dos que funcionam melhor não são escolas rivais, e sim ferramentas numa mesma caixa. A inteligência — humana ou artificial — está menos em qualquer uma delas do que em saber qual pegar.

E no seu trabalho, quem faz o papel de professor: alguém com o gabarito na mão, os próprios dados, uma nota que só chega no fim ou a seleção, ao longo do tempo, do que funciona melhor?

Leia também

Para continuar no Brasil Acadêmico:

Nota do autor critérios, fontes e simplificações — clique para abrir

Os dados de Samuel (IBM 704, oito a dez horas de jogo, mais de 53 mil posições na fita, 38 características com 16 em uso, o arranjo Alfa-Beta, as partidas de livro em cartões ou fita) foram conferidos no texto integral do artigo de 1959, disponível em cópia digitalizada aberta. A definição "aprender sem ser explicitamente programado", atribuída a ele em muitos materiais, não foi encontrada nesse artigo; por isso, não foi citada como sua. A frase de Mitchell foi traduzida pelo autor, assim como os trechos e títulos de obras em inglês mencionados no texto.

A interpretação das três "sementes" no trabalho de Samuel (gabarito, recompensa e seleção) é do autor, como recurso didático; Samuel não usava esses nomes. Sutton e Barto (2018) reconhecem o programa de damas de Samuel como precursor dos métodos de diferença temporal do aprendizado por reforço.

A Tabela 1 traz os vencedores da tarefa de classificação da ILSVRC usando apenas os dados de treino fornecidos, conforme Russakovsky et al. (2015). A atribuição da equipe SuperVision à Universidade de Toronto e a descrição do modelo como rede convolucional treinada em GPU são informações amplamente documentadas na literatura da área. A acurácia de 83,9% da AmoebaNet-A refere-se à métrica top-1, a convenção usual, embora o resumo de Real et al. (2019) não use esse rótulo explicitamente.

Os números do Blondie24 vêm de reportagem de 2000 da HPCwire e do livro de Fogel (2002); o artigo científico original (Chellapilla e Fogel, 2001, IEEE Transactions on Evolutionary Computation) não é de acesso aberto. O livro de Holland é citado pela edição de 1992 da MIT Press, a disponível em livraria; a primeira edição é de 1975. Os resultados do AlphaGo foram tomados do comunicado oficial de 2016; o artigo da revista Nature não é de acesso aberto.

Os laboratórios são deliberadamente simplificados. Os frutos do Laboratório 1 são fictícios (diâmetro e doçura gerados para formar três grupos), e as distâncias são medidas no gráfico, isto é, depois de pôr as duas medidas numa escala comparável. No Laboratório 2, o Q-learning usa α = 0,5, γ = 0,95, recompensa −1 por passo, +20 na toca e −20 no buraco, com no máximo 80 passos por episódio; o algoritmo genético usa população de 40, cromossomos de 20 movimentos, seleção por torneio de três, cruzamento de um ponto (taxa de 90%), elitismo de dois indivíduos e aptidão igual a 100 mais 3 pontos por movimento poupado quando chega à toca, ou 60 menos 4 pontos por casa de distância quando não chega, com penalidade de 30 por cair no buraco. Como ambos usam sorteios, cada execução é diferente.

Vocabulário

Os termos marcados com sublinhado pontilhado ao longo do texto levam até aqui; o botão ao lado do verbete leva de volta.

Agente
No aprendizado por reforço, quem toma as decisões: observa o estado do ambiente, escolhe ações e recebe recompensas. Lance 05
Agrupamento (clustering)
Tarefa não supervisionada de dividir os exemplos em grupos de elementos parecidos entre si, sem rótulos prévios. Lance 04
Algoritmo genético
Método de otimização formulado por John Holland que evolui uma população de soluções codificadas como cromossomos, usando seleção, cruzamento e mutação. Lance 06
Aprendizado autossupervisionado
Variante em que a própria máquina cria o gabarito a partir dos dados brutos — por exemplo, escondendo a próxima palavra de um texto e tentando adivinhá-la. Base do pré-treinamento dos grandes modelos de linguagem. Lance 04
Aprendizado de máquina
Ramo da inteligência artificial que constrói sistemas capazes de melhorar seu desempenho numa tarefa a partir de dados ou de experiência, em vez de receber todas as regras prontas. Lance 02
Aprendizado não supervisionado
Paradigma em que a máquina recebe dados sem rótulos e procura estrutura neles: grupos, padrões, associações, anomalias. Lance 04
Aprendizado por reforço
Paradigma em que um agente aprende por tentativa e erro, interagindo com um ambiente e recebendo recompensas numéricas, com o objetivo de maximizar a recompensa acumulada. Lance 05
Aprendizado supervisionado
Paradigma em que cada exemplo de treino traz a resposta certa (rótulo) e a máquina aprende a prever essa resposta para casos novos. Lance 03
Aptidão (fitness)
Nota que mede a qualidade de uma solução candidata num algoritmo evolucionário; define o que "melhor" significa. Lance 06
Atribuição de crédito
Problema de descobrir quais ações, entre muitas, foram responsáveis por uma recompensa que só chegou depois. Lance 05
Atributo (feature)
Cada característica usada para descrever um exemplo: o diâmetro de uma fruta, a mobilidade numa posição de damas. Lance 02
Busca de arquitetura neural (NAS)
Do inglês neural architecture search: procura automática da estrutura de uma rede neural (camadas, conexões), feita por evolução, reforço ou outros métodos. Lance 08
Centroide
Ponto médio de um grupo de exemplos; no k-means, cada grupo é representado pelo seu centroide. Lance 04
Classificação
Tarefa supervisionada em que a resposta é uma categoria (spam ou não spam, pequi ou mangaba). Lance 03
Computação evolucionária
Família de métodos de otimização inspirados na evolução por seleção natural, que trabalham com populações de soluções: algoritmos genéticos, estratégias evolutivas, programação evolutiva e programação genética. Lance 06
Cromossomo
Num algoritmo genético, a codificação de uma solução candidata, em geral uma sequência de símbolos (os genes). Lance 06
Cruzamento (crossover)
Operador que combina trechos dos cromossomos de dois pais para gerar um filho. Lance 06
Detecção de anomalias
Tarefa de encontrar exemplos que destoam do padrão dos demais, como uma transação de cartão incomum. Lance 04
Elitismo
Estratégia que copia os melhores indivíduos de uma geração diretamente para a seguinte, para que a melhor solução encontrada não se perca. Lance 06
Episódio
Uma tentativa completa no aprendizado por reforço, do estado inicial até um estado final (vitória, derrota, chegada) ou até um limite de passos. Lance 05
Erro top-5
Proporção de imagens em que a categoria correta não está entre os cinco palpites mais prováveis do modelo; métrica usada na competição ImageNet. Lance 03
Estratégias evolutivas
Corrente da computação evolucionária criada em Berlim nos anos 1960, voltada a otimizar parâmetros numéricos com mutações aleatórias e seleção. Lance 06
Exploração e aproveitamento
Dilema entre repetir o que já deu certo (aproveitar) e testar o desconhecido em busca de algo melhor (explorar). A estratégia ε-gulosa explora numa fração ε das vezes. Lance 05
Fator de desconto (γ)
Número entre 0 e 1 que define quanto uma recompensa futura vale hoje; perto de 1, o agente é paciente; perto de 0, imediatista. Lance 05
Função de valor
Estimativa da recompensa futura que se pode esperar a partir de um estado (ou de um par estado-ação) seguindo uma política. Lance 05
Generalização
Capacidade de um modelo de acertar em exemplos que não viu durante o treino; é o verdadeiro objetivo do aprendizado. Lance 02
Hacking de recompensa
Quando um agente maximiza a recompensa especificada de um jeito que contraria a intenção de quem a especificou, como a lancha que gira em círculos em vez de terminar a corrida. Lance 05
k-means (k-médias)
Algoritmo de agrupamento que alterna entre atribuir cada exemplo ao centro mais próximo e mover cada centro para a média do seu grupo, até estabilizar. Lance 04
k-NN (k-nearest neighbors)
Método supervisionado que classifica um caso novo pela votação dos k exemplos rotulados mais parecidos com ele. Lance 03
Mutação
Operador que altera ao acaso um ou mais genes de um cromossomo, trazendo variação à população. Lance 06
Neuroevolução
Uso de algoritmos evolucionários para encontrar os pesos e, às vezes, a arquitetura de redes neurais, como no NEAT. Lance 08
Parâmetro
Valor ajustável de um modelo, aprendido a partir dos dados — os "botões" que o treino gira, como os pesos de uma soma ponderada. Lance 02
Política
Regra que diz ao agente qual ação tomar em cada estado; é o produto final do aprendizado por reforço. Lance 05
Programação genética
Variante da computação evolucionária, difundida por John Koza nos anos 1990, em que os indivíduos são programas de computador. Lance 06
Q-learning
Algoritmo de aprendizado por reforço, proposto por Chris Watkins em 1989, que aprende uma tabela de valores Q(s, a) para cada ação em cada estado sem precisar de um modelo do ambiente. Lance 05
Recompensa
Sinal numérico que o ambiente devolve ao agente depois de cada ação, indicando se o resultado foi bom ou ruim. Lance 05
Redução de dimensionalidade
Técnicas que resumem muitos atributos em poucos, preservando o essencial, para visualizar dados ou acelerar outros algoritmos. Lance 04
Regras de associação
Padrões do tipo "quem compra X também costuma comprar Y", minerados de bases de transações sem rótulos. Lance 04
Regressão
Tarefa supervisionada em que a resposta é um número, como o preço de um imóvel. Lance 03
RLHF
Do inglês reinforcement learning from human feedback: aprendizado por reforço com um modelo de recompensa treinado a partir de avaliações humanas; usado para ajustar modelos de linguagem. Lance 05
Rótulo
A resposta certa associada a um exemplo de treino no aprendizado supervisionado. Lance 03
Seleção (por roleta ou por torneio)
Escolha dos pais num algoritmo evolucionário. Na roleta, a chance é proporcional à aptidão; no torneio, sorteia-se um pequeno grupo e vence o melhor dele. Lance 06
Sobreajuste (overfitting)
Quando o modelo se ajusta tanto aos exemplos de treino que reproduz até o ruído deles e passa a errar em casos novos. Lance 02

Referências

  1. CLARK, Jack; AMODEI, Dario. Faulty reward functions in the wild. OpenAI, San Francisco, 21 dez. 2016. Disponível em: https://openai.com/index/faulty-reward-functions/. Acesso em: 7 out. 2026.
  2. EIBEN, A. E.; SMITH, J. E. Introduction to evolutionary computing. 2. ed. Berlin: Springer, 2015.
  3. FACELI, Katti; LORENA, Ana Carolina; GAMA, João; ALMEIDA, Tiago Agostinho de; CARVALHO, André Carlos Ponce de Leon Ferreira de. Inteligência artificial: uma abordagem de aprendizado de máquina. 3. ed. Rio de Janeiro: LTC, 2025.
  4. FOGEL, David B. Blondie24: playing at the edge of AI. San Francisco: Morgan Kaufmann, 2002.
  5. HASSABIS, Demis. AlphaGo: using machine learning to master the ancient game of Go. The Keyword, Mountain View, 27 jan. 2016. Disponível em: https://blog.google/technology/ai/alphago-machine-learning-game-go/. Acesso em: 7 out. 2026.
  6. HOLLAND, John H. Adaptation in natural and artificial systems: an introductory analysis with applications to biology, control, and artificial intelligence. Cambridge, MA: MIT Press, 1992. Publicado originalmente em 1975.
  7. IT’S only checkers, but the computer taught itself. HPCwire, [s. l.], 28 jul. 2000. Disponível em: https://www.hpcwire.com/2000/07/28/its-only-checkers-but-the-computer-taught-itself/. Acesso em: 7 out. 2026.
  8. MACQUEEN, J. Some methods for classification and analysis of multivariate observations. In: BERKELEY SYMPOSIUM ON MATHEMATICAL STATISTICS AND PROBABILITY, 5., 1965-1966, Berkeley. Proceedings [...]. Berkeley: University of California Press, 1967. v. 1, p. 281-297. Disponível em: https://projecteuclid.org/euclid.bsmsp/1200512992. Acesso em: 7 out. 2026.
  9. MITCHELL, Tom M. Machine learning. New York: McGraw-Hill, 1997.
  10. OUYANG, Long et al. Training language models to follow instructions with human feedback. arXiv, Ithaca, 4 mar. 2022. Preprint arXiv:2203.02155. Disponível em: https://arxiv.org/abs/2203.02155. Acesso em: 7 out. 2026.
  11. POWER, D. J. Ask Dan!: What is the "true story" about data mining, beer and diapers? DSS News, [s. l.], v. 3, n. 23, 10 nov. 2002. Disponível em: https://dssresources.com/newsletters/66.php. Acesso em: 7 out. 2026.
  12. REAL, Esteban; AGGARWAL, Alok; HUANG, Yanping; LE, Quoc V. Regularized evolution for image classifier architecture search. arXiv, Ithaca, 2019. Preprint arXiv:1802.01548v7, versão aceita na AAAI Conference on Artificial Intelligence, 33., 2019. Disponível em: https://arxiv.org/abs/1802.01548. Acesso em: 7 out. 2026.
  13. RUSSAKOVSKY, Olga et al. ImageNet large scale visual recognition challenge. International Journal of Computer Vision, [s. l.], v. 115, n. 3, p. 211-252, 2015. DOI: 10.1007/s11263-015-0816-y. Disponível em: https://arxiv.org/abs/1409.0575. Acesso em: 7 out. 2026.
  14. RUSSELL, Stuart J.; NORVIG, Peter. Inteligência artificial: uma abordagem moderna. 4. ed. Rio de Janeiro: LTC, 2022.
  15. SALIMANS, Tim; HO, Jonathan; CHEN, Xi; SIDOR, Szymon; SUTSKEVER, Ilya. Evolution strategies as a scalable alternative to reinforcement learning. arXiv, Ithaca, 2017. Preprint arXiv:1703.03864v2. Disponível em: https://arxiv.org/abs/1703.03864. Acesso em: 7 out. 2026.
  16. SAMUEL, Arthur L. Some studies in machine learning using the game of checkers. IBM Journal of Research and Development, Armonk, v. 3, n. 3, p. 210-229, jul. 1959. DOI: 10.1147/rd.33.0210. Disponível em: https://people.csail.mit.edu/brooks/idocs/Samuel.pdf. Acesso em: 7 out. 2026.
  17. SCHAEFFER, Jonathan et al. Checkers is solved. Science, Washington, v. 317, n. 5844, p. 1518-1522, 14 set. 2007. DOI: 10.1126/science.1144079. Disponível em: https://webdocs.cs.ualberta.ca/~chinook/publications/solving_checkers.html. Acesso em: 7 out. 2026.
  18. SILVER, David et al. Mastering chess and shogi by self-play with a general reinforcement learning algorithm. arXiv, Ithaca, 5 dez. 2017. Preprint arXiv:1712.01815. Disponível em: https://arxiv.org/abs/1712.01815. Acesso em: 7 out. 2026.
  19. SIMS, Karl. Evolving virtual creatures. In: ANNUAL CONFERENCE ON COMPUTER GRAPHICS AND INTERACTIVE TECHNIQUES, 21., 1994, Orlando. Computer Graphics: SIGGRAPH 94 Proceedings. New York: ACM, 1994. p. 15-22. Disponível em: https://www.karlsims.com/papers/siggraph94.pdf. Acesso em: 7 out. 2026.
  20. STANLEY, Kenneth O.; MIIKKULAINEN, Risto. Evolving neural networks through augmenting topologies. Evolutionary Computation, Cambridge, MA, v. 10, n. 2, p. 99-127, 2002. Disponível em: https://nn.cs.utexas.edu/downloads/papers/stanley.ec02.pdf. Acesso em: 7 out. 2026.
  21. SUTTON, Richard S.; BARTO, Andrew G. Reinforcement learning: an introduction. 2. ed. Cambridge, MA: MIT Press, 2018. Disponível em: http://incompleteideas.net/book/the-book-2nd.html. Acesso em: 7 out. 2026.
  22. TURING, A. M. Computing machinery and intelligence. Mind, Oxford, v. 59, n. 236, p. 433-460, out. 1950. DOI: 10.1093/mind/LIX.236.433. Disponível em: https://academic.oup.com/mind/article/LIX/236/433/986238. Acesso em: 7 out. 2026.

Comentários

BLOGGER

$show=mobile

Nuvem de Categorias


Coluna Gastroturismo
Nome

#existepesquisanobrasil,2,Abelha,3,Acessibilidade,25,Acessórios,2,Acidente,52,Acústica,16,Adestramento,5,Administração,49,Aerodinâmica,4,Aeronáutica,9,África,7,Agência Bori,1,Agência Brasil,25,Agência FAPESP,5,Agência Fiocruz,6,Agência Porvir,1,Agência Senado,2,Agência USP,5,Agnotologia,1,Agricultura,7,Agropecuária,4,AirBNB,1,Albert Einstein,1,Alcoolismo,9,Alemanha,10,Alemão,4,Alerta,2,Algoritmo,9,Alimento,1,Alzheimer,4,Amazon,5,Amazônia,5,América Latina,1,Análise Combinatória,1,Análise de Texto,2,Anatomia,8,Android,3,Angola,1,Animação,52,Animais de Estimação,6,Animal,2,Antropologia,14,Apicultura,9,App,9,Apple,5,Apresentação,4,aquário,1,Argentina,4,Armamento,1,Arqueologia,6,arquitetura,33,Arte,173,Astrobiologia,3,Astrofísica,4,Astronomia,36,Ativismo,35,Áudio,3,Audio FX,2,Áustria,1,Autismo,2,Auto-ajuda,10,Automobilismo,17,Automóvel,22,aventura,3,Aviação,5,Aviônica,8,Bahia,2,Balonismo,3,Banco Central,1,Banco de Dados,5,Beber e Dirigir,1,biblioteconomia,6,Bicicleta,1,Biografia,18,Biologia,176,Biologia Marinha,15,bioquímica,7,Biotecnologia,25,Bitcoin,2,Blog,29,Blogger,33,Boato,6,Bomba,1,Botânica,6,BRASA,1,BRASA Leads,1,Brasil,41,Brasília,17,BRIC,1,Browser,11,Bugs,3,CAD,3,Calor,2,Caltech,1,Câmera lenta,1,Campanha,47,Canadá,1,cardiologia,16,Carnaval,2,carreira,3,Cartografia,3,Casemods,1,Caso Isabella Nardoni,1,Caso Snowden,1,Ceará,1,Celebridades,6,celular,24,Células-Tronco,5,Cérebro,2,Charge,22,ChatGPT,2,China,23,Cibercultura,3,Ciclovia,1,Cidadania,40,Ciência,226,Cinema,70,Climatologia,3,Clip,1,Cliparts,1,Cloud computing,4,Coaching,12,Comédia,2,competência,2,Complemento de dois,1,Comportamento,277,Computação,103,Computação em grade,5,Computação forense,3,Computação Gráfica,140,Computação Móvel,1,Computação Quântica,1,Comunicação e Marketing,158,Concurso,2,Concurso Cultural de Natal,1,Concursos Público,2,Concursos Públicos,4,Conectômica,1,Conferência,1,Congresso em Foco,1,Conspiração,2,Consumidor,7,Consumismo,3,contabilidade,2,Contos,55,Copa do Mundo,26,Cordel,3,Coreia do Norte,1,Coreia do Sul,1,Corpo,2,Coruja,1,cosmética,3,Cosmologia,21,Covid-19,99,Crash Course,1,Criança,1,Criatividade,4,Crime,49,Crime Digital,9,crise,11,crise econômica,8,Croácia,1,crônica,6,crônicas,5,Cronologia,1,CSS,3,Cuba,4,Culinária,8,Cultura,19,Curiosidades,113,custos fixo,1,custos variáveis,1,Dale Dougherty,2,Dança,6,DAO,1,Darwin,12,Davos,1,Debate,3,Decoração,1,demência,1,Demografia,3,Denúncia,12,Dermatologia,6,Desastre Natural,14,Descoberta,2,Desenho instrucional,19,Desenvolvimento de jogos,18,Desenvolvimento Pessoal,1,Design,34,Design Instrucional,19,Destaque,9,Dia das Mães,1,Dia do professor,1,diabetes,6,Dicas,66,Didática,1,Dieta,4,Dinamarca,1,diplomacia,3,Direito,188,Direito Eleitoral,2,Direito Internacional,30,Direito Militar,1,Direito Trabalhista,1,Direito Tributário,2,Direitos Autorais,4,Direitos Humanos,39,Disney,8,Distrito Federal,4,Documentário,72,Doutorado,1,download,3,Drogas,7,Drone,3,Dubai,1,e-Book,2,e-governo,2,EBC,1,Ecologia,89,Economia,120,Editoração Eletrônica,1,Educação,428,Educação a Distância,190,Educação Corporativa,6,educação física,19,Educação sexual,6,Efeitos Sonoros,4,Egiptologia,2,Eleições,30,Eleições 2014,12,Eleições 2018,5,Eleições 2020,2,Eleições 2022,1,Eletricidade,10,eletrônica,4,Elon Musk,1,Em Operários,1,Embrapa,4,empreendedorismo,7,enciclopédia,1,endocrinologia,6,Enem,3,Energia,17,Energia Alternativa,18,Energia Nuclear,12,Enfermagem,1,Engenharia,71,Engenharia Agrícola,1,Engenharia Civil,6,Engenharia de materiais,18,Engenharia de Software,17,Engenharia Genética,32,Engenharia Mecânica,2,Enretenimento,1,Ensino a Distância,11,Ensino Superior,5,Entomologia,7,Entretenimento,47,Entrevista,91,Entrevista.,1,Epidemiologia,70,Epistemologia,1,Equador,1,Escândalo,6,Escritório,1,ESMPU,1,Espaço,74,Espanha,1,Espanhol,2,Espeleologia,1,Espetáculo,8,Espionagem,20,Esporte,44,Estação,1,Estágio,2,Estatísticas,40,Estética,1,estrutura de dados,1,Ética,32,EUA,20,Europa,2,Evento,60,Evolução,5,Exercícios físicos,2,Exobiologia,3,experiência,43,fábulas,3,Facebook,20,Família,1,Farmacologia,25,Favo,1,Feminismo,2,Férias,1,Ferramentas,15,FIFA,2,Filantropia,4,Filmes,20,Filosofia,50,Finep,2,Finlândia,3,Fintech,1,Firefox,1,Física,119,Física Quântica,4,Fisiologia,10,Fisioterapia,6,Flagrante,2,Flamengo,1,Folclore,3,Fome,1,Fomento,1,Fonética,1,Fonoaudiologia,7,Fotografia,46,Fotos em 360 graus,6,França,10,Francês,4,Frase,3,Fraude,5,Freeware,75,Futebol,38,Futurologia,95,gadget,87,gadgets,1,Gafe,2,Gamificação,8,Gastroenterologia,5,Gastronomia,9,Gastroturismo,7,Geek,2,Genética,46,Geofísica,1,Geografia,57,Geologia,12,Geometria,6,geopolítica,23,Gerenciamento do Tempo,2,Geriatria,13,Gestão de Competências,3,Gestão de Configuração,2,Gestão de Pessoas,12,Gestão de Projetos,29,Gestão do conhecimento,7,Ginecologia,3,Glass,1,Golpe de Estado,1,Google,81,Governo,4,GPS,1,Gradiente,1,gramática,15,Gravidez,1,Grécia,1,Grécia Antiga,2,Guerra,43,Guerra Civil,2,Guinness,1,H2,2,Haiti,3,hardware,39,Henry Ford,1,História,219,HIV,1,Hololens,2,homenagem,46,Horologia,1,HPV,1,HTML,6,Humor,213,Humor Negro,9,IBGE,3,IBM,4,ICIJ,2,Idioma,57,IESB,2,IHC,8,ilo,29,ilusão,36,ilusionismo,5,Imagem 3D,16,Imagens,7,Imagine Cup,1,Império Romano,8,Imprensa,34,Impressora 3D,22,Imunologia,8,Incêndio,2,Inclusão digital,8,Índia,4,Índios,1,Infectologia,36,Infográfico,57,Informática,38,Inglaterra,4,Inglês,26,Inovação,209,Inspiração,1,Inteligência Artificial,189,intercâmbio,1,Interface,206,Interfaces Hápticas,24,Internacional,23,Internacionalização da Amazônia,3,Internet,168,Internet das Coisas,2,Inundação,2,Invenção,20,Inventos,6,iPad,1,IPEA,1,iphone,3,Irã,3,Iraque,1,Israel,7,Itália,2,Japão,5,Java,2,Java.,2,jogos,12,Jogos de Tabuleiro,5,Jogos educativos,20,Jogos Olímpicos,10,Jornalismo,72,José Saramago,1,Justiça,4,Ken Robinson,1,Kinect,10,Le Monde Diplomatique Brasil,9,Le Monde Diplomatique Brasil,1,Letras,2,Lexicografia,5,Liderança,4,Life Hacking,20,línguas estrangeiras,3,Linguística,11,Literatura,59,Livro,73,Lógica,28,Logística,4,Loterias,4,Lua,1,Maçonaria,4,Malásia,2,Malvinas,2,Malware,1,Mapa,96,Mário Sérgio Conti,1,Marte,4,Mastologia,1,Matemática,85,Matemática Financeira,1,maternidade,1,MEC,1,Mecânica,8,Mecânica dos Fluidos,2,Mecatrônica,47,Medalha Fields,1,Medicina,569,Medicina Esportiva,2,Medicina Veterinária,4,Meio Ambiente,131,Mel,1,melanoma,1,Memória,5,memorização,4,Mente,4,Mercado de Trabalho,85,mercosul,1,Mestrado,4,Metaverso,2,meteorologia,12,Metodologia Científica,62,México,1,Microbiologia,4,Microsoft,16,Mídia Social,62,Militar,16,Mineralogia,1,Mistério,3,MIT,15,Mitologia,2,Mobilidade,1,Mobilidade Urbana,9,Moçambique,1,Moda,1,MonaVie,1,Montanhismo,1,Moodle,7,Mossad,1,Motivação,1,Movimento Maker,3,MSF,1,Mudança Climática,30,Mulher,4,Multimídia,15,museu,16,Música,90,MVC,1,Nanotecnologia,37,Nasa,19,Natação,2,Natal,17,Natureza,2,Nefrologia,1,Negócios,31,Netflix,1,Neurociência,97,Neurologia,81,Nicolelis,1,Nordeste,2,Noruega,2,notícias,8,Novidades,18,Novo Enem,2,Números,2,Nutrição,75,Obama,1,Obesidade,11,Observatório da Imprensa,27,Obstetrícia,4,OCDE,1,Oceanografia,7,odontologia,10,Offshore Leaks,2,oftalmologia,11,Olimpíadas,9,oncologia,50,ONU,10,OpenAI,1,Opinião,107,Óptica,17,Oracle,1,Oriente Médio,5,Orkut,2,Ornitologia,1,ortografia,3,Ortopedia,4,Ótica,9,Otorrinolaringologia,2,Oxfam,3,Pacifismo,1,Paginadores,1,paleontologia,4,Palestina,1,Paquistão,1,Pará,2,Paraguai,2,parkinson,2,Passeio virtual,1,Patinação,1,Paulo Freire,1,Pedagogia,8,Pediatria,6,Pensamentos,3,performance,3,Periférico,1,Pesca,2,Pesquisa,267,Petição,1,Petrobrás,10,Petróleo,13,Photoshop,5,Pirataria,7,planilha de custo,1,Playstation 3,2,Plebiscito,3,Pneumologia,1,Podcast,7,Poesia,29,Política,324,Polônia,1,Portugal,9,português,20,Pós-graduação,2,Pré-sal,5,Prêmio Nobel,7,primatologia,1,Primeira Guerra Mundial,2,privacidade,27,produtividade,8,professor Hamilton Alves,2,Programa Gratuito,4,Programação,79,Projeção Mapeada,1,Projeto Truco,2,Promoção,1,Propaganda,5,Psicanálise,1,Psicologia,286,Psicologia Animal,26,Psiquiatria,17,Pública,14,publicidade,19,Publieditorial,6,PUC Minas,1,Quadrinhos,11,Quads,5,Qualidade,5,Qualidade de Vida,12,química,34,REA,2,realidade aumentada,47,realidade diminuída,2,Realidade Misturada,5,Realidade Virtual,50,Reconhecimento de imagem,12,Reconhecimento de voz,3,Recorde,1,Recoverit,1,Recuperar vídeos,1,Redação,1,redes,12,Referência,5,Referendo,1,Reforma Política,3,Reino Unido,2,Relacionamento,2,Relações Internacionais,41,Religião,44,Responsabilidade Social,4,Retrospectiva,1,Review,15,Rio 2016,6,Rio de Janeiro,3,Rio Grande do Norte,1,Rio Grande do Sul,1,Robert Oppenheimer,3,Robô,49,robótica,52,Roda Viva,49,Roma,6,roteiro,1,RSA,1,RTP,1,Rússia,6,Samsung,1,Sanitarismo,5,Santa Catarina,1,São Paulo,5,Saúde,626,Savant,1,Segunda Guerra Mundial,27,Segurança,130,Segurança da Informação,70,Seleção Natural,3,Séries,2,serviço,1,Serviço Online,1,Sexologia,2,sexualidade,5,Show,7,SIGGRAPH,1,Simulação,37,Singularity University,1,Síria,3,Sismologia,2,Sistema operacional,4,Sistemas de Numeração,1,Sites de Busca,22,Sociedade,5,Sociologia,55,Software,34,Software Livre,24,Sol,2,Sono,4,Sony,3,SOPA,2,Star Wars,1,Startup,2,Steve Cutts,1,Steve Jobs,1,Suécia,3,Sugestão de presentes,67,Sun,1,supercomputadores,2,Sustentabilidade,5,Tabagismo,6,Taiwan,1,Talento precoce,1,Taxas Equivalentes,1,Taxidermia,1,Teatro,28,Técnicas de Estudo,3,Tecnologia,606,Tecnologia da Informação,31,TED,448,TED-Ed,48,TedMed,2,TEDx,5,TEDx Rio+20,1,TEDxAmazônia,1,TEDxAsaSul,1,Telefonia,61,Televisão,45,Temas,1,Tempo,2,Tendência,1,Tendências,13,Teologia,6,teoria das supercordas,1,Teoria dos Jogos,1,Terremoto,9,Terrorismo,15,Tesla,1,Testes,17,Thaís Victer,2,ticker,2,TikTok,1,Tipologia,8,Tomada de Decisão,1,tradução,5,Trânsito,12,transporte,59,Tributo,3,Trigonometria,1,Tubarão,2,Tunísia,1,Turismo,30,Tutorial,23,Twitter,10,Uber,7,Ucrânia,11,UFC,1,UFES,1,UFG,2,UFMG,1,ufologia,5,UFRJ,3,UFSC,1,UNB,1,UNESCO,1,Unicamp,4,UNIFESP,1,UNIP,1,universidade,6,Universidade Corporativa,1,Universidade da Califórnica,1,Universidade da Geórgia,1,Universidade da Pensilvânia,1,Universidade de Brasília,1,Universidade de Cambridge,2,Universidade de Chicago,1,Universidade de Columbia,1,Universidade de Michigan,1,Universidade de Princeton,1,Universidade de Rochester,1,Universidade de Washington,3,University College London,1,Urbanismo,26,Urologia,2,URSS,1,User Experience,1,USP,11,Utilidade Pública,4,Utilitário,3,Vale,1,Vaticano,1,Veículo Autônomo,9,Venezuela,1,Ventriloquismo,2,Verão,1,vestibular,3,Vestimenta,1,Vida Digital,7,Vida Moderna,18,Vida Selvagem,10,Videogame,120,Vídeos,990,Vídeos 360,1,Vietnã,1,Violência,5,Vírus,18,Visão Computacional,10,Vôlei,1,Vulcanologia,8,Watergate Política,1,WCIT 2016,2,WCIT 2017,1,Web,1,Web 2.0,29,Web Application,161,Web Semântica,2,Web Seminar,1,webdesign,13,Webinar,2,widget,2,WikiLeaks,37,Wikipedia,4,Windows,5,Xadrez,2,YouTube,6,Zika,1,Zimbábue,1,Zoologia,59,
ltr
item
Brasil Acadêmico: Aprendizado de máquina e computação evolucionária: aprendizado supervisionado, não supervisionado, por reforço e algoritmos genéticos
Aprendizado de máquina e computação evolucionária: aprendizado supervisionado, não supervisionado, por reforço e algoritmos genéticos
https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEhNAQmZmUxcjmJQ2Ho1x2XPyMPEDo0IN691Or8pTaCowWKFi1LzC2Q4543W9UvT-EA9D3puJnK6xiy-zddkmxhyphenhyphenw2AZDkN3QkKou8enbKxivqdIHeKJD4aUEx39dNZ6hEFPeARyqSp-bqEAcOyp1N_wH7JNlkm06u7JQq2RmQKuft85BmDUQdDxQwFv16g/s1600/img01-capa.png
https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEhNAQmZmUxcjmJQ2Ho1x2XPyMPEDo0IN691Or8pTaCowWKFi1LzC2Q4543W9UvT-EA9D3puJnK6xiy-zddkmxhyphenhyphenw2AZDkN3QkKou8enbKxivqdIHeKJD4aUEx39dNZ6hEFPeARyqSp-bqEAcOyp1N_wH7JNlkm06u7JQq2RmQKuft85BmDUQdDxQwFv16g/s72-c/img01-capa.png
Brasil Acadêmico
https://blog.brasilacademico.com/2026/10/aprendizado-de-maquina-e-computacao.html
https://blog.brasilacademico.com/
http://blog.brasilacademico.com/
http://blog.brasilacademico.com/2026/10/aprendizado-de-maquina-e-computacao.html
true
3049085869098582068
UTF-8
Todos os posts carregados Nenhum post encontrado Ver todos Saiba mais Responder Cancelar resposta Apagar Por Início Páginas POSTS Ver todos Especialmente para você Categoria Arquivo Busca Todos os posts Nenhum post coincide com sua busca Início Domingo Segunda Terça Quarta Quinta Sexta Sábado Dom Seg Ter Qua Qui Sex Sáb Janeiro Fevereiro Março Abril Maio Junho Julho Agosto Setembro Outubro Novembro Dezembro Jan Fev Mar Abr Maio Jun Jul Ago Set Out Nov Dez Agora 1 minuto atrás $$1$$ minutos atrás 1 hora atrás $$1$$ horas atrás Ontem $$1$$ dias atrás $$1$$ semanas atrás Mais de 5 semanas atrás Seguidores Seguir Conteúdo PREMIUM fechado Passo 1: Compartilhar com a rede social Passo 2: Clique no link da sua rede social Copiar todo código Selecionar todo código Todos os código copiados para a memória Não posso copiar o código / textos, favor teclar [CTRL]+[C] (ou CMD+C no Mac) para copiar Tabela de Conteúdo