Machine learning types and training · Tipos de machine learning e treinamento
| English | Português |
|---|---|
| machine learning/məˈʃiːn ˈlɜːnɪŋ/ | aprendizado de máquina |
| backpropagation/ˌbækprəpəˈɡeɪʃn/ | propagação reversa |
| supervised learning/ˈsuːpəvaɪzd ˈlɜːnɪŋ/ | aprendizado supervisionado |
| classification/ˌklæsɪfɪˈkeɪʃn/ | classificação |
| unsupervised learning/ʌnˈsuːpəvaɪzd ˈlɜːnɪŋ/ | aprendizado não supervisionado |
| clusters/ˈklʌstəz/ | clusters |
| reinforcement learning/ˌriːɪnˈfɔːsmənt ˈlɜːnɪŋ/ | aprendizado por reforço |
| agent/ˈeɪdʒənt/ | agente |
| reward/rɪˈwɔːd/ | recompensa |
| policy/ˈpɒlɪsi/ | política |
| gradient descent/ˈɡreɪdɪənt dɪˈsent/ | descida de gradiente |
| loss function/lɒs ˈfʌŋkʃn/ | função de perda |
| epoch/ˈiːpɒk/ | época |
The program that taught itself an opening no human had played
- AlphaGo Zero was given the rules of Go and nothing else. No human games, no opening book, no advice. It played against itself, starting from random moves.
- In three days it surpassed the version that had beaten the world champion. Along the way it rediscovered centuries of human opening theory, and then discarded parts of it as inferior.
- It learned from a single number after each game: won or lost. That is a completely different kind of learning from being shown a million labelled photographs.
- This lesson is the three paradigms of machine learning, what data each needs, and how a network's weights are actually changed by backpropagation 反向传播.
O programa que se ensinou uma abertura que nenhum humano jogou
- AlphaGo Zero recebeu as regras do Go e nada mais. Sem jogos humanos, sem livro de aberturas, sem conselhos. Jogou contra si mesmo, começando com movimentos aleatórios.
- Em três dias superou a versão que havia batido o campeão mundial. Ao longo do caminho redescobriu séculos de teoria de aberturas humanas e depois descartou partes dela como inferiores.
- Aprendeu a partir de um único número após cada jogo: venceu ou perdeu. Isso é um tipo completamente diferente de aprendizado do que ser mostrado um milhão de fotos rotuladas.
- Esta lição são os três paradigmas de machine learning, que dados cada um precisa e como os pesos de uma rede são realmente alterados por backpropagation 反向传播.
Supervised learning
- Supervised learning 监督学习 trains on data that carries labels: photographs tagged "cat" or "dog", emails marked spam or not, houses with their sale prices.
- The model learns the mapping from input to label, and is then given inputs it has never seen and asked to produce the label.
- It splits into classification 分类, where the output is a category, and regression, where the output is a number.
- Its cost is the labels: someone must produce them, which for a million images is a great deal of human work.
Labelled examples in, a model out, then unlabelled inputs
Aprendizado supervisionado
- Aprendizado supervisionado 监督学习 treina com dados que carregam rótulos: fotos marcadas "gato" ou "cachorro", e-mails marcados spam ou não, casas com seus preços de venda.
- O modelo aprende o mapeamento de entrada para rótulo, e então recebe entradas que nunca viu e é perguntado para produzir o rótulo.
- Divide-se em classificação 分类, onde a saída é uma categoria, e regressão, onde a saída é um número.
- Seu custo são os rótulos: alguém deve produzi-los, o que para um milhão de imagens é muito trabalho humano.

Exemplos rotulados entram, um modelo sai, então entradas não rotuladas
Supervised learning uses: · Aprendizado supervisionado usa:
Supervised learning trains on labelled examples (e.g. images tagged cat/dog). · O aprendizado supervisionado treina com exemplos rotulados (ex.: imagens marcadas como gato/cachorro).
Unsupervised learning
- Unsupervised learning 无监督学习 is given data with no labels and asked to find structure in it.
- The commonest use is clustering: grouping into clusters 聚类 of similar items, such as customers who buy similar things, without anyone deciding in advance what the groups should be.
- That is its strength and its weakness: it can discover a grouping nobody suspected, and it cannot tell you what the grouping means.
Aprendizado não supervisionado
- Aprendizado não supervisionado 无监督学习 recebe dados com sem rótulos e é pedido para encontrar estrutura neles.
- O uso mais comum é agrupamento: agrupar em clusters 聚类 de itens semelhantes, como clientes que compram coisas semelhantes, sem ninguém decidir antecipadamente quais devem ser os grupos.
- Essa é sua força e sua fraqueza: pode descobrir um agrupamento ninguém suspeitava, e não pode dizer o que o agrupamento significa.
Unsupervised learning is used to: · O aprendizado não supervisionado é usado para:
With no labels, unsupervised learning discovers patterns/clusters in the data. · Sem rótulos, o aprendizado não supervisionado descobre padrões/agrupamentos nos dados.
Reinforcement learning
- Reinforcement learning 强化学习 has an agent 智能体 acting in an environment. Each action changes the state and returns a reward 奖励, which may be zero for a long time.
- The agent learns a policy 策略, a strategy for choosing actions, that maximises its total reward over time. It learns by trial and error, with no labelled examples at all.
- It suits problems that are a sequence of decisions where the right move is only revealed by the eventual outcome: games, robot control, self-driving cars. That is exactly the AlphaGo Zero case.
Aprendizado por reforço
- Aprendizado por reforço 强化学习 tem um agente 智能体 agindo em um ambiente. Cada ação muda o estado e retorna uma recompensa 奖励, que pode ser zero por muito tempo.
- O agente aprende uma política 策略, uma estratégia para escolher ações, que maximiza sua recompensa total ao longo do tempo. Aprende por tentativa e erro, sem exemplos rotulados.
- Adequa-se a problemas que são uma sequência de decisões onde o movimento certo só é revelado pelo resultado final: jogos, controle de robôs, carros autônomos. Esse é exatamente o caso do AlphaGo Zero.
In reinforcement learning, the agent learns by: · No aprendizado por reforço, o agente aprende através de:
The agent tries actions, receives rewards, and learns a policy that maximises long-term reward. · O agente tenta ações, recebe recompensas e aprende uma política que maximiza a recompensa de longo prazo.
In reinforcement learning the agent learns a ____ that maximises its total reward over time. · No aprendizado por reforço, o agente aprende uma ____ que maximiza sua recompensa total ao longo do tempo.
It learns by trial and error from rewards, with no labelled examples at all, which is why it suits sequences of decisions. · Ele aprende por tentativa e erro a partir de recompensas, sem nenhum exemplo rotulado, por isso se adequa a sequências de decisões.
Worked example: choose the paradigm
- Ten thousand medical scans, each labelled by a doctor as showing a tumour or not, are used to train a system to flag new scans. Supervised: the data has labels and the task is to learn input to label, specifically a classification.
- A shop wants to know whether its customers fall into natural groups, without deciding the groups in advance. Unsupervised: no labels exist, and the task is to find structure, specifically clustering.
- A robot arm must learn to place components, judged only by whether each attempt succeeded. Reinforcement: an agent, a sequence of actions, and a reward rather than a label.
- Name the paradigm, then justify from the data: labelled, unlabelled, or a reward signal.
Exemplo resolvido: escolha o paradigma
- Dez mil exames médicos, cada um rotulado por um médico mostrando tumor ou não, são usados para treinar um sistema para sinalizar novos exames. Supervisionado: os dados têm rótulos e a tarefa é aprender entrada para rótulo, especificamente uma classificação.
- Uma loja quer saber se seus clientes formam grupos naturais, sem decidir os grupos com antecedência. Não supervisionado: não existem rótulos, e a tarefa é encontrar estrutura, especificamente agrupamento.
- Um braço robótico deve aprender a posicionar componentes, julgado apenas pelo sucesso de cada tentativa. Reforço: um agente, uma sequência de ações e uma recompensa em vez de um rótulo.
- Nomeie o paradigma, então justifique a partir dos dados: rotulados, não rotulados ou um sinal de recompensa.
AI learning type lab · Laboratório de tipos de aprendizado de IA
Classify AI examples by the type of learning or concern involved. · Classifique exemplos de IA pelo tipo de aprendizado ou preocupação envolvida.
Match each ML paradigm to its data. · Associe cada paradigma de ML aos seus dados.
Supervised = labels; unsupervised = no labels; reinforcement = reward feedback. · Supervisionado = rótulos; não supervisionado = sem rótulos; reforço = feedback de recompensa.
Match each situation to the machine-learning paradigm it needs. · Associe cada situação ao paradigma de aprendizado de máquina necessário.
Labels, no labels, or a reward. The data decides the paradigm, not the difficulty of the task. · Rótulos, sem rótulos ou uma recompensa. Os dados determinam o paradigma, não a dificuldade da tarefa.
Training by backpropagation
- Training means adjusting the weights so the network's outputs match the targets. The method is backpropagation with gradient descent 梯度下降.
- Forward pass: feed an input through the network and get its output. Compute the error using a loss function 损失函数, which measures how far the output is from the target.
- Backward pass: propagate that error backwards through the layers to find each weight's gradient, that is, how much that weight contributed to the error.
- Update: change each weight by a small step against its gradient. The step size is the learning rate.
Downhill, one small step at a time
Treinamento por retropropagação
- Treinar significa ajustar os pesos para que as saídas da rede correspondam aos alvos. O método é retropropagação com descida do gradiente 梯度下降.
- Passagem frontal: passe uma entrada pela rede e obtenha sua saída. Calcule o erro usando uma função de perda 损失函数, que mede quão longe a saída está do alvo.
- Passagem traseira: propague esse erro para trás através das camadas para encontrar o gradiente de cada peso, isto é, quanto aquele peso contribuiu para o erro.
- Atualização: altere cada peso em um pequeno passo contra seu gradiente. O tamanho do passo é a taxa de aprendizado.

Borracho abaixo, um pequeno passo de cada vez
Backpropagation trains a network by: · A retropropagação treina uma rede por meio de:
The error flows from the output back through the network (chain rule) so every weight's gradient is found, then weights step downhill. · O erro flui da saída de volta pela rede (regra da cadeia) para encontrar o gradiente de todos os pesos, depois os pesos descem colina abaixo.
Put one round of backpropagation training in order. · Organize uma rodada de treinamento de retropropagação na ordem correta.
Forward, error, backward, update, repeated over many epochs until the error stops falling. · Frontal, erro, reverso, atualização, repetido por muitas épocas até que o erro deixe de cair.
Epochs, and why the learning rate matters
- One pass through the whole training set is an epoch 训练轮次. Training repeats for many epochs until the error stops falling.
- Too large a learning rate overshoots the minimum and the error jumps about; too small and training takes far longer than it needs to.
- After training, using the model is only a forward pass, which is why a trained network answers instantly even though training took days.
Épocas, e por que a taxa de aprendizado importa
- Uma passagem por todo o conjunto de treinamento é uma época 训练轮次. O treinamento repete-se por muitas épocas até que o erro pare de cair.
- Uma taxa de aprendizado muito grande ultrapassa o mínimo e o erro oscila; muito pequena e o treinamento leva muito mais tempo do que o necessário.
- Após o treinamento, usar o modelo é apenas uma passagem frontal, por isso uma rede treinada responde instantaneamente mesmo que o treinamento tenha levado dias.
In gradient descent the learning rate sets how big a step each weight update takes — too large overshoots the minimum, too small makes training slow. · Na descida de gradiente, a taxa de aprendizado define o tamanho do passo de cada atualização de peso — muito grande ultrapassa o mínimo, muito pequena torna o treinamento lento.
Backpropagation finds each weight's gradient; the learning rate scales how far down that gradient the weight moves. · A retropropagação encontra o gradiente de cada peso; a taxa de aprendizado escala quão longe o peso desce nesse gradiente.
Which statements about training are correct? Select all · todos that apply. · Quais afirmações sobre o treinamento estão corretas? Selecione todas as que se aplicam.
The learning rate is the size of each weight update. That is why training can take days while a prediction takes milliseconds. · A taxa de aprendizado é o tamanho de cada atualização de peso. É por isso que o treinamento pode levar dias enquanto uma previsão leva milissegundos.
Marks that slip away
- Justify a paradigm from the data: labelled means supervised, unlabelled means unsupervised, a reward signal means reinforcement.
- Reinforcement learning has no labels. Calling its reward a label is the classic confusion.
- Backpropagation is forward, error, backward, update, repeated. Naming only "it adjusts the weights" is half an answer.
- The learning rate is the size of each step, not the speed of training or the number of epochs.
Marcas que escapam
- Justifique um paradigma a partir dos dados: rotulados significam supervisionado, não rotulados significam não supervisionado, um sinal de recompensa significam reforço.
- Aprendizado por reforço não tem rótulos. Chamar sua recompensa de rótulo é a confusão clássica.
- Retropropagação é passagem frontal, erro, passagem traseira, atualização, repetido. Nomina-se apenas "ele ajusta os pesos" como meia resposta.
- A taxa de aprendizado é o tamanho de cada passo, não a velocidade do treinamento nem o número de épocas.
You've got it
- supervised learns input to label from labelled data, for classification or regression · unsupervised finds structure such as clusters in unlabelled data · reinforcement has an agent learning a policy from rewards by trial and error
- choose the paradigm from what the data provides, not from the task's difficulty
- backpropagation: a forward pass, an error from the loss function, a backward pass giving each weight's gradient, then an update of size set by the learning rate
- training repeats for many epochs; using the trained model is one forward pass
Entendeu?
- supervisionado aprende entrada para rótulo a partir de dados rotulados, para classificação ou regressão · não supervisionado encontra estrutura como agrupamentos em dados não rotulados · reforço possui um agente aprendendo uma política a partir de recompensas por tentativa e erro
- escolha o paradigma a partir do que os dados fornecem, não da dificuldade da tarefa
- retropropagação: uma passagem frontal, um erro da função de perda, uma passagem traseira dando o gradiente de cada peso, então uma atualização de tamanho definido pela taxa de aprendizado
- treinamento repete-se por muitas épocas; usar o modelo treinado é uma única passagem frontal