Machine learning types and training · Tipos de aprendizaje automático y entrenamiento
| English | Español |
|---|---|
| machine learning/məˈʃiːn ˈlɜːnɪŋ/ | aprendizaje automático |
| backpropagation/ˌbækprəpəˈɡeɪʃn/ | propagación hacia atrás |
| supervised learning/ˈsuːpəvaɪzd ˈlɜːnɪŋ/ | aprendizaje supervisado |
| classification/ˌklæsɪfɪˈkeɪʃn/ | clasificación |
| unsupervised learning/ʌnˈsuːpəvaɪzd ˈlɜːnɪŋ/ | aprendizaje no supervisado |
| clusters/ˈklʌstəz/ | clústeres |
| reinforcement learning/ˌriːɪnˈfɔːsmənt ˈlɜːnɪŋ/ | aprendizaje por refuerzo |
| agent/ˈeɪdʒənt/ | agente |
| reward/rɪˈwɔːd/ | recompensa |
| policy/ˈpɒlɪsi/ | política |
| gradient descent/ˈɡreɪdɪənt dɪˈsent/ | descenso de gradiente |
| loss function/lɒs ˈfʌŋkʃn/ | función de pérdida |
| epoch/ˈiːpɒk/ | época |
The program that taught itself an opening no human had played
- AlphaGo Zero was given the rules of Go and nothing else. No human games, no opening book, no advice. It played against itself, starting from random moves.
- In three days it surpassed the version that had beaten the world champion. Along the way it rediscovered centuries of human opening theory, and then discarded parts of it as inferior.
- It learned from a single number after each game: won or lost. That is a completely different kind of learning from being shown a million labelled photographs.
- This lesson is the three paradigms of machine learning, what data each needs, and how a network's weights are actually changed by backpropagation 反向传播.
El programa que aprendió solo una apertura que ningún humano había jugado
- A AlphaGo Zero se le dieron las reglas del Go y nada más. Ningún juego humano, ningún libro de aperturas, ningún consejo. Jugó contra sí mismo, comenzando con movimientos aleatorios.
- En tres días superó a la versión que había vencido al campeón mundial. En el proceso redescubrió siglos de teoría humana de aperturas, y luego descartó partes de ella por ser inferiores.
- Aprendió de un único número después de cada juego: ganada o perdida. Ese es un tipo de aprendizaje completamente distinto al de ser mostrado un millón de fotografías etiquetadas.
- Esta lección presenta los tres paradigmas del aprendizaje automático, qué datos necesita cada uno y cómo cambian realmente los pesos de una red mediante la backpropagación 反向传播.
Supervised learning
- Supervised learning 监督学习 trains on data that carries labels: photographs tagged "cat" or "dog", emails marked spam or not, houses with their sale prices.
- The model learns the mapping from input to label, and is then given inputs it has never seen and asked to produce the label.
- It splits into classification 分类, where the output is a category, and regression, where the output is a number.
- Its cost is the labels: someone must produce them, which for a million images is a great deal of human work.
Labelled examples in, a model out, then unlabelled inputs
Aprendizaje supervisado
- El aprendizaje supervisado 监督学习 entrena con datos que llevan etiquetas: fotografías marcadas como "gato" o "perro", correos electrónicos identificados como spam o no, casas con sus precios de venta.
- El modelo aprende el mapeo desde la entrada hasta la etiqueta, y luego se le proporcionan entradas que nunca ha visto para que produzca la etiqueta correspondiente.
- Se divide en clasificación 分类, donde la salida es una categoría, y regresión, donde la salida es un número.
- Su costo son las etiquetas: alguien debe producirlas, lo cual implica una gran cantidad de trabajo humano si se trata de un millón de imágenes.

Entrada de ejemplos etiquetados, salida de un modelo, y luego entradas sin etiquetar
Supervised learning uses: · El aprendizaje supervisado utiliza:
Supervised learning trains on labelled examples (e.g. images tagged cat/dog). · El aprendizaje supervisado se entrena con ejemplos etiquetados (p. ej., imágenes marcadas como gato/perro).
Unsupervised learning
- Unsupervised learning 无监督学习 is given data with no labels and asked to find structure in it.
- The commonest use is clustering: grouping into clusters 聚类 of similar items, such as customers who buy similar things, without anyone deciding in advance what the groups should be.
- That is its strength and its weakness: it can discover a grouping nobody suspected, and it cannot tell you what the grouping means.
Aprendizaje no supervisado
- El aprendizaje no supervisado 无监督学习 recibe datos sin etiquetas y se le pide que encuentre estructura en ellos.
- El uso más común es el agrupamiento (clustering): formar grupos 聚类 de elementos similares, como clientes que compran cosas parecidas, sin que nadie decida de antemano cuáles deben ser esos grupos.
- Esa es su fortaleza y su debilidad: puede descubrir una agrupación de la que nadie sospechaba, pero no puede explicarte qué significa dicha agrupación.
Unsupervised learning is used to: · El aprendizaje no supervisado se utiliza para:
With no labels, unsupervised learning discovers patterns/clusters in the data. · Sin etiquetas, el aprendizaje no supervisado descubre patrones/grupos en los datos.
Reinforcement learning
- Reinforcement learning 强化学习 has an agent 智能体 acting in an environment. Each action changes the state and returns a reward 奖励, which may be zero for a long time.
- The agent learns a policy 策略, a strategy for choosing actions, that maximises its total reward over time. It learns by trial and error, with no labelled examples at all.
- It suits problems that are a sequence of decisions where the right move is only revealed by the eventual outcome: games, robot control, self-driving cars. That is exactly the AlphaGo Zero case.
Aprendizaje por refuerzo
- El aprendizaje por refuerzo 强化学习 tiene un agente 智能体 actuando en un entorno. Cada acción cambia el estado y devuelve una recompensa 奖励, que puede ser cero durante mucho tiempo.
- El agente aprende una política 策略, una estrategia para elegir acciones, que maximiza su recompensa total a lo largo del tiempo. Aprende mediante ensayo y error, sin ningún ejemplo etiquetado.
- Es adecuado para problemas que consisten en una secuencia de decisiones donde el movimiento correcto solo se revela mediante el resultado final: juegos, control robótico, coches autónomos. Ese es exactamente el caso de AlphaGo Zero.
In reinforcement learning, the agent learns by: · En el aprendizaje por refuerzo, el agente aprende mediante:
The agent tries actions, receives rewards, and learns a policy that maximises long-term reward. · El agente intenta acciones, recibe recompensas y aprende una política que maximiza la recompensa a largo plazo.
In reinforcement learning the agent learns a ____ that maximises its total reward over time. · En el aprendizaje por refuerzo, el agente aprende una ____ que maximiza su recompensa total con el tiempo.
It learns by trial and error from rewards, with no labelled examples at all, which is why it suits sequences of decisions. · Aprende mediante ensayo y error a partir de recompensas, sin ningún ejemplo etiquetado, lo cual es por qué se adapta bien a secuencias de decisiones.
Worked example: choose the paradigm
- Ten thousand medical scans, each labelled by a doctor as showing a tumour or not, are used to train a system to flag new scans. Supervised: the data has labels and the task is to learn input to label, specifically a classification.
- A shop wants to know whether its customers fall into natural groups, without deciding the groups in advance. Unsupervised: no labels exist, and the task is to find structure, specifically clustering.
- A robot arm must learn to place components, judged only by whether each attempt succeeded. Reinforcement: an agent, a sequence of actions, and a reward rather than a label.
- Name the paradigm, then justify from the data: labelled, unlabelled, or a reward signal.
Ejemplo resuelto: elegir el paradigma
- Diez mil escaneos médicos, cada uno etiquetado por un médico como que muestra un tumor o no, se utilizan para entrenar un sistema que marque nuevos escaneos. Supervisado: los datos tienen etiquetas y la tarea es aprender de entrada a etiqueta, específicamente una clasificación.
- Una tienda quiere saber si sus clientes caen en grupos naturales, sin decidir los grupos de antemano. No supervisado: no existen etiquetas y la tarea es encontrar estructura, específicamente agrupamiento.
- Un brazo robótico debe aprender a colocar componentes, juzgado solo por si cada intento tuvo éxito. Por refuerzo: un agente, una secuencia de acciones y una recompensa en lugar de una etiqueta.
- Nombra el paradigma y justifícalo basándote en los datos: etiquetados, no etiquetados o una señal de recompensa.
AI learning type lab · Laboratorio de tipos de aprendizaje de IA
Classify AI examples by the type of learning or concern involved. · Clasificar ejemplos de IA según el tipo de aprendizaje o la preocupación involucrada.
Match each ML paradigm to its data. · Asocia cada paradigma de ML con sus datos.
Supervised = labels; unsupervised = no labels; reinforcement = reward feedback. · Supervisado = etiquetas; no supervisado = sin etiquetas; por refuerzo = retroalimentación de recompensa.
Match each situation to the machine-learning paradigm it needs. · Asocia cada situación con el paradigma de aprendizaje automático que necesita.
Labels, no labels, or a reward. The data decides the paradigm, not the difficulty of the task. · Etiquetas, sin etiquetas o una recompensa. Los datos deciden el paradigma, no la dificultad de la tarea.
Training by backpropagation
- Training means adjusting the weights so the network's outputs match the targets. The method is backpropagation with gradient descent 梯度下降.
- Forward pass: feed an input through the network and get its output. Compute the error using a loss function 损失函数, which measures how far the output is from the target.
- Backward pass: propagate that error backwards through the layers to find each weight's gradient, that is, how much that weight contributed to the error.
- Update: change each weight by a small step against its gradient. The step size is the learning rate.
Downhill, one small step at a time
Entrenamiento mediante backpropagación
- Entrenar significa ajustar los pesos para que las salidas de la red coincidan con los objetivos. El método es la backpropagación con descenso de gradiente 梯度下降.
- Paso hacia adelante: introducir una entrada a través de la red y obtener su salida. Calcular el error usando una función de pérdida 损失函数, que mide cuánto se desvía la salida del objetivo.
- Paso hacia atrás: propagar ese error hacia atrás a través de las capas para encontrar el gradiente de cada peso, es decir, cuánto contribuyó ese peso al error.
- Actualización: cambiar cada peso dando un pequeño paso en dirección opuesta a su gradiente. El tamaño del paso es la tasa de aprendizaje.

Bajando cuesta abajo, un pequeño paso a la vez
Backpropagation trains a network by: · La retropropagación entrena una red mediante:
The error flows from the output back through the network (chain rule) so every weight's gradient is found, then weights step downhill. · El error fluye desde la salida hacia atrás a través de la red (regla de la cadena) para encontrar el gradiente de cada peso, y luego los pesos descienden cuesta abajo.
Put one round of backpropagation training in order. · Ordena una ronda de entrenamiento de retropropagación.
Forward, error, backward, update, repeated over many epochs until the error stops falling. · Hacia adelante, error, hacia atrás, actualización, repetido durante muchas épocas hasta que el error deje de disminuir.
Epochs, and why the learning rate matters
- One pass through the whole training set is an epoch 训练轮次. Training repeats for many epochs until the error stops falling.
- Too large a learning rate overshoots the minimum and the error jumps about; too small and training takes far longer than it needs to.
- After training, using the model is only a forward pass, which is why a trained network answers instantly even though training took days.
Épocas y por qué importa la tasa de aprendizaje
- Un paso completo a través de todo el conjunto de entrenamiento es una época 训练轮次. El entrenamiento se repite durante muchas épocas hasta que el error deja de descender.
- Una tasa de aprendizaje demasiado grande sobrepasa el mínimo y el error salta; demasiado pequeña y el entrenamiento tarda mucho más de lo necesario.
- Después del entrenamiento, usar el modelo consiste únicamente en un paso hacia adelante, por eso una red entrenada responde instantáneamente aunque el entrenamiento haya tardado días.
In gradient descent the learning rate sets how big a step each weight update takes — too large overshoots the minimum, too small makes training slow. · En el descenso de gradiente, la tasa de aprendizaje establece qué tan grande es el paso de cada actualización de peso — demasiado grande sobrepasa el mínimo, demasiado lento hace que el entrenamiento sea lento.
Backpropagation finds each weight's gradient; the learning rate scales how far down that gradient the weight moves. · La retropropagación encuentra el gradiente de cada peso; la tasa de aprendizaje escala cuánto se mueve el peso cuesta abajo por ese gradiente.
Which statements about training are correct? Select all · todos that apply. · ¿Cuáles son las afirmaciones correctas sobre el entrenamiento? Selecciona todas las que correspondan.
The learning rate is the size of each weight update. That is why training can take days while a prediction takes milliseconds. · La tasa de aprendizaje es el tamaño de cada actualización de peso. Por eso el entrenamiento puede tardar días mientras que una predicción toma milisegundos.
Marks that slip away
- Justify a paradigm from the data: labelled means supervised, unlabelled means unsupervised, a reward signal means reinforcement.
- Reinforcement learning has no labels. Calling its reward a label is the classic confusion.
- Backpropagation is forward, error, backward, update, repeated. Naming only "it adjusts the weights" is half an answer.
- The learning rate is the size of each step, not the speed of training or the number of epochs.
Puntos clave que se pierden fácilmente
- Justifica un paradigma basándote en los datos: datos etiquetados significan supervisado, datos no etiquetados significan no supervisado, una señal de recompensa significa aprendizaje por refuerzo.
- El aprendizaje por refuerzo no tiene etiquetas. Llamar "etiqueta" a su recompensa es la confusión clásica.
- La backpropagación es hacia adelante, error, hacia atrás, actualización, repetido. Nombrar solo "ajusta los pesos" es solo la mitad de la respuesta.
- La tasa de aprendizaje es el tamaño de cada paso, no la velocidad del entrenamiento ni el número de épocas.
You've got it
- supervised learns input to label from labelled data, for classification or regression · unsupervised finds structure such as clusters in unlabelled data · reinforcement has an agent learning a policy from rewards by trial and error
- choose the paradigm from what the data provides, not from the task's difficulty
- backpropagation: a forward pass, an error from the loss function, a backward pass giving each weight's gradient, then an update of size set by the learning rate
- training repeats for many epochs; using the trained model is one forward pass
Lo has entendido
- El supervisado aprende de entrada a etiqueta a partir de datos etiquetados, para clasificación o regresión · el no supervisado encuentra estructura como grupos en datos no etiquetados · el por refuerzo tiene un agente que aprende una política a partir de recompensas mediante ensayo y error
- Elige el paradigma según lo que ofrecen los datos, no según la dificultad de la tarea
- Backpropagación: un paso hacia adelante, un error de la función de pérdida, un paso hacia atrás que da el gradiente de cada peso, seguido de una actualización cuyo tamaño está definido por la tasa de aprendizaje
- El entrenamiento se repite durante muchas épocas; usar el modelo entrenado requiere un solo paso hacia adelante