Типы машинного обучения и обучение
| English | Русский |
|---|---|
| machine learning/məˈʃiːn ˈlɜːnɪŋ/ | машинное обучение |
| backpropagation/ˌbækprəpəˈɡeɪʃn/ | обратное распространение ошибки |
| supervised learning/ˈsuːpəvaɪzd ˈlɜːnɪŋ/ | обучение с учителем |
| classification/ˌklæsɪfɪˈkeɪʃn/ | классификация |
| unsupervised learning/ʌnˈsuːpəvaɪzd ˈlɜːnɪŋ/ | обучение без учителя |
| clusters/ˈklʌstəz/ | кластеры |
| reinforcement learning/ˌriːɪnˈfɔːsmənt ˈlɜːnɪŋ/ | обучение с подкреплением |
| agent/ˈeɪdʒənt/ | агент |
| reward/rɪˈwɔːd/ | вознаграждение |
| policy/ˈpɒlɪsi/ | политику |
| gradient descent/ˈɡreɪdɪənt dɪˈsent/ | спуск по градиенту |
| loss function/lɒs ˈfʌŋkʃn/ | функция потерь |
| epoch/ˈiːpɒk/ | эпоха |
Программа, которая научилась открытию, которое ни один человек никогда не играл
- AlphaGo Zero получил только правила го и ничего больше. Никаких человеческих партий, никаких книг开局, никаких советов. Она играла сама против себя, начиная со случайных ходов.
- За три дня она превзошла версию, которая побеждала чемпиона мира. В ходе этого процесса она заново открыла столетия человеческой теории开局 и затем отбросила их части как менее эффективные.
- Она обучалась по одному числу после каждой партии: победа или поражение. Это совершенно другой тип обучения, чем показ миллионов размеченных фотографий.
- Этот урок посвящен трем парадигмам машинного обучения, данным,所需的 каждой из них, и тому, как веса сети на самом деле изменяются с помощью обратного распространения ошибки.
Обучение с учителем
- Обучение с учителем тренируется на данных, содержащих метки: фотографии с тегами «кошка» или «собака», письма, помеченные как спам или нет, дома с ценами продажи.
- Модель изучает отображение от входа к метке, а затем получает входы, которых она никогда раньше не видела, и просит её предсказать метку.
- Оно делится на классификацию, где выход — это категория, и регрессию, где выход — число.
- Его стоимость — это метки: кто-то должен их создавать, что для миллиона изображений требует огромного количества ручного труда.

Размеченные примеры на входе, модель на выходе, затем неразмеченные входы
Обучение с учителем использует:
Обучение с учителем тренируется на размеченных примерах (например, изображениях с метками кошка/собака).
Обучение без учителя
- Обучение без учителя получает данные без меток и просит найти в них структуру.
- Наиболее распространенное применение — кластеризация: группировка в кластеры похожих объектов, таких как клиенты, покупающие одинаковые товары, без предварительного решения о том, какими должны быть группы.
- Это ее сила и слабость: она может открыть группировку, о которой никто не подозревал, но не сможет объяснить вам, что эта группировка означает.
Обучение без учителя используется для:
Без меток обучение без учителя открывает паттерны/кластеры в данных.
Обучение с подкреплением
- Обучение с подкреплением имеет агента, действующего в среде. Каждое действие меняет состояние и возвращает вознаграждение, которое может отсутствовать долгое время.
- Агент изучает политику, стратегию выбора действий, которая максимизирует его общее вознаграждение со временем. Он учится методом проб и ошибок, вообще без размеченных примеров.
- Оно подходит для задач, являющихся последовательностью решений, где правильный ход раскрывается только конечным результатом: игры, управление роботами, беспилотные автомобили. Это именно случай AlphaGo Zero.
В обучении с подкреплением агент учится путем:
Агент пробует действия, получает награды и учит политику, максимизирующую долгосрочную награду.
В обучении с подкреплением агент учит ____ , которое максимизирует его общую награду со временем.
Он учится методом проб и ошибок на основе вознаграждений, вообще без размеченных примеров, именно поэтому он подходит для последовательностей решений.
Разобранный пример: выберите парадигму
- Десять тысяч медицинских снимков, каждый из которых размечен врачом как наличие или отсутствие опухоли, используются для обучения системы标记 новых снимков. С учителем: данные имеют метки, задача — изучить отображение входа к метке, конкретно классификация.
- Магазин хочет знать, падают ли его клиенты в естественные группы, не решая группы заранее. Без учителя: меток не существует, задача — найти структуру, конкретно кластеризацию.
- Робот-рука должна научиться помещать компоненты, оцениваемые только по успеху каждой попытки. С подкреплением: агент, последовательность действий и вознаграждение вместо метки.
- Назовите парадигму, затем обоснуйте на основе данных: размеченные, неразмеченные или сигнал вознаграждения.
Лаборатория типа обучения ИИ
Классифицируйте примеры ИИ по типу обучения или涉及的 concerns involved.
Соотнесите каждый парадигму ML с её данными.
Обучение с учителем = метки; без учителя = нет меток; с подкреплением = обратная связь по вознаграждению.
Соотнесите каждую ситуацию с парадигмой машинного обучения, которая ей необходима.
Метки, отсутствие меток или вознаграждение. Данные определяют парадигму, а не сложность задачи.
Обучение обратным распространением ошибки
- Обучение означает корректировку весов, чтобы выходы сети совпадали с целевыми значениями. Метод — обратное распространение ошибки с спуском по градиенту.
- Прямой проход: подайте вход через сеть и получите выход. Вычислите ошибку с помощью функции потерь, которая измеряет, насколько выход отличается от цели.
- Обратный проход: распространите эту ошибку назад через слои, чтобы найти градиент каждого веса, то есть, сколько этот вес внес вклад в ошибку.
- Обновление: измените каждый вес на маленький шаг против его градиента. Размер шага — это скорость обучения (learning rate).

Вниз по склону, маленьким шагом за шагом
Обратное распространение ошибки обучает сеть путем:
Ошибка течет от выхода обратно через сеть (правило цепной производной), чтобы найти градиент каждого веса, затем веса двигаются вниз по склону.
Расставьте этапы одного цикла обучения обратным распространением в правильном порядке.
Прямой проход, ошибка, обратный проход, обновление — повторяется много раз за эпохи, пока ошибка не перестанет снижаться.
Эпохи и почему важно значение скорости обучения
- Один полный проход по всему обучающему набору данных — это эпоха. Обучение повторяется на протяжении многих эпох, пока ошибка не перестать снижаться.
- Слишком большая скорость обучения приводит к пролетанию через минимум, и ошибка начинает скакать; слишком маленькая делает обучение неоправданно долгим.
- После обучения использование модели — это только прямой проход, поэтому обученная сеть отвечает мгновенно, хотя само обучение заняло дни.
В градиентном спуске скорость обучения определяет размер шага при каждом обновлении веса — слишком большой шаг приведет к превышению минимума, слишком маленький замедлит обучение.
Обратное распространение находит градиент каждого веса; скорость обучения масштабирует, насколько далеко вниз по этому градиенту движется вес.
Какие утверждения об обучении верны? Выберите все подходящие варианты.
Скорость обучения — это величина каждого обновления веса. Именно поэтому обучение может занимать дни, а предсказание выполняется за миллисекунды.
Потерянные баллы
- Обоснуйте парадигму на основе данных: наличие меток означает обучаемость с учителем, отсутствие меток — без учителя, наличие сигнала вознаграждения — обучение с подкреплением.
- В обучении с подкреплением нет меток. Называть вознаграждение меткой — это классическая путаница.
- Обратное распространение ошибки — это прямой проход, вычисление ошибки, обратный проход, обновление весов, повторяемое многократно. Утверждение «только оно корректирует веса» — это лишь половина ответа.
- Скорость обучения — это размер каждого шага, а не скорость самого процесса обучения или количество эпох.
Вы поняли
- Обучение с учителем изучает соответствие входных данных и меток на помеченных данных для задач классификации или регрессии · Обучение без учителя находит структуру, например кластеры, в непомеченных данных · Обучение с подкреплением involves агент, изучающий стратегию из вознаграждений методом проб и ошибок.
- Выбирайте парадигму исходя из того, что предоставляют данные, а не от сложности задачи.
- Обратное распространение ошибки: прямой проход, ошибка из функции потерь, обратный проход, дающий градиент для каждого веса, затем обновление размера которого задается скоростью обучения.
- Обучение повторяется на протяжении многих эпох; использование обученной модели — это один прямой проход.