Machine Learning

machine learning — программа, которая учится на данных, а не по правилам

Раздел
Основы AI
Сокращ.
ML
Обновлено
11.08.26

Machine Learning (машинное обучение, ML) — раздел AI, в котором программа не получает готовые правила, а выводит их сама из данных. Алгоритму показывают тысячи или миллионы примеров с правильными ответами, и он настраивает параметры так, чтобы предсказывать ответ на новых примерах. ML — основа спам-фильтров, рекомендательных систем, распознавания речи, переводчиков, ChatGPT и Stable Diffusion.

Коротко

Коротко. Machine Learning — это способ научить программу решать задачу не через инструкции программиста, а через примеры. Алгоритму показывают пары «вход → правильный ответ», он подстраивает внутренние параметры, и на новых, не виданных ранее данных продолжает отвечать правильно. Чем больше и чище данные, тем выше шансы, что модель окажется полезной за пределами учебного датасета.

Что это такое

Распознавание спама в почте — классическая история про ML. В 1990-е фильтры писали правилами: если в письме есть «выиграл», «миллион» и ссылка на странный домен — отправить в спам. Список рос, спамеры адаптировались, и поддержка превращалась в бесконечную гонку.

Тогда инженеры попробовали иной подход. Вместо правил — данные. Дали алгоритму миллион писем, помеченных людьми как «спам / не спам». Алгоритм сам нашёл, какие сочетания слов, отправителей и характеристик чаще встречаются у спама. Через сутки фильтр работал лучше, чем рукописные правила, набранные за десять лет.

Это и есть машинное обучение. Алгоритм не получает решение задачи. Он получает доступ к большому количеству примеров и сам выводит закономерности.

Термин ввёл Артур Сэмюэл в 1959 году. Долгое время ML был академической нишей: данных мало, компьютеры слабые. Современный взлёт начался в 2010-х: интернет дал терабайты размеченных данных, видеокарты дали мощность, нейросети дали архитектуру, способную ими воспользоваться.

Как это работает

Базовая схема ML — три блока: данные, обучение, применение.

  1. Данные. Собирается датасет — таблица примеров. У каждого примера есть набор признаков (features) и правильный ответ (label). Для писем: текст + флаг «спам». Для фотографий: пиксели + название объекта. Для домов: площадь, район, год постройки + цена.
  2. Обучение (training). Алгоритм проходит по датасету много раз. У него есть параметры, которые можно крутить (от десятков в простых моделях до сотен миллиардов в LLM). На каждом проходе он подстраивает параметры так, чтобы предсказание на знакомых данных всё точнее совпадало с правильным ответом.
  3. Применение (inference). Когда обучение закончено, параметры замораживаются. Модель получает новый, не виданный ранее пример и считает ответ. Хорошая модель угадает правильно, даже если конкретно этот пример ей не показывали.

Три большие семьи ML:

  • Supervised learning (обучение с учителем). Данные размечены: каждый пример имеет правильный ответ. Большинство практических задач сюда: классификация, регрессия, переводы, генерация по подписям.
  • Unsupervised learning (без учителя). Размеченных ответов нет. Алгоритм ищет структуру сам: кластеры похожих объектов, аномалии, скрытые тематические группы.
  • Reinforcement learning (обучение с подкреплением). Алгоритм действует в среде, получает награду или штраф. Так учатся играть в шахматы, ходить роботам, оптимизировать поведение чат-ботов после первичного обучения.

Пример на практике

Видеомонтажёр получает заказ: разметить кадры из часового видео по сценам — «интерьер», «улица», «лицо крупно», «общий план». Вручную — день работы.

Для черновой разметки каждый кадр проходит через vision-language encoder и получает embedding. Текстовые описания категорий кодируются той же моделью, после чего сравниваются по косинусной близости. Время зависит от числа кадров, модели, batch и устройства.

Модель не обучалась специально на этих четырёх классах, поэтому zero-shot результат служит baseline. Точность измеряют на вручную проверенной выборке, а не предполагают по общим свойствам CLIP; спорные кадры можно отправить на разметку человеку.

Тот же принцип работает в любом ML-сервисе. Spotify рекомендует музыку: модель училась на парах [история прослушиваний → следующий трек]. Google Translate переводит: модель училась на парах [фраза на одном языке → её перевод]. ChatGPT отвечает: модель училась предсказывать следующий токен на триллионах токенов текста.

С чем часто путают

  • Machine Learning и AI — ML является частью AI. Искусственный интеллект шире: к нему относятся также экспертные системы, символьные подходы и эвристики. В разговорной речи слово AI часто используют для продуктов на основе машинного обучения, но термины не равны.
  • Machine Learning и Deep Learning — Deep Learning это разновидность ML, использующая глубокие нейросети с множеством слоёв. Классический ML работает и на простых алгоритмах: линейная регрессия, деревья решений, k-means.
  • Machine Learning и статистика — границы размытые. Статистика обычно объясняет данные через интерпретируемые модели и проверку гипотез. ML чаще оптимизирует точность предсказания, не требуя интерпретируемости. Многие методы пересекаются (линейная регрессия — и там, и там).
  • Machine Learning и обычное программирование — программист пишет шаги. В ML программист пишет архитектуру модели и алгоритм обучения, а «логика» (значения параметров) рождается автоматически. Поэтому ML-код короткий, но требует много данных и вычислений.

Частые ошибки и заблуждения

  • ML всегда лучше правил. Не всегда. Для жёстко определённых задач с понятными условиями (вычисление налогов, валидация формы) обычный код проще, надёжнее и не зависит от датасета. ML нужен там, где правила слишком сложны или меняются.
  • Больше данных — всегда лучше результат. Качество важнее количества. Грязные, смещённые или шумные данные могут ухудшить модель. Лучше 10 тысяч чистых размеченных примеров, чем миллион случайных скриншотов.
  • Модель работает на новых данных так же, как на тестовых. Только если новые данные похожи на обучающие. Камера с другим освещением, текст из другой эпохи, аудио с акцентом — всё это сдвигает распределение. Это называется data drift и постоянно ломает «работающие» модели в проде.
  • ML понимает причинно-следственные связи. Нет. ML находит корреляции. Если в датасете жилья дорогие квартиры чаще имели бассейн, модель решит, что бассейн поднимает цену. На деле причина — район, и бассейн просто коррелирует с дорогими районами.
  • Если модель ошиблась — её можно «отладить». В классическом коде ошибка локализуется на конкретной строке. В ML ошибка — это сдвиг в распределении весов, который сложно проследить. Решения обычно идут через данные: исправить разметку, добавить недостающие примеры, балансировать классы.

Связанные термины

  • Deep Learning — обучение глубоких нейросетей, ветка ML с множеством скрытых слоёв.
  • Neural Network — основная архитектура современного ML.
  • Dataset — размеченный набор примеров, на котором учится модель.
  • Training — процесс подбора параметров на обучающих данных.
  • Inference — применение обученной модели к новым данным.
  • Overfitting — модель запоминает датасет вместо обобщения.
  • Fine-tuning — дообучение уже готовой модели на узкой задаче.
  • Supervised / Unsupervised / Reinforcement Learning — три семьи методов ML по типу обратной связи.

Частые вопросы

Можно ли обучить ML-модель без программирования? Для несложных задач — да, через no-code платформы (Google AutoML, Teachable Machine, Microsoft Azure ML Studio). Они автоматизируют выбор архитектуры и гиперпараметров. Для сложных продуктовых задач код всё равно потребуется.

Сколько данных нужно для ML? Зависит от задачи и модели. Простой классификатор по табличным данным — от тысячи примеров. Обучение нейросети с нуля — миллионы. Fine-tuning готовой модели — иногда 100–500 примеров достаточно.

Чем отличается обучение от использования модели? Обучение — однократный процесс подбора параметров на больших данных, требует GPU и часов или дней времени. Использование (inference) — это запуск готовой модели на новых данных, обычно занимает миллисекунды или секунды.

Можно ли запускать ML локально? Да, для большинства моделей. Stable Diffusion, локальные LLM (Llama, Mistral), CLIP, Whisper — всё работает на персональном компьютере с видеокартой. В облако имеет смысл идти за самыми крупными моделями или за масштабом запросов.

Почему модели иногда «забывают» уже выученное? Если дообучать модель только на новых данных, она может потерять часть старых знаний — это называется catastrophic forgetting. Решения: смешивать новые данные со старыми, использовать LoRA или другие методы PEFT (parameter-efficient fine-tuning).

Главное

В машинном обучении поведение программы формируется на примерах, а не только на явно записанных правилах. Такой подход подходит для распознавания, рекомендаций и других задач со сложными закономерностями. Его граница тоже связана с данными: модель надёжнее работает там, где новые случаи похожи на то, что было представлено при обучении и проверке.