Задания олимпиады по искусственному интеллекту: какие бывают и как их решать
Задания отборочных туров олимпиад по искусственному интеллекту — это счётные задачи по машинному обучению и тесты на понимание: посчитать метрику по матрице ошибок, сделать шаг градиентного спуска, выбрать признак для разбиения. После отборочных идёт практический тур, где обучают модель на готовом датасете. Сами задания прошлых сезонов публикуют организаторы на своих платформах.
Чужих условий и разборов здесь нет: прошлогодний вариант в новом сезоне не встретится, а вот тип задания повторяется из года в год. Ниже разобраны четыре типа, из которых складывается счётная часть отбора: на каждом показано, что спрашивают, какую ошибку делают чаще всего и как считать верно. Числа в разборах придуманы для примера.
Четыре типа заданий отборочного тура
Метрика по матрице ошибок
Пример постановки: модель отбирает спам. Из 100 писем спамом являются 20; модель пометила 25 писем, и настоящего спама среди них 15. Спрашивают F1.
Частая ошибка — усреднить точность и полноту арифметически: (0,6 + 0,75) ÷ 2 = 0,675. F1 — гармоническое среднее, а не арифметическое, и подмена даёт ответ, который выглядит правдоподобно и не принимается.
Верный ход: сначала точность — доля настоящего спама среди помеченного, 15 ÷ 25 = 0,6; затем полнота — доля пойманного среди всего спама, 15 ÷ 20 = 0,75. F1 = 2 × 0,6 × 0,75 ÷ (0,6 + 0,75) = 0,9 ÷ 1,35 ≈ 0,67.
Задачи этого типа с проверкой: разобрать.
Шаг градиентного спуска
Пример постановки: функция потерь f(w) = (w − 3)², текущее значение w = 5, скорость обучения 0,1. Спрашивают значение w после одного шага.
Частая ошибка — шагнуть по градиенту, а не против него: 5 + 0,1 × 4 = 5,4. Параметр уходит от минимума, и на следующем шаге ошибка станет ещё больше — знак в этой задаче важнее самой производной.
Верный ход: производная равна 2 × (5 − 3) = 4, а спуск идёт против градиента, потому что функцию потерь минимизируют. Новый параметр: 5 − 0,1 × 4 = 4,6 — ближе к минимуму w = 3, как и должно быть.
Задачи этого типа с проверкой: разобрать.
Ближайшие соседи и голосование
Пример постановки: новую точку (2; 3) классифицируют методом трёх ближайших соседей. Обучающие точки: (1; 3) с меткой «кошка», (4; 3) и (2; 5) с меткой «собака». Спрашивают итоговую метку.
Частая ошибка — ответить меткой единственного ближайшего соседа: расстояние до «кошки» равно 1 и оно наименьшее. Но k здесь равно трём, а значит голосуют трое, и один ближайший голос решает не всё.
Верный ход: посчитать все три расстояния — 1 до «кошки», 2 и 2 до обеих «собак», — убедиться, что при k = 3 в голосовании участвуют все три точки, и взять большинство: два голоса против одного, ответ «собака».
Задачи этого типа с проверкой: разобрать.
Выбор признака для разбиения
Пример постановки: в выборке 8 объектов, по 4 каждого класса. Признак делит её на группу из 2 объектов одного класса и группу из 6, где классы лежат как 2 и 4. Спрашивают неоднородность после разбиения по Джини.
Частая ошибка — обрадоваться чистой малой группе: «слева идеально, признак отличный». Оценка разбиения складывается из обеих групп, и каждая входит с весом своей доли — чистые два объекта из восьми почти ничего не меняют.
Верный ход: у малой группы Джини равен нулю, у большой 1 − (2/6)² − (4/6)² = 16/36 ≈ 0,44. Взвешенно: 2/8 × 0 + 6/8 × 0,44 = 0,33 против 0,5 до разбиения. Признаки сравнивают именно этим числом, а не видом лучшей ветки.
Задачи этого типа с проверкой: разобрать.
8 задач тех же типов с проверкой
Условие даёт таблицу или выборку и просит число; ответ вводится в поле и проверяется сразу. Формулы, которые нужны для счёта, приведены в самих задачах — заранее их учить не требуется.
- Метрики прогноза тренировки бегуна — средний
- Матрица ошибок прогноза отмены заказа — базовый
- Шаг градиентного спуска для времени доставки — средний
- Шаг градиента для велопроката — средний
- Ближайшие посещения по двум метрикам — средний
- Прогноз выдач книг по ближайшим изданиям — средний
- Энтропия статусов заказов — базовый
- Индекс Джини меток тепличных измерений — базовый
Как заниматься по заданиям прошлых лет
Рабочий порядок обратен привычному. Сначала решают задачу своего типа самостоятельно и до конца, потом сверяют с разбором не ответ, а ход — на каком шаге счёт разошёлся. Прошлогодний вариант организатора открывают в конце, как проверку: если после чужого разбора задача того же типа с другими числами не решается, тип не освоен, сколько бы вариантов ни было прочитано.
Куда идти дальше
Какие олимпиады по ИИ существуют, что даёт диплом каждой и почему всероссийская олимпиада по ИИ — не ВсОШ, разобрано на странице кластера. Маршрут подготовки по неделям с разбором формата — подготовка к олимпиадам по ИИ и анализу данных.
Частые вопросы про задания
Какие задания на олимпиаде по искусственному интеллекту?
На отборочных турах — счётные задачи по машинному обучению и тесты на понимание: метрики качества, расстояния и соседи, деревья, градиент, статистика. Дальше идёт практический тур: выдаётся датасет, и нужно обучить модель, которую оценят по метрике. У части олимпиад после этого есть очный финал по правилам организатора.
Где взять задания олимпиады по ИИ прошлых лет?
У организаторов: отборочные туры идут на их онлайн-платформах, и варианты прошлых сезонов вместе с разборами публикуются там же и на сайтах олимпиад. Мы чужие условия не перепечатываем: пользы от копии нет, а ошибки при переносе появляются.
Есть ли ответы на олимпиаду по искусственному интеллекту?
Готовых ответов к чужим комплектам нет и не будет: прошлогодний вариант в новом сезоне не встретится, а тип задания встретится обязательно. У наших задач ответ проверяется автоматически, и после попытки открывается разбор — он показывает, где сломался счёт, а не выдаёт число.
Можно ли решать задания отборочного тура без программирования?
Счётную часть — да: формулы машинного обучения в этих заданиях считаются на бумаге, и именно так они разобраны выше. Код появляется на практическом туре, где модель обучают на настоящем датасете.
Из чего состоит практический тур и готовите ли вы к нему?
Практический тур — это готовый датасет, обучение модели и посылка предсказаний, которые оцениваются метрикой; нужны Python, pandas и numpy. Мы к нему не готовим: наша песочница запускает чистый Python без внешних библиотек, и мы говорим об этом прямо, а не мелким шрифтом.