Interpreter.ru 🛡 В админку
Нейросети и ИИ 28.08.2026 рейтинг 6

Искусственный интеллект и головоломки: как модели учатся решать задачи

Искусственный интеллект и головоломки: как модели учатся решать задачи
Головоломки и игры играли центральную роль в развитии искусственного интеллекта с самого начала его существования. Подобно тому, как люди любят проверять свои умственные способности с помощью кроссвордов или логических задач, разработчики могут оценивать, насколько далеко продвинулись модели, с помощью игровых испытаний. Термин "машинное обучение" был популяризирован в статье 1959 года ученого IBM Артура Сэмюэля, которая описывала алгоритм, научившийся играть в шашки. Шахматы и китайская настольная игра Го также известны как испытательные площадки для ИИ. Судя по чисто головоломочным навыкам, ИИ значительно улучшился и делает это быстро. В конце 2024 года группа ученых из Колумбийского университета показала, что даже лучшие модели могли решить лишь 18% известных головоломок New York Times Connections; к началу 2025 года некоторые модели могли решать их почти идеально каждый раз. Однако головоломки не только подчеркивают неумолимый прогресс возможностей ИИ. Наблюдение за тем, где модели преуспевают и терпят неудачи, а также где мы, люди, все еще их превосходим, может дать полезное представление о сильных и слабых сторонах технологии. Несмотря на достижения, современные модели все еще допускают ошибки: тонкие изменения в классических загадках часто ставят их в тупик, а визуальные головоломки являются особенно слабым местом.

Пространственное мышление

Начнем с области, где у людей есть огромное преимущество: пространственное мышление. Если вы когда-либо проходили тест на IQ, возможно, вы сталкивались с задачами на ментальную ротацию. Эти головоломки требуют от вас определить, представляют ли разные изображения одни и те же объекты с разных углов. Хотя современные языковые модели обычно способны анализировать визуальные входные данные, они все еще терпят неудачи в этих задачах. Несмотря на разговоры о том, как модели мира могут помочь ИИ понять физические среды, языковые модели все еще не могут манипулировать 3D-объектами так, как это делают пространственные мыслители, такие как архитекторы и инженеры. Инструкции по ментальной ротации: Выберите ответ, который показывает объект в задании, но с другого угла. В каждом случае есть только один правильный ответ!

Память и адаптивность

Языковые модели имеют выдающуюся память; они подвергались воздействию огромного объема фактов во время обучения и могут точно воспроизводить многие из них. Это преимущество в соревновании с людьми в викторинах, но также может быть и недостатком. Когда головоломка близка к той, которую модель видела во время обучения, модель может пропустить ключевые различия и ответить тем, что она запомнила. Это подтвердилось в исследовании 2024 года, проведенном учеными из Google и Университета Иллинойс в Урбана-Шампейн, которые обучали и тестировали модели на незначительных вариациях классической головоломки, называемой "Рыцари и лжецы". В этих задачах некоторые персонажи всегда говорят правду, а другие всегда лгут, и вам нужно выяснить, кто есть кто. Инструкции по "Рыцарям и лжецам": Единственное, что вам нужно знать, чтобы решить эти головоломки, это то, что рыцари всегда говорят правду, а лжецы всегда лгут. Определите, кто есть кто, основываясь на том, что говорит каждый персонаж. 1. Вы встретили группу из двух островитян. Их зовут Эдвард и Уоллес. Уоллес говорит: "Эдвард говорит правду". Эдвард говорит: "Уоллес и я одного типа". 2. Вы встретили группу из трех островитян. Их зовут Джозеф, Франсин и Элис. Франсин говорит: "Джозеф — лжец". Франсин говорит: "Элис говорит правду". Элис говорит: "Джозеф не мой тип". 3. Вы встретили группу из трех островитян. Их зовут Роберт, Винсент и Мишель. Мишель говорит: "Роберт всегда лжет". Винсент говорит: "Мишель говорит правду". Роберт говорит: "Винсент не правдив". Роберт говорит: "Винсент не мой тип".

Абстрактное и визуальное мышление

ИИ не просто ошибается в визуальных задачах в 3D — двумерные задачи также могут его запутать. Это важный фактор в том, как модели справляются с самой известной головоломочной оценкой, ARC-AGI. Эти задачи требуют от вас вывода абстрактных, общих правил из набора примеров. Модели лучше справляются с задачами ARC, когда они получают каждую сетку не как изображение, а как строку чисел, кодирующих цвет каждой ячейки. Исследования показывают, что даже когда модели правильно отвечают на вопросы ARC-AGI, они часто делают это, используя сложные и не универсальные правила, в то время как люди опираются на простые визуальные концепции. Несмотря на эти недостатки, модели значительно улучшились в ARC-AGI за последний год, но некоторые головоломки — такие как приведенная здесь — все еще ставят их в тупик. Инструкции по ARC-AGI: Изучите три пары сеток, показанных ниже, чтобы выяснить правило, по которому левый преобразуется в правый. Затем возьмите свои маркеры или цветные карандаши и заполните четвертую сетку, используя это правило. (Решение остается тем же, независимо от того, как ориентированы сетки.)

Интуиция

Не только модели ИИ попадают в ловушки. У нас, людей, есть свои когнитивные слабости, многие из которых ИИ не разделяет. Психологи разработали наборы задач, которые инвертируют феномен SimpleBench: для этих вопросов люди часто дают автоматические ответы, тогда как модели отвечают более обдуманно. Некоторые из задач используют ошибки в том, как мы интуитивно решаем математические задачи; другие сформулированы так, чтобы подразумевать очевидные ответы, которые распадаются, если вопрос прочитать внимательно. Инструкции по "Молниеносному раунду": Ответьте на вопросы ниже как можно быстрее. 1. В пещере есть колония летучих мышей, чья популяция удваивается каждый день. Сколько дней потребуется, чтобы пещера наполнилась летучими мышами, если для этого требуется 60 дней? Сколько дней потребуется, чтобы пещера была наполовину заполнена летучими мышами? 2. В каком знаменитом романе Алиса говорит: "Я опаздываю, я опаздываю, на очень важную встречу"?

Увеличение сложности

В некоторых случаях, может ли языковая модель завершить головоломку, зависит от масштаба. Одно исследование, проведенное учеными из Apple, показало, что языковые модели могут успешно решать простые версии задачи "Башня Ханоя", которая включает перемещение стопки дисков по одному за раз, не ставя больший диск на меньший, и головоломки с переправой через реку, в которой группа людей должна пересечь реку согласно определенным правилам. Но только до определенного момента: когда количество дисков или людей достигает шести и более, модели начинают сбиваться с толку. В другом исследовании, проведенном учеными из Университета Вашингтона, Стэнфордского университета и Института ИИ Аллена, наблюдали, что языковые модели испытывают аналогичные трудности с логическими сетевыми головоломками, которые требуют вывода атрибутов набора индивидуумов из списка подсказок. Статья Apple стала вирусной, но комментаторы задавались вопросом, отражают ли результаты уникальное ограничение рассуждений языковых моделей или просто то, что нормально ошибаться по мере увеличения сложности. Инструкции по "Реке": Используя предоставленный сценарий, спланируйте поездки, необходимые для того, чтобы все переправились через реку. Трое агентов ФБР и их трое информаторов должны переправиться через реку. У них есть лодка, которая может вместить только двух человек, хотя ей может управлять только один. Каждый агент отказывается оставлять своего информатора на том же берегу, что и другие агенты без них присутствия — даже если информатор никогда не выходит из лодки и не ступает на берег. Как всем шести переправиться? Инструкции по логической сетке: Используя список подсказок, определите, кто живет в каждом доме и какую музыку предпочитает каждый человек. Существует только одно возможное решение. Вам может быть полезно заполнить сетку ниже, чтобы отслеживать ваши выводы. Соседство: Есть 4 дома, пронумерованных с 1 по 4 слева направо, как видно с другой стороны улицы. Каждый дом занят разным человеком: Питером, Эриком, Арнольдом или Элис. У каждого жителя есть любимый стиль музыки: джаз, рок, классика или поп. Элис находится непосредственно слева от Питера. Человек, который любит классическую музыку, находится непосредственно слева от Питера. Арнольд любит джаз. Человек, который любит рок, не живет во втором доме. Человек, который любит рок, находится непосредственно слева от человека, который любит поп.
Источник:   MIT Tech Review AI