Support us

ИИ-модели не понимают, какие задания сложны для людей

Исследователи из США пришли к выводу, что даже самые продвинутые языковые модели плохо понимают, какие задания действительно сложны для людей.

Оставить комментарий
ИИ-модели не понимают, какие задания сложны для людей

Исследователи из США пришли к выводу, что даже самые продвинутые языковые модели плохо понимают, какие задания действительно сложны для людей.

Новое исследование показывает, что ИИ сталкивается с так называемым «проклятием знания»: модели умеют решать экзаменационные вопросы, но не способны адекватно оценить, где именно у человека возникают трудности.

В рамках исследования ученые протестировали более 20 больших языковых моделей, включая GPT-5, GPT-4o, различные версии Llama и Qwen, а также специализированные reasoning-модели вроде DeepSeek-R1. Моделям предлагалось оценить, насколько сложными экзаменационные вопросы покажутся людям.

Затем эти оценки сравнили с реальными данными — результатами полевых тестов со студентами в четырех областях: медицинский экзамен USMLE, экзамены Cambridge по английскому языку, а также разделы Reading/Writing и Math в SAT. Для сравнения использовалась корреляция Спирмена — статистический показатель, который отражает, насколько схожим образом люди и модели ранжируют вопросы от «легких» к «сложным». Значение 1 означает полное совпадение, 0 — отсутствие связи.

Результаты оказались слабыми. В среднем корреляция у моделей была ниже 0,50, что говорит о плохом совпадении с человеческим восприятием сложности. Более того, рост размеров и эффективности моделей не гарантировал улучшения. Так, GPT-5 показал корреляцию всего 0,34, тогда как более старая версия GPT-4.1 справилась заметно лучше — с результатом 0,44.

Авторы исследования отмечают, что проблема носит фундаментальный характер. Поскольку модели уже «знают ответы», они не сталкиваются с теми когнитивными барьерами, которые испытывают люди при обучении. В итоге ИИ не понимает, какие шаги рассуждения вызывают затруднения у студентов и почему одни задания оказываются сложнее других.

По мнению исследователей, этот разрыв имеет практические последствия. Он ограничивает применение ИИ в образовании — например, при создании учебных материалов, адаптивных тестов и систем персонализированного обучения. Пока языковые модели не научатся лучше понимать человеческое восприятие сложности, их роль в обучении будет оставаться вспомогательной, а не полноценно педагогической.

Бывший главный ИИ-учёный Meta рассказал почему поругался с Цукербергом и ушёл
Бывший главный ИИ-учёный Meta рассказал, почему поругался с Цукербергом и ушёл
По теме
Бывший главный ИИ-учёный Meta рассказал, почему поругался с Цукербергом и ушёл
Почему ИИ думает дольше там где думать почти не нужно — учёные нашли ответ
Почему ИИ думает дольше там, где думать почти не нужно — учёные нашли ответ
По теме
Почему ИИ думает дольше там, где думать почти не нужно — учёные нашли ответ
«Крёстный отец ИИ» обманывает чат-ботов ради честных ответов
«Крёстный отец ИИ» обманывает чат-ботов ради честных ответов
По теме
«Крёстный отец ИИ» обманывает чат-ботов ради честных ответов
Читайте также
Блогеров начали «отменять» за рекламу и использование ИИ
Блогеров начали «отменять» за рекламу и использование ИИ
Блогеров начали «отменять» за рекламу и использование ИИ
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
Anthropic изменит лимиты Claude Code: формально +25%, фактически -17%
ИИ всё чаще выходит из-под контроля: за месяц число инцидентов удвоилось
ИИ всё чаще выходит из-под контроля: за месяц число инцидентов удвоилось
ИИ всё чаще выходит из-под контроля: за месяц число инцидентов удвоилось
Бизнесы теперь хвастаются, что не используют ИИ
Бизнесы теперь хвастаются, что не используют ИИ
Бизнесы теперь хвастаются, что не используют ИИ

Хотите сообщить важную новость? Пишите в Telegram-бот

Главные события и полезные ссылки в нашем Telegram-канале

Обсуждение
Комментируйте без ограничений

Релоцировались? Теперь вы можете комментировать без верификации аккаунта.

Комментариев пока нет.