LLM-тесты показывают неожиданные результаты что мешает ИИ-революции

LLM-тесты показывают неожиданные результаты что мешает ИИ-революции

Большие языковые модели (LLM) вот уже несколько лет позиционируются как технологический прорыв, способный автоматизировать половину рабочего процесса. Программисты используют их для генерации кода, маркетологи — для создания текстов, HR-службы — для отбора резюме. Каждый новый релиз обещает улучшенные результаты, а тесты на бенчмарках становятся всё внушительнее. Но недавние независимые исследования заставляют усомниться в этой картине прогресса.

Эксперты из Стэнфордского университета и университета Калифорнии в Беркли опубликовали отчёт, в котором проанализировали более 500 тысяч запросов к последним версиям нескольких ведущих LLM. Выводы неутешительны: с каждой новой моделью качество ответов не только не растёт, а в ряде случаев даже снижается. Например, в задачах на логическое мышление и решение математических уравнений модели последнего поколения демонстрируют худшие результаты, чем их предшественники. При этом показатели на стандартных тестах, где примитивные ответы оцениваются как правильные, остаются высокими — создаётся иллюзия прогресса.

Проблема кроется в том, как именно обучаются современные LLM. Традиционный подход предполагает использование огромных массивов текстовых данных, среди которых преобладают низкокачественные источники: форумы, социальные сети, неотредактированные книги. Модели учатся предсказывать следующий символ в строке, но не проверяют фактическую корректность. В результате они генерируют правдоподобные, но неверные ответы — так называемый эффект «иллюзии знания». Производители моделей пытаются бороться с этим, добавляя фильтры и системы проверки фактов, но это лишь маскирует симптомы, не решая корень проблемы.

Ещё одна сложность связана с так называемым «зашумлением данных». Чем больше объём обучающего набора, тем сложнее отфильтровать некачественный контент. Например, в интернете полно статей с ошибками, но модель не может их отличить от проверенных источников. В итоге она усваивает как правду, так и заблуждения, что приводит к парадоксальной ситуации: с каждым новым релизом количество ошибок в ответах растёт, хотя формальные метрики производительности остаются стабильными или даже улучшаются.

Производители ИИ-решений не спешат признавать проблему. Официальные пресс-релизы по-прежнему делают акцент на росте производительности, сравнивая лишь собственные модели с предыдущими версиями, а не с реальными задачами пользователей. Между тем, компании, активно внедрившие LLM в рабочие процессы, сталкиваются с растущим числом ошибок. Один из разработчиков из команды, создающей ИИ-помощников для программирования, признался, что около 30 % сгенерированного кода требует ручной правки — цифра, которая оставалась стабильной даже после обновлений моделей.

Эксперты сходятся во мнении, что текущая парадигма развития LLM исчерпала себя. Поиски новых подходов уже ведутся: разрабатываются модели с меньшим количеством параметров, но более точной архитектурой, внедряются системы рейтингования ответов на основе проверенных источников, а также методы активного обучения, где модель получает обратную связь от экспертов. Однако до массового внедрения этих решений пройдёт не один год. Пока же пользователям остаётся надеяться на удачу при работе с ИИ — или вручную перепроверять каждый ответ, что сводит на нет обещанную эффективность.