Некоторое время назад, по пути на одну конференцию, я разговорился с одним участником и услышал бурную тираду по поводу возможностей ИИ. Так, говорил мне эксперт, его можно использовать как инструмент для формулировки смысла. Общаемся мы на совещании, долго не можем понять о чем, потом загружаем его в программу - и он нам выводит решение, которое мы не могли принять и вообще он находит такие смыслы в наших разговорах.
– Шахматы! – говорил Остап. – Знаете ли вы, что такое шахматы? Они двигают вперед не только культуру, но и экономику!
По горячим следам я тогда написал «Искушение искусственным интеллектом». И вот, минуло два года, модели обросли мускулами. Вот оно, светлое будущее… Но… Тот пост так остается актуальным:
«… согласно техническому отчёту OpenAI, у моделей o3 и o4-mini (вышли в апреле 2025-го) значительно более высокие показатели галлюцинаций по сравнению с o1 (конец 2024-го).
Например, при обобщении общедоступных фактов о людях модель o3 ошибается в 33% случаев, а модель o4-mini — в 48%. Для сравнения, у o1 уровень галлюцинаций составлял 16%.
Проблема не только у моделей OpenAI. В последнем рейтинге галлюцинаций Vectra некоторые «рассуждающие» модели, включая DeepSeek-R1, показали кратный рост галлюцинаций по сравнению с предыдущими версиями.
Последние модели LLM проявили ещё одно новое качество, которого раньше не было: они намерено врут пользователям, даже зная правильный ответ. Такое поведение называют «стратегическим обманом», то есть продуманной тактикой введения в заблуждение.
Причины многих странных эффектов до сих пор не до конца понятны». Статья.
Вот и снова вижу очередное мечтание, что через пару лет ИИ начнет дружить с реальностью, то есть с тем, на что человеку разумному понадобилось пару миллионов лет эволюции. Впрочем, это можно добиться, если добавить органы чувств и то, чтобы засовывание пальцев в розетку отзывалось болью.
Помимо того, исследователи обнаружили, что ИИ-чатботы часто говорят пользователям то, что те хотят услышать, вместо того чтобы предоставлять точную информацию, и эта тенденция к «подхалимству» становится серьезной проблемой.
Галлюцинации LLM, дезинформация, фейки становятся частью нашей жизни.
Недавно состоялся диалог, в котором прозвучало, что для контроля над галлюцинациями достаточно поставить контроль из «6 пар глаз» и проблема будет решена. Но при этом забывается, что даже в рабочих сценариях экономия времени от ИИ (в среднем 1 час в неделю) нивелируется такими задачами, такими как проверка его выводов. Модель, которая стабильно выдаёт ложные факты и требует проверки — не самый лучший помощник.
Это известное ограничение нейросетей, известное ещё с прошлого века: они способны обобщать только в пределах обучающей выборки данных. Даже семимесячные дети способны экстраполировать и обобщать информацию на таком уровне, который недоступен нейросетям. Меня всерьез заботит ментальная зрелость специалистов, очарованных способностью ИИ «думать».
Люди склонны к антропоморфности. Так называемая цепочка рассуждений LLM - во многом предмет веры в то, что сгенерированные токены являются «рассуждением».
Правила цифрового выживания с ИИ в 2025:
-
факты только с перекрёстными ссылками (нет источника в Google/Wikipedia? Переспросите;
-
если ИИ настаивает на немедленных действиях (инвестиции, переводы) или решениях - это красный флаг, а лучше - не доверяйте никаких решений;
-
детектор лести:.«Вы абсолютно правы!», «Великолепный вопрос», «Выпрыгнуть из окна - прекрасная идея!» - требуйте контраргументы.
-
помним, что ИИ - это алгоритм, который генерирует тексты, а не истины.
-
продают «ИИ, который заменит мозг» - бегите. Это продавцы цифрового змеиного масла.
Какие правила используете вы?
Когда я вижу предложения от некоторых хрупкоделов использовать ИИ в стратегировании или решений для бизнеса, я мысленно улыбаюсь - ведь число конкурентов после таких стратегий у нас может снизится.
*С использованием материалов *статьи.