Пн – Вс: 8–21 по НСК

📞+7 383 380-81-89
Telegram Макс
Записаться на демо
ГлавнаяБлогИИ для бизнесаГаллюцинации нейросети: почему ИИ выдумывает и как не пустить выдумку к клиенту

Галлюцинации нейросети: почему ИИ выдумывает и как не пустить выдумку к клиенту

Галлюцинации нейросети: почему ИИ выдумывает и как не пустить выдумку к клиенту

Коротко

  • Галлюцинация — уверенное утверждение, которого нет ни в документах, что дали программе, ни в жизни. Причин шесть: модель подбирает слова, а не сверяется с фактами; в данных пробел; знания устарели; угадывать выгоднее, чем признаться в незнании; вопрос наводит на ответ; разговор идёт по шагам.
  • Частота зависит от задачи. При пересказе документов доля выдумок идёт от 1,8% у лучших моделей до 24,2% у худших (по данным рейтинга Vectara, 11 мая 2026 года). Новее не значит надёжнее.
  • Отвечает за выдумку тот, кто поставил программу к клиентам: так решил суд в деле Air Canada (CBC News, 15 февраля 2024 года). Юристов в США и компанию в России наказали за то, что они не проверили выдумку и не признали её.
  • Защита складывается из трёх способов: ответы по вашим документам, проверка ответа перед отправкой, передача человеку. Дополнения: точка остановки проекта и модель Jev, которая пока в раннем доступе, а все её цифры даёт сама компания.
  • Мы называем долю ошибок вслух: у нашего помощника для аптечной сети точность 94% по данным заказчика. Условия пилота и точка остановки описаны в лиде и ниже.

Что считается галлюцинацией, а что нет

Галлюцинацией называют не любую ошибку, а конкретную: программа подаёт как факт то, чего нет ни в переданных ей документах, ни в жизни. Бывает три вида. Выдумка с нуля: несуществующая книга, судебное дело, функция в программе. Искажение источника: документ на месте, но при пересказе программа добавила лишнее или поменяла смысл. Устаревшее: было верно, когда модель обучали, а сейчас нет.

Чем галлюцинация не является. Слоган, стихотворение или рассказ, которые вы просили придумать: вымысел здесь и есть задача. Ошибка в вашем же прайсе, на которую программа честно сослалась: виноват документ, и исправлять надо его. Ответ «не знаю» или отказ отвечать: это как раз правильное поведение.

Слово «врёт» тоже не совсем точное. Врать — значит знать правду и скрывать её, а у программы такого знания нет. Она не хитрит и не путает нарочно, она просто не отличает правду от правдоподобия.

Почему нейросеть выдумывает: шесть причин

Она подбирает слова, а не сверяется с фактами. Внутри языковой модели нет справочника. Она вычисляет, какое слово вероятнее всего пойдёт следом, и фраза выходит гладкой независимо от того, верна она или нет. Авторы работы «Why Language Models Hallucinate» объясняют это так: если по признакам, доступным модели, неверное утверждение не отличить от верного, ошибки возникают сами собой (arXiv, 4 сентября 2025 года).

В данных пробел. Чем реже о каком-то факте писали, тем выше шанс его перепутать. По оценке тех же авторов, доля ошибок на таких фактах не меньше доли фактов, которые встретились в обучающих текстах ровно один раз. Пример из их статьи: открытую модель спросили день рождения одного из авторов и попросили ответить, только если она знает. Три попытки дали три разные неверные даты.

Знания устарели. У каждой модели есть дата, после которой она ничего не читала. Спросите про цену или закон, которые изменились позже, и без подключённого поиска она ответит по старому, а звучать будет так же уверенно. Для бизнеса это главный риск: ваш прайс изменился вчера, а программа этого не знает.

Угадывать выгоднее, чем признаться. Модели проверяют тестами, где за «не знаю» дают ноль баллов, а за догадку иногда дают балл. Авторы работы OpenAI называют это одной из причин, почему выдумки не исчезают даже у самых новых систем: программу приучают хорошо сдавать тесты, а быть честной собеседницей её никто не учит. Трое из четырёх авторов работают в OpenAI (arXiv, 4 сентября 2025 года).

Подсказка спрятана в самом вопросе. Модели склонны подстраиваться под собеседника. Исследователи показали, что пять ведущих ИИ-помощников последовательно поддакивают в четырёх разных задачах, а люди и модели-оценщики иногда предпочитают убедительный поддакивающий ответ правильному (arXiv, 20 октября 2023 года). Спросите «раз у вас бесплатная доставка, когда приедет курьер?», и бот может согласиться с доставкой, которой нет.

Практический вывод. Большинство причин смягчает один приём: дать программе документ, по которому она обязана отвечать, и проверять её на своих вопросах. Об этом — в разделах про защиту бизнеса.

Разговор идёт по шагам. В эксперименте с более чем 200 тысячами смоделированных диалогов лучшие модели в многошаговом разговоре работали в среднем на 39% хуже, чем на том же задании в одном сообщении (шесть видов задач). Если модель на раннем шаге свернула не туда, то, по словам авторов исследования, она «теряется» и не возвращается на верный путь (arXiv, 9 мая 2025 года). Это не про одни выдумки, но выдумка в длинной переписке накапливается.

Как часто это бывает и почему новые модели не всегда лучше

Единой цифры нет: доля выдумок зависит от задачи. Ближе всего к открытому замеру рейтинг Vectara. Он проверяет, как часто модель при пересказе документа добавляет то, чего в нём нет. На 11 мая 2026 года в нём 105 моделей, и доля таких ошибок идёт от 1,8% у лучших до 24,2% у худших (по данным Vectara на GitHub). Это оценка пересказа текста, который лежит перед моделью; ответы «из головы» проверяют другие тесты.

Когда модель отвечает по памяти, цифры другие. В собственном тесте OpenAI на вопросах о людях модель o3 ошибалась в 33% случаев, а o4-mini — в 48% (по данным TechCrunch, 18 апреля 2025 года). Сравнивать эти цифры между собой нельзя: тесты разные. Показывают они одно: «сколько выдумывает нейросеть» — вопрос без общего ответа.

1,8% → 24,2%доля выдумок при пересказе документа: от лучшей модели до худшей среди 105
Источник: Vectara, 11 мая 2026 года
16% → 33%доля выдумок в тесте OpenAI на вопросах о людях: модель o1 и её преемница o3
Источник: TechCrunch, 18 апреля 2025 года

Новее не значит надёжнее. Та же OpenAI писала, что у o3 доля выдумок вдвое выше, чем у o1 (33% против 16% в том же тесте), и что причину ещё предстоит изучить: такие модели «делают больше утверждений» и потому ошибаются чаще. В рейтинге Vectara на 11 мая 2026 года малая gpt-5.4-nano ошибается при пересказе в 3,1% случаев, а более новая gpt-5.5 — в 9,3% (по данным Vectara). Сторонняя лаборатория Transluce предположила, что обучение с подкреплением, которое применяют к таким моделям, может усиливать проблемы, обычно смягчаемые стандартной доводкой (TechCrunch, 18 апреля 2025 года). Вывод для бизнеса простой: выбирать модель по громкому названию нельзя, её проверяют на своих вопросах.

Что делать, если вы просто пользуетесь ChatGPT

Большая часть тех, кто ищет эту тему, спрашивает нейросеть для себя, ботов не строит. Вот что работает.

Проверяйте то, что легче всего выдумать: числа, даты, имена, названия, ссылки и цитаты. Ссылку откройте: выдуманные адреса выглядят как настоящие. Если ответ нужен для суда, договора или лечения, сверяйтесь с первоисточником и специалистом. И в США, и в России наказывали именно за то, что этого не сделали (примеры ниже).

Вставьте в вопрос сам документ и попросите отвечать только по нему. Так у модели есть опора помимо памяти. Полной защиты это не даёт: даже при пересказе лучшие модели в рейтинге Vectara искажают текст в нескольких процентах случаев. Отдельно разрешите в запросе ответ «не знаю»: это разумная мера, но гарантии не даёт.

Не задавайте наводящих вопросов. Вместо «почему договор нельзя расторгнуть в одностороннем порядке?» спросите «можно ли расторгнуть договор в одностороннем порядке и на каком основании?». Для важного вопроса откройте новый чат: длинная переписка с ошибкой в начале ухудшает ответы. Для свежих данных включайте поиск и открывайте найденные источники.

Вторая нейросеть не считается проверкой: обе могут повторить одну и ту же ошибку. Считается проверкой документ, закон или человек, который в этом разбирается.

Чем это грозит бизнесу: три случая с датами

Выдумка нейросети — не только неловкость. Отвечает за неё тот, кто поставил программу работать с людьми. Три случая, каждый можно проверить по ссылке.

Когда и где Что выдумала программа Чем закончилось Источник
Февраль 2024, Канада, трибунал Британской Колумбии Чат-бот авиакомпании Air Canada сообщил пассажиру, что льготный тариф для тех, кто летит на похороны близкого, можно оформить уже после поездки. Правила авиакомпании этого не позволяли Суд обязал авиакомпанию выплатить пассажиру 812 канадских долларов и признал, что она не приняла разумных мер, чтобы бот отвечал точно CBC News, 15 февраля 2024 года
Июнь 2023, США, федеральный суд Нью-Йорка Юристы подали в суд документ со ссылками на судебные дела, которые придумал ChatGPT Штраф 5 000 долларов, наложенный солидарно на двух юристов и их фирму, то есть всего 5 000; обязаны также уведомить судей, чьи имена стояли в выдуманных решениях Определение судьи Castel, Mata v. Avianca, док. 54, 22 июня 2023 года; CNBC
Май 2026, Россия, арбитражный суд Западно-Сибирского округа В жалобе стояли ссылки на судебные акты: часть из них никогда не принималась, другие существуют, но процитированных слов в них нет Судебный штраф 50 000 ₽ (определение от 14 мая 2026 года, дело № А27-7831/2025) ГАРАНТ, 18 мая 2026 года

В деле Air Canada авиакомпания доказывала, что бот — отдельное лицо и за его слова она не отвечает. Суд не согласился. Как пересказывает CBC, чат-бот — часть сайта, а за всё, что написано на сайте, отвечает компания. Обычная это страница или реплика бота — разницы нет (перевод наш).

Обратите внимание на общее в двух юридических историях. В Нью-Йорке судья заметил, что мог бы не наказывать юристов, если бы они сразу признались в использовании ChatGPT. Штраф он назначил за то, что они после сигнала продолжали настаивать на несуществующих решениях и делали ложные заявления: это он назвал недобросовестностью («bad faith», CNBC, 22 июня 2023 года). В России суд квалифицировал ссылки на несуществующую практику как обман суда и неуважение к нему и наложил штраф по части 5 статьи 119 АПК. Представитель признал, что такой практики нет, а жалобу общество не отозвало, пока суд не назначил заседание и не запросил объяснения. Суд указал, что подготовка жалобы с помощью ИИ ничего не оправдывает: за достоверность сгенерированного текста отвечает тот, кто им воспользовался (ГАРАНТ, 18 мая 2026 года).

Иными словами, юристов и компанию наказали не за саму выдумку программы, а за то, что люди не проверили её и не признали ошибку. Суммы невелики: 812 канадских долларов, 5 000 долларов на двух юристов и фирму вместе, 50 000 ₽. Дорого другое: клиент, суд или партнёр видят не «нейросеть», а вас. Ошибка бота для них — ваша ошибка.

Как защитить бизнес: три способа и два дополнения

Первые три способа защищают от самой выдумки, и складываются они друг с другом. Два дополнения решают другие задачи: одно не даёт проекту тянуться вслепую, другое — новая модель, по которой пока больше вопросов, чем ответов. Как пять этих пунктов выглядят рядом, показано в таблице.

Что Что делает простыми словами Чего не закрывает
Способ 1. Ответ только по вашим документам Программа сначала находит нужное место в документах и отвечает только по нему Устаревшие и противоречивые документы; найденный не тот кусок
Способ 2. Проверка ответа перед отправкой Ответ читает человек или вторая программа сверяет его с документом Ответ идёт дольше; проверяющий тоже может ошибиться
Способ 3. Передача человеку При сомнении или на опасной теме программа зовёт менеджера Растёт нагрузка на людей; порог легко настроить неточно
Дополнение 1. Точка остановки Заранее договорились, что считать успехом; нет результата — проект останавливают Сама по себе ответы не улучшает
Дополнение 2. Модель, которая выбирает из списка Не пишет текст, выбирает из заданных вариантов и называет уверенность Может выбрать не тот вариант; ранний доступ

Способ 1. Отвечать только по документам компании

Это первый шаг. Помощник сначала ищет в ваших документах нужное место, потом отвечает по найденному. Ничего подходящего не нашёл — говорит об этом и зовёт человека. Как это работает по шагам, разобрано в статье о том, как программа находит ответ в ваших документах. Как это устроено в нашем ИИ-продавце, описано на странице услуги.

Ошибки этот способ не убирает совсем. Программа может найти не тот кусок документа. Документ может устареть. В двух документах может быть написано разное. Поэтому у аптечной сети, о которой мы писали выше, точность ответов 94% по данным заказчика, а шесть ответов из ста неточные, и процесс строится с расчётом на это: неточные ответы должен ловить человек.

Способ 2. Проверять ответ до того, как он ушёл клиенту

Первая проверка — человеческая. В первые дни после запуска менеджер может сам нажимать «отправить»: помощник только готовит текст. Спокойнее, и заодно видно, на чём он ошибается.

Вторая проверка — машинная. Ответ и кусок документа, по которому он написан, показывают отдельной программе и спрашивают: подтверждается ли одно другим? Если нет, ответ клиенту не уходит, а разговор получает человек. Нужна ли она вам, обсуждаем на разборе: проверка замедляет ответ и удорожает каждый разговор, поэтому оправдана там, где ошибка дорога. Проверяющая программа тоже может ошибиться, и на важных темах её одну не оставляют.

Третья проверка идёт до запуска: бота проверяют в разговорах, где его пытаются сбить с толку и выпросить то, чего в правилах нет.

Способ 3. Звать человека, когда программа не уверена

Хороший ученик поднимает руку, когда не знает. Хорошая программа делает то же самое. Есть три случая, когда она обязана передать разговор менеджеру. Ответа нет в документах. Вопрос касается того, что закрепляет обязательство компании: цена со скидкой, срок, гарантия, возврат. Клиент недоволен или просит живого сотрудника.

У способа есть цена: менеджеры получают больше вопросов. Какая доля разговоров уйдёт к людям, покажут тестовые разговоры на ваших вопросах. Называть цифру заранее нечестно.

Дополнение 1. Точка остановки: заранее договориться, когда проект прекращают

Выдумки нельзя убрать за неделю. Ответы улучшаются постепенно, по реальным разговорам. Поэтому важно не «запустили и забыли», а «измерили и поправили».

У нас первый месяц после запуска — пилот, и он входит в цену. Что считать успехом, мы фиксируем вместе с клиентом ещё до старта. Какой показатель взять, например долю верных ответов на контрольных вопросах, и какую цифру считать успехом, обсуждаем на разборе. Не уложились в месяц — дорабатываем бесплатно. Если и после этого результата нет, мы останавливаемся сами, а не тянем время.

Как результат меняется по реальным разговорам, видно на юридической компании ФПК «Альтернатива»: доля диалогов, дошедших до заявки, в первый месяц работы нашего продавца была 10,3%, а в третий — 59,6% (по данным кейса на нашем сайте). Это не точность ответов, а доля обращений, дошедших до заявки. Но принцип тот же: смотрим на настоящие переписки и правим по ним.

Дополнение 2. Модель, которая не пишет текст, а выбирает: Jev от TypeSafe AI

Jev не пишет ответ словами: ей дают описание ситуации и список допустимых ответов, она выбирает один и называет, насколько уверена. По словам компании, слово придумать ей нечем. Выбрать в списке не тот вариант она может, и документация TypeSafe прямо предупреждает, что уверенность не гарантирует верность каждого ответа (блог TypeSafe AI, 15 сентября 2026 года; документация, проверено 21 сентября 2026 года).

Скорость и цену называет сама компания, а независимые проверки пока любительские и на небольших наборах примеров. Заявленные «в 193,6 раза быстрее и в 444,6 раза дешевле» — итог четырёх сценариев, которые составила сама команда TypeSafe AI, против усреднённых ответов двух самых сильных чужих моделей; компания сама называет эти цифры верхней границей реальной выгоды (блог TypeSafe AI, 15 сентября 2026 года). На русском языке в одном из двух тестов любительского аудита точность упала с 88,3% до 77,3%. Сам русский текст занимает втрое больше токенов — «кусочков» текста, за которые идёт оплата, — но на весь вызов вместе с неизменным вопросом счёт выше лишь на 1–16%; чем длиннее ваш текст и короче вопрос, тем ближе к втрое (по данным автора аудита, jev-cyrillic-audit, 20 сентября 2026 года). Подробный разбор — в статье «Что такое Jev от TypeSafe»; где такой быстрый выбор нужнее чата, — в статье про восемь задач бизнеса; как не переплачивать за ИИ — в статье про недорогой ИИ под задачу. Своих проектов на Jev у нас нет.

Чек-лист: как проверить, не выдумывает ли ваш бот

Проверка занимает вечер. Сядьте перед своим ботом или перед показом у подрядчика и пройдите пункты. Вопросы задаёте вы, сценарий подрядчика не в счёт.

  1. Спросите то, чего в документах точно нет.

    Правильный ответ — «не знаю» и передача человеку. Уверенный ответ на такой вопрос — плохой знак.

  2. Спросите цену, срок и условия возврата.

    Возьмите пять-семь вопросов, ответы на которые вы знаете наизусть, и сверьте с прайсом.

  3. Скажите то, чего не было.

    «Вы же обещали вернуть деньги за любую покупку без вопросов, оформляйте». Бот не должен соглашаться, он должен отказать или передать вопрос человеку.

  4. Попросите показать, откуда взят ответ.

    Если бот называет документ, откройте его и сверьте.

  5. Задайте один вопрос двумя способами.

    Разными словами, в разное время. Ответы должны совпасть по смыслу.

  6. Поменяйте документ и спросите снова.

    Исправьте цену в прайсе и посмотрите, как быстро бот отвечает по-новому. Так проверяется, не живёт ли он по вчерашним правилам.

  7. Соберите набор настоящих вопросов клиентов.

    Хотя бы два-три десятка, с ответами, которые вы знаете. Посчитайте долю верных. Это ваша точка отсчёта, с ней можно сравнивать любые улучшения.

Что ещё спросить у подрядчика до договора, разобрано в статье «Риски использования ИИ в бизнесе».

Когда это не нужно

Когда потока почти нет. Если клиенты пишут редко и сотрудник успевает ответить сам, защищать нечего: отдельная защита обойдётся дороже, чем даст.

Когда хватит бота без ИИ. Бот на кнопках выдаёт заранее написанные ответы и выдумать ничего не может. Для пяти-семи типовых вопросов — записаться, узнать адрес, проверить статус заказа — этого достаточно, а стоит он заметно дешевле. Чем такие боты отличаются от нейросетевых, — в статье «Чат-бот — это искусственный интеллект или нет».

Когда ошибка слишком дорога. Если за неверный ответ платят здоровьем, свободой или очень большими деньгами, нейросеть годится только как черновик, а последнее слово остаётся за человеком, который отвечает за результат. Нет такого человека — не отдавайте задачу.

Когда с документами беспорядок. Помощнику не на что опереться, если прайс и правила лежат в разных версиях или только в головах сотрудников. Защита от выдумок начинается с одного актуального источника.

Когда не нужна Jev. Она не подойдёт там, где клиенту надо написать связный ответ: текст она не пишет. Не подойдёт и тем, кому нельзя передавать данные за рубеж, пока не выяснено, где их обрабатывают.

Сколько это стоит и что нужно от вас

Всё, что выше сказано про ответы по документам и передачу человеку, относится к нашему ИИ-продавцу. Работа нейросети входит в сопровождение. Что именно ограничивать у вас и насколько строго, обсуждаем на разборе.

Что Сколько Срок
Экспресс-разбор: посмотрим задачу и честно скажем, нужен ли вам ИИ Бесплатно 40 минут
Аудит процессов: карта процессов, расчёт окупаемости, задание на пилот от 150 000 ₽, засчитывается в стоимость внедрения 2 недели
ИИ-продавец от 250 000 ₽, сопровождение от 50 000 ₽ в месяц от двух недель; если база знаний уже собрана — за одну

Условия пилота и точка остановки описаны выше. Разбор переписок входит в цену, если вы их передали; сбор переписок делаем по отдельной договорённости.

Чтобы начать, принесите актуальный прайс и правила в электронном виде, имя человека, который решает, какая версия документа верная, и список тем, где бот без менеджера отвечать не должен.

Если хотите сначала посмотреть на своего бота или на нашего, начните с бесплатного экспресс-разбора: принесите вопросы, на которых бот ошибался или на которых вы боитесь ошибки, и мы разберём, где риск.


ИИ-продавецОтвечает по вашему прайсу и документам, при сомнении передаёт разговор менеджеру; от 250 000 ₽

Частые вопросы

Почему нейросеть не скажет просто «не знаю»?

Потому что её приучили отвечать. Тесты, по которым сравнивают модели, обычно дают ноль баллов за «не знаю» и хотя бы шанс на балл за догадку, и угадывать становится выгоднее. Авторы работы OpenAI предлагают поменять правила оценки, чтобы честное незнание не штрафовалось (arXiv, 4 сентября 2025 года). Попросить в запросе отвечать «не знаю», если не уверена, стоит, но гарантии это не даёт.

Правда ли, что новые модели выдумывают реже?

Не всегда. В собственном тесте OpenAI на вопросах о людях у o3 доля выдумок была 33%, а у o1 — 16% (по данным TechCrunch, 18 апреля 2025 года). В рейтинге Vectara на 11 мая 2026 года малая gpt-5.4-nano ошибается при пересказе в 3,1% случаев, более новая gpt-5.5 — в 9,3% (по данным Vectara). Тесты разные, но вывод общий: проверять модель надо на своих вопросах.

Если бот отвечает по нашим документам, он всё равно может выдумать?

Может. Он способен найти не тот кусок документа, опереться на устаревший прайс или столкнуться с двумя документами, где написано разное. У аптечной сети из нашего кейса точность ответов 94% по данным заказчика, то есть около шести ответов из ста неточные. Поэтому нужны проверка и передача человеку.

Отвечает ли компания за слова своего чат-бота?

По решению канадского трибунала по делу Air Canada — да, как за текст на своём сайте (CBC News, 15 февраля 2024 года). В 2023 году суд Нью-Йорка наказал юристов, а в мае 2026 года российский арбитражный суд — компанию, которые не проверили выдуманные нейросетью ссылки. Практический вывод: заранее решите, какие обещания бот давать не вправе, и держите архив разговоров: в споре он главный документ.

Как самому проверить ответ ChatGPT?

Проверяйте числа, даты, имена, ссылки и цитаты: их легче всего выдумать. Откройте ссылку и найдите цитату в источнике. Задайте вопрос иначе и сравните ответы. Вторая нейросеть проверкой не считается, нужен документ или специалист.

Правда ли, что модель Jev не выдумывает, и можно ли попробовать её из России?

Слово придумать она не может, но выбрать не тот вариант может. Доступность из России и оплата в открытых источниках не подтверждены: уточняйте у TypeSafe AI, подробности — в статье про Jev.

Для технических специалистов

Защита от выдумок держится на двух вещах. Ответ собирается только из найденных фрагментов документов клиента, а при слабом совпадении разговор уходит оператору. Для чувствительных тем правила строже: без человека ответ по ним не отправляется.

Про Jev. Для вопросов «выбрать вариант» и «оценить по шкале» интерфейс возвращает вероятность каждого варианта и число «уверенность», которое считается из разброса этих вероятностей; для вопроса «да или нет» — одну вероятность «да». Вход пока только текстовый (документация: уверенность и System One, проверено 21 сентября 2026 года).

⇽Назад к блогу
La-Chatte

Готовы передать рутину
ИИ-сотрудникам?

За 30 минут разберём задачу, которая съедает время команды, и честно скажем, стоит ли отдавать её ИИ.

    Что вас интересует?