В этой статье
- За что платят при работе ИИ
- Почему простому вопросу не нужна дорогая модель
- Четыре уровня: от готового ответа до человека
- Кто решает, куда отправить вопрос
- Пример быстрого «решателя»: Jev от TypeSafe AI
- ИИ в реальном времени: когда секунда — это много
- Считаем на условном примере
- Как проверить, что качество не упало
- Что ещё снижает счёт
- Что у нас: нейросеть входит в цену
- Когда это не нужно
- Что нужно от вас
- Частые вопросы
- Для технических специалистов
Коротко
- За ИИ платят токенами: кусочками текста, которые модель прочитала и написала. Чем длиннее вопрос, история диалога и подсказки, тем дороже ответ.
- Часть вопросов нейросети не требует вовсе: часы работы, адрес, статус заказа. Их отдают готовому ответу или обычной программе.
- Дальше идут лёгкая модель, сильная модель и человек. Правило из примера LangChain (блог LangChain, 17 сентября 2026): брать самую недорогую модель, которая справится.
- Куда отправить вопрос, решает быстрый «решатель». Пример — Jev от TypeSafe AI: по данным компании, она отвечает за 70–500 миллисекунд. На русском она слабее, подробности в отдельной статье про Jev.
- У нашего клиента счёта за токены нет: в типовом проекте ИИ-продавца работа нейросети входит в сопровождение от 50 000 ₽ в месяц. Считать токены нужно тем, кто покупает доступ к моделям сам.
За что платят при работе ИИ
Представьте, что за телефонный разговор платят не по минутам, а по словам. И за ваши слова, и за слова собеседника. Примерно так устроен счёт за ИИ.
Единица счёта называется токен. Это кусочек текста: короткое слово целиком или часть длинного. Модель — так называют программу, которая читает и пишет текст — видит его именно такими кусочками. Сколько кусочков она прочитала и написала, столько и оплачивается.
Платят за две вещи. Первая — то, что модель прочитала: вопрос клиента, инструкцию для неё, прошлые сообщения диалога и куски ваших документов, по которым она отвечает. Вторая — то, что она написала в ответ. У ряда поставщиков написанное стоит дороже прочитанного, пример в таблице ниже.
Отсюда два правила. Длинный диалог дороже короткого: на каждый новый вопрос модель заново читает всё, что было сказано раньше. И сильная модель дороже лёгкой за тот же токен, разницу видно в таблице ниже. О том, чем опасна привязка к одному поставщику и его ценам, есть раздел в статье про восемь рисков ИИ в бизнесе.
Вот цены двух поставщиков, снятые с их официальных страниц 21 сентября 2026 года. «Лёгкая» и «сильная» — наши названия: лёгкая — младшая модель поставщика, сильная — одна из старших. У Anthropic выше в прайсе стоят ещё более дорогие модели, одну из них мы добавили в таблицу.
| Поставщик и модель | Цена за миллион токенов | Где смотреть |
|---|---|---|
| Anthropic, Claude Haiku 4.5 (лёгкая) | читает $1, пишет $5 | страница тарифов Anthropic, цены в долларах |
| Anthropic, Claude Opus 5 (сильная) | читает $5, пишет $25 | |
| Anthropic, Claude Fable 5.1 (одна из самых дорогих в прайсе) | читает $10, пишет $50 | |
| GigaChat Lite (лёгкая) | 65 ₽ (0,065 ₽ за 1 000 токенов) | тарифы GigaChat для юрлиц, страница обновлена 16 сентября 2026, цены с НДС, синхронный режим |
| GigaChat Max (сильная) | 650 ₽ (0,65 ₽ за 1 000 токенов) |
Видно три вещи. Первая: за токен у Anthropic Opus 5 дороже Haiku 4.5 в 5 раз, а Fable 5.1 — в 10, у GigaChat Max дороже Lite в 10 раз. Вторая: у Anthropic написанное стоит в 5 раз дороже прочитанного, а у GigaChat цена одна на все токены. Третья — оговорка со страницы Anthropic: модели «4.7 and later», Opus 5 среди них, дают «approximately 30% more tokens for the same text», то есть примерно на 30% больше токенов на тот же текст; у Haiku 4.5 токенайзер прежний. Значит, за один и тот же текст Opus 5 дороже Haiku 4.5 не в 5, а примерно в 6,5 раза (5 × 1,3). Точная цифра зависит от текста, так пишет и сама страница (по данным страницы тарифов Anthropic, 21 сентября 2026).
Про GigaChat. Страница «Тарифы для юрлиц» устроена так: тарифы даны для двух групп клиентов, ООО «Салют для Бизнеса» и ООО «СалютДевайсы», и в таблице выше цены у обеих групп совпадают. Отдельной строкой сказано: с 1 сентября 2026 года для новых клиентов оплата возможна на платформе cloud.ru. Цены меняются, поэтому перед расчётом откройте страницу тарифов вашего поставщика. Русский текст обычно занимает больше токенов, чем такой же английский, поэтому считайте по счётчику токенов вашей модели.
Формула. Расходы за месяц = сколько диалогов × сколько стоит один диалог. Цену одного диалога угадывать не нужно: возьмите счёт поставщика за прошлый месяц и поделите на число диалогов.
Почему простому вопросу не нужна дорогая модель
Покупатель заходит в магазин и спрашивает у директора: «До скольки вы сегодня?» У двери, между прочим, висит табличка «Работаем до 21:00». Директор ответит верно. Но в эту минуту он занят пустяком, а зарплату получает как директор.
С ИИ выходит так же. Сильная модель на вопрос «до скольки работаете?» ответит безупречно. Но перед ответом она прочтёт и инструкцию, и всю переписку, и куски документов, хотя нужная строка давно лежит в справочнике. Счёт придёт как за разбор сложного случая. Один такой вопрос стоит копейки, но их набегает много.
Есть и обратная беда. Отдадите всё самой дешёвой модели — она справится с лёгким и наверняка споткнётся на сложном. Клиент уйдёт, а вместе с ним и заявка, которую вы «сэкономили». Поэтому задача звучит так: каждый вопрос должен попасть на самый дешёвый уровень, где на него ответят верно.
Четыре уровня: от готового ответа до человека
Вернёмся в магазин. Есть табличка на двери, продавец в зале, специалист по сложной технике и директор. Каждый берёт свой круг вопросов и не делает чужую работу. Так же раскладывают вопросы клиентов в ИИ-системе.
| Уровень | Кто отвечает | Какие вопросы | Что с деньгами |
|---|---|---|---|
| 1. Табличка | Готовый ответ или правило | «До скольки работаете?», «Где вы находитесь?», статус заказа по номеру | Почти бесплатно: нейросеть не нужна |
| 2. Продавец | Лёгкая модель | Типовые вопросы про товар, цену, доставку, если ответ есть в ваших документах | Недорого |
| 3. Специалист | Сильная модель | Нестандартные случаи: сравнить условия, разобрать длинное письмо, ответить сразу на несколько вопросов | Дорого, поэтому не для каждого вопроса |
| 4. Директор | Человек | Жалобы, деньги, договоры и всё, в чём ИИ не уверен | Время сотрудника |
Первый уровень — это то, что умели обычные чат-боты с кнопками: заранее написанный ответ без нейросети. Чем такой бот отличается от ИИ, разобрано в статье «Чат-бот — это искусственный интеллект или нет». Второй и третий уровни отвечают по вашим документам. Как это устроено, объясняет статья про ответы ИИ по вашим документам.
Не мы это придумали. Демонстрацию TypeSafe AI для службы поддержки 17 сентября 2026 года пересказал heise. Про статус заказа там отвечает обычная программа, про товар — языковая модель, а трудный или неясный случай берёт человек (heise).
В тот же день LangChain, компания с популярным набором инструментов для ИИ-помощников, показала то же правило на другом примере: помощник для программиста. Поиск и мелкие правки там уходят быстрой модели, архитектура и ответственные решения — мощной. Инструкция для такого «решателя» в переводе звучит так: «выбирай самую недорогую модель, которая справится с задачей» (блог LangChain, 17 сентября 2026).
Кто решает, куда отправить вопрос
Кто-то должен сказать: этот вопрос к табличке, этот к продавцу, этот к специалисту. Способов три, и у каждого свой изъян.
Первый — жёсткие правила. Видим в сообщении «режим работы» и отвечаем готовым текстом. Дёшево и понятно, но люди пишут кто во что горазд: «вы сегодня открыты?», «когда закрываетесь?», «в воскресенье работаете?». Под каждую фразу правило не напишешь.
Второй — спросить у сильной модели, простой ли это вопрос. Сортирует она хорошо. Вот только за сортировку вы платите как за полноценный разбор, и часть экономии сгорает ещё до ответа клиенту.
Третий — отдельный быстрый «решатель». Это небольшая программа, которая сама клиенту не отвечает. Её единственное дело — решить, кому передать вопрос. Писать текст ей не нужно, поэтому она может быть очень быстрой и очень дешёвой.
Пример быстрого «решателя»: Jev от TypeSafe AI
Один из свежих примеров — модель Jev американской компании TypeSafe AI, вышедшая в ранний доступ 15 сентября 2026 года. Она не пишет текст. Ей дают вопрос клиента и список вариантов, например «про заказ», «про товар», «жалоба», а она выбирает один пункт и говорит, насколько в нём уверена. По данным TypeSafe AI, ответ занимает от 70 до 500 миллисекунд, а цена — 0,042 доллара за миллион входных токенов (блог TypeSafe AI, 15 сентября 2026; документация, 21 сентября 2026). Это цифры самой компании.
«Не выдумывает» здесь лишь значит «выбирает из списка», и выбрать в нём не тот пункт она вполне может. Русский язык — слабое место. По данным независимого аудита на GitHub (20 сентября 2026), в одной задаче точность упала с 88,3% на английском до 77,3% на русском. Сам текст на русском занимает втрое больше токенов, но на весь вызов счёт выше лишь на 1–16%: чем длиннее ваш текст и короче вопрос, тем ближе к втрое. Замеры, условия доступа и всё остальное — в отдельной статье про Jev.
ИИ в реальном времени: когда секунда — это много
Под «ИИ в реальном времени» обычно понимают ответ, который приходит, пока человек ещё смотрит на экран. Сколько это секунд, зависит от места. В переписке с клиентом хватает нескольких секунд: медиана ответа нашего продавца у ФПК «Альтернатива» — 8,4 секунды (с 26 мая по 20 августа 2026 года, кейс на сайте). Медиана — это середина: половина ответов пришла быстрее, половина медленнее. Эти секунды нельзя сравнивать с 70–500 миллисекундами у Jev. Быстрый «решатель» только выбирает вариант, а продавец пишет и отправляет ответ, поэтому его 8,4 секунды — время ответа целиком.
Секунда становится дорогой там, где ИИ встроен в действие человека: подсказка оператору прямо во время разговора, проверка сообщения перед отправкой. Здесь быстрый «решатель» нужен из-за скорости. В чате с клиентом он нужен из-за денег. Какие ещё задачи бизнеса лучше отдавать быстрому «решателю», чем чат-боту, — в статье про восемь таких задач.
Считаем на условном примере
Это условный пример. Числа придуманы для счёта, замеров за ними нет. Вместо них подставьте свои.
Допустим, в месяц приходит 30 000 диалогов. Один диалог у сильной модели условно стоит 5 ₽, у лёгкой — 1 ₽. Рубли придуманы, а соотношение 1 к 5 взято из цен за токен в таблице Anthropic выше. За один и тот же текст у Opus 5 оно около 1 к 6,5 из-за токенайзера, но для условного расчёта оставим 1 к 5. Если отдавать всё сильной, счёт за месяц: 30 000 × 5 = 150 000 ₽.
Теперь разложим вопросы по четырём уровням. Доли тоже условные.
| Кто отвечает | Из каждых 100 вопросов | Диалогов в месяц | Условная цена диалога | Итого в месяц |
|---|---|---|---|---|
| Готовый ответ | 30 | 9 000 | 0 ₽ | 0 ₽ |
| Лёгкая модель | 45 | 13 500 | 1 ₽ | 13 500 ₽ |
| Сильная модель | 20 | 6 000 | 5 ₽ | 30 000 ₽ |
| Человек | 5 | 1 500 | 0 ₽ за ИИ | 0 ₽ |
| Сортировка «решателем» | все 100 | 30 000 | 0,05 ₽ | 1 500 ₽ |
| Всего | 45 000 ₽ |
По слоям выходит 45 000 ₽ в месяц: лёгкая модель (13 500 ₽), сильная (30 000 ₽) и сортировка (1 500 ₽). Цену сортировки считаем от лёгкой модели GigaChat Lite из таблицы выше: 65 ₽ за миллион токенов. Условные 500 токенов на обращение дают около 0,03 ₽, округляем до 0,05 ₽. Свою цену считайте по счётчику токенов вашей модели.
Диалоги, которые ушли человеку, и раньше доставались сотрудникам. Новых расходов на них нет, но и в экономию их время не входит.
Осторожно. Экономия существует только на бумаге, пока вы не проверили две вещи: правда ли простых вопросов столько и не падает ли качество на лёгком уровне. Первое показывает выборка ваших переписок, второе — проверка из следующего раздела.
Как проверить, что качество не упало
Сначала измеряем, потом меняем. Останавливать чат не нужно: всё делается на уже записанных диалогах.
- Возьмите реальные вопросы
Двести-триста вопросов клиентов из переписок за прошлые месяцы. Нужны живые формулировки с ошибками и сокращениями, придуманные примеры не годятся.
- Разложите их вручную по четырём уровням
Это делает человек, который знает клиентов. Получится эталон, с которым вы будете сравнивать.
- Дайте «решателю» разложить те же вопросы
Добавьте в список пункт «другое или не по теме»: без него чужим вопросам некуда деваться. Смотрите, где «решатель» не совпал с человеком. Хуже всего, когда сложный вопрос ушёл на лёгкий уровень: там клиент получит слабый ответ.
- Сравните ответы
Ответы лёгкого уровня положите рядом с ответами сильной модели. Спорные покажите тому, кто отвечает за качество.
- Поставьте порог уверенности
Когда «решатель» не уверен, вопрос поднимается на уровень выше или уходит человеку. Порог подбирают на ваших данных: чем он выше, тем меньше вопросов решается без человека.
Раз в неделю читайте выборку живых диалогов. Вопросы клиентов меняются, и со временем «решатель» начинает ошибаться в новых местах. Отдельная тема — выдуманные ответы. Как их ловить, разобрано в статье о том, почему ИИ выдумывает и что с этим делать.
Что ещё снижает счёт
Уровни убирают дорогую модель из простых вопросов. Есть и другие способы платить меньше, и ни одному не нужна новая модель.
Начнём со способа, у которого есть цифры на официальной странице, и он же самый ощутимый: асинхронный режим. У GigaChat он ровно вдвое дешевле обычного. Lite стоит 0,0325 ₽ вместо 0,065 ₽ за 1 000 токенов, Max — 0,325 ₽ вместо 0,65 ₽ (тарифы GigaChat для юрлиц, страница обновлена 16 сентября 2026, снято 21 сентября 2026). Цена такая, потому что ответ приходит позже. Для диалога, где клиент ждёт ответа, режим не годится. Зато подходит для работы в фоне: разобрать вчерашние переписки, разложить вопросы для проверки, подготовить выжимки.
Пишите короткие инструкции. Всё, что вы написали модели, читается заново в каждом диалоге, и каждое слово оплачивается каждый раз. Лишний абзац в инструкции — лишняя сумма в счёте на весь месяц.
Не пересылайте модели весь диалог целиком. Старую часть переписки можно заменить короткой выжимкой: что клиент хотел и о чём договорились. Тогда длинный разговор перестаёт дорожать с каждым сообщением.
Давайте модели только нужные куски документов: хватит трёх строк прайса, которые относятся к вопросу, весь прайс ей ни к чему. И ограничьте длину ответа: написанное у многих поставщиков стоит дороже прочитанного, а клиенту чаще нужен короткий ответ.
Лимит расходов. Поставьте его с оповещением. Если из-за ошибки в настройках запросов вдруг станет намного больше, вы узнаете об этом в тот же день, а ждать счёта в конце месяца не придётся.
Что у нас: нейросеть входит в цену
У нашего клиента счёта за токены нет. В типовом проекте ИИ-продавца работа нейросети входит в сопровождение от 50 000 ₽ в месяц, и отдельно за диалоги вы не платите (страница услуги). Считать токены приходится тем, кто покупает доступ к модели напрямую и собирает свой продукт сам: у них это отдельная строка в бюджете. Для них эта статья.
Модели мы подбираем по ситуации: GigaChat, YandexGPT, OpenAI, Claude, открытые модели вроде Qwen. Выбор зависит от задачи и от того, куда можно отправлять данные. Имена и телефоны клиентов при необходимости обезличиваем до отправки в модель. Своих замеров Jev у нас нет: цифры про неё в этой статье — заявления самой TypeSafe AI и чужой независимый аудит, со ссылками.
| Что | Цена | Срок |
|---|---|---|
| Экспресс-разбор: есть ли что удешевлять | бесплатно | 40 минут |
| Аудит процессов: карта, расчёт окупаемости, техзадание | 150 000 ₽ | 2 недели |
| ИИ-продавец | от 250 000 ₽ | от двух недель; если база знаний уже собрана — за одну |
Аудит засчитывается в стоимость внедрения. Другие ступени — в статье «С чего начать внедрение ИИ». Если вы покупаете доступ к моделям сами и счёт растёт, принесите его на бесплатный экспресс-разбор: за 40 минут посмотрим задачу и честно скажем, есть ли что удешевлять.
Когда это не нужно
Поток небольшой. У поставщиков бывает минимальный платёж. У GigaChat на странице тарифов сказано: если объём операций за месяц меньше 600 рублей, списывается минимальный платёж 600 рублей с НДС (если сервисом не пользовались, плата не взимается). Поэтому на малом потоке счёт сводится к этому минимуму, и удешевлять нечего. Настройка и проверка обойдутся дороже. Правило простое: если счёт за нейросеть за месяц меньше, чем стоит рабочий день человека, который всё это будет настраивать, не усложняйте.
Вопросы почти все сложные. В юридических, медицинских и денежных вопросах цена ошибки высока. Сортировать там нечего: либо сильная модель под присмотром человека, либо сразу человек. Уровни для таких вопросов мы предлагать не будем.
Данные нельзя отправлять наружу. Если в сообщениях личные данные и вы покупаете доступ к модели сами, сначала выясните у юриста, куда данные уходят. А если их вообще нельзя выпускать из компании, это отдельный проект, и к экономии по уровням он отношения не имеет. Такой разговор — на разборе.
Слишком рано или слишком дорого рисковать. Если ИИ у вас ещё не запущен, удешевлять нечего: пока нет счёта, нет и предмета для экономии. Сначала запустите один рабочий сценарий и измерьте результат. А если одна ошибка обходится вам дороже, чем вся экономия за год, оставьте сильную модель и человека.
Что нужно от вас
Чтобы понять, есть ли что удешевлять, нужно немного. Время в таблице — ориентир.
| Что | Кто даёт | Сколько времени |
|---|---|---|
| Счёт поставщика нейросети за прошлый месяц и число диалогов | Бухгалтер или ответственный за ИИ | Около 30 минут |
| Двести-триста реальных вопросов клиентов | Руководитель поддержки или продаж | 1–2 часа |
| Разметка вопросов по четырём уровням | Тот, кто хорошо знает клиентов | 2–3 часа |
| Решение, какие темы всегда идут человеку | Руководитель | Около часа |
Последняя строка важнее остальных. Заранее договоритесь: деньги, договоры, жалобы и здоровье идут человеку всегда, как бы уверенно ни отвечала модель.
Частые вопросы
Что такое токен в нейросети простыми словами?
Это кусочек текста: слог, короткое слово или часть длинного. Модель читает и пишет токенами, и по их числу вам выставляют счёт. Один и тот же русский текст на разных моделях разбивается на разное число токенов.
Сколько стоит миллион токенов у двух поставщиков на 21 сентября 2026 года?
У Anthropic лёгкая Claude Haiku 4.5 читает по $1 за миллион и пишет по $5, а Claude Opus 5 — по $5 и $25 (страница тарифов). У GigaChat Lite миллион стоит 65 ₽ (тарифы для юрлиц). Остальных поставщиков ищите на их страницах тарифов: цены меняются.
Не упадёт ли качество, если простые вопросы отдавать лёгкой модели?
Упасть может. Стоит «решателю» отправить сложный вопрос на лёгкий уровень, и клиент получит слабый ответ. Поэтому до запуска всё прогоняют на записанных диалогах, а неуверенные случаи отправляют выше или человеку.
С какого потока диалогов стоит думать об уровнях?
Точной границы нет: всё зависит от цены диалога и доли простых вопросов. Если счёт за нейросеть за месяц меньше, чем стоит рабочий день человека, который всё настроит, не усложняйте. Считайте по формуле «диалоги × цена диалога» на своих числах.
«Решатель» заменяет чат-бота?
Нет. Он только выбирает, кому передать вопрос. Клиенту ответит готовый текст, модель или человек.
Для технических специалистов
Считайте не цену токена, а цену решённого обращения. Каждый поставщик режет текст на токены по-своему, поэтому один русский текст даёт разное число токенов на разных моделях: смотрите счётчик своей модели, входные и выходные токены отдельно. По данным страницы Anthropic, токенайзер моделей 4.7 и новее даёт примерно на 30% больше токенов на тот же текст. У ряда поставщиков повторяющаяся часть запроса, например длинная инструкция, тарифицируется со скидкой через кэш, а часть задач можно отправлять пакетом дешевле. Проверьте это в условиях своего поставщика. В индустрии такие модели называют LLM, то есть большие языковые модели: программы, которые пишут текст.
«Решатель» — это классификатор: на входе текст обращения, на выходе один из заданных вариантов и оценка уверенности. Ниже порога вопрос уходит человеку. Всегда добавляйте вариант «другое или не по теме». Арифметику, даты и статус заказа оставляйте обычному коду. Порог не берите из чужого примера: подбирайте на своих размеченных данных, а для дорогих ошибок ставьте выше. Jev выдаёт вариант, вероятности по всем вариантам и оценку уверенности; параметры, лимиты и слабые места собраны в статье про Jev.
Что мерить у себя: матрицу ошибок на 200–300 размеченных обращениях, долю обращений, ушедших человеку, цену решённого обращения и задержку в худших случаях, не только среднюю. Версию модели фиксируйте идентификатором: псевдоним вроде «latest» переезжает на новый релиз, и ответы меняются без ваших правок. Ограничение длины ответа, кэш повторяющейся части запроса и учёт токенов по каждому диалогу дают вам цену диалога без догадок.

