Русский язык обходится генеративным моделям дороже английского
Небольшое исследование сравнило токенизацию текстов на русском и английском разными моделями искусственного интеллекта.

Большинству моделей искусственного интеллекта русский язык обходится на 20–50% дороже английского, показало небольшое исследование, которое провел пользователь Хабра. Все дело в токенизации — переводе естественного текста в понятные ИИ цифровые единицы.
Стоимость API разных LLM, с помощью которых разработчики создают чат-боты, системы клиентской поддержки и прочие полезные продукты, обычно сравнивают по цене за миллион токенов. Но токен у каждой модели свой — он зависит от алгоритма токенизации: одни режут русский текст крупными кусками, другие почти по буквам.
«Я прогнал один и тот же русский текст через Claude Opus 5 и GPT-5.5. Opus 5 насчитал в нем в 3,9 раза больше токенов, — приводит пример автор. — Значит, при одинаковой цене за токен обработка русского текста на Opus 5 обойдется почти вчетверо дороже, чем на GPT-5.5, — и это не зависит от того, у кого вы покупаете доступ».
Исследователь подготовил четыре текста, каждый на русском и английском, и пропустил их через токенизаторы одиннадцати моделей — результаты чего, в том числе пересчитанные в рубли, собрал в таблице.
Английский почти у всех одинаковый — 5,0–5,1 символа на токен у десяти моделей из одиннадцати. Вполне логично — ведь учились они на английском.
На русском — большой разброс. Эффективнее всех его токенизируют отечественные модели YandexGPT и GigaChat — у них один токен умещает в пять раз больше русских букв, чем у Claude Opus 5, а русский текст выходит дешевле английского перевода.
У остальных — закономерность противоположная: русский текст «тяжелее» английского:
у GPT-5.x/6, Gemini, Grok и GLM — на 18–23%, у DeepSeek — на 38%, у Qwen — на 52%, у Kimi — на 86%, у Claude Opus 5 — почти втрое.«Сравнивать модели для русскоязычного продукта нужно по цене не за миллион токенов, а за 1 000 символов или за типичный запрос на ваших текстах», — резюмирует автор.
Он признает ограничения исследования, но отмечает, что судя по измерениям на разных моделях более обширный массив данных дал бы, по всей видимости, те же результаты.
Что и подтверждается в комментариях. Там показали скриншот другого исследования с аналогичными результатами, хотя и несколько меньшим разбросом. Закономерность тот анализ выявил ровно такую же: китайский язык обходится дешевле при обработке китайскими моделями.
Выяснилось, какой язык лучше всего понимают чат-боты
Для общения друг с другом агенты ИИ изобрели собственный язык
Подписывайтесь и читайте «Науку» в MAX













