Вы отправили нейросети короткий вопрос, а счётчик списал заметно больше, чем вы ожидали. Или наоборот: диалог шёл нормально, а к сороковому сообщению модель начала путаться в том, о чём вы договорились в начале. Оба случая объясняются одним и тем же — тем, как языковые модели измеряют текст.
Разберём, что такое токены в нейросети, из чего складывается расход, что такое контекст в нейросети и почему у любой модели есть предел, после которого она перестаёт видеть начало разговора.
Что такое токены в нейросети простыми словами
Токен — это кусочек текста, которым оперирует искусственный интеллект. Не буква и не слово, а именно фрагмент: часть слова, целое слово, знак препинания или пробел.
Справка OpenAI «What are tokens and how to count them?» описывает это так: токены работают как строительные блоки текста, которые обрабатывают модели, и они бывают короткими, как один символ, и длинными, как целое слово, в зависимости от языка и контекста.
Искусственный интеллект не читает текст так, как читаете его вы. Модель получает последовательность номеров: каждый токен заменяется на число из словаря токенизатора, и дальше работа идёт с числами. Ответ строится тем же способом в обратную сторону — модель предсказывает следующий токен, потом следующий, и уже готовая цепочка собирается обратно в текст.
Это базовый принцип работы нейросетей, и отсюда следует то, ради чего вообще стоит знать это слово: токен — это единица тарификации. Разработчики моделей продают доступ по токенам, а не по символам, страницам или запросам. Поэтому вопрос «сколько это стоит» всегда сводится к вопросу «сколько там токенов».
Почему токен — это не слово и не символ
Самая частая ошибка — считать токен равным слову. Тогда 1 000 токенов кажутся тысячей слов, а на деле это в лучшем случае 750, а на русском — вдвое меньше.
Официальные ориентиры OpenAI даны для английского языка:
| Ориентир | Значение |
|---|---|
| 1 токен | ≈ 4 символа |
| 1 токен | ≈ ¾ слова |
| 100 токенов | ≈ 75 слов |
| 1–2 предложения | ≈ 30 токенов |
| 1 абзац | ≈ 100 токенов |
| ~1 500 слов | ≈ 2 048 токенов |
Там же приведены живые примеры. Цитата «You miss 100% of the shots you don’t take» занимает 11 токенов, Устав OpenAI — 476 токенов, Декларация независимости США — 1 695 токенов.
Обратите внимание на оговорку самой справки: токенизация различается от модели к модели и от кодировки к кодировке. Эти числа — ориентир для прикидки, а не константа.
Как работает токенизация текста
При токенизации текст разбивается на токены по заранее обученному словарю. Современные нейросети используют алгоритм BPE (byte pair encoding): он начинает с отдельных байтов и постепенно склеивает самые частые пары в один токен. Чем чаще сочетание встречалось в обучающих данных, тем выше шанс, что оно стало отдельным токеном.
Поэтому частые английские слова занимают ровно один токен, а редкие и составные разваливаются на части. Вот как официальный токенизатор OpenAI (кодировка o200k_base, замер 21.08.2026) режет несколько слов:
| Слово | Разбиение | Токенов |
|---|---|---|
| hello | hello |
1 |
| context | context |
1 |
| tokenization | token + ization |
2 |
| привет | пр + ивет |
2 |
| нейросеть | ней + рос + еть |
3 |
| контекстное | конт + екст + ное |
3 |
| токенизация | т + ок + ен + изация |
4 |
Разница видна сразу: английское context — один токен, русское «контекстное» — три.

Кроме обычных токенов у моделей есть служебные. Ими модель размечает границы: где заканчивается системная инструкция, где начинается реплика пользователя, где ответ. Их вы не пишете и не видите, но они входят в объём запроса.
Почему русский текст расходует токены быстрее английского
Причина не в языке как таковом, а в том, на чём учили токенизатор. Словари собирались преимущественно на англоязычных корпусах, поэтому английские слова и морфемы попали в словарь целиком, а кириллица — обрывками. Добавляет и кодировка: в UTF‑8 латинская буква занимает один байт, кириллическая — два, а BPE работает именно с байтами.
Сколько это в числах, разработчики моделей официально не публикуют. Поэтому мы измерили сами: 12 пар предложений на русском и английском, официальная библиотека tiktoken 0.14.0, кодировка o200k_base, замер 21 августа 2026 года.
| Показатель | Русский | Английский |
|---|---|---|
| Всего символов | 775 | 720 |
| Всего слов | 101 | 120 |
| Всего токенов | 192 | 135 |
| Символов на токен | 4,04 | 5,33 |
| Токенов на слово | 1,90 | 1,12 |
По токенам на слово русский вышел дороже английского примерно в 1,7 раза.
Это наш замер на небольшой выборке, а не отраслевая норма: результат зависит от модели, темы и длины слов. Универсального множителя не существует — если вам нужна точность, проверьте свой текст в токенизаторе, о котором рассказываем ниже.
Одно следствие из этого стоит запомнить сразу: мерить объём текста в символах и делать вывод о расходе — неверно. Двадцать тысяч символов на русском и на английском дадут заметно разное количество токенов.
Токены в искусственном интеллекте и токены в криптовалюте — это разные вещи
Слово одно, смысла два, и поиск их постоянно смешивает.
В криптовалюте токен — это цифровой актив, запись в блокчейне, у которой есть стоимость и владелец. Его покупают, продают и хранят в кошельке.
В искусственном интеллекте токен ничего не стоит сам по себе и никому не принадлежит — это не актив. Это техническая единица, которой измеряют текст, вроде килобайта у файла. «Купить токены» в этом смысле означает оплатить объём обработки текста у поставщика модели, а не приобрести актив.
Дальше в статье речь только о втором значении.
Какие токены вы оплачиваете: входные, выходные, кэшированные и токены рассуждений
Справка OpenAI перечисляет четыре категории учёта, и в счёт попадают все четыре.
Входные токены — всё, что модель получила: ваш вопрос, системная инструкция, прикреплённый файл и вся предыдущая переписка.
Выходные токены — то, что модель написала в ответ. Обычно они дороже входных: у флагманской линейки OpenAI на 21.08.2026 это $5 за миллион входных против $30 за миллион выходных, у старшей модели Anthropic — $10 против $50.
Кэшированные токены — повторно использованная часть истории диалога. Если одна и та же длинная инструкция уходит в модель раз за разом, поставщик может не обрабатывать её заново, а взять из кэша по сниженной ставке.
Токены рассуждений — внутренние «шаги размышления» у тех систем искусственного интеллекта, которые умеют думать перед ответом. Эти токены влияют на счёт так же, как обычные. Вы их не видите: в чат приходит финальный текст. Но посчитаны и оплачены они будут.
Последняя категория — источник самых неожиданных счетов. Короткий ответ в три строки не означает маленького расхода, если модель перед этим построила длинную цепочку рассуждений.
Что такое контекст в нейросети и зачем модели история диалога
У искусственного интеллекта нет памяти в человеческом смысле. Нейросети сами по себе ничего не хранят между запросами: каждый вызов для модели — первый.
Иллюзию непрерывного разговора создаёт именно контекст. Что такое контекст в нейросети: это весь текст, который отправляется модели вместе с очередным запросом, чтобы она понимала, о чём идёт речь. Сервис просто подкладывает предыдущие сообщения к новому вопросу — и модель отвечает так, будто помнит разговор.
Отсюда неочевидная механика расхода: вся переписка отправляется заново с каждым сообщением. Пятидесятая реплика в длинном диалоге стоит дороже первой, даже если состоит из одного слова, потому что вместе с ней уезжают все сорок девять предыдущих.
Что входит в контекст: запрос, ответ, системные инструкции и файлы
В контекст диалога попадает больше, чем видно на экране:
- системная инструкция сервиса: правила, по которым модель себя ведёт, заданные до вас;
- ваши сообщения с начала диалога;
- ответы модели на них;
- содержимое прикреплённых файлов — документ на сорок страниц превращается в десятки тысяч входных токенов;
- результаты веб-поиска и работы инструментов, если они включены;
- описания самих инструментов, доступных модели.
Именно поэтому «я же написал всего одну строчку» и «списалось много» — не противоречие.
Чем контекст отличается от памяти нейросети
Эти два слова часто путают, а устроены они по-разному.
Контекст живёт внутри одного диалога и исчезает вместе с ним. Начали новый чат — и контекст снова пуст.
Память — отдельная функция сервиса, которая сохраняет факты о вас между диалогами: имя, профессию, предпочтения, рабочие детали. Технически она устроена так же: сохранённые заметки подкладываются в контекст при каждом запросе. Но управляется память отдельно, и её можно посмотреть, отредактировать и отключить.
Практический вывод: если модель «помнит» лишнее из старых разговоров, чистить нужно память. Если она забыла начало текущего разговора, дело в контекстном окне.
Что такое контекстное окно и в чём измеряется его размер
Контекстное окно нейросети — это максимальный объём текста, который нейросеть видит за один раз и способна обработать за один вызов. Измеряется в токенах, а не в символах или страницах.
Размер контекстного окна считается целиком: в него входят системная инструкция, вся история, ваш новый запрос и место под ответ. Если окно — миллион токенов, а история заняла 990 тысяч, на ответ останется десять тысяч, и длинный текст модель просто не допишет.
Ещё одна деталь, о которой редко говорят: у большинства моделей отдельно ограничен объём ответа. Окно на миллион токенов не означает, что модель напишет вам книгу за один запрос.

Контекстное окно ChatGPT, Claude и Gemini: сравнение на август 2026
Числа ниже сняты 21 августа 2026 года прямо из документации разработчиков. Ниша меняется быстро — перед тем как опираться на конкретную цифру, проверьте её у вендора.
| Разработчик | Линейка на 21.08.2026 | Контекстное окно | Максимум ответа |
|---|---|---|---|
| OpenAI (ChatGPT) | GPT‑5.6 Sol / Terra / Luna | 1,05 млн токенов | 128 тыс. |
| Anthropic (Claude) | Fable 5 / Opus 5 / Sonnet 5 | 1 млн токенов | 128 тыс. |
| Anthropic (Claude) | Haiku 4.5 | 200 тыс. токенов | 64 тыс. |
| Google (Gemini) | Gemini 3.1 Pro | 1 048 576 токенов | 65 536 |
| DeepSeek | актуальная линейка | 1 млн токенов | — |
| xAI (Grok) | актуальная линейка | 500 тыс. токенов | — |
Чтобы перевести это в понятные величины: миллион токенов — это примерно 750 тысяч английских слов, то есть несколько толстых книг. На русском при нашем замере в 1,9 токена на слово — около 525 тысяч слов. Большие документы в такое окно помещаются целиком.
Разброс между моделями заметный, и он влияет на выбор под задачу: разобрать длинный договор или большой репозиторий кода имеет смысл на модели с окном в миллион токенов, а короткие однотипные запросы дешевле гонять на модели поменьше. В chad переключиться между ними можно в одном интерфейсе, не заводя отдельные подписки на каждого разработчика.
Почему большое контекстное окно не решает всё
Заполнить окно до краёв не значит получить лучший ответ. Работа «Lost in the Middle: How Language Models Use Long Contexts» (arXiv:2307.03172, авторы из Стэнфорда и Беркли, опубликована в TACL) показала: качество ответа зависит от того, где в длинном контексте лежит нужный факт. Информацию в начале и в конце модели находят надёжно, в середине — заметно хуже.
Из аннотации работы: качество существенно падает, когда нужный факт переставляют в другое место контекста — то есть модели не умеют устойчиво пользоваться всем, что попало в длинный контекст.
Есть и вторая причина не набивать окно: чем больше старого текста модель обрабатывает, тем выше шанс, что она зацепится за неактуальную деталь из начала переписки. Если задача сменилась, дешевле и точнее начать новый диалог, чем тянуть старый.
Почему у контекстного окна вообще есть предел
Логичный вопрос: если искусственный интеллект и так работает с текстом, почему нельзя сделать окно бесконечным?
Дело в механизме внимания — это способ, которым модель связывает слова между собой. Обрабатывая очередной токен, она сопоставляет его со всеми остальными токенами в окне: так искусственный интеллект понимает, к чему относится местоимение и какое слово в конце документа зависит от условия в начале.
Например, во фразе «загрузи договор и проверь, есть ли в нём пункт про неустойку» слово «нём» осмысленно только вместе со словом «договор». Чтобы удерживать такую связь, внимание должно сопоставить эти токены напрямую — и то же самое проделать для каждой пары токенов в окне.
Отсюда цена: число таких сопоставлений растёт не пропорционально длине текста, а примерно как её квадрат. Удвоили объём текста — вычислений стало вчетверо больше. Именно поэтому удерживать данные в контексте дорого, и именно поэтому разработчики продают длинный контекст отдельно, а не раздают его даром. Понимание этого снимает ожидание, что окно когда-нибудь станет бесконечным: удерживать в поле внимания миллион токенов уже дорого, а десять миллионов дороже не в десять раз, а в сто.
Понимание этой механики объясняет и два практических наблюдения. Первое: длинный запрос обрабатывается заметно дольше короткого. Второе: у моделей с большим окном ответ по длинному документу стоит дороже — не из-за жадности поставщика, а потому что вычислений действительно больше.
Что делать, если документы и данные не помещаются в окно
Задачи, где текста заведомо больше окна, решают не тем, что берут окно побольше, а тем, что меняют способ работы.
- Разбить на части. Большие документы обрабатываются по главам, а результаты собираются отдельным запросом: дешевле и надёжнее, чем грузить всё целиком.
- Сначала выжимка, потом работа. Модель делает краткое содержание каждого куска, а дальше работает с выжимками. Так в контекст помещается смысл десятка документов вместо одного полного.
- Поиск по базе знаний, подход RAG. Тексты заранее раскладываются в поисковый индекс, и на каждый вопрос в контекст подставляются только те фрагменты, которые к нему относятся. Схема RAG — стандартный ответ на вопрос «как научить нейросеть работать с гигабайтами данных»: в окно уезжает не вся база, а несколько нужных абзацев. Через API такой индекс собирают кодом, в готовых сервисах достаточно прикрепить файлы к рабочему пространству.
Общее правило простое: если при постоянном использовании нейросетей вы регулярно упираетесь в предел окна, менять надо не модель, а способ подачи данных.
Что происходит при выходе за лимит контекстного окна
Когда история перестаёт помещаться в окно, поведение зависит от того, как вы работаете с моделью.
В чате: модель забывает начало длинного диалога
В обычном чат-интерфейсе ошибки вы не увидите. Сервис сам приводит историю к размеру окна — как правило, отбрасывая самые старые сообщения или заменяя их сжатым пересказом.
Снаружи это выглядит как забывчивость: модель перестаёт помнить, что вы просили в самом начале, теряет заданный формат ответа, переспрашивает то, что уже обсуждали. Никакого сбоя при этом нет — просто начало разговора больше не входит в окно токенов.
Что с этим делать:
- начинать новый диалог под новую задачу, а не продолжать бесконечную ленту;
- перед сменой темы попросить модель сделать краткую выжимку договорённостей и перенести её в новый чат;
- важные постоянные факты держать в памяти сервиса, а не в истории переписки.
В API: длинный запрос возвращает ошибку
При работе через API поведение другое и более честное: если запрос вместе с историей не помещается в окно, он не выполняется, а возвращает ошибку. Молча ничего не отбрасывается — сокращать историю должен ваш код.
Для разработчика это удобнее: проблема видна сразу, а не проявляется странными ответами модели. Правило простое — считать объём до отправки и держать запас под ответ.
Как посчитать количество токенов заранее
Есть два способа, и выбирать между ними стоит по цене ошибки.
Грубая оценка по символам
Быстрая прикидка на глаз: разделить число символов на 4 для английского текста и на 3 для русского. По нашему замеру реальные значения — 5,33 и 4,04 символа на токен, так что такая оценка даёт запас в большую сторону. Для вопроса «влезет ли документ в окно» этого достаточно.
Ещё проще считать в словах: английское слово занимает примерно 1 токен, русское — около 2. Страница текста в 500 слов на русском даёт порядка тысячи токенов.
Точный подсчёт: Tokenizer и tiktoken
Когда важна точность, нужен настоящий токенизатор: при расчёте бюджета проекта или проверке лимита перед отправкой прикидки уже мало.
Tokenizer от OpenAI — веб-страница, куда можно вставить текст и увидеть и число токенов, и само разбиение. Это удобно, когда разбиение нужно увидеть глазами.
tiktoken — библиотека OpenAI для подсчёта в коде, тот самый быстрый BPE-токенизатор, которым мы делали замер выше. Справка рекомендует брать кодировку под конкретную модель через tiktoken.encodingformodel(), потому что у разных семейств моделей словари отличаются.
Важная оговорка: у Anthropic и Google свои токенизаторы, и число токенов для одного и того же текста у них не совпадёт с подсчётом tiktoken. Считать нужно тем инструментом, который соответствует модели.
Сколько это стоит в деньгах у разработчиков моделей
Формула у всех поставщиков одинаковая: расход = (входные токены × цена входа) + (выходные токены × цена выхода), обычно за миллион токенов.
Цены на 21 августа 2026 года по документации разработчиков, за миллион токенов:
| Модель | Вход | Выход |
|---|---|---|
| OpenAI GPT‑5.6 Sol | $5 | $30 |
| OpenAI GPT‑5.6 Terra | $2 | $12 |
| Anthropic Claude Fable 5 | $10 | $50 |
| Anthropic Claude Opus 5 | $5 | $25 |
| Anthropic Claude Sonnet 5 | $2 | $10 |
| Anthropic Claude Haiku 4.5 | $1 | $5 |
| xAI Grok | $2 | $6 |
Разброс между младшей и старшей моделью — десятикратный. Токены влияют не только на счёт, но и на скорость: чем их больше, тем дольше идёт ответ. Отсюда главный приём экономии, который работает лучше любой оптимизации промта: брать модель под задачу. Переписать письмо или составить список справится дешёвая модель; сложный анализ и код имеет смысл отдавать флагманской.
Для российского пользователя к этой арифметике добавляется отдельная сложность: оплатить API напрямую нельзя без зарубежной карты, а цены указаны в долларах.
Искры вместо токенов: как расход устроен в chad
В chad расход считается не в токенах, а во внутренней валюте — искрах. Это сделано ради понятности: искра привязана к слову, а не к фрагменту слова.
Базовая единица на странице тарифов: у оптимальной модели 1 искра = 1 обработанное или написанное нейросетью слово, то есть каждое слово, которое нейросеть прочитала или написала. У остальных моделей действует коэффициент — от 0,5 искры за слово у самых лёгких до 15 у самых тяжёлых. Проверять его нужно на /pricing в день использования: каталог моделей меняется.
Тарифы на 21 августа 2026 года:
| Тариф | Цена | Искр в месяц | Цена 1 000 искр |
|---|---|---|---|
| Мини | 290 ₽ / мес | 120 000 | 2,41 ₽ |
| Опти | 590 ₽ / мес | 300 000 | 1,96 ₽ |
| Плюс | 1 690 ₽ / мес | 900 000 | 1,87 ₽ |
Отдельно есть тариф для компаний, у которого искры не сгорают в конце месяца, и возможность докупать искры при активной подписке — сначала расходуются тарифные, потом купленные. Бесплатного тарифа нет, есть бесплатный тест.
Что именно списывается за один запрос
Примечание на странице тарифов формулирует правило прямо: учитываются слова текста запроса, слова ответа нейросети и слова контекста диалога.
Дополнительные детали оттуда же:
- слова длиннее 20 символов при подсчёте разбиваются на несколько слов до 20 символов каждое;
- если к запросу прикреплён файл, извлечённые из него слова считаются словами запроса и тратят искры;
- каждая картинка в контексте диалога расходует примерно 100–150 искр;
- распознавание изображения стоит от 100 до 3 600 искр в зависимости от модели, удаление фона — 6 400 искр за генерацию, распознавание текста с картинки — 1 000 искр.
Механика та же, что у токенов: платит не только то, что вы написали, но и весь разговор, который едет вместе с запросом. Только единица измерения понятнее — слово вместо трёх обрывков слова.
Как управлять расходом контекста и памяти
В отличие от токенов у поставщика модели, здесь у вас есть ручки:
- контекст можно отключить. Тогда каждый запрос уходит сам по себе, без истории; для разовых задач вроде «переведи абзац» это экономит заметно;
- лимит расхода искр на память настраивается. Вы задаёте, сколько сервису разрешено тратить на подкладывание сохранённых фактов;
- модель выбирается под задачу. Коэффициент от 0,5 до 15 означает тридцатикратную разницу в цене одного и того же запроса.
Как сократить расход токенов без потери качества ответа
Приёмы, которые дают эффект на задачах, решаемых с помощью нейросетей, а не создают его видимость:

- Разделяйте задачи по диалогам. Один чат под одну тему — самый действенный способ: он не даёт истории расти бесконечно и заодно улучшает ответы, потому что модель не отвлекается на старое.
- Формулируйте запрос точно с первого раза. Три уточняющих раунда обходятся дороже, чем один продуманный запрос: каждый раунд тащит за собой весь предыдущий контекст.
- Не прикладывайте большие документы целиком. Если нужен один раздел договора, отправьте раздел, а не договор целиком: вырезать нужное дешевле, чем платить за сорок страниц при каждом запросе.
- Просите ответ нужного объёма. «Ответь тремя пунктами» и «сделай выжимку на 5 предложений» ограничивают выходные токены, а они самые дорогие.
- Берите модель по весу задачи. Разница между лёгкой и флагманской моделью на простом запросе не видна, а в счёте она в разы заметнее.
- Держите системную инструкцию короткой. Если вы используете один и тот же большой шаблон для всех задач, половина требований к конкретному запросу не относится, но оплачивается при каждом обращении.
- Пишите повторяющиеся инструкции стабильно. Кэширование срабатывает на совпадающем начале запроса: если шаблон не меняется от вызова к вызову, его обработка может пойти по сниженной ставке.
Частые ошибки при работе с токенами и контекстом
- Считать, что токен равен слову. Даже на английском это ¾ слова, на русском — около половины.
- Мерить расход в символах. Один и тот же объём текста на разных языках даёт разное количество токенов; при нашем замере разница в 1,7 раза.
- Вести один бесконечный диалог. Самая дорогая привычка: каждое новое сообщение оплачивает всю переписку заново.
- Считать, что забывчивость модели — это сбой. Это работа механизма усечения: старые сообщения перестали помещаться в окно контекста.
- Ждать, что большое контекстное окно решит всё. Модель хуже находит информацию в середине длинного контекста, и это измеренный эффект, а не предположение.
- Забывать про токены рассуждений. Короткий ответ не гарантирует маленького расхода.
- Переносить цену одной модели на другую. У каждой свой токенизатор и свой тариф; тот же текст обойдётся по-разному.
Частые вопросы
Токен — это сколько слов?
Для английского один токен — примерно ¾ слова, для русского одно слово занимает в среднем около двух токенов. Точное число зависит от модели и самого слова.
Сколько токенов в странице текста?
Страница примерно в 500 слов на русском — порядка тысячи токенов. На английском та же страница уйдёт примерно в 670 токенов.
Что будет, если превысить лимит токенов?
Через API запрос вернёт ошибку и не выполнится. В чате сервис отбросит самые старые сообщения, и модель перестанет помнить начало разговора.
Как узнать точное количество токенов до отправки?
Через Tokenizer от OpenAI или библиотеку tiktoken — но считать нужно токенизатором той модели, к которой вы обращаетесь.
Тратятся ли токены, если ответ мне не понравился?
Да, расход происходит в момент генерации ответа. Поэтому точная формулировка запроса экономит больше, чем повторные попытки.
Влияет ли длина диалога на качество ответов?
Да, и не только через расход. Чем длиннее контекст, тем выше шанс, что модель зацепится за неактуальную деталь из начала переписки или не найдёт нужный факт в середине.
Чем контекстное окно отличается от памяти?
Окно задаёт технический предел одного диалога. Память — функция сервиса, которая переносит факты о вас между диалогами.
Что запомнить
Токен — это единица, которой искусственный интеллект измеряет текст, и одновременно единица тарификации. Токен не равен слову: для английского это примерно ¾ слова и 4 символа, для русского — около половины слова; в нашем замере на 12 парах фраз русский текст оказался дороже английского в 1,7 раза по токенам на слово.
Оплачиваются четыре категории: входные токены, выходные, кэшированные и токены рассуждений. Главный источник неожиданного расхода — контекст: вся переписка уходит модели заново с каждым запросом.
Контекстное окно — предел, за которым модель перестаёт видеть начало разговора. У актуальных на август 2026 года линеек это от 200 тысяч до миллиона с лишним токенов, но заполнять его до краёв не стоит: в середине длинного контекста модели ищут хуже.
Отсюда и способ экономить: делить задачи по диалогам, формулировать запрос точно, не прикладывать лишние файлы и выбирать модель по весу задачи. В chad всё это считается в искрах, то есть по словам, а не по фрагментам слов, и контекст с памятью настраиваются вручную. Попробовать можно бесплатно.
—
Ориентиры по токенизации приведены по справке OpenAI, размеры контекстных окон и цены — по документации разработчиков моделей, всё проверено 21 августа 2026 года. Замер соотношения русского и английского текста выполнен нами библиотекой tiktoken и является иллюстрацией, а не отраслевой нормой. Состав моделей, тарифы и коэффициенты искр уточняйте на странице тарифов — они меняются.