Что такое токены в нейросети: как считается расход, контекстное окно и память диалога

Что такое токены в нейросети: как считается расход, контекстное окно и память диалога
21 августа 2026 — 18 мин

Вы отправили нейросети короткий вопрос, а счётчик списал заметно больше, чем вы ожидали. Или наоборот: диалог шёл нормально, а к сороковому сообщению модель начала путаться в том, о чём вы договорились в начале. Оба случая объясняются одним и тем же — тем, как языковые модели измеряют текст.

Разберём, что такое токены в нейросети, из чего складывается расход, что такое контекст в нейросети и почему у любой модели есть предел, после которого она перестаёт видеть начало разговора.

Что такое токены в нейросети простыми словами

Токен — это кусочек текста, которым оперирует искусственный интеллект. Не буква и не слово, а именно фрагмент: часть слова, целое слово, знак препинания или пробел.

Справка OpenAI «What are tokens and how to count them?» описывает это так: токены работают как строительные блоки текста, которые обрабатывают модели, и они бывают короткими, как один символ, и длинными, как целое слово, в зависимости от языка и контекста.

Искусственный интеллект не читает текст так, как читаете его вы. Модель получает последовательность номеров: каждый токен заменяется на число из словаря токенизатора, и дальше работа идёт с числами. Ответ строится тем же способом в обратную сторону — модель предсказывает следующий токен, потом следующий, и уже готовая цепочка собирается обратно в текст.

Это базовый принцип работы нейросетей, и отсюда следует то, ради чего вообще стоит знать это слово: токен — это единица тарификации. Разработчики моделей продают доступ по токенам, а не по символам, страницам или запросам. Поэтому вопрос «сколько это стоит» всегда сводится к вопросу «сколько там токенов».

Почему токен — это не слово и не символ

Самая частая ошибка — считать токен равным слову. Тогда 1 000 токенов кажутся тысячей слов, а на деле это в лучшем случае 750, а на русском — вдвое меньше.

Официальные ориентиры OpenAI даны для английского языка:

Ориентир Значение
1 токен ≈ 4 символа
1 токен ≈ ¾ слова
100 токенов ≈ 75 слов
1–2 предложения ≈ 30 токенов
1 абзац ≈ 100 токенов
~1 500 слов ≈ 2 048 токенов

Там же приведены живые примеры. Цитата «You miss 100% of the shots you don’t take» занимает 11 токенов, Устав OpenAI — 476 токенов, Декларация независимости США — 1 695 токенов.

Обратите внимание на оговорку самой справки: токенизация различается от модели к модели и от кодировки к кодировке. Эти числа — ориентир для прикидки, а не константа.

Как работает токенизация текста

При токенизации текст разбивается на токены по заранее обученному словарю. Современные нейросети используют алгоритм BPE (byte pair encoding): он начинает с отдельных байтов и постепенно склеивает самые частые пары в один токен. Чем чаще сочетание встречалось в обучающих данных, тем выше шанс, что оно стало отдельным токеном.

Поэтому частые английские слова занимают ровно один токен, а редкие и составные разваливаются на части. Вот как официальный токенизатор OpenAI (кодировка o200k_base, замер 21.08.2026) режет несколько слов:

Слово Разбиение Токенов
hello hello 1
context context 1
tokenization token + ization 2
привет пр + ивет 2
нейросеть ней + рос + еть 3
контекстное конт + екст + ное 3
токенизация т + ок + ен + изация 4

Разница видна сразу: английское context — один токен, русское «контекстное» — три.

Две колонки одинаковой высоты: левая собрана из трёх крупных ячеек, правая — из семи мелких

Кроме обычных токенов у моделей есть служебные. Ими модель размечает границы: где заканчивается системная инструкция, где начинается реплика пользователя, где ответ. Их вы не пишете и не видите, но они входят в объём запроса.

Почему русский текст расходует токены быстрее английского

Причина не в языке как таковом, а в том, на чём учили токенизатор. Словари собирались преимущественно на англоязычных корпусах, поэтому английские слова и морфемы попали в словарь целиком, а кириллица — обрывками. Добавляет и кодировка: в UTF‑8 латинская буква занимает один байт, кириллическая — два, а BPE работает именно с байтами.

Сколько это в числах, разработчики моделей официально не публикуют. Поэтому мы измерили сами: 12 пар предложений на русском и английском, официальная библиотека tiktoken 0.14.0, кодировка o200k_base, замер 21 августа 2026 года.

Показатель Русский Английский
Всего символов 775 720
Всего слов 101 120
Всего токенов 192 135
Символов на токен 4,04 5,33
Токенов на слово 1,90 1,12

По токенам на слово русский вышел дороже английского примерно в 1,7 раза.

Это наш замер на небольшой выборке, а не отраслевая норма: результат зависит от модели, темы и длины слов. Универсального множителя не существует — если вам нужна точность, проверьте свой текст в токенизаторе, о котором рассказываем ниже.

Одно следствие из этого стоит запомнить сразу: мерить объём текста в символах и делать вывод о расходе — неверно. Двадцать тысяч символов на русском и на английском дадут заметно разное количество токенов.

Токены в искусственном интеллекте и токены в криптовалюте — это разные вещи

Слово одно, смысла два, и поиск их постоянно смешивает.

В криптовалюте токен — это цифровой актив, запись в блокчейне, у которой есть стоимость и владелец. Его покупают, продают и хранят в кошельке.

В искусственном интеллекте токен ничего не стоит сам по себе и никому не принадлежит — это не актив. Это техническая единица, которой измеряют текст, вроде килобайта у файла. «Купить токены» в этом смысле означает оплатить объём обработки текста у поставщика модели, а не приобрести актив.

Дальше в статье речь только о втором значении.

Какие токены вы оплачиваете: входные, выходные, кэшированные и токены рассуждений

Справка OpenAI перечисляет четыре категории учёта, и в счёт попадают все четыре.

Входные токены — всё, что модель получила: ваш вопрос, системная инструкция, прикреплённый файл и вся предыдущая переписка.

Выходные токены — то, что модель написала в ответ. Обычно они дороже входных: у флагманской линейки OpenAI на 21.08.2026 это $5 за миллион входных против $30 за миллион выходных, у старшей модели Anthropic — $10 против $50.

Кэшированные токены — повторно использованная часть истории диалога. Если одна и та же длинная инструкция уходит в модель раз за разом, поставщик может не обрабатывать её заново, а взять из кэша по сниженной ставке.

Токены рассуждений — внутренние «шаги размышления» у тех систем искусственного интеллекта, которые умеют думать перед ответом. Эти токены влияют на счёт так же, как обычные. Вы их не видите: в чат приходит финальный текст. Но посчитаны и оплачены они будут.

Последняя категория — источник самых неожиданных счетов. Короткий ответ в три строки не означает маленького расхода, если модель перед этим построила длинную цепочку рассуждений.

Что такое контекст в нейросети и зачем модели история диалога

У искусственного интеллекта нет памяти в человеческом смысле. Нейросети сами по себе ничего не хранят между запросами: каждый вызов для модели — первый.

Иллюзию непрерывного разговора создаёт именно контекст. Что такое контекст в нейросети: это весь текст, который отправляется модели вместе с очередным запросом, чтобы она понимала, о чём идёт речь. Сервис просто подкладывает предыдущие сообщения к новому вопросу — и модель отвечает так, будто помнит разговор.

Отсюда неочевидная механика расхода: вся переписка отправляется заново с каждым сообщением. Пятидесятая реплика в длинном диалоге стоит дороже первой, даже если состоит из одного слова, потому что вместе с ней уезжают все сорок девять предыдущих.

Что входит в контекст: запрос, ответ, системные инструкции и файлы

В контекст диалога попадает больше, чем видно на экране:

  • системная инструкция сервиса: правила, по которым модель себя ведёт, заданные до вас;
  • ваши сообщения с начала диалога;
  • ответы модели на них;
  • содержимое прикреплённых файлов — документ на сорок страниц превращается в десятки тысяч входных токенов;
  • результаты веб-поиска и работы инструментов, если они включены;
  • описания самих инструментов, доступных модели.

Именно поэтому «я же написал всего одну строчку» и «списалось много» — не противоречие.

Чем контекст отличается от памяти нейросети

Эти два слова часто путают, а устроены они по-разному.

Контекст живёт внутри одного диалога и исчезает вместе с ним. Начали новый чат — и контекст снова пуст.

Память — отдельная функция сервиса, которая сохраняет факты о вас между диалогами: имя, профессию, предпочтения, рабочие детали. Технически она устроена так же: сохранённые заметки подкладываются в контекст при каждом запросе. Но управляется память отдельно, и её можно посмотреть, отредактировать и отключить.

Практический вывод: если модель «помнит» лишнее из старых разговоров, чистить нужно память. Если она забыла начало текущего разговора, дело в контекстном окне.

Что такое контекстное окно и в чём измеряется его размер

Контекстное окно нейросети — это максимальный объём текста, который нейросеть видит за один раз и способна обработать за один вызов. Измеряется в токенах, а не в символах или страницах.

Размер контекстного окна считается целиком: в него входят системная инструкция, вся история, ваш новый запрос и место под ответ. Если окно — миллион токенов, а история заняла 990 тысяч, на ответ останется десять тысяч, и длинный текст модель просто не допишет.

Ещё одна деталь, о которой редко говорят: у большинства моделей отдельно ограничен объём ответа. Окно на миллион токенов не означает, что модель напишет вам книгу за один запрос.

Переполненный контейнер: карточки-сообщения плотно уложены внутри, две верхние вылетают через открытый край наружу

Контекстное окно ChatGPT, Claude и Gemini: сравнение на август 2026

Числа ниже сняты 21 августа 2026 года прямо из документации разработчиков. Ниша меняется быстро — перед тем как опираться на конкретную цифру, проверьте её у вендора.

Разработчик Линейка на 21.08.2026 Контекстное окно Максимум ответа
OpenAI (ChatGPT) GPT‑5.6 Sol / Terra / Luna 1,05 млн токенов 128 тыс.
Anthropic (Claude) Fable 5 / Opus 5 / Sonnet 5 1 млн токенов 128 тыс.
Anthropic (Claude) Haiku 4.5 200 тыс. токенов 64 тыс.
Google (Gemini) Gemini 3.1 Pro 1 048 576 токенов 65 536
DeepSeek актуальная линейка 1 млн токенов
xAI (Grok) актуальная линейка 500 тыс. токенов

Чтобы перевести это в понятные величины: миллион токенов — это примерно 750 тысяч английских слов, то есть несколько толстых книг. На русском при нашем замере в 1,9 токена на слово — около 525 тысяч слов. Большие документы в такое окно помещаются целиком.

Разброс между моделями заметный, и он влияет на выбор под задачу: разобрать длинный договор или большой репозиторий кода имеет смысл на модели с окном в миллион токенов, а короткие однотипные запросы дешевле гонять на модели поменьше. В chad переключиться между ними можно в одном интерфейсе, не заводя отдельные подписки на каждого разработчика.

Почему большое контекстное окно не решает всё

Заполнить окно до краёв не значит получить лучший ответ. Работа «Lost in the Middle: How Language Models Use Long Contexts» (arXiv:2307.03172, авторы из Стэнфорда и Беркли, опубликована в TACL) показала: качество ответа зависит от того, где в длинном контексте лежит нужный факт. Информацию в начале и в конце модели находят надёжно, в середине — заметно хуже.

Из аннотации работы: качество существенно падает, когда нужный факт переставляют в другое место контекста — то есть модели не умеют устойчиво пользоваться всем, что попало в длинный контекст.

Есть и вторая причина не набивать окно: чем больше старого текста модель обрабатывает, тем выше шанс, что она зацепится за неактуальную деталь из начала переписки. Если задача сменилась, дешевле и точнее начать новый диалог, чем тянуть старый.

Почему у контекстного окна вообще есть предел

Логичный вопрос: если искусственный интеллект и так работает с текстом, почему нельзя сделать окно бесконечным?

Дело в механизме внимания — это способ, которым модель связывает слова между собой. Обрабатывая очередной токен, она сопоставляет его со всеми остальными токенами в окне: так искусственный интеллект понимает, к чему относится местоимение и какое слово в конце документа зависит от условия в начале.

Например, во фразе «загрузи договор и проверь, есть ли в нём пункт про неустойку» слово «нём» осмысленно только вместе со словом «договор». Чтобы удерживать такую связь, внимание должно сопоставить эти токены напрямую — и то же самое проделать для каждой пары токенов в окне.

Отсюда цена: число таких сопоставлений растёт не пропорционально длине текста, а примерно как её квадрат. Удвоили объём текста — вычислений стало вчетверо больше. Именно поэтому удерживать данные в контексте дорого, и именно поэтому разработчики продают длинный контекст отдельно, а не раздают его даром. Понимание этого снимает ожидание, что окно когда-нибудь станет бесконечным: удерживать в поле внимания миллион токенов уже дорого, а десять миллионов дороже не в десять раз, а в сто.

Понимание этой механики объясняет и два практических наблюдения. Первое: длинный запрос обрабатывается заметно дольше короткого. Второе: у моделей с большим окном ответ по длинному документу стоит дороже — не из-за жадности поставщика, а потому что вычислений действительно больше.

Что делать, если документы и данные не помещаются в окно

Задачи, где текста заведомо больше окна, решают не тем, что берут окно побольше, а тем, что меняют способ работы.

  • Разбить на части. Большие документы обрабатываются по главам, а результаты собираются отдельным запросом: дешевле и надёжнее, чем грузить всё целиком.
  • Сначала выжимка, потом работа. Модель делает краткое содержание каждого куска, а дальше работает с выжимками. Так в контекст помещается смысл десятка документов вместо одного полного.
  • Поиск по базе знаний, подход RAG. Тексты заранее раскладываются в поисковый индекс, и на каждый вопрос в контекст подставляются только те фрагменты, которые к нему относятся. Схема RAG — стандартный ответ на вопрос «как научить нейросеть работать с гигабайтами данных»: в окно уезжает не вся база, а несколько нужных абзацев. Через API такой индекс собирают кодом, в готовых сервисах достаточно прикрепить файлы к рабочему пространству.

Общее правило простое: если при постоянном использовании нейросетей вы регулярно упираетесь в предел окна, менять надо не модель, а способ подачи данных.

Что происходит при выходе за лимит контекстного окна

Когда история перестаёт помещаться в окно, поведение зависит от того, как вы работаете с моделью.

В чате: модель забывает начало длинного диалога

В обычном чат-интерфейсе ошибки вы не увидите. Сервис сам приводит историю к размеру окна — как правило, отбрасывая самые старые сообщения или заменяя их сжатым пересказом.

Снаружи это выглядит как забывчивость: модель перестаёт помнить, что вы просили в самом начале, теряет заданный формат ответа, переспрашивает то, что уже обсуждали. Никакого сбоя при этом нет — просто начало разговора больше не входит в окно токенов.

Что с этим делать:

  • начинать новый диалог под новую задачу, а не продолжать бесконечную ленту;
  • перед сменой темы попросить модель сделать краткую выжимку договорённостей и перенести её в новый чат;
  • важные постоянные факты держать в памяти сервиса, а не в истории переписки.

В API: длинный запрос возвращает ошибку

При работе через API поведение другое и более честное: если запрос вместе с историей не помещается в окно, он не выполняется, а возвращает ошибку. Молча ничего не отбрасывается — сокращать историю должен ваш код.

Для разработчика это удобнее: проблема видна сразу, а не проявляется странными ответами модели. Правило простое — считать объём до отправки и держать запас под ответ.

Как посчитать количество токенов заранее

Есть два способа, и выбирать между ними стоит по цене ошибки.

Грубая оценка по символам

Быстрая прикидка на глаз: разделить число символов на 4 для английского текста и на 3 для русского. По нашему замеру реальные значения — 5,33 и 4,04 символа на токен, так что такая оценка даёт запас в большую сторону. Для вопроса «влезет ли документ в окно» этого достаточно.

Ещё проще считать в словах: английское слово занимает примерно 1 токен, русское — около 2. Страница текста в 500 слов на русском даёт порядка тысячи токенов.

Точный подсчёт: Tokenizer и tiktoken

Когда важна точность, нужен настоящий токенизатор: при расчёте бюджета проекта или проверке лимита перед отправкой прикидки уже мало.

Tokenizer от OpenAI — веб-страница, куда можно вставить текст и увидеть и число токенов, и само разбиение. Это удобно, когда разбиение нужно увидеть глазами.

tiktoken — библиотека OpenAI для подсчёта в коде, тот самый быстрый BPE-токенизатор, которым мы делали замер выше. Справка рекомендует брать кодировку под конкретную модель через tiktoken.encodingformodel(), потому что у разных семейств моделей словари отличаются.

Важная оговорка: у Anthropic и Google свои токенизаторы, и число токенов для одного и того же текста у них не совпадёт с подсчётом tiktoken. Считать нужно тем инструментом, который соответствует модели.

Сколько это стоит в деньгах у разработчиков моделей

Формула у всех поставщиков одинаковая: расход = (входные токены × цена входа) + (выходные токены × цена выхода), обычно за миллион токенов.

Цены на 21 августа 2026 года по документации разработчиков, за миллион токенов:

Модель Вход Выход
OpenAI GPT‑5.6 Sol $5 $30
OpenAI GPT‑5.6 Terra $2 $12
Anthropic Claude Fable 5 $10 $50
Anthropic Claude Opus 5 $5 $25
Anthropic Claude Sonnet 5 $2 $10
Anthropic Claude Haiku 4.5 $1 $5
xAI Grok $2 $6

Разброс между младшей и старшей моделью — десятикратный. Токены влияют не только на счёт, но и на скорость: чем их больше, тем дольше идёт ответ. Отсюда главный приём экономии, который работает лучше любой оптимизации промта: брать модель под задачу. Переписать письмо или составить список справится дешёвая модель; сложный анализ и код имеет смысл отдавать флагманской.

Для российского пользователя к этой арифметике добавляется отдельная сложность: оплатить API напрямую нельзя без зарубежной карты, а цены указаны в долларах.

Искры вместо токенов: как расход устроен в chad

В chad расход считается не в токенах, а во внутренней валюте — искрах. Это сделано ради понятности: искра привязана к слову, а не к фрагменту слова.

Базовая единица на странице тарифов: у оптимальной модели 1 искра = 1 обработанное или написанное нейросетью слово, то есть каждое слово, которое нейросеть прочитала или написала. У остальных моделей действует коэффициент — от 0,5 искры за слово у самых лёгких до 15 у самых тяжёлых. Проверять его нужно на /pricing в день использования: каталог моделей меняется.

Тарифы на 21 августа 2026 года:

Тариф Цена Искр в месяц Цена 1 000 искр
Мини 290 ₽ / мес 120 000 2,41 ₽
Опти 590 ₽ / мес 300 000 1,96 ₽
Плюс 1 690 ₽ / мес 900 000 1,87 ₽

Отдельно есть тариф для компаний, у которого искры не сгорают в конце месяца, и возможность докупать искры при активной подписке — сначала расходуются тарифные, потом купленные. Бесплатного тарифа нет, есть бесплатный тест.

Что именно списывается за один запрос

Примечание на странице тарифов формулирует правило прямо: учитываются слова текста запроса, слова ответа нейросети и слова контекста диалога.

Дополнительные детали оттуда же:

  • слова длиннее 20 символов при подсчёте разбиваются на несколько слов до 20 символов каждое;
  • если к запросу прикреплён файл, извлечённые из него слова считаются словами запроса и тратят искры;
  • каждая картинка в контексте диалога расходует примерно 100–150 искр;
  • распознавание изображения стоит от 100 до 3 600 искр в зависимости от модели, удаление фона — 6 400 искр за генерацию, распознавание текста с картинки — 1 000 искр.

Механика та же, что у токенов: платит не только то, что вы написали, но и весь разговор, который едет вместе с запросом. Только единица измерения понятнее — слово вместо трёх обрывков слова.

Как управлять расходом контекста и памяти

В отличие от токенов у поставщика модели, здесь у вас есть ручки:

  • контекст можно отключить. Тогда каждый запрос уходит сам по себе, без истории; для разовых задач вроде «переведи абзац» это экономит заметно;
  • лимит расхода искр на память настраивается. Вы задаёте, сколько сервису разрешено тратить на подкладывание сохранённых фактов;
  • модель выбирается под задачу. Коэффициент от 0,5 до 15 означает тридцатикратную разницу в цене одного и того же запроса.

Как сократить расход токенов без потери качества ответа

Приёмы, которые дают эффект на задачах, решаемых с помощью нейросетей, а не создают его видимость:

Кольцевая диаграмма расхода, из которой вынут и отложен в сторону один крупный сектор, рядом карточка с ползунками
  • Разделяйте задачи по диалогам. Один чат под одну тему — самый действенный способ: он не даёт истории расти бесконечно и заодно улучшает ответы, потому что модель не отвлекается на старое.
  • Формулируйте запрос точно с первого раза. Три уточняющих раунда обходятся дороже, чем один продуманный запрос: каждый раунд тащит за собой весь предыдущий контекст.
  • Не прикладывайте большие документы целиком. Если нужен один раздел договора, отправьте раздел, а не договор целиком: вырезать нужное дешевле, чем платить за сорок страниц при каждом запросе.
  • Просите ответ нужного объёма. «Ответь тремя пунктами» и «сделай выжимку на 5 предложений» ограничивают выходные токены, а они самые дорогие.
  • Берите модель по весу задачи. Разница между лёгкой и флагманской моделью на простом запросе не видна, а в счёте она в разы заметнее.
  • Держите системную инструкцию короткой. Если вы используете один и тот же большой шаблон для всех задач, половина требований к конкретному запросу не относится, но оплачивается при каждом обращении.
  • Пишите повторяющиеся инструкции стабильно. Кэширование срабатывает на совпадающем начале запроса: если шаблон не меняется от вызова к вызову, его обработка может пойти по сниженной ставке.

Частые ошибки при работе с токенами и контекстом

  • Считать, что токен равен слову. Даже на английском это ¾ слова, на русском — около половины.
  • Мерить расход в символах. Один и тот же объём текста на разных языках даёт разное количество токенов; при нашем замере разница в 1,7 раза.
  • Вести один бесконечный диалог. Самая дорогая привычка: каждое новое сообщение оплачивает всю переписку заново.
  • Считать, что забывчивость модели — это сбой. Это работа механизма усечения: старые сообщения перестали помещаться в окно контекста.
  • Ждать, что большое контекстное окно решит всё. Модель хуже находит информацию в середине длинного контекста, и это измеренный эффект, а не предположение.
  • Забывать про токены рассуждений. Короткий ответ не гарантирует маленького расхода.
  • Переносить цену одной модели на другую. У каждой свой токенизатор и свой тариф; тот же текст обойдётся по-разному.

Частые вопросы

Токен — это сколько слов?
Для английского один токен — примерно ¾ слова, для русского одно слово занимает в среднем около двух токенов. Точное число зависит от модели и самого слова.

Сколько токенов в странице текста?
Страница примерно в 500 слов на русском — порядка тысячи токенов. На английском та же страница уйдёт примерно в 670 токенов.

Что будет, если превысить лимит токенов?
Через API запрос вернёт ошибку и не выполнится. В чате сервис отбросит самые старые сообщения, и модель перестанет помнить начало разговора.

Как узнать точное количество токенов до отправки?
Через Tokenizer от OpenAI или библиотеку tiktoken — но считать нужно токенизатором той модели, к которой вы обращаетесь.

Тратятся ли токены, если ответ мне не понравился?
Да, расход происходит в момент генерации ответа. Поэтому точная формулировка запроса экономит больше, чем повторные попытки.

Влияет ли длина диалога на качество ответов?
Да, и не только через расход. Чем длиннее контекст, тем выше шанс, что модель зацепится за неактуальную деталь из начала переписки или не найдёт нужный факт в середине.

Чем контекстное окно отличается от памяти?
Окно задаёт технический предел одного диалога. Память — функция сервиса, которая переносит факты о вас между диалогами.

Что запомнить

Токен — это единица, которой искусственный интеллект измеряет текст, и одновременно единица тарификации. Токен не равен слову: для английского это примерно ¾ слова и 4 символа, для русского — около половины слова; в нашем замере на 12 парах фраз русский текст оказался дороже английского в 1,7 раза по токенам на слово.

Оплачиваются четыре категории: входные токены, выходные, кэшированные и токены рассуждений. Главный источник неожиданного расхода — контекст: вся переписка уходит модели заново с каждым запросом.

Контекстное окно — предел, за которым модель перестаёт видеть начало разговора. У актуальных на август 2026 года линеек это от 200 тысяч до миллиона с лишним токенов, но заполнять его до краёв не стоит: в середине длинного контекста модели ищут хуже.

Отсюда и способ экономить: делить задачи по диалогам, формулировать запрос точно, не прикладывать лишние файлы и выбирать модель по весу задачи. В chad всё это считается в искрах, то есть по словам, а не по фрагментам слов, и контекст с памятью настраиваются вручную. Попробовать можно бесплатно.

Ориентиры по токенизации приведены по справке OpenAI, размеры контекстных окон и цены — по документации разработчиков моделей, всё проверено 21 августа 2026 года. Замер соотношения русского и английского текста выполнен нами библиотекой tiktoken и является иллюстрацией, а не отраслевой нормой. Состав моделей, тарифы и коэффициенты искр уточняйте на странице тарифов — они меняются.

Алексей Крайнов
Алексей Крайнов
В этой статье: