Токен (в нейросетях)
Токен — это кусочек текста, на который языковая модель внутри себя делит и запрос, и ответ при обработке. Не всегда целое слово: токеном может быть часть слова, знак препинания или пробел рядом с символом. Русский текст нарезается мельче, чем английский: большинство языковых моделей обучены преимущественно на английском, поэтому один русский слог нередко занимает больше одного токена. Конкретное устройство этой нарезки знать необязательно — важно понять, что именно токен является единицей измерения, в которой модель считает объём входящего и исходящего текста.
Для обычного пользователя токены важны в двух ситуациях. Первая — стоимость: в платных API, которые компании используют для встраивания ИИ в свои сервисы, запросы тарифицируются в токенах, а не в словах и не в символах. Вторая — ограничения по длине: у каждой модели есть лимит на суммарное количество токенов в запросе и ответе вместе. Для примерной оценки работает правило: один токен — это примерно 3–4 символа русского текста. Значит, страница текста около 2000 символов — это порядка 500–600 токенов.
Длинный промт с примерами и контекстом быстрее упирается в лимит, чем короткий вопрос. Если вы передаёте модели объёмный документ и добавляете к нему подробные инструкции — всё это входит в общий «бюджет» токенов. Когда лимит достигнут, сервис либо обрезает текст, либо отказывается обрабатывать запрос. Именно поэтому большой документ нередко приходится делить на части и обрабатывать порциями. О том, как лимит токенов связан с «памятью» модели в длинных диалогах, — в справке про контекстное окно.
Частая ошибка — думать, что лимит ограничивает только ответ. На самом деле он суммарный: модель удерживает вместе и весь запрос с историей переписки, и свой ответ. Чем длиннее накопившийся диалог, тем меньше места остаётся для нового ответа — и тем вероятнее, что модель «забудет» детали из начала разговора. Практический вывод: в длинных рабочих сессиях лучше начинать новый чат и коротко задавать контекст заново, а не тянуть одну бесконечную переписку. Как устроена эта «память» технически, объяснено в справке про большую языковую модель.
