Векторные представления связывают входные идентификаторы с вычислениями модели, а токенизатор определяет, какие идентификаторы получит текст. Совпадение размера весов или семейства модели не заменяет согласование словаря.
Почему это важно
Лимит контекста и объём работы задаются токенами, а не строками интерфейса. Несогласованный токенизатор меняет вход модели; приблизительное отношение слов к токенам не даёт надёжной проверки, поместится ли реальный запрос после шаблона чата.
Что подтверждено
Модель получает идентификаторы токенов с определённым соответствием словарю и векторным представлениям. Поэтому токенизатор загружают как согласованную часть артефакта: другой словарь или набор специальных идентификаторов может изменить смысл входа, даже если исходная строка выглядит одинаково.
Граница применимости: Связь словаря субслов, модельных векторных представлений и входных идентификаторов; проверяют точный токенизатор и конфигурацию, не только название семейства.
Токенизация на основе субслов может разбить одно слово на несколько единиц, а разные написания и языки — дать разную сегментацию. Универсальное правило «одно слово равно одному токену» или постоянный коэффициент слов для всех входов не следует из устройства токенизатора.
Граница применимости: Подходы на основе BPE и субслов; не утверждается, что любая модель применяет именно BPE или одинаковые правила предварительной обработки.
В работе о BPE для машинного перевода набор слияний строится по обучающему тексту, постепенно объединяя частые пары единиц. Конкретный словарь и правила слияния определяют последующую сегментацию; одно имя алгоритма BPE не задаёт готовое соответствие текста идентификаторам токенов.
Граница применимости: Алгоритм Sennrich, Haddow, Birch 2016; побайтовый BPE и другие современные варианты не объявляются тождественными исходной реализации.
Вход модели может включать специальные токены и служебные разделители сверх пользовательских слов. BOS/EOS и формат ролей учитывают так, как их добавляет конкретный токенизатор и шаблон; повторное ручное добавление уже вставленного BOS способно изменить фактический вход и его длину.
Граница применимости: Шаблоны чата Transformers 4.44.2 и точный артефакт запуска; не предполагается, что каждый токенизатор автоматически добавляет все специальные токены.
Для проверки контекстного лимита сначала формируют полный вход с историей и служебными частями, затем считают идентификаторы токенов действующим токенизатором. Оценка по символам, словам или токенизатору другой модели не является доказательством допустимой длины запроса.
Граница применимости: Бюджет входа и зарезервированного продолжения в decoder-only модели; точный подсчёт выполняют тем же токенизатором и шаблоном, что использует сервер.
Усечение до допустимого числа токенов меняет сам вход: удалённые инструкции или история больше не участвуют в вычислении. Поэтому успешное помещение усечённого массива идентификаторов в лимит не доказывает сохранение смысла первоначального задания.
Граница применимости: Обрезка токенизированного входа перед генерацией; политика выбора удаляемой части определяется приложением и должна быть видимой при проверке.
Числовой идентификатор токена имеет значение только в соответствующем словаре. Нельзя передать последовательность идентификаторов другой модели с её токенизатором как эквивалент исходного текста без проверки отображения; совпадение числа токенов тоже не доказывает совпадение сегментации или входа.
Граница применимости: Разные словари и артефакты; совместимость специально согласованных токенизаторов допустима, но устанавливается отдельно.
Не путать
Токенизатор задаёт фактическую последовательность входных токенов, контекстное окно ограничивает допустимый сценарий их использования. Словесная длина запроса не позволяет доказать соблюдение этого лимита.
Токенизатор — часть согласованного артефакта запуска вместе с весами и конфигурацией. Копия одних весов без правил сегментации и специальных токенов может не воспроизвести исходный вход.
Что проверить
- Зафиксируйте точный токенизатор, словарь, правила и идентификаторы специальных токенов.
- Сверьте токенизатор с конфигурацией и векторными представлениями именно выбранной модели.
- Сформируйте вход с историей, ролями и служебными разделителями до подсчёта.
- Проверьте, кто добавляет BOS/EOS, чтобы не вставить их второй раз.
- Считайте реальные идентификаторы токенов; коэффициент слов используйте только как предварительную оценку.
- Сделайте политику усечения явной и проверьте сохранение нужных инструкций.
- Не переносите массив идентификаторов между разными артефактами по совпадению длины.
Первоисточники
Neural Machine Translation of Rare Words with Subword Units
Rico Sennrich, Barry Haddow, Alexandra Birch · ACL Anthology, ACL 2016, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникAttention Is All You Need
Ashish Vaswani и соавторы · arXiv:1706.03762, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникTransformers 4.44.2: Generation
Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточникTransformers 4.44.2: Chat templates
Hugging Face · документация Hugging Face Transformers v4.44.2, страница открыта 7 сентября 2026 года
Открыт редактором 7 сентября 2026 года, заголовок документа сверен.
Открыть первоисточник