Статус материала

Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.

Почему LLM-сети типа ChatGPT лучше работают на английском, чем на русском

Ключевая причина - токенизация.
Для человека логическая единица - слово. Для модели - токен.

Чтобы получить токены, текст прогоняется через токенайзер, который разбивает слова и символы на подстроки и сопоставляет им числовые идентификаторы.

Модели обучены преимущественно на английском языке, потому что именно на нём представлены большие, качественные и структурированные массивы данных. Дополнительно английский язык проще с точки зрения токенизации: слова короче, морфология беднее, больше повторяющихся корней, отсутствуют падежи. В результате английские слова чаще кодируются от 1 до 2 токенов, тогда как русские от 4 до 6.

Далее вступает в работу механизм внимания (attention), который параллельно распределяет веса между токенами и строит связи. В фразе «у меня сломалась моя старая тойота» человеку очевидно, что сломалась машина, а не я или абстрактный объект. Модель же должна распределить внимание между всеми токенами, чтобы прийти к тому же выводу.

Attention имеет квадратичную вычислительную сложность по числу токенов. Итого: больше токенов → больше связей → выше вычислительная нагрузка и больше шума.
Меньше токенов - дешевле, стабильнее и точнее обработка.

Это не вопрос языка. Это вопрос математики находящейся под капотом.

Источники и след

  1. 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 31