Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.
Почему LLM-сети типа ChatGPT лучше работают на английском, чем на русском
Ключевая причина - токенизация.
Для человека логическая единица - слово. Для модели - токен.
Чтобы получить токены, текст прогоняется через токенайзер, который разбивает слова и символы на подстроки и сопоставляет им числовые идентификаторы.
Модели обучены преимущественно на английском языке, потому что именно на нём представлены большие, качественные и структурированные массивы данных. Дополнительно английский язык проще с точки зрения токенизации: слова короче, морфология беднее, больше повторяющихся корней, отсутствуют падежи. В результате английские слова чаще кодируются от 1 до 2 токенов, тогда как русские от 4 до 6.
Далее вступает в работу механизм внимания (attention), который параллельно распределяет веса между токенами и строит связи. В фразе «у меня сломалась моя старая тойота» человеку очевидно, что сломалась машина, а не я или абстрактный объект. Модель же должна распределить внимание между всеми токенами, чтобы прийти к тому же выводу.
Attention имеет квадратичную вычислительную сложность по числу токенов. Итого: больше токенов → больше связей → выше вычислительная нагрузка и больше шума.
Меньше токенов - дешевле, стабильнее и точнее обработка.
Это не вопрос языка. Это вопрос математики находящейся под капотом.
Источники и след
- 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 31