Архивный авторский материал перенесён без переписывания. Внешние утверждения отдельно не перепроверялись и относятся к дате публикации.
Контекстное окно или почему LLM забывает о чем вы ей рассказывал
Представьте примерно через 100 сообщений LLM начинает тупить и забывать детали, которыми вы с ней уже делились.
Поздравляю - вы вылетели за пределы контекстного окна.
Контекстное окно LLM - это не количество слов и не число сообщений.
Это фиксированное количество токенов - единиц, на которые разбивается весь ввод и контекст.
Контекстные окна бывают разного размера.
Реальный лимит зависит от конкретной модели.
И поверьте, он заканчивается гораздо быстрее, чем вы ожидаете.
Что реально содержится в контекстном окне:
-
системный промт - то, что заложили разработчики до вас
-
вся история сообщений и взаимодействий
-
текущий запрос
-
текущий ответ
-
если это AI-агент или инструмент - ещё и системные команды и тулзы, которые вы вообще не видите
Всё это - токены.
И когда лимит выбит, старый контекст вытесняется.
Признаки переполнения:
-
ответ обрывается на полуслове
-
модель «забывает» ранее указанные детали
-
переспрашивает то, что уже было явно сказано
Как технологии пытаются это лечить:
Современные инструменты сжимают старую историю.
Но тут подвох.
При саммаризации:
-
теряются логические связи
-
пропадает хронология изменений
-
стираются нюансы решений
Короче - умирает линия повествования.
Остаётся пересказ, а не контекст.
Что делать на практике:
Саммаризировать историю самостоятельно, фиксируя ключевые логические и исторические точки.
И открывать новое контекстное окно - по-простому, новый чат с полным резюме предыдущего.
Каждый файл.
Каждый вопрос.
Каждое уточнение.
Агрессивно жрут контекстное окно.
LLM - это не долговременное хранилище знаний.
Это оперативная память, работающая в максимально актуальном контексте.
Чем лучше вы понимаете, что у неё под капотом -
тем сильнее и чище ваш опыт взаимодействия.
Источники и след
- 01 Оригинал в канале Under the Hood Происхождение / Telegram / сообщение 32