/
Текст
Теория информации для машинного
обучения
От энтропии и кодирования до NLP, LLM, компьютерного зрения и
обучения с подкреплением
Влад Куликов
Открытая редакция · 2026
Публикация и лицензия
Эта открытая редакция содержит только тексты лекций и иллюстрации. Тесты, упражнения, решения, ноутбуки,
проекты и материалы оценивания не входят в данное издание.
Авторское право © 2026 Влад Куликов.
Тексты и иллюстрации курса: CC BY-NC-SA 4.0.
Инструменты публикации: Apache-2.0.
Сайт открытого курса: https://vladgkulikov.github.io/
Полный курс на Stepik: https://stepik.org/295411
Исходный код: https://github.com/VladGKulikov/open-courses
Редакция 2026.1 · 2026-08-10
Содержание
Модуль 1. Введение
1.1. Информация и смысл: почему это не одно и то же . . . . . . . . . . . . . . . . . . . . .
1.2. Шенноновский фрейм: сила и ограничения . . . . . . . . . . . . . . . . . . . . . . . . .
1.3. Почему появляется логарифм: короткий мост к энтропии . . . . . . . . . . . . . . . . .
1.4. Как устроен курс и как его читать . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.5. Обзор программы курса . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.6. Литература: с чего начинать . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
1.7. Справочная заметка: convex / concave (выпуклая / вогнутая функция) . . . . . . . . . .
1.8. Справочник: подробная программа курса . . . . . . . . . . . . . . . . . . . . . . . . . .
1.9. Справочник: полный аннотированный список литературы . . . . . . . . . . . . . . . .
1.10. Факультативное математическое углубление I: равномерный источник . . . . . . . .
1.11. Факультативное математическое углубление II: от группировки к формуле Шеннона
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
1
1
2
3
5
6
7
8
9
14
16
17
Модуль 2. Энтропия
2.1. Энтропия: средний счёт за неопределённость . . .
2.2. Цепное правило: как разбить один счёт на токены
2.3. От монеты к языку: энтропийная скорость . . . . .
2.4. Как читать энтропию языковой модели . . . . . .
2.6. Литература и первоисточники . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
21
21
24
27
30
34
Модуль 3. Кросс-энтропия и KL-дивергенция
3.1. Модель отвечает распределением, мир — одним исходом . . . . . .
3.2. Кросс-энтропия: средний счёт по вероятностям модели . . . . . . .
3.3. KL-дивергенция: часть потери, за которую отвечает модель . . . . .
3.4. Чужой код: как KL превращается в лишние биты . . . . . . . . . . .
3.5. Одна формула для классификации и языковой модели . . . . . . .
3.6. Почему CrossEntropyLoss так удобно оптимизировать . . . . . . .
3.7. Перплексия: возврат из логарифмической шкалы . . . . . . . . . .
3.8. Математическое углубление: почему направление KL меняет ответ
3.9. Карта KL-целевых функций в ML . . . . . . . . . . . . . . . . . . . .
3.11. Литература и первоисточники . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
35
35
36
37
40
42
43
45
47
49
51
Модуль 4. Неравенство Йенсена: когда среднее встречает нелинейность
4.1. Сначала усреднить или сначала посчитать функцию потерь? . . . . . . . . .
4.2. Неравенство Йенсена: направление задаёт кривизна . . . . . . . . . . . . .
4.3. Ансамбли: точная гарантия для log-loss . . . . . . . . . . . . . . . . . . . . .
4.4. ELBO: логарифм стоит снаружи скрытых объяснений . . . . . . . . . . . . .
4.5. Log-sum inequality: что теряется при объединении состояний . . . . . . . . .
4.6. Одна теорема — четыре рабочих механизма . . . . . . . . . . . . . . . . . . .
4.7. Ключевые выводы модуля . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
4.9. Литература и первоисточники . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
52
52
53
56
59
62
65
65
66
Модуль 5. Взаимная информация: сколько один объект говорит о другом
5.1. Признак полезен не сам по себе . . . . . . . . . . . . . . . . . . . . . . . . . . . .
5.2. Одна величина — три чтения . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
5.3. PMI: локальный логарифм связи . . . . . . . . . . . . . . . . . . . . . . . . . . .
5.4. Условная MI: что новый признак добавляет сверх известных . . . . . . . . . . .
5.5. DPI: энкодер может перепаковать информацию, но не напечатать новые биты
5.6. MI, корреляция и причинность отвечают на разные вопросы . . . . . . . . . . .
5.7. Шумные метки: когда 100% ошибок всё ещё несут один бит . . . . . . . . . . . .
5.8. Отбор признаков: полезный фильтр, но не оракул . . . . . . . . . . . . . . . . .
5.9. InfoNCE: найти согласованную пару среди случайных . . . . . . . . . . . . . . .
5.10. Почему число MI трудно получить из выборки . . . . . . . . . . . . . . . . . . .
5.11. Энтропия attention — не взаимная информация . . . . . . . . . . . . . . . . . .
5.12. Ключевые выводы модуля . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
5.14. Источники и дальнейшее чтение . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
67
67
69
71
71
72
75
76
78
78
80
81
82
83
Модуль 6. Кодирование источника: от энтропии к реальным битам
6.1. Инженерная постановка: вероятностная модель и энтропийный кодер . . . . . . . . . . . . . . . . . . . . . . . .
6.2. Префиксные коды и неравенство Крафта—Макмиллана . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
84
84
86
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
iii
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
Теория информации для машинного обучения
6.3. Односимвольная теорема кодирования . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
6.4. Хаффман, арифметическое кодирование и кодирование диапазонов . . . . . . . . . . . . . . . . . . . . . . . .
6.5. Длинные последовательности: блочное кодирование, AEP и энтропийная скорость . . . . . . . . . . . . . . .
6.6. Метрики языковой модели: PPL, BPC и BPB . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
6.7. Языковая модель как часть компрессора . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
6.8. Размер модели, законы масштабирования и полная длина описания . . . . . . . . . . . . . . . . . . . . . . . .
6.9. Математическое углубление: универсальное кодирование, последовательная логарифмическая потеря и ICL
6.10. Связь качества сжатия и возможностей модели . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
6.11. Практический протокол оценки LLM как компрессора . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
6.13. Заключение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Модуль 7. Канал и пропускная способность
7.1. Надёжная передача через шум . . . . . . . . . . . . . . . .
7.2. Дискретный канал без памяти и блочный код . . . . . . .
7.3. Пропускная способность дискретного канала . . . . . . .
7.4. BSC, BEC и Z-канал . . . . . . . . . . . . . . . . . . . . . . .
7.5. Гауссовский канал и ограничение мощности . . . . . . . .
7.6. Почему случайное кодирование достигает 𝑅 < 𝐼(𝑋; 𝑌) . .
7.7. Обратная теорема и конечная длина блока . . . . . . . . .
7.8. Шумные метки как канал . . . . . . . . . . . . . . . . . . .
7.9. Канальное кодирование в ML: ECOC и DeepJSCC . . . . .
7.10. LLM как канал: точная постановка и границы аналогии
7.11. Как формализовать канал в ML-системе . . . . . . . . . .
7.13. Заключение . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
88
90
94
96
98
99
101
102
103
103
104
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
105
105
106
109
110
112
114
117
118
120
121
124
124
125
Модуль 8. Максимальная энтропия, экспоненциальные модели и KL-регуляризация
8.1. От неполного знания к распределению . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
8.2. Экспоненциальный наклон и информационная проекция . . . . . . . . . . . . . . . . . . . .
8.3. Пространство состояний и базовая мера . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
8.4. Классические MaxEnt-распределения и AWGN-канал . . . . . . . . . . . . . . . . . . . . . .
8.5. Условный MaxEnt и лог-линейные модели . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
8.6. Softmax как решение задачи «оценка + энтропия» . . . . . . . . . . . . . . . . . . . . . . . .
8.7. Энергетические модели и нормировочная константа . . . . . . . . . . . . . . . . . . . . . . .
8.8. KL-регуляризованная политика и Gibbs-оптимум . . . . . . . . . . . . . . . . . . . . . . . .
8.9. Переоптимизация награды и роль KL . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
8.10. Математическое углубление: экспоненциальные семейства и достаточность . . . . . . . .
8.12. Заключение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
126
126
128
131
132
135
137
141
144
147
151
164
165
Модуль 9. Скорость–искажение и Information Bottleneck: как управлять потерей информации
9.1. Зачем модели забывать . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
9.2. Теория скорости–искажения: сколько информации нужно сохранить . . . . . . . . . . . . . . . . . . . .
9.3. Information Bottleneck: сохранить то, что важно для 𝑌 . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
9.4. Variational Information Bottleneck: как сделать IB обучаемым . . . . . . . . . . . . . . . . . . . . . . . . .
9.5. VAE как система скорость–искажение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
9.6. Когда скорость становится реальными битами . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
9.7. Как построить честную кривую скорость–искажение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
9.8. Информационная плоскость: цель обучения или описание динамики? . . . . . . . . . . . . . . . . . . .
9.9. Математическое углубление: I–MMSE и гауссовское зашумление . . . . . . . . . . . . . . . . . . . . . .
9.11. Ключевые выводы модуля . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
166
166
167
170
173
175
178
180
181
182
185
186
Модуль 10. Алгоритмическая теория информации: кратчайшие
предсказание
10.1. От распределения к одному конкретному объекту . . . . . . . . . . . .
10.2. Колмогоровская сложность и язык описания . . . . . . . . . . . . . . .
10.3. Несжимаемость, невычислимость и реальные компрессоры . . . . . .
10.4. Связь с энтропией Шеннона . . . . . . . . . . . . . . . . . . . . . . . . .
10.5. Алгоритмическая вероятность и универсальное предсказание . . . . .
10.6. MDL в машинном обучении . . . . . . . . . . . . . . . . . . . . . . . . .
10.7. Сходство через совместное сжатие . . . . . . . . . . . . . . . . . . . . .
10.8. LLM и универсальное предсказание . . . . . . . . . . . . . . . . . . . .
10.9. Математическое углубление: AIXI . . . . . . . . . . . . . . . . . . . . .
10.10. Факультативный физический мост: принцип Ландауэра . . . . . . .
10.12. Ключевые выводы модуля . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
Модуль 11.
Сравнение распределений: f-дивергенции,
Вассерштейна
11.1. От двух выборок к задаче сравнения распределений . . . . . . .
11.2. f-дивергенции: одна схема, разные штрафы . . . . . . . . . . .
11.3. Какие различия видят f-дивергенции . . . . . . . . . . . . . . .
11.4. Классификатор оценивает отношение плотностей . . . . . . . .
.
.
.
.
iv
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
описания, MDL и универсальное
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
187
187
188
191
193
194
196
199
200
201
202
204
204
вариационные критики и расстояние
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
205
205
207
209
211
Влад Куликов · Открытая редакция 2026.1
11.5. Вариационная форма: как сделать расхождение обучаемым . . . . . . . . .
11.6. GAN и f-GAN . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
11.7. MINE и InfoNCE . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
11.8. Интегральные вероятностные метрики: расстояние Вассерштейна и MMD
11.9. Выбор расхождения в практической задаче . . . . . . . . . . . . . . . . . . .
11.10. Математическое углубление: общая мера и точная двойственность . . . .
11.12. Заключение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
212
215
217
220
222
223
225
225
Модуль 12. Информационные границы обобщения: PAC-Bayes и взаимная информация
12.1. Почему лучшая обучающая ошибка почти неизбежно слишком хороша . . . . . . . . . . . . .
12.2. От фиксированной модели к адаптивному выбору . . . . . . . . . . . . . . . . . . . . . . . . . .
12.3. PAC-Bayes: распределение до данных и распределение после обучения . . . . . . . . . . . . .
12.4. PAC-Bayes-kl: сертификат для конкретной выборки . . . . . . . . . . . . . . . . . . . . . . . . .
12.5. От сертификата к обучаемому распределению . . . . . . . . . . . . . . . . . . . . . . . . . . . .
12.6. MI-границы: обучение как канал от выборки к модели . . . . . . . . . . . . . . . . . . . . . . .
12.7. Точное разложение, связывающее PAC-Bayes и MI . . . . . . . . . . . . . . . . . . . . . . . . .
12.8. Связи с MDL, Information Bottleneck и KL-регуляризованными политиками . . . . . . . . . .
12.9. Как построить практический PAC-Bayes-сертификат . . . . . . . . . . . . . . . . . . . . . . . .
12.10. Математическое углубление: более локальные информационные цены . . . . . . . . . . . .
12.12. Ключевые выводы модуля . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
226
226
228
230
232
235
237
239
241
243
245
246
247
Модуль 13. Рассуждение в LLM: вычисление, поиск и информация
13.1. Что меняется, когда модель «думает дольше» . . . . . . . . . . . . . .
13.2. Амортизация, рабочий черновик и поиск . . . . . . . . . . . . . . . . .
13.3. Почему промежуточные токены могут помогать . . . . . . . . . . . . .
13.4. Новая информация или новое вычисление? . . . . . . . . . . . . . . .
13.5. Что можно измерять по шагам . . . . . . . . . . . . . . . . . . . . . . .
13.6. Одна длинная траектория или много кандидатов? . . . . . . . . . . . .
13.7. In-context learning: когда контекст действительно приносит данные .
13.8. Как модели учатся рассуждать . . . . . . . . . . . . . . . . . . . . . . .
13.9. Как оценивать систему рассуждения . . . . . . . . . . . . . . . . . . . .
13.10. Что доказано, что наблюдается и что пока служит гипотезой . . . . .
13.11. Математическое углубление: пошаговый информационный прирост
13.13. Заключение: информация не заменяет вычисление . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
248
248
249
251
252
254
255
257
258
260
262
263
265
265
Модуль 14. Компьютерное зрение через теорию информации
14.1. Почему компьютерное зрение — хороший полигон для теории информации . . . .
14.2. Нейронное сжатие изображений: энтропийная модель и реальный поток битов . .
14.3. Искажение и перцептивное качество . . . . . . . . . . . . . . . . . . . . . . . . . . .
14.4. Диффузионные модели: гауссовское зашумление, денойзинг и I–MMSE . . . . . .
14.5. CLIP и контрастивное выравнивание изображений с текстом . . . . . . . . . . . . .
14.6. Самообучение визуальных представлений: инвариантности и защита от коллапса
14.7. Сжатие CV-модели: квантизация, pruning и distillation . . . . . . . . . . . . . . . . .
14.8. Один CV-пайплайн, четыре разных информационных бюджета . . . . . . . . . . . .
14.9. Математическое углубление: два точных расчёта . . . . . . . . . . . . . . . . . . . .
14.11. Заключение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
267
267
268
272
275
277
279
282
284
286
288
288
Модуль 15. Информационная геометрия: Fisher, естественный градиент и потоки распределений
15.1. Что значит «маленький шаг» для вероятностной модели . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
15.2. Информация Фишера и локальная форма KL . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
15.3. Естественный градиент: наискорейший спуск при малом изменении модели . . . . . . . . . . . . . . . . .
15.4. Что именно называют «кривизной» в глубокой сети . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
15.5. Геометрия политик: NPG, TRPO, PPO и KL в RLHF . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
15.6. Wasserstein-геометрия и потоки распределений . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
15.7. Экспоненциальные семейства, двойственные координаты и зеркальный спуск . . . . . . . . . . . . . . . .
15.8. Практическая карта: сначала выберите объект, затем геометрию . . . . . . . . . . . . . . . . . . . . . . . .
15.9. Математическое углубление: α-геометрия и точные примеры . . . . . . . . . . . . . . . . . . . . . . . . . .
15.11. Заключение . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
Основные источники . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
289
289
291
295
297
300
303
306
308
310
313
314
Модуль 16. Памятка по курсу
16.1. Памятка по курсу: ключевые идеи и формулы . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
315
315
v
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
.
Теория информации для машинного обучения
vi
Модуль 1. Введение
Как читать этот модуль. Обязательное первое прохождение — §§1.1–1.4. В §1.3
формулы входят как короткий мост от вероятности к энтропии и кросс-энтропии; §1.4
объясняет дальнейший маршрут. §§1.5–1.9 — обзорные и справочные материалы, которые
не нужно читать подряд. §§1.10–1.11 сохраняют полный строгий вывод формулы Шеннона
для второго прохода — лучше после Модуля 2 или Модуля 4.
Три курса — одна программа. «Теория информации для машинного обучения от NLP
и LLM до CV и RL» — математический фундамент серии. Два самостоятельных смежных
курса развивают прикладные линии: «Современные LLM» разбирает архитектуру,
обучение, инференс и оценку современных языковых моделей, а «Reinforcement Learning
для LLM» — обучение по обратной связи, RLVR и агентные системы. Все три курса
можно проходить независимо: ссылки между ними ведут к углублению, а не заменяют
необходимые объяснения.
1.1. Информация и смысл: почему это не одно и то же
В 1948 году Клод Шеннон строил не просто теорию передачи по телеграфному проводу, а общий язык
для источников, кодов и шумных каналов. Инженерный вопрос звучал почти вызывающе просто:
какой минимальный ресурс нужен, чтобы передать сообщение надёжно? Чтобы на него
ответить, требовалось научиться измерять неопределённость до того, как сообщение пришло.
Начнём с интуиции. Сообщение «завтра в Париже взойдёт солнце» почти ничего не меняет в наших
ожиданиях. Сообщение «завтра в Париже будет торнадо» — если оно оказалось верным — меняет их
резко. Второе событие не обязательно важнее, полезнее или глубже по смыслу. Оно просто гораздо
менее вероятно относительно выбранной модели мира и потому сильнее удивляет.
Это первая нетривиальная мысль курса: информация и смысл — не одно и то же. Шеннон
сознательно вынес семантику за границы своей инженерной задачи. На первый взгляд кажется, что
теория отказывается от самого интересного. На деле этот отказ и сделал возможной математику:
вместо спора о ценности сообщения мы получили вероятности, коды, пределы сжатия и пропускную
способность канала.
Сейчас этот ход выглядит естественным, но исторически он был радикальным. Найквист и Хартли
уже связывали передачу с числом различимых сообщений и логарифмической шкалой. Шеннон
добавил вероятностный источник, неравновероятные сообщения, длинные последовательности и
шум — и собрал всё в единую теорию.
Запомните этот выбор: он будет возвращаться через весь курс. Вероятностную языковую модель
можно превратить в компрессор без потерь, а её отрицательное логарифмическое правдоподобие
связано с длиной кода. Но хорошее сжатие текста не тождественно пониманию текста; низкая
функция потерь не является сертификатом истинности; выражение «энтропия языка» становится
строгим только после того, как задан источник и уточнён режим длинных последовательностей.
Шенноновский аппарат силён не потому, что измеряет всё, а потому, что очень точно
измеряет выбранный слой задачи.
1
Теория информации для машинного обучения
Три вопроса, которые пока достаточно различать словами
В дальнейшем у нас появятся три близкие, но разные величины:
• насколько неожидан именно этот реализовавшийся исход;
• насколько неопределён источник в среднем до наблюдения;
• насколько наблюдение одной переменной в среднем уменьшает неопределённость о другой.
В разговоре всё это легко назвать «информацией». В математике это будут разные объекты: surprisal, энтропия и взаимная информация. Формула неожиданности появится в коротком мосте §1.3,
энтропия будет подробно разобрана в Модуле 2, а взаимная информация — в Модуле 5. Сейчас
важнее не запомнить обозначения, а не смешать вопросы.
1.2. Шенноновский фрейм: сила и ограничения
Шенноновский фрейм продуктивен именно потому, что отвечает на ограниченный набор вопросов.
Сначала посмотрим, что он даёт, а затем — где заканчивается точное утверждение.
Где шенноновский фрейм продуктивен
Обучение языковых моделей. Кросс-энтропийная функция потерь задаёт ясную задачу:
распределение модели должно назначать высокую вероятность наблюдаемым продолжениям. Это
делает кросс-энтропию, перплексию и биты на токен содержательными измерителями, а связь
предсказания со сжатием — не метафорой, а математической конструкцией. При этом сама целевая
функция не содержит отдельного критерия фактической истинности или понимания. Из этого не
следует, что модель не способна формировать полезные представления; следует лишь, что такой
результат не гарантируется одной записью loss.
Сжатие изображений и аудио. JPEG, MP3 и современные нейронные кодеки можно рассматривать
как разные способы тратить rate ради допустимого distortion. Практический кодек не обязан лежать
на теоретической границе 𝑅(𝐷), а выбор меры искажения уже кодирует наши предпочтения. Но
именно язык rate–distortion позволяет честно сформулировать компромисс. В Модуле 9 та же логика
появится при квантизации весов и активаций.
Обучение представлений через информационную узость. Information Bottleneck ставит
нормативный вопрос: сколько информации о входе должно сохранить представление 𝑇, чтобы не
потерять релевантную информацию о целевой переменной 𝑌? Это сильная постановка, особенно
когда переменные и стохастический энкодер заданы явно. Она не превращается автоматически
в объяснение любой детерминированной глубокой сети: в непрерывных моделях взаимную
информацию бывает трудно корректно определить и ещё труднее оценить.
Где шенноновского фрейма недостаточно
Галлюцинации LLM. Кросс-энтропийное обучение учит воспроизводить распределение
текстовых продолжений. Оно не проверяет каждое утверждение о внешнем мире. Поэтому низкая
кросс-энтропия сама по себе не гарантирует фактическую надёжность. Retrieval, инструменты,
верификация и внешняя обратная связь добавляют сигналы, которых нет в чистом обучении по
правдоподобию.
Эксплуатация награды и закон Гудхарта. Прокси-награда полезна, пока остаётся связана с
истинной целью в области, где работает политика. Сильная оптимизация может вывести систему
туда, где эта связь меняется. KL-регуляризация в RLHF назначает цену уходу от базовой политики
и тем самым создаёт область доверия по распределению. Это важный механизм, но не сертификат
того, что прокси стала истинной целью.
Рассуждение, факты и причинность. Вероятностная модель способна хранить факты в
параметрах и реализовывать сложные вычисления; поэтому фраза «статистическая модель не умеет
рассуждать» слишком груба. Точное ограничение скромнее: обучение по правдоподобию само
по себе не гарантирует причинной корректности, точного выполнения алгоритма или устойчивой
экстраполяции за пределы обучающего распределения.
2
Влад Куликов · Открытая редакция 2026.1
Метакомментарий
Принципиальная граница проходит не по лозунгу «теория информации не учитывает смысл», а
по способу задания объекта. Шенноновские величины определяются относительно вероятностной
модели источника и канала. Смысл часто требует ещё внешнего мира, целей получателя, причинной
структуры и критерия успешного действия.
Алгоритмическая теория информации в Модуле 10 сдвинет фокус к длине программ, вычислимости
и универсальному предсказанию. Она расширит карту, но не даст готовой теории семантики. Это не
поражение аппарата. Это дисциплина: понимать, что именно измеряет формула и где заканчивается
её обещание.
1.3. Почему появляется логарифм: короткий мост к энтропии
Ровно один математический шаг. Здесь нужно увидеть механизм, а не выучить
формулу заранее. Модуль 2 введёт энтропию систематически, а §§1.10–1.11 дадут полный
аксиоматический вывод.
Начнём с одного естественного вопроса: как должна измеряться неожиданность отдельного
события?
Пусть событие имеет вероятность 𝑝, а его неожиданность обозначена 𝑠(𝑝). Если два события
независимы, их совместная вероятность равна 𝑝𝑞 . Узнав оба события, мы хотим сложить полученную
неожиданность:
𝑠(𝑝𝑞) = 𝑠(𝑝) + 𝑠(𝑞).
Это требование переводит произведение вероятностей в сумму информационных вкладов. Именно
такую работу делает логарифм. При обычных условиях регулярности — например, непрерывности и
монотонном росте неожиданности при уменьшении вероятности — получаем
𝑠(𝑝) = −𝑐 log 𝑝,
где положительная константа 𝑐 и основание логарифма задают единицу измерения.
При основании 2 событие вероятности 1/2 несёт 1 бит неожиданности, событие вероятности 1/8 —
3 бита. Два независимых броска честной монеты дают четыре равновероятных последовательности
и 2 бита: один бит за первый выбор и один за второй. Логарифм здесь не декоративен. Он ровно
выражает требование, чтобы независимые этапы складывались.
Для равномерного источника с 𝑛 исходами каждый исход имеет вероятность 1/𝑛, поэтому
неожиданность любого исхода равна
− log2
1
= log2 𝑛.
𝑛
Отсюда уже виден ответ Хартли: число равновероятных альтернатив измеряется логарифмом.
Неравномерный источник требует ещё одного шага — усреднить неожиданность по вероятностям
самих исходов:
𝐻(𝑃) = 𝔼𝑋∼𝑃 − log2 𝑃(𝑋) = −
𝑃(𝑥) log2 𝑃(𝑥).
𝑥
Это и есть формула Шеннона, которую мы подробно разберём в Модуле 2. Здесь она появляется не как
символ, который нужно заранее выучить, а как ответ на два последовательных требования: редкий
исход должен удивлять сильнее, а независимые этапы должны давать сумму.
3
Теория информации для машинного обучения
Почему это сразу узнаётся в ML
Авторегрессионная модель раскладывает вероятность последовательности в произведение условных
вероятностей:
𝑇
𝑞(𝑥1∶𝑇 ) =
𝑞(𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
После логарифма произведение превращается в сумму:
𝑇
− log2 𝑞(𝑥1∶𝑇 ) =
− log2 𝑞(𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
Для одной наблюдаемой последовательности эта величина является её отрицательным
логарифмическим правдоподобием (negative log-likelihood, NLL). Среднее таких величин
по набору данных — эмпирическая кросс-энтропия модели относительно данных.
Поэтому
в практической ML-речи NLL и кросс-энтропия часто стоят рядом, хотя формально первый
термин относится к наблюдению или всей выборке, а второй — к среднему по распределению или
эмпирической выборке.
По-токенные вклады NLL складываются в функцию потерь всей последовательности. Та же сумма
задаёт идеальную длину кода, если предсказательные вероятности подать в энтропийный кодер.
Реальный файл добавит накладные расходы кодера, а полная система — ещё и стоимость хранения
или передачи самой модели, но математическая связь между предсказанием и длиной кода уже
точна.
4
Влад Куликов · Открытая редакция 2026.1
Где заканчивается короткий вывод
Из аддитивности мы получили логарифмическую неожиданность и значение log 𝑛 для равномерного
источника. Но этого ещё недостаточно, чтобы единственным образом выделить формулу Шеннона
на всех неравномерных распределениях: энтропии Реньи тоже аддитивны на независимых
произведениях и совпадают с log 𝑛 на равномерном распределении.
Полный вывод требует более сильной идеи: если выбор совершается в два этапа, общая неопределённость
должна равняться неопределённости первого этапа плюс средняя условная неопределённость
второго. Эта взвешенная группировка и есть мост от равномерного случая к − ∑ 𝑝𝑖 log 𝑝𝑖 . В §§1.10–1.11
мост построен полностью; для первого прохождения достаточно знать, зачем он нужен.
1.4. Как устроен курс и как его читать
Основной маршрут и второй проход
В каждом модуле есть основной ML-маршрут и явно помеченные математические углубления.
Основной маршрут начинается с узнаваемой задачи, вводит минимально необходимую математику
и возвращается к моделям, данным или обучению. Углубление сохраняет полное доказательство,
более общие условия и контрпримеры, но не служит входным экзаменом.
В этом модуле разделение уже работает на практике. Чтобы идти дальше, достаточно различать
вероятность, неожиданность и смысл, понимать область действия шенноновского фрейма и увидеть
короткий логарифмический механизм из §1.3. Полный вывод формулы энтропии ценен, но лучше
читать его вторым слоем — после того, как энтропия стала знакомым рабочим объектом.
Язык курса
Поясняющий текст остаётся преимущественно русским. При первом появлении важного термина
даётся общепринятый английский эквивалент: целевая функция (objective), сдвиг распределения
(distribution shift), обучение представлений (representation learning). Далее используется прежде
всего русский вариант. Названия методов, аббревиатуры, API и слова, без которых современный MLтекст звучит искусственно, — softmax, logits, teacher forcing, ELBO, InfoNCE, RLHF, DPO, PyTorch —
сохраняются в стандартной форме.
По этой же причине §1.7 — справочная заметка о словах выпуклая и вогнутая, бытовые значения
которых подталкивают к обратному прочтению convex и concave, — существует только в русской
версии. Английскому читателю такая заметка не нужна, поэтому английский Модуль 1 короче
на один раздел, а его последующая нумерация сдвинута на единицу. Во всех остальных модулях
нумерация в обеих версиях совпадает.
Как устроен типичный модуль
Сначала появляется вопрос: зачем вообще нужен новый объект. Затем — интуиция, формальная
модель и ключевая формула. Короткое доказательство остаётся в основном тексте, если раскрывает
механизм; длинная техническая часть уходит в углубление. После этого мы смотрим классический
пример, прямое ML-применение, границу интерпретации и проверяем понимание на задаче или
коде.
Такой порядок важен. KL, MI или MaxEnt легко превратить в коллекцию символов. Гораздо полезнее
увидеть, какой инженерный вопрос привёл к формуле, что именно она гарантирует и какую ошибку
мышления предотвращает.
Темп курса не фиксирован жёстко. Один модуль может занять вечер, а может стать темой на неделю.
Основной маршрут M1–M9 уже даёт самостоятельный инструментальный слой; M10–M13 добавляют
продвинутую теорию и frontier-темы; M14–M15 остаются факультативными специализациями.
Обязательный маршрут Модуля 1 закончен. Следующий шаг — Модуль 2. §1.5
можно быстро просмотреть как карту курса; к §§1.6–1.9 возвращайтесь по необходимости;
§§1.10–1.11 открывайте тогда, когда захочется увидеть полный математический механизм.
5
Теория информации для машинного обучения
1.5. Обзор программы курса
Курс выстроен как четыре концентрические окружности — от ядра классической шенноновской
теории до её современных расширений в ML.
Ядро языка (Модули 2–3, 5). Энтропия, кросс-энтропия, KL, взаимная информация —
фундаментальные меры, на которых строится всё остальное. Технический Модуль 4 — это страховой
полис: неравенство Йенсена и связанный аппарат, без которого следующие модули читаются с
натяжкой.
Классическая теория Шеннона (Модули 6–7). Теоремы об источнике и канале. Здесь
теория встречается с инженерной реальностью: компрессия и связь. Это исторический корень
всего, и именно здесь начинают мерцать связи с современным ML — тезис «компрессия как тест
интеллекта», контекст как ограниченный ресурс, attention как возможная аналогия канала. Важно:
это перспективы и эвристики, а не прямые следствия теорем Шеннона.
Принципы вывода (Модули 8–9). MaxEnt, IB, rate–distortion. Здесь теория информации
становится нормативным фреймом для построения систем. Softmax возникает как решение задачи
«ожидаемый score + энтропийная регуляризация»; KL-регуляризованный RLHF-оптимум имеет
гиббсовскую форму относительно reference policy; VAE допускает rate–distortion и informationbottleneck интерпретации. Каждое из этих утверждений требует явно заданной оптимизационной
задачи — без неё красивые аналогии становятся слишком сильными.
Расширения (Модули 10–13).
Алгоритмическая теория информации; 𝑓 -дивергенции и
вариационные характеризации; информационная теория обобщения (PAC-Bayes и MI-bounds);
frontier-модуль про reasoning в LLM. Эти темы выходят за пределы классической инженерной теории
связи и показывают, насколько далеко распространяется информационно-теоретический язык в
современном ML — иногда как точная теорема, иногда как исследовательская модель.
Бонусные модули (факультативно). Два дополнительных модуля расширяют охват курса в
стороны от основного пути:
• Модуль 14 — Информационная теория в компьютерном зрении.
Neural image codecs как продолжение M6 для непрерывных источников; связи диффузионных
моделей с оцениванием, score identities и I–MMSE; contrastive, self-distillation и maskedreconstruction методы в CV; perceptual losses и distributional metrics. Не все эти методы
являются MI-maximization, а LPIPS, SSIM и FID не являются информационно-теоретическими
дивергенциями — модуль должен аккуратно разводить прямые теоремы и полезные
интерпретации.
• Модуль 15 — Информационная геометрия. Fisher information как риманова метрика
на статистическом многообразии, естественные градиенты и локальная квадратичная
аппроксимация KL через матрицу Фишера. Сам KL не является римановым расстоянием.
Углубление M3, M4, M11. Целевая аудитория: ML-инженеры в RL, normalizing flows и
тонкой оптимизации, где обычный градиентный спуск сталкивается с плохо обусловленными
параметризациями.
Три уровня глубины. Курс намеренно устроен так, что на любом из трёх уровней можно
остановиться и иметь самостоятельную, целостную картину:
• Уровень 1 — базовый toolkit (M1-M9). Достаточно для практикующего ML-инженера: энтропия,
KL/CE, MI, теоремы Шеннона о кодировании и канале, MaxEnt и IB/ELBO/rate-distortion. После
M9 вы понимаете информационно-теоретический смысл cross-entropy loss, perplexity, KL-якоря
в RLHF, ELBO в VAE, MI-интерпретации некоторых contrastive objectives. Это полный базовый
минимум для современной работы.
• Уровень 2 — продвинутая теория (M10-M12).
Алгоритмическая теория информации
(Колмогоров, Соломонофф, AIXI), f-дивергенции и вариационные характеризации, PACBayes и MI-границы обобщения. Это продвинутый теоретический слой над Уровнем 1 — он
нужен тем, кто планирует читать современные исследовательские работы или вести свои.
• Уровень 3 — capstone и спецтемы (M13 + M14, M15). Reasoning в LLM как синтез всего
пройденного (M13). Бонусные модули M14 (CV) и M15 (Information geometry) — углубления для
специфической аудитории.
6
Влад Куликов · Открытая редакция 2026.1
Конкретные рекомендованные траектории прохождения описаны в §1.8.
Подробная программа и полный список литературы вынесены в справочные §§1.8–
1.9. Литература там сгруппирована по ролям (backbone, справочники, узкие специализации,
оригинальные работы), и переходить к ней лучше по мере того, как возникает интерес или ступор в
конкретной теме.
1.6. Литература: с чего начинать
Курс не привязан жёстко к одному учебнику. Несколько источников играют разные роли.
Polyanskiy & Wu, «Information Theory: From Coding to Learning» (2025) — современный
backbone. Связь IT и ML в нём центральная с первой страницы, что соответствует духу нашего курса.
MacKay, «Information Theory, Inference, and Learning Algorithms» (2003) — классический
ML-ориентированный учебник. Он свободно доступен на сайте автора и особенно хорош для
интуиции и байесовской перспективы.
Cover & Thomas, «Elements of Information Theory» — справочник для аккуратных доказательств
там, где Polyanskiy–Wu или MacKay лаконичны.
Murphy, «Probabilistic Machine Learning: An Introduction» и «Probabilistic Machine
Learning: Advanced Topics» — связующий мост между нашими модулями и современным
probabilistic ML.
7
Теория информации для машинного обучения
Узкие специализации — Tsybakov для непараметрики, Yamanishi для MDL, Jurafsky–Martin для
NLP, MIT VisionBook для CV и Amari для информационной геометрии — перечислены вместе с
оригинальными работами Шеннона, Тишби, Хаттера и русскоязычными источниками в §1.9. Не
надо пытаться прочитать всё заранее; гораздо эффективнее обращаться к источнику, когда возникает
интерес или ступор.
1.7. Справочная заметка:
вогнутая функция)
convex / concave (выпуклая /
В русскоязычной литературе по математическому анализу есть две конкурирующих традиции
именования выпуклых/вогнутых функций. Чтобы избежать путаницы, в этом курсе используется
международное соглашение, принятое в Cover & Thomas, MacKay, и во всей оптимизационной и MLлитературе:
• Выпуклая (convex) функция — её график лежит ниже хорды, соединяющей две любые
точки графика. Геометрически — «чашка». Примеры: 𝑓(𝑥) = 𝑥 2 , 𝑒 𝑥 , − log 𝑥 . Для дважды
дифференцируемой функции: 𝑓 ″ (𝑥) ≥ 0.
• Вогнутая (concave) функция — график лежит выше хорды. Геометрически — «шапка».
Примеры: 𝑓(𝑥) = log 𝑥 , √𝑥 , энтропия 𝐻2 (𝑝). Для дважды дифференцируемой: 𝑓 ″ (𝑥) ≤ 0.
Если в школе или старых учебниках вы учили иначе — в классической русской традиции
(Фихтенгольц и т.д.) часто использовалось «выпуклая вверх» (= современная concave) и «выпуклая
вниз» (= современная convex). Без уточнения «вверх/вниз» термины могли значить противоположное
современному. Это вопрос терминологический, не математический: log остаётся той же функцией,
неравенство Йенсена работает одинаково.
В этом курсе для определённости: log — вогнутая, 𝑥 2 — выпуклая, дискретная энтропия —
вогнутая по распределению, KL-дивергенция — совместно выпуклая по паре распределений
(𝑃, 𝑄) при стандартных соглашениях о носителях.
8
Влад Куликов · Открытая редакция 2026.1
Мнемоника
Запомните не слова, а форму графика и неравенство Йенсена.
Для log 𝑥 (типичный пример вогнутой), если 𝑋 > 0 почти наверное и соответствующие ожидания
конечны: 𝔼[log 𝑋] ≤ log 𝔼[𝑋] — «логарифм матожидания не меньше матожидания логарифма».
Для 𝑥 2 (типичный пример выпуклой), если 𝔼[𝑋 2 ] < ∞: 𝔼[𝑋 2 ] ≥ (𝔼[𝑋])2 — «матожидание квадрата не
меньше квадрата матожидания» (это в точности неотрицательность дисперсии).
Когда сомневаетесь в названии — мысленно проверяйте на этих двух примерах.
Почему я выбрал именно это соглашение
Все ключевые материалы курса используют его. Cover & Thomas, MacKay, Boyd & Vandenberghe («Convex Optimization» — стандартный учебник), статьи Tishby, работы Хаттера, Delétang et al.,
вся литература по VAE/RLHF/contrastive learning — везде log называется concave, а 𝑥 2 — convex. Если
откроете любую современную статью — придётся думать на этом языке.
Современная русскоязычная литература по оптимизации тоже на нём. Поляк, Юдин–
Немировский, переводы Boyd, многие современные курсы МФТИ/ВШЭ — согласованы с этой
традицией.
Один из двух классических русских терминов имеет встроенную двусмысленность.
«Выпуклая» без уточнения «вверх/вниз» зависит от автора и эпохи. Поэтому в формулах и
доказательствах надёжнее опираться не на направление слова «выпуклая», а на положение графика
относительно хорды и знак второй производной.
P.S. Я сам учился по обратной традиции, принятой у Фихтенгольца. Это более интуитивно для
русскоязычного читателя, но, к сожалению, не совпадает с основным подходом, принятым в
современной литературе. Пришлось переучиваться и привыкать.
1.8. Справочник: подробная программа курса
Этот подраздел даёт детальное описание каждого модуля курса. Он не входит в обязательный
маршрут первого чтения: к нему удобно возвращаться по мере прохождения, чтобы освежить,
что будет в следующем модуле или почему тема разнесена между несколькими модулями.
9
Теория информации для машинного обучения
Программа
Модуль 1. Введение. Информация и смысл — Шеннон сознательно отделил семантические
вопросы от инженерной теории связи, и это решение оказалось одновременно силой и естественной
границей теории. Основной маршрут объясняет, почему аддитивная мера неожиданности должна
быть логарифмической, и связывает этот факт с NLL в авторегрессионных моделях. Факультативные
§§1.10–1.11 дают полный аксиоматический вывод: от равномерного источника через взвешенную
группировку и непрерывность к формуле Шеннона.
Модуль 2. Энтропия. 𝐻(𝑋) = 𝔼[− log 𝑝(𝑋)] как ожидаемая неожиданность. Свойства:
неотрицательность, вогнутость, максимум на равномерном распределении.
Совместная и
условная энтропия, цепное правило 𝐻(𝑋, 𝑌) = 𝐻(𝑋) + 𝐻(𝑌 ∣ 𝑋). Классика: энтропия честной
и нечестной монеты; эксперимент Шеннона с угадыванием английского текста и его оценка
порядка 0.6–1.3 бит/символ при конкретной постановке эксперимента.
ML/LLM: энтропия
выходного распределения как мера его рассеянности — не то же самое, что калибровка или
эпистемическая неопределённость; как post-training, decoding и temperature меняют энтропию, без
универсального утверждения, что любая instruct-модель обязательно имеет меньшую энтропию, чем
соответствующая base-модель.
Модуль 3. Кросс-энтропия и KL-дивергенция. Различие между энтропией источника и
ожидаемой длиной кода, построенного по другой модели. Определения 𝐻(𝑃, 𝑄) и 𝐷KL (𝑃‖𝑄),
тождество 𝐻(𝑃, 𝑄) = 𝐻(𝑃) + 𝐷KL (𝑃‖𝑄), неравенство Гиббса. Асимметрия KL и распространённые
mode-covering/mode-seeking эффекты при ограниченных семействах аппроксимаций — именно
эффекты типичных постановок, а не абсолютная характеристика любого алгоритма. ML/LLM: empir10
Влад Куликов · Открытая редакция 2026.1
ical negative log-likelihood оценивает cross-entropy; если CE измерена в битах, PPL = 2CE , если в натах
— PPL = 𝑒CE , в общем случае PPL = 𝑏CE𝑏 . Роль reference policy и KL-регуляризации в PPO-подобном
RLHF и в выводе DPO.
Модуль 4. Неравенство Йенсена: компактный инструментарий для ML. Основной
маршрут: Йенсен, условия равенства, log-sum inequality, выпуклость KL, два способа ансамблирования
и вывод ELBO. Это технический модуль, но каждая формула привязана к узнаваемой ML-задаче.
Более поздние темы не раскрываются заранее: достаточные статистики переходят в Модуль 8, IWAE
— в Модуль 9, Donsker–Varadhan и 𝑓-GAN — в Модуль 11, PAC-Bayes — в Модуль 12.
Модуль 5. Взаимная информация. 𝐼(𝑋; 𝑌) через разность энтропий, KL между совместным
распределением и произведением маргиналов и ожидаемое сокращение неопределённости. Data
Processing Inequality. MI обнаруживает любую зависимость в том смысле, что 𝐼(𝑋; 𝑌) = 0 тогда и
только тогда, когда 𝑋 и 𝑌 независимы (в стандартной постановке), тогда как нулевая корреляция
исключает лишь линейную связь. ML: InfoNCE как contrastive objective и, при соответствующей
схеме выборки, нижняя оценка MI; Information Bottleneck; MINE и трудности оценки MI в высокой
размерности. Интерпретации attention как информационного обмена и residual connections через
SDPI будут явно помечены как исследовательские линзы, а не как следствия DPI.
Модуль 6. Кодирование источника. Неравенство Крафта и два уровня теоремы о кодировании.
Для оптимального двоичного префиксного кода символа конечного алфавита, если энтропия
измерена в битах: 𝐻(𝑋) ≤ 𝐿∗ < 𝐻(𝑋) + 1. Для длинных блоков из стационарного эргодического
источника средняя длина на символ может приближаться к entropy rate. Хаффман, арифметическое
кодирование, AEP и типичные множества.
ML/LLM: операционально точное соответствие
вероятностного prediction и lossless compression через entropy coding, с учётом конечного coding overhead; результаты Delétang et al. как впечатляющая демонстрация, но с оговоркой, что в
опубликованных compression ratios не учитывается размер параметров модели. Scaling laws могут
описывать приближение cross-entropy к некоторому пределу, но отождествлять этот предел с
«истинной энтропией языка» можно только при дополнительных предпосылках. Bits per character и
bits per byte — полезные tokenizer-independent единицы, но не единственно допустимые.
Модуль 7. Канал и пропускная способность. Для дискретного канала без памяти capacity
определяется как 𝐶 = max𝑝(𝑥) 𝐼(𝑋; 𝑌). Теорема кодирования для канала, BSC, BEC, гауссовский
канал и формула Шеннона–Хартли. ML/LLM: контекстное окно, hidden states и attention можно
рассматривать через язык ограниченного информационного потока, но это моделирующая аналогия:
архитектура трансформера не становится дискретным каналом Шеннона без явного задания входов,
шумов, ограничений и критерия передачи.
Модуль 8. Принцип максимальной энтропии. Принцип Джейнса: при заданных ограничениях
выбирать распределение максимальной энтропии. При линейных ограничениях на ожидания
решение, когда оно существует, имеет экспоненциальную форму. Это связано с экспоненциальными
семействами, но не тождественно теореме Питмана–Купмана–Дармуа: последняя при регулярностных
условиях характеризует i.i.d.-семейства, допускающие достаточную статистику фиксированной
размерности. Для регулярных экспоненциальных семейств MLE даёт moment matching, если
конечное внутреннее решение существует. Softmax удовлетворяет точной вариационной формуле,
если 𝐻(𝑞) = − ∑𝑖 𝑞𝑖 ln 𝑞𝑖 измеряется в натах и 𝜏 > 0:
softmax(𝑧/𝜏) = arg max 𝔼𝑖∼𝑞 [𝑧𝑖 ] + 𝜏𝐻(𝑞) .
𝑞∈Δ
Для неограниченной оптимизации по политикам на носителе reference policy задача
max 𝔼𝑦∼𝜋(⋅∣𝑥) [𝑟(𝑥, 𝑦)] − 𝛽𝐷KL (𝜋(⋅ ∣ 𝑥)‖𝜋ref (⋅ ∣ 𝑥))
𝜋
при 𝛽 > 0 и конечной нормировочной константе имеет решение 𝜋 ∗ (𝑦 ∣ 𝑥) ∝ 𝜋ref (𝑦 ∣ 𝑥)𝑒 𝑟(𝑥,𝑦)/𝛽 .
Это точное утверждение для указанной оптимизационной задачи; связь с Goodhart — полезная
инженерная интерпретация, а не отдельная теорема MaxEnt.
11
Теория информации для машинного обучения
Модуль 9. Information Bottleneck, ELBO, rate–distortion. IB-принцип, rate–distortion theory и variational objectives. VAE ELBO естественно раскладывается на distortion/reconstruction term
и rate/KL term; связь с variational IB реальна, но зависит от того, какие переменные названы входом,
представлением и target. ML: self-supervised representation learning, квантизация весов и активаций,
спор об IB-интерпретации динамики нейросетей. Сверх классики: для 𝑌 = √snr𝑋 + 𝑁, где 𝑁 ∼ 𝒩(0, 1)
независимо от 𝑋 и 𝔼[𝑋 2 ] < ∞, и взаимной информации в натах
𝑑
1
𝐼(𝑋; 𝑌) = mmse(snr);
𝑑 snr
2
в битах справа появляется дополнительный множитель 1/ ln 2. I–MMSE, Tweedie/score identities и denoising дают важные мосты к diffusion models, но score matching не является следствием одной только
I–MMSE identity.
Модуль 10. Алгоритмическая теория информации. Колмогоровская сложность, теорема
инвариантности и невычислимость; соломоновская универсальная нижнеполувычислимая semimeasure и соответствующий предиктор; AIXI как идеализированный, невычислимый агент. ML/LLM:
MDL, Occam’s razor и осторожная аналогия между большой языковой моделью и вычислимым
приближением к универсальному предсказанию — именно аналогия, а не установленная теорема
Хаттера о конкретных LLM. Принцип Ландауэра, predictive information и free energy principle можно
обсуждать рядом, но FEP происходит из вариационного вывода и статистической физики, а не
«рождается» непосредственно из колмогоровской сложности.
Модуль 11. 𝑓 -дивергенции и вариационные характеризации. 𝑓 -дивергенции включают
KL, total variation, 𝜒 2 , squared Hellinger и Jensen–Shannon divergence. Rényi divergence следует
рассматривать отдельно: при фиксированном порядке она связана монотонным логарифмическим
преобразованием с соответствующей Hellinger/power 𝑓-дивергенцией, но сама в общем случае не
является 𝑓 -дивергенцией. Donsker–Varadhan для KL, Gibbs variational principle, Pinsker и другие
связи. ML: исходный minimax GAN при оптимальном discriminator и идеализированной постановке
связан с JS divergence; f-GAN обобщает конструкцию на 𝑓-дивергенции; MINE использует DVпредставление.
Модуль 12. Информационная теория обобщения. PAC-Bayes и границы через взаимную
информацию между выборкой и результатом алгоритма. Они могут быть data- и algorithm-dependent
и потому концептуально тоньше грубого подсчёта параметров, но для глубоких сетей нередко
остаются трудновычислимыми или численно vacuous. Почему LLM хорошо генерализуют, несмотря
на overparameterization, — открытая исследовательская задача; MDL, flatness и information-theoretic
bounds дают разные частичные объяснения, а не завершённую теорию.
Модуль 13. Reasoning в LLM через теорию информации (frontier). Capstone-модуль, где
channel, bottleneck, compression и algorithmic search используются как исследовательские модели
reasoning. Chain-of-thought можно моделировать как последовательный вычислительный процесс с
промежуточным состоянием, но не следует без доказательства отождествлять его с «многократным
использованием канала» или считать глубину CoT прямой аппроксимацией соломоновского поиска.
В frontier-части — Ton, Taufiq & Liu, «Understanding Chain-of-Thought in LLMs through Information
Theory» (arXiv 2024; ICML 2025), и другие недавние работы; все выводы здесь должны быть особенно
чётко разделены на теоремы, эмпирику и гипотезы.
Бонусные модули (факультативно)
Два дополнительных модуля расширяют курс в стороны от основного пути. Они написаны так, чтобы
их можно было пропустить, пройти не по номеру или подобрать по интересу. Они опираются на
основной курс M1–M13, но не используются им обратно.
Модуль 14. Информационная теория в компьютерном зрении (бонус). Neural image
compression непосредственно связан с rate–distortion и learned entropy models. Для generative
modeling полезны I–MMSE, denoising и score identities. В representation learning методы нужно
разделять: SimCLR, MoCo и CLIP используют contrastive objectives; DINO — self-distillation without
labels; MAE — masked reconstruction of pixels. Их можно сравнивать информационно, но нельзя без
12
Влад Куликов · Открытая редакция 2026.1
дополнительного вывода объявлять все MI-maximization. LPIPS — learned perceptual feature distance,
SSIM — structural similarity index, FID — квадрат 2-Wasserstein-расстояния между гауссовскими
аппроксимациями распределений признаков (обычно Inception features); это не 𝑓-дивергенции
и не «информационно-теоретические дивергенции» в стандартном смысле. MSE уместен для
squared-error/PSNR objectives, хотя часто плохо совпадает с человеческим perceptual quality.
Модуль 15. Информационная геометрия (бонус). Распределения как точки статистического
многообразия, Fisher information matrix 𝐺(𝜃) как риманова метрика и естественный градиент
∇𝜃 𝐿 = 𝐺(𝜃)−1 ∇𝜃 𝐿.
KL не является метрикой или римановым расстоянием, но для близких параметров при регулярностных
условиях
𝐷KL (𝑝𝜃 ‖𝑝𝜃+𝑑𝜃 ) =
1 ⊤
𝑑𝜃 𝐺(𝜃)𝑑𝜃 + 𝑜(‖𝑑𝜃‖2 ).
2
Регулярные экспоненциальные семейства обладают dually flat структурой относительно пары dual
affine connections; это не означает нулевую кривизну Fisher–Rao metric во всех смыслах. TRPO
использует приближённое решение KL-constrained surrogate problem и близок к natural-gradient
methods, но не является «точным natural gradient». PPO clipping — практическая эвристика
и не гарантирует строгого trust region. K-FAC аппроксимирует Fisher/Gauss–Newton curvature
при определённых предпосылках; Shampoo — structured preconditioner из семейства full-matrix
AdaGrad/second-order-inspired методов, а не просто ещё одна аппроксимация Fisher.
Рекомендуемые треки прохождения
Курс рассчитан так, что можно выбрать глубину под цели и время. Каждый из ниже описанных
треков — самодостаточная единица, после прохождения которой у вас будет целостная картина
соответствующего уровня.
Базовый трек — M1–M9 (≈30–40 часов).
Информационно-теоретический toolkit для
практической работы.
Покрывает основные конструкции, регулярно встречающиеся вокруг
cross-entropy loss, perplexity, KL-регуляризации, ELBO, contrastive objectives и rate–distortion. После
M9 получается самостоятельная, целостная картина. Трек подходит ML-инженерам, которые хотят
понимать математические основы повседневных методов, но пока не планируют глубоко уходить в
исследовательскую теорию.
Полный основной курс — M1–M13 (≈60-80 часов). К базовому треку добавляются продвинутая
теория (M10 — алгоритмическая теория информации; M11 — f-дивергенции и вариационные
характеризации; M12 — PAC-Bayes и MI-границы обобщения) и capstone-модуль про reasoning в LLM
(M13). Нужен тем, кто планирует читать современные исследовательские работы по теоретическому
ML или вести собственные исследования.
Полный курс с CV-фокусом — M1–M9 + M14 + ключевые места M11. Базовый трек плюс
бонусный модуль по computer vision (M14: neural codecs, диффузия через I-MMSE, contrastive в
CV, perceptual losses). Из M11 обязательны §11.4-§11.5 (f-GAN и MINE), которые непосредственно
используются в M14. Подходит CV-инженерам, которым нужна информационно-теоретическая база
именно под их область.
Полный курс с теоретическим фокусом — M1–M13 + M15. Полный основной курс плюс
бонусный модуль по Information Geometry. Подходит ML-инженерам в RL (естественный policy
gradient), нормирующих потоках, тонкой оптимизации — везде, где обычный градиентный спуск
сталкивается с плохо обусловленными параметризациями.
Замечания. Бонусные M14 и M15 не обязательны для основной линии курса — их можно проходить
в любом порядке после M13 или подбирать по интересу. Если хочется и того и другого — порядок не
важен, они независимы.
13
Теория информации для машинного обучения
1.9. Справочник: полный аннотированный список литературы
Материалы
Курс не привязан жёстко к одному учебнику. Источники сгруппированы по их роли.
Современный backbone (математическая строгость + современная подача).
• Polyanskiy & Wu, «Information Theory: From Coding to Learning» (2025) — современный
учебник, делающий связь IT и ML центральной с первой страницы. Используется как основной
справочник по строгим доказательствам.
• MacKay, «Information Theory, Inference, and Learning Algorithms» (2003) — классика, в которой
теория информации с самого начала подаётся в связке с машинным обучением и байесовским
выводом. Свободно доступна на сайте автора; особенно хороша для интуиции и байесовской
перспективы.
Классические доказательства как справочник.
• Cover & Thomas, «Elements of Information Theory», 2-е изд. (2006) — каноническая книга для
аккуратных доказательств.
• Csiszár & Körner, «Information Theory: Coding Theorems for Discrete Memoryless Systems» —
глубокая книга по комбинаторной стороне.
Probabilistic ML спутник.
• Murphy, «Probabilistic Machine Learning: An Introduction» и «Probabilistic Machine Learning:
Advanced Topics» (2022, 2023) — стандартный современный учебник по ML с правильной
информационно-теоретической базой. Хороший мост между нашими модулями и общим
современным ML.
Узкие специализации.
• Tsybakov, «Introduction to Nonparametric Estimation» (2009) — для аккуратных нижних границ
через теорию информации: Fano, Le Cam, Assouad. Используется в Модулях 5 и 12.
• Yamanishi, «Learning with the Minimum Description Length Principle» (2023) — углубление MDL.
Используется в Модуле 10.
• Jurafsky & Martin, «Speech and Language Processing», 3-е изд., online manuscript (2026) — NLPдомен. Используется в Модулях 6 и 13.
Практика и код.
• Zhang, Lipton, Li, Smola, «Dive into Deep Learning» — практические Python-примеры для
энтропии, кросс-энтропии и KL.
Квантизация моделей (для Модуля 9).
• Frantar et al., «GPTQ» (ICLR 2023); Lin et al., «AWQ» (MLSys 2024); Xiao et al., «SmoothQuant»
(ICML 2023) — методы post-training quantization для развёртывания LLM. Они хорошо
иллюстрируют инженерный компромисс «размер / скорость / ошибка», но не являются
прямыми следствиями теоремы скорость–искажение.
Computer Vision (для Модуля 14).
• Torralba, Isola, Freeman, «Foundations of Computer Vision» (MIT VisionBook, 2024) — общий
современный CV-фон.
• Ballé, Laparra, Simoncelli, «End-to-end Optimized Image Compression» (2017) и Ballé et al., «Variational Image Compression with a Scale Hyperprior» (2018) — основополагающие работы по
нейронным кодекам, базис §14.2.
• Blau & Michaeli, «Rethinking Lossy Compression: The Rate-Distortion-Perception Tradeoff» (2019)
— теоретический фундамент §14.4.
• Mentzer et al., «High-Fidelity Generative Image Compression» (HiFiC, 2020) — практический
перцептивный кодек.
• Radford et al., «Learning Transferable Visual Models From Natural Language Supervision» (CLIP,
2021) — основа §14.5; IB-интерпретация возможна, но не является основным утверждением
статьи.
14
Влад Куликов · Открытая редакция 2026.1
• Chen et al., «A Simple Framework for Contrastive Learning» (SimCLR); He et al., «Momentum Contrast» (MoCo); Grill et al., «Bootstrap Your Own Latent» (BYOL); Caron et al., «Emerging Properties
in Self-Supervised Vision Transformers» (DINO); Oquab et al., «DINOv2»; He et al., «Masked Autoencoders Are Scalable Vision Learners» (MAE) — разные семейства SSL-методов для §14.6.
Информационная геометрия, RL и generative flows (для Модуля 15).
• Amari, «Information Geometry and Its Applications» (Springer, 2016) — корневая учебниковая
ссылка Модуля 15.
• Amari, «Natural Gradient Works Efficiently in Learning» (1998) — основополагающая работа по
естественному градиенту.
• Schulman et al., «Trust Region Policy Optimization» (2015) и «Proximal Policy Optimization Algorithms» (2017) — основа §15.5.
• Kakade, «A Natural Policy Gradient» (2001) — переход естественного градиента в RL.
• Haarnoja et al., «Soft Actor-Critic» (2018) — maximum-entropy RL.
• Martens & Grosse, «Optimizing Neural Networks with Kronecker-factored Approximate Curvature»
(K-FAC, 2015); Gupta, Koren & Singer, «Shampoo» (2018); Anil et al., «Scalable Second-Order
Optimization for Deep Learning» (2020) — структурное предобусловливание и приближения
кривизны.
• Lipman et al., «Flow Matching for Generative Modeling»; Liu et al., «Flow Straight and Fast»; Song et
al., «Score-Based Generative Modeling through Stochastic Differential Equations» — основа §§15.6–
15.7.
• Ouyang et al., «Training Language Models to Follow Instructions with Human Feedback» (InstructGPT); Rafailov et al., «Direct Preference Optimization» — основа capstone о RLHF/DPO.
Русскоязычные ресурсы.
• Верещагин, Успенский, Шень, «Колмогоровская сложность и алгоритмическая случайность»
(МЦНМО, 2013) — фундаментальная книга по алгоритмической теории информации.
• Вьюгин, «Математические основы машинного обучения и прогнозирования» (МЦНМО, 2022)
— современная книга, охватывающая PAC-Bayes и online learning.
• Учебник ШАД/Яндекса: «Энтропия и семейство экспоненциальных распределений» —
полезный русскоязычный материал к Модулю 8.
Frontier reasoning.
• Ton, Taufiq & Liu, «Understanding Chain-of-Thought in LLMs through Information Theory» (ICML
2025) — информационно-теоретический анализ шагов CoT.
Обязательные оригинальные работы для полного прочтения.
• Shannon, «A Mathematical Theory of Communication» (1948) — один из лучших научных текстов
XX века, читается неожиданно легко.
• Tishby, Pereira, Bialek, «The Information Bottleneck Method» (1999) — основа Модуля 9.
• Belghazi et al., «MINE: Mutual Information Neural Estimation» (2018) — связь MI и нейросетевых
вариационных оценок.
• Delétang et al., «Language Modeling Is Compression» (ICLR 2024) — прямая связь IT и
современных языковых моделей.
• Hutter, «Universal Artificial Intelligence» (2005) — основа Модуля 10.
• Guo, Shamai, Verdú, «Mutual Information and Minimum Mean-Square Error in Gaussian Channels»
(2005) — I–MMSE identity, основа связи с диффузионными моделями.
• Amari, «Natural Gradient Works Efficiently in Learning» (1998) — фундаментальная работа по NGD.
Для интуиции.
• Лекции MacKay на YouTube.
• 3Blue1Brown: визуальное объяснение энтропии через Wordle.
15
Теория информации для машинного обучения
1.10. Факультативное математическое углубление I: равномерный
источник
Второй проход. Ни один следующий модуль не требует помнить детали этого
доказательства. Его цель — показать, что логарифм не был угадан по красивой форме: он
вынужден согласованностью многоэтапного выбора.
Пусть
𝑓(𝑛) ∶= 𝐻
1
1
,…,
𝑛
𝑛
обозначает неопределённость равномерного выбора из 𝑛 вариантов.
требования.
Монотонность.
уменьшаться.
Нам понадобятся два
Если равновероятных вариантов стало больше, неопределённость не должна
Согласованность двухэтапного выбора. Выбор одного из 𝑚𝑘 равновероятных исходов можно
описать как выбор одной из 𝑚 равновероятных групп, а затем одного из 𝑘 элементов внутри группы.
Поэтому
𝑓(𝑚𝑘) = 𝑓(𝑚) + 𝑓(𝑘).
Теперь докажем точную теорему.
Теорема. Если 𝑓 ∶ ℕ → ℝ не убывает и
𝑓(𝑚𝑘) = 𝑓(𝑚) + 𝑓(𝑘)
для всех 𝑚, 𝑘 ≥ 1, то существует константа 𝑐 ≥ 0 такая, что
𝑓(𝑛) = 𝑐 ln 𝑛.
Доказательство. Подставим 𝑚 = 𝑘 = 1:
𝑓(1) = 𝑓(1) + 𝑓(1),
откуда 𝑓(1) = 0. Из монотонности следует 𝑓(𝑛) ≥ 0 для всех 𝑛 ≥ 1.
Здесь есть маленькая, но важная развилка. Аксиомы допускают вырожденное решение 𝑓 ≡ 0;
оно соответствует 𝑐 = 0. Если решение невырождено, существует хотя бы одно 𝑎 ≥ 2 с 𝑓(𝑎) > 0.
Зафиксируем такое 𝑎.
Из функционального уравнения по индукции получаем для любого целого 𝑟 ≥ 0
𝑓(𝑢𝑟 ) = 𝑟𝑓(𝑢).
Теперь зафиксируем произвольное 𝑛 ≥ 2. Для каждого 𝑟 ≥ 1 положим
𝑠𝑟 = 𝑟 log𝑎 𝑛 .
Тогда
𝑎 𝑠𝑟 ≤ 𝑛𝑟 < 𝑎 𝑠𝑟 +1 .
16
Влад Куликов · Открытая редакция 2026.1
Поскольку 𝑓 не убывает,
𝑓(𝑎 𝑠𝑟 ) ≤ 𝑓(𝑛𝑟 ) ≤ 𝑓(𝑎 𝑠𝑟 +1 ).
Используя формулу для степеней, получаем
𝑠𝑟 𝑓(𝑎) ≤ 𝑟𝑓(𝑛) ≤ (𝑠𝑟 + 1)𝑓(𝑎).
Можно разделить на 𝑟𝑓(𝑎), потому что 𝑟 > 0 и 𝑓(𝑎) > 0:
𝑠𝑟
𝑓(𝑛)
𝑠𝑟 + 1
≤
≤
.
𝑟
𝑓(𝑎)
𝑟
(1)
Но из определения 𝑠𝑟 одновременно следует
𝑠𝑟
𝑠𝑟 + 1
≤ log𝑎 𝑛 <
.
𝑟
𝑟
(2)
Обе величины, 𝑓(𝑛)/𝑓(𝑎) и log𝑎 𝑛, лежат в интервале длины 1/𝑟. Следовательно,
𝑓(𝑛)
1
− log𝑎 𝑛 ≤ .
𝑓(𝑎)
𝑟
Левая часть от 𝑟 не зависит, а оценка верна для любого 𝑟. Переходя к пределу 𝑟 → ∞, получаем
𝑓(𝑛)
= log𝑎 𝑛.
𝑓(𝑎)
Значит,
𝑓(𝑛) = 𝑓(𝑎) log𝑎 𝑛 =
𝑓(𝑎)
ln 𝑛 = 𝑐 ln 𝑛.
ln 𝑎
В невырожденном случае 𝑐 > 0; вместе с решением 𝑓 ≡ 0 получаем 𝑐 ≥ 0. ■
Что именно мы доказали
Мы получили логарифмическую форму только на равномерных распределениях. Непрерывность
здесь не использовалась: функция пока определена на натуральных 𝑛.
Чтобы перейти к
произвольным вероятностям, понадобится взвешенная группировка — содержательно более
сильное требование, чем простая аддитивность независимых источников.
1.11.
Факультативное математическое углубление II: от
группировки к формуле Шеннона
Второй проход. Этот раздел завершает доказательство. Основная идея важнее техники:
неопределённость многоэтапного выбора должна раскладываться по тому же принципу,
что и ожидаемая стоимость решения дерева.
Рассмотрим функцию 𝐻(𝑝1 , … , 𝑝𝑘 ) на конечных вероятностных векторах. Переименование исходов
ничего не меняет; исходы нулевой вероятности можно удалить; 𝐻 непрерывна на симплексе.
Ключевое требование — взвешенная группировка. Пусть сначала выбирается группа 𝑖 с
вероятностью 𝑝𝑖 , а затем внутри неё исход 𝑗 с условной вероятностью 𝑞𝑗∣𝑖 . Тогда
17
Теория информации для машинного обучения
𝑚
𝐻 𝑝𝑖 𝑞𝑗∣𝑖 ∶ 𝑖, 𝑗 = 𝐻(𝑝1 , … , 𝑝𝑚 ) +
𝑝𝑖 𝐻(𝑞1∣𝑖 , … , 𝑞𝑘𝑖 ∣𝑖 ).
𝑖=1
Это конечная форма цепного правила: неопределённость первого этапа плюс средняя неопределённость
второго.
Шаг 1. Рациональные вероятности
Пусть 𝑝𝑖 = 𝑛𝑖 /𝑁, где 𝑛𝑖 — положительные целые и 𝑁 = ∑𝑖 𝑛𝑖 . Представим 𝑁 равновероятных
микроисходов и объединим их в группы размеров 𝑛1 , … , 𝑛𝑘 . Выбор микроисхода можно описать
двумя способами.
Сразу выбрать один из 𝑁 исходов стоит 𝑓(𝑁). Сначала выбрать группу, а затем элемент внутри группы
—
𝑘
𝐻(𝑝1 , … , 𝑝𝑘 ) +
𝑝𝑖 𝑓(𝑛𝑖 ).
𝑖=1
По группировке эти выражения равны:
𝑓(𝑁) = 𝐻(𝑝1 , … , 𝑝𝑘 ) +
𝑝𝑖 𝑓(𝑛𝑖 ).
𝑖
Подставляем результат §1.10, 𝑓(𝑛) = 𝑐 ln 𝑛:
𝐻(𝑝1 , … , 𝑝𝑘 ) = 𝑐 ln 𝑁 − 𝑐
𝑝𝑖 ln 𝑛𝑖
𝑖
= −𝑐
𝑝𝑖 ln
𝑖
= −𝑐
𝑛𝑖
𝑁
𝑝𝑖 ln 𝑝𝑖 .
𝑖
Формула Шеннона получена для всех распределений с рациональными вероятностями.
Шаг 2. Произвольные вероятности
Рациональные точки плотны в вероятностном симплексе. Непрерывность 𝐻 переносит формулу на
произвольные вещественные вероятности:
𝐻(𝑝1 , … , 𝑝𝑘 ) = −𝑐
𝑝𝑖 ln 𝑝𝑖 ,
𝑖
с соглашением 0 ln 0 ∶= 0.
Аксиомы всё ещё допускают нулевую меру 𝐻 ≡ 0. Нормировка одновременно исключает её и
выбирает единицу. Если потребовать
𝐻
1 1
,
= 1 бит,
2 2
то 𝑐 = 1/ ln 2, и формула принимает привычный вид
18
Влад Куликов · Открытая редакция 2026.1
𝐻(𝑝1 , … , 𝑝𝑘 ) = −
𝑝𝑖 log2 𝑝𝑖 .
𝑖
Почему одной аддитивности независимых источников недостаточно
Здесь легко сделать слишком сильный вывод. Семейство энтропий Реньи
𝐻𝛼 (𝑃) =
1
log
1−𝛼
𝑝𝑖𝛼 ,
𝛼 > 0, 𝛼 ≠ 1,
𝑖
тоже аддитивно для независимых распределений и тоже равно log 𝑛 на равномерном распределении.
Поэтому логарифмическая шкала и product-additivity ещё не выделяют Шеннона. Выделяет его
взвешенная группировка, то есть правильный учёт того, с какой вероятностью мы попадаем в
каждую ветвь второго этапа.
Контрпример в числах
Этот контрпример стоит увидеть явно: качественное утверждение выше легко принять, не заметив,
насколько оно точное. Возьмём энтропию Реньи порядка 2:
𝑝𝑖2 .
𝐻2 (𝑃) = − log2
𝑖
На равномерном источнике она даёт логарифм. Для 𝑈𝑛 = (1/𝑛, … , 1/𝑛)
𝑛
𝑖=1
1
𝑛
2
=
1
,
𝑛
поэтому
𝐻2 (𝑈𝑛 ) = − log2
1
= log2 𝑛.
𝑛
На независимых произведениях она аддитивна. Для независимых 𝑃 = (𝑝𝑖 ) и 𝑄 = (𝑞𝑗 ):
(𝑝𝑖 𝑞𝑗 )2
𝐻2 (𝑃 ⊗ 𝑄) = − log2
𝑖,𝑗
𝑝𝑖2
= − log2
𝑖
𝑞𝑗2
𝑗
= 𝐻2 (𝑃) + 𝐻2 (𝑄).
И тем не менее взвешенная группировка нарушается. Пусть
𝑃=
1 1 1
, ,
.
2 4 4
Прямое вычисление даёт
𝐻2 (𝑃) = − log2
3
8
= log2 ≈ 1.415.
8
3
19
Теория информации для машинного обучения
Опишем тот же выбор в два этапа: сначала группа {1} или {2, 3} с вероятностями (1/2, 1/2), затем
исход внутри выбранной группы. Шенноновская правая часть была бы равна
𝐻2
1 1
1
1
1 1
1
,
+ 𝐻2 (1) + 𝐻2 ,
= 1 + 0 + = 1.5.
2 2
2
2
2 2
2
Числа не совпадают: 1.415 против 1.5. То есть 𝐻2 проходит оба более слабых теста и не
проходит тождество группировки — именно поэтому выводу выше и потребовалась более сильная
аксиома. Обратите внимание и на то, чему это не противоречит: §§1.10–1.11 нигде не утверждали,
что логарифмической шкалы и аддитивности на произведениях достаточно. Они являются
необходимыми следствиями аксиом, а 𝐻2 показывает, что сами по себе они этого не обеспечивают.
Вот теперь формула не постулирована и не угадана. Мы увидели весь механизм: многоэтапный выбор
заставляет появиться логарифм в равномерном случае, группировка переносит его на рациональные
вероятности, непрерывность закрывает вещественный симплекс, а нормировка выбирает биты.
20
Модуль 2. Энтропия
Как читать этот модуль. Основной маршрут — §§2.1–2.4. Короткие доказательства
базовых свойств входят в ядро курса: они объясняют механизм и понадобятся дальше.
Два фрагмента отмечены как математическое углубление — вывод энтропийной скорости
и производная энтропии по температуре. Их можно оставить для второго прохода.
Инженерная вставка о speculative decoding тоже факультативна.
2.1. Энтропия: средний счёт за неопределённость
Представьте два классификатора, которые выбирают один и тот же класс. Первый выдаёт
𝑞𝐴 = (0.97, 0.01, 0.01, 0.01),
а второй —
𝑞𝐵 = (0.40, 0.30, 0.20, 0.10).
По argmax их ответы неразличимы: победил первый класс. Но сами распределения устроены
совершенно по-разному. У первого почти вся масса собрана в одной точке; у второго остаётся
несколько правдоподобных альтернатив. Энтропия замечает именно эту разницу:
𝐻(𝑞𝐴 ) ≈ 0.242 бита,
𝐻(𝑞𝐵 ) ≈ 1.846 бита.
Это и есть первый ML-смысл энтропии: она смотрит не только на победителя, а на всю форму
распределения.
В Модуле 1 мы увидели, почему неожиданность отдельного исхода должна измеряться логарифмом.
Теперь сделаем следующий шаг. Пусть дискретная случайная величина 𝑋 имеет распределение 𝑃 с
вероятностями 𝑝(𝑥). Если не оговорено иное, алфавит в этом модуле конечен, логарифмы берутся по
основанию 2, а единицей служит бит.
Неожиданность, или собственная информация (surprisal), конкретного исхода 𝑥 равна
𝑖𝑃 (𝑥) = − log2 𝑝(𝑥).
Энтропия Шеннона — ожидаемая неожиданность исхода:
𝐻𝑃 (𝑋) = 𝔼𝑋∼𝑃 [𝑖𝑃 (𝑋)] = −
𝑝(𝑥) log2 𝑝(𝑥).
𝑥∈𝒳
Соглашение 0 log 0 ∶= 0 задаётся по непрерывности, поскольку 𝑢 log 𝑢 → 0 при 𝑢 → 0+ .
У этой формулы есть простое чтение. Источник как будто выставляет счёт за каждый реализовавшийся
исход: − log2 𝑝(𝑥) бит. Редкий исход дорог, но приходит редко; частый стоит мало, но встречается
постоянно. Энтропия — средний счёт до того, как мы увидели результат.
21
Теория информации для машинного обучения
Можно перевести его ещё в одну полезную шкалу. Величина
𝑁eff = 2𝐻(𝑃)
показывает, сколько равновероятных исходов соответствовало бы той же энтропии. Для общего
распределения это эффективное число: оно не обязано быть целым и не равно буквальному
размеру носителя. Так, энтропия 3 бита соответствует по неопределённости восьми равновероятным
вариантам.
Свойство 1. От полной определённости до равномерного распределения
Для распределения на 𝑛 возможных исходах
0 ≤ 𝐻(𝑋) ≤ log2 𝑛.
Нижняя граница достигается, когда исход фактически предопределён. Верхняя — когда все 𝑛
вариантов равновероятны. Иными словами, энтропия правильно ставит на противоположные
концы шкалы детерминированность и полное отсутствие предпочтений между вариантами.
Неотрицательность. Для любого исхода с 𝑝(𝑥) > 0
− log2 𝑝(𝑥) ≥ 0.
Поэтому все ненулевые вклады в ожидание неотрицательны. Равенство 𝐻(𝑋) = 0 возможно только
тогда, когда единственный исход имеет вероятность 1. ■
Максимум. Здесь нулевые вероятности требуют небольшой аккуратности. Обозначим положительный
носитель распределения через
𝒮 = {𝑥 ∶ 𝑝(𝑥) > 0},
𝑚 = |𝒮| ≤ 𝑛.
Для вогнутого логарифма неравенство Йенсена имеет вид
𝑤𝑥 log2 𝑎𝑥 ≤ log2
𝑥
𝑤𝑥 𝑎𝑥 .
𝑥
Поэтому
𝐻(𝑋) =
𝑝(𝑥) log2
𝑥∈𝒮
≤ log2
1
𝑝(𝑥)
𝑝(𝑥)
𝑥∈𝒮
1
𝑝(𝑥)
= log2 𝑚 ≤ log2 𝑛.
Первое неравенство обращается в равенство только при одинаковых 𝑝(𝑥) на носителе. Чтобы
получить именно log2 𝑛, носитель должен включать все 𝑛 исходов. Значит, максимизатор — полное
равномерное распределение. ■
22
Влад Куликов · Открытая редакция 2026.1
Это принцип максимальной энтропии в самой простой форме: если известно только
множество допустимых исходов и больше никаких ограничений, равномерное распределение
оставляет минимум необоснованных предпочтений. В Модуле 8 мы добавим ограничения на
средние и увидим, как из того же принципа возникают уже неравномерные экспоненциальные
распределения и softmax.
Эти границы полезны и как инженерная проверка. Если код для распределения по словарю из
𝑛 токенов возвращает отрицательную энтропию или значение выше log2 𝑛, проблема не в тонкой
интерпретации — в вычислении ошибка.
Свойство 2. Вогнутость: забытый источник смеси добавляет неопределённость
Пусть у нас есть два распределения 𝑝 и 𝑞 , а перед генерацией мы случайно выбираем одно из них:
первое с вероятностью 𝜆, второе с вероятностью 1 − 𝜆. Если после этого забыть, какое распределение
было выбрано, наблюдаемый закон станет смесью
𝑟 = 𝜆𝑝 + (1 − 𝜆)𝑞.
Энтропия удовлетворяет неравенству
𝐻(𝑟) ≥ 𝜆𝐻(𝑝) + (1 − 𝜆)𝐻(𝑞).
23
Теория информации для машинного обучения
То есть потеря информации о том, какой компонент породил пример, не может уменьшить
среднюю неопределённость.
Это один из тех результатов, которые позже будут постоянно
возвращаться: в смесях, латентных моделях, ансамблях и взаимной информации.
Доказательство. Функция
𝜑(𝑢) = −𝑢 log2 𝑢
при 𝑢 > 0 имеет вторую производную
𝜑 ″ (𝑢) = −
1
< 0.
𝑢 ln 2
После непрерывного доопределения 𝜑(0) = 0 она строго вогнута на [0, 1]. Поскольку
𝐻(𝑝) =
𝜑(𝑝𝑖 ),
𝑖
энтропия вогнута на вероятностном симплексе. При 0 < 𝜆 < 1 равенство возможно только при 𝑝 = 𝑞 .
■
Здесь легко сказать чуть больше, чем доказано. Энтропия смеси не меньше средней энтропии
компонентов, но не обязана превосходить каждый компонент.
Если смешать равномерное
распределение с вырожденным, результат останется менее энтропийным, чем равномерная часть.
2.2. Цепное правило: как разбить один счёт на токены
Для последовательности можно получить один общий счёт за весь исход, а можно оплачивать его по
частям. Цепное правило говорит, что при корректном условливании сумма не изменится.
Пусть 𝑋 и 𝑌 имеют совместное распределение 𝑝(𝑥, 𝑦). Совместная энтропия равна
𝐻(𝑋, 𝑌) = −
𝑝(𝑥, 𝑦) log2 𝑝(𝑥, 𝑦).
𝑥,𝑦
Условная энтропия 𝑌 после наблюдения 𝑋 определяется как
𝐻(𝑌 ∣ 𝑋) =
𝑝(𝑥)𝐻(𝑌 ∣ 𝑋 = 𝑥)
𝑥∶𝑝(𝑥)>0
=−
𝑝(𝑥, 𝑦) log2 𝑝(𝑦 ∣ 𝑥).
𝑥,𝑦
Ключевое слово здесь — средняя. 𝐻(𝑌 ∣ 𝑋) усредняет остаточную неопределённость по возможным
значениям 𝑋. Это не то же самое, что 𝐻(𝑌 ∣ 𝑋 = 𝑥0 ) для одного конкретного события. Для значений
𝑥 с 𝑝(𝑥) = 0 условное распределение можно задать произвольно: оно получает нулевой вес.
Цепное правило
𝐻(𝑋, 𝑌) = 𝐻(𝑋) + 𝐻(𝑌 ∣ 𝑋).
Прочитаем формулу до доказательства. Сначала мы платим 𝐻(𝑋) бит в среднем, чтобы узнать 𝑋.
После этого остаётся в среднем 𝐻(𝑌 ∣ 𝑋) бит неопределённости о 𝑌. Вместе это ровно тот же счёт,
что и прямое описание пары (𝑋, 𝑌).
Доказательство. На положительном носителе
24
Влад Куликов · Открытая редакция 2026.1
𝑝(𝑥, 𝑦) = 𝑝(𝑥)𝑝(𝑦 ∣ 𝑥).
Логарифм превращает произведение в сумму:
𝐻(𝑋, 𝑌) = −
𝑝(𝑥, 𝑦) log2 𝑝(𝑥)𝑝(𝑦 ∣ 𝑥)
𝑥,𝑦
=−
𝑝(𝑥, 𝑦) log2 𝑝(𝑥) −
𝑥,𝑦
𝑝(𝑥, 𝑦) log2 𝑝(𝑦 ∣ 𝑥)
■
𝑥,𝑦
= 𝐻(𝑋) + 𝐻(𝑌 ∣ 𝑋).
Порядок можно поменять:
𝐻(𝑋, 𝑌) = 𝐻(𝑌) + 𝐻(𝑋 ∣ 𝑌).
Для последовательности по индукции получаем
𝑛
𝑛
𝐻(𝑋𝑖 ∣ 𝑋<𝑖 ).
𝐻(𝑋𝑖 ∣ 𝑋1 , … , 𝑋𝑖−1 ) =
𝐻(𝑋1 , … , 𝑋𝑛 ) =
𝑖=1
𝑖=1
Вот сильная формулировка, которую стоит запомнить: цепное правило — бухгалтерия
авторегрессии. Совместная неопределённость последовательности раскладывается на остаточную
неопределённость каждого следующего элемента после уже известного префикса. Если после q
почти всегда приходит u, контекст делает второй символ дешёвым. Если продолжение действительно
многовариантно, счёт остаётся высоким.
Источник и модель: одна факторизация, два разных счёта
Фраза «цепное правило буквально описывает работу языковой модели» почти попадает в цель, но ей
нужна одна важная развилка.
Пусть данные порождаются распределением 𝑃:
25
Теория информации для машинного обучения
𝑛
𝑝(𝑥1∶𝑛 ) =
𝑝(𝑥𝑖 ∣ 𝑥<𝑖 ).
𝑖=1
Тогда цепное правило раскладывает энтропию самого источника:
𝑛
𝐻𝑃 (𝑋1∶𝑛 ) =
𝐻𝑃 (𝑋𝑖 ∣ 𝑋<𝑖 ).
𝑖=1
Авторегрессионная модель задаёт своё распределение 𝑄𝜃 :
𝑛
𝑞𝜃 (𝑥1∶𝑛 ) =
𝑞𝜃 (𝑥𝑖 ∣ 𝑥<𝑖 ).
𝑖=1
Для конкретной наблюдаемой последовательности модельный счёт также складывается по токенам:
𝑛
− log2 𝑞𝜃 (𝑥1∶𝑛 ) =
− log2 𝑞𝜃 (𝑥𝑖 ∣ 𝑥<𝑖 ).
𝑖=1
Но после усреднения по данным 𝑃 мы получаем уже не 𝐻(𝑃) автоматически, а кросс-энтропию
источника относительно модели:
𝐻(𝑃, 𝑄𝜃 ) = 𝔼𝑋∼𝑃 − log2 𝑞𝜃 (𝑋) .
Эти величины совпадут, только если модельные условные распределения совпадают с условными
распределениями источника почти всюду по 𝑃. В Модуле 3 разница станет видна одной строкой:
𝐻(𝑃, 𝑄) = 𝐻(𝑃) + 𝐷KL (𝑃‖𝑄).
Пока достаточно помнить смысл. Цепное правило действительно объясняет, почему функция потерь
языковой модели складывается по токенам. Оно не утверждает, что любая такая функция потерь уже
равна внутренней энтропии источника.
Условление уменьшает энтропию — но именно в среднем
Контекст в среднем помогает:
𝐻(𝑌 ∣ 𝑋) ≤ 𝐻(𝑌),
причём равенство выполняется тогда и только тогда, когда 𝑋 и 𝑌 независимы.
Доказательство. Маргинальное распределение 𝑌 является смесью условных распределений:
𝑝𝑌 =
𝑝(𝑥)𝑝𝑌∣𝑋=𝑥 .
𝑥
По вогнутости энтропии
𝐻(𝑌) = 𝐻
𝑝(𝑥)𝑝𝑌∣𝑋=𝑥
𝑥
≥
𝑝(𝑥)𝐻(𝑌 ∣ 𝑋 = 𝑥) = 𝐻(𝑌 ∣ 𝑋).
𝑥
26
Влад Куликов · Открытая редакция 2026.1
При строгой вогнутости равенство означает, что все условные распределения с положительным весом
одинаковы и равны 𝑝𝑌 , то есть 𝑋 и 𝑌 независимы. ■
Отсюда сразу следует субаддитивность:
𝐻(𝑋, 𝑌) ≤ 𝐻(𝑋) + 𝐻(𝑌),
с равенством ровно при независимости.
Граница утверждения компактна, но важна. Для отдельного значения 𝑥0 вполне может оказаться
𝐻(𝑌 ∣ 𝑋 = 𝑥0 ) > 𝐻(𝑌).
Некоторое конкретное наблюдение способно открыть более неоднозначный режим, хотя в среднем
знание 𝑋 уменьшает неопределённость. Упражнение 3 строит такой пример без каких-либо трюков.
2.3. От монеты к языку: энтропийная скорость
Монета как лаборатория
Для монеты с вероятностью орла 𝑝 энтропия равна
ℎ2 (𝑝) = −𝑝 log2 𝑝 − (1 − 𝑝) log2 (1 − 𝑝).
Строчную букву ℎ2 обычно используют для бинарной энтропии; это заодно не даёт спутать её с
энтропией Реньи порядка 2, которую часто обозначают 𝐻2 .
27
Теория информации для машинного обучения
График говорит всю историю. При 𝑝 = 0 или 𝑝 = 1 будущий бросок уже известен и энтропия
равна нулю. При 𝑝 = 1/2 ни один исход не предпочтительнее другого, поэтому неопределённость
максимальна и равна одному биту. Производные и строгую вогнутость вы получите в Упражнении 1.
Но текст — не мешок независимо вытянутых букв. Если просто посчитать частоты символов и
перемешать строку, мы сохраним односимвольную энтропию и уничтожим слова, синтаксис и тему.
Поэтому для языка нужен объект, который учитывает зависимость от контекста.
Главный результат для источника с памятью
Пусть (𝑋𝑡 )𝑡≥1 — стационарный процесс на конечном алфавите: распределение любого конечного
блока не зависит от его абсолютной позиции во времени. Обозначим остаточную неопределённость
следующего символа при контексте длины 𝑛 − 1 через
ℎ𝑛 = 𝐻(𝑋𝑛 ∣ 𝑋1 , … , 𝑋𝑛−1 ),
ℎ1 = 𝐻(𝑋1 ).
Тогда более длинный контекст не увеличивает эту величину в среднем, и существует предел
1
𝐻(𝑋1 , … , 𝑋𝑛 )
𝑛
ℎ = lim 𝐻(𝑋𝑛 ∣ 𝑋1 , … , 𝑋𝑛−1 ) = lim
𝑛→∞
𝑛→∞
— энтропийная скорость (entropy rate) источника.
Это точная версия фразы «сколько новых бит в среднем приносит следующий символ, когда доступно
всё прошлое». Односимвольная энтропия отвечает на вопрос о букве без контекста; энтропийная
скорость — о неизбежном остатке после использования зависимостей источника.
Математическое углубление: почему предел существует. Для первого чтения
можно перейти к эксперименту Шеннона ниже.
По свойству «условление уменьшает энтропию» и стационарности
ℎ𝑛+1 = 𝐻(𝑋𝑛+1 ∣ 𝑋1 , … , 𝑋𝑛 )
≤ 𝐻(𝑋𝑛+1 ∣ 𝑋2 , … , 𝑋𝑛 )
= 𝐻(𝑋𝑛 ∣ 𝑋1 , … , 𝑋𝑛−1 ) = ℎ𝑛 .
Последовательность (ℎ𝑛 ) не возрастает и ограничена снизу нулём, поэтому сходится. По
цепному правилу
1
1
𝐻(𝑋1 , … , 𝑋𝑛 ) =
𝑛
𝑛
𝑛
ℎ𝑖 .
𝑖=1
Средние Чезаро сходящейся последовательности имеют тот же предел, что и сама
последовательность. Отсюда следуют обе записи в рамке.
Теперь выражение «бит на символ» получило строгий объект, но вместе с ним появились и условия:
источник, алфавит, стационарность и правила предварительной обработки должны быть заданы.
Без этого «энтропия английского языка» звучит содержательно, но не обозначает единственную
универсальную константу.
Шеннон просит человека быть языковой моделью
В статье Prediction and Entropy of Printed English 1951 года Шеннон рассматривал 27 символов: 26
букв и пробел. Последовательные приближения показывали, как контекст снимает неопределённость:
28
Влад Куликов · Открытая редакция 2026.1
Приближение
бит/символ
Равномерный 27-символьный источник, 𝐹0
Частоты отдельных символов, 𝐹1
Условные частоты второго порядка, 𝐹2
Условные частоты третьего порядка, 𝐹3
Приближение через частоты слов, 𝐹word
4.76
4.03
3.32
3.10
2.14
Но самая красивая часть работы начинается там, где таблиц 𝑛-грамм уже не хватает. Испытуемому
показывали предыдущий текст и просили называть следующий символ. Если первая догадка была
неверной, он пробовал второй вариант, затем третий — пока не находил правильный. Номер удачной
догадки превращал человеческое знание слов, грамматики, клише и темы в измеримые ограничения
на условную энтропию.
При контексте порядка ста предыдущих символов итоговая таблица дала приблизительно 1.3
бит/символ сверху и 0.6 бит/символ снизу. Шеннон сформулировал вывод осторожно: для
обычного литературного английского длинные зависимости снижают энтропию до величины
порядка одного бита на букву.
Почему этот эксперимент до сих пор впечатляет? Равномерный выбор из 27 символов стоит 4.76
бита. Человеческий предиктор, используя структуру языка на десятках позиций, обнаруживает,
что большая часть этого счета предсказуема. Синтаксис, устойчивые выражения и тема текста
здесь перестают быть абстрактным «смыслом» и проявляются как статистические ограничения на
продолжение.
Но сильный результат не требует превращать число 1 в физическую константу. Выборка у Шеннона
была небольшой; редкие номера догадок оценивались ненадёжно; человек не является идеальным
предиктором; газетный текст, научная проза и поэзия дают разные режимы. Диапазон 0.6–1.3
— историческая оценка в конкретном эксперименте, а не нижний предел для любого файла на
английском.
При стандартных условиях теоремы кодирования источника энтропийная скорость задаёт
асимптотический предел сжатия без потерь. Это будет Модуль 6. Уже сейчас важно видеть
предмет теоремы: предел относится к заданному стохастическому источнику, а не к слову
«язык» без модели данных.
29
Теория информации для машинного обучения
Современная языковая модель как компрессор
Авторегрессионная LLM решает задачу, очень похожую на эксперимент Шеннона: по префиксу
назначает вероятности продолжениям. Если соединить эти вероятности с арифметическим или
интервальным кодированием (range coding), модельный NLL превращается, с небольшими
накладными расходами, в реально достижимую длину кода.
Отсюда возникает точная и полезная картина:
• лучшая модель на отложенном корпусе обычно даёт меньший счёт в битах и лучший
компрессор;
• её кросс-энтропия остаётся верхней оценкой энтропии источника при той же постановке;
• приближение к оценке Шеннона интересно, но совпадение чисел из разных корпусов,
алфавитов и протоколов само по себе ничего не доказывает.
Если 𝑄 назначает положительную вероятность всем последовательностям, возможным под 𝑃, то для
каждого 𝑛
𝐻𝑃 (𝑋1∶𝑛 ) ≤ 𝔼𝑃 [− log2 𝑞(𝑋1∶𝑛 )].
После деления на 𝑛 модельный битрейт может приближаться к энтропийной скорости сверху. Разрыв
— цена несовпадения модели с источником; в следующем модуле она получит имя KL-дивергенции.
2.4. Как читать энтропию языковой модели
В ML словом «энтропия» часто называют несколько разных чисел. Они родственны, но отвечают на
разные вопросы. Перед интерпретацией полезно спросить две вещи: чьё распределение стоит
внутри логарифма и по какому распределению берётся среднее?
Величина
Что усредняется
Что она говорит
Предиктивная энтропия
𝐻(𝑄𝜃 (⋅ ∣ 𝑐))
исходы, сэмплированные из самой
модели при фиксированном
контексте
реальные данные из 𝑃, оценённые
вероятностями модели
исходы истинного источника под
его собственными вероятностями
насколько распределение модели
рассеяно сейчас
Кросс-энтропия 𝐻(𝑃, 𝑄𝜃 ) или
эмпирический NLL
Энтропия или энтропийная
скорость 𝐻(𝑃), ℎ(𝑃)
сколько модель платит за
наблюдаемые продолжения
сколько неопределённости
содержит сам источник
Именно смешение этих строк порождает многие слишком сильные выводы.
Предиктивная энтропия: насколько широк выбор модели
Для фиксированного контекста 𝑐 = 𝑥<𝑡 модель выдаёт распределение 𝑞𝜃 (𝑣 ∣ 𝑐) по словарю 𝒱 . Его
энтропия равна
𝐻𝜃 (𝑐) = −
𝑞𝜃 (𝑣 ∣ 𝑐) log2 𝑞𝜃 (𝑣 ∣ 𝑐).
𝑣∈𝒱
Низкое значение означает, что масса собрана на небольшом числе токенов. Высокое — что заметную
массу делят многие продолжения. Величина
2𝐻𝜃 (𝑐)
даёт удобный «эффективный размер меню»: для равномерного распределения она буквально равна
числу вариантов, в общем случае служит энтропийным эквивалентом.
30
Влад Куликов · Открытая редакция 2026.1
Это хороший локальный диагностический сигнал.
Он может обнаружить резкое ветвление
продолжения, чрезмерную концентрацию, изменение поведения после дообучения (fine‐tuning)
или необычный участок последовательности. Но энтропия отвечает на вопрос о концентрации,
а не о фактической истинности. Модель способна уверенно ошибаться; высокая энтропия может
означать не тупик, а реальную многовариантность. Калибровка и разделение эпистемической и
алеаторной неопределённости требуют дополнительных конструкций и данных.
Особенно важно не путать предиктивную энтропию с NLL на тестовых данных. Модель может
искусственно заострить распределение, уменьшить 𝐻(𝑄𝜃 (⋅ ∣ 𝑐)) и одновременно повысить функцию
потерь на реальном токене, если масса ушла не туда.
Температура: один случай, где направление известно точно
Пусть 𝑧𝑣 — фиксированные логиты, а
𝑞𝑇 (𝑣) =
exp(𝑧𝑣 /𝑇)
,
∑𝑢 exp(𝑧𝑢 /𝑇)
𝑇 > 0.
Здесь можно сказать без эмпирических оговорок: при фиксированных логитах повышение
температуры не уменьшает энтропию. Низкая температура усиливает различия логитов и
собирает массу у максимумов; высокая сглаживает их.
Если единственный токен имеет максимальный логит, то при 𝑇 → 0 энтропия стремится к нулю. Если
максимум делят 𝑟 токенов, предел равен log2 𝑟. При 𝑇 → ∞ распределение стремится к равномерному
на всём словаре и
𝐻(𝑞𝑇 ) → log2 |𝒱|.
31
Теория информации для машинного обучения
Поэтому при неравных логитах любая целевая энтропия строго между предельными значениями
задаёт единственную температуру.
Математическое углубление: производная по температуре. Положим 𝛽 = 1/𝑇 и
временно измерим энтропию в натах. Для 𝑍(𝛽) = ∑𝑣 𝑒 𝛽𝑧𝑣
𝐻(𝑞𝑇 ) = log 𝑍(𝛽) − 𝛽 𝔼𝑞𝑇 [𝑧].
Поскольку
𝑑
𝔼 [𝑧] = Var𝑞𝑇 (𝑧),
𝑑𝛽 𝑞𝑇
получаем
𝑑𝐻
= −𝛽 Var𝑞𝑇 (𝑧),
𝑑𝛽
𝑑𝛽
1
= − 2,
𝑑𝑇
𝑇
и, следовательно,
Var𝑞𝑇 (𝑧)
𝑑
𝐻(𝑞𝑇 ) =
≥ 0.
𝑑𝑇
𝑇3
Для битов правая часть дополнительно делится на ln 2.
Точная монотонность относится именно к чистому масштабированию температурой (temperature
scaling) при фиксированных логитах. Top-𝑘 , top-𝑝, min-𝑝 и другие фильтры сначала меняют
носитель или относительные веса, а затем перенормируют распределение.
Это уже другие
преобразования; их нельзя без доказательства подменять утверждением о температуре.
Дообучение после предобучения: полезная гипотеза вместо универсального
закона
У популярного тезиса «после инструктивного дообучения энтропия ниже» есть правдоподобное
эмпирическое ядро: SFT, RLHF или DPO обучают модель предпочитать определённые форматы
ответа. На конкретном наборе инструктивных промптов это может сконцентрировать массу,
понизить среднюю предиктивную энтропию и уменьшить разнообразие. Модель реже продолжает
промпт как случайный фрагмент интернета и чаще выбирает ожидаемую роль ассистента.
Но из самого ярлыка instruct это не следует. Дообучение после предобучения (post‐training)
меняет логиты контекстно-зависимым образом. Оно может увеличить энтропию там, где базовая
модель была чрезмерно уверена в нежелательном продолжении, и уменьшить её там, где
предпочтения задают узкий формат. Коллапс мод (mode collapse) — возможный режим отказа
при агрессивной оптимизации, а не определение RLHF.
Поэтому правильный инженерный вопрос звучит не «у instruct-моделей энтропия ниже?», а так:
На фиксированном наборе промптов, при одном токенизаторе и до применения фильтров
сэмплирования, как изменилось распределение токенов после дообучения?
Это уже измеримый эксперимент, а не спор лозунгов.
Инженерная вставка: почему одной энтропии мало для speculative decoding
Рассмотрим два распределения на токенах a и b:
𝑝 = (0.9, 0.1),
𝑞1 = (0.9, 0.1),
32
𝑞2 = (0.1, 0.9).
Влад Куликов · Открытая редакция 2026.1
У 𝑞1 и 𝑞2 одинаковая энтропия. Но первое распределение совпадает с 𝑝, а второе почти переставляет
его массу местами. Для exact speculative decoding это принципиальная разница.
В базовой одношаговой схеме exact speculative decoding средняя вероятность принятия draft-токена
равна
𝛼=
min{𝑝(𝑣), 𝑞(𝑣)} = 1 − TV(𝑝, 𝑞),
𝑣
где
TV(𝑝, 𝑞) =
1
2
|𝑝(𝑣) − 𝑞(𝑣)|.
𝑣
Для 𝑞1 имеем 𝛼 = 1, для 𝑞2 — только 0.2, хотя энтропии одинаковы. Урок здесь шире конкретного
алгоритма: энтропия сжимает распределение в одно число и теряет информацию о том, где именно
лежит масса. Когда инженерная задача зависит от совпадения двух распределений, нужна мера их
близости, а не энтропия каждого по отдельности.
Кросс-энтропия и перплексия: счёт модели на данных
Для токенизированной тестовой последовательности 𝑥1∶𝑛 определим среднюю функцию потерь с
логарифмом по основанию 𝑏:
1
𝐿𝑏 = −
𝑛
𝑛
log𝑏 𝑞𝜃 (𝑥𝑖 ∣ 𝑥<𝑖 ).
𝑖=1
Это эмпирическая кросс-энтропия, или средний NLL на токен при выбранной нормировке.
Перплексия равна
PPL = 𝑏𝐿𝑏 .
Если функция потерь измерена в натах, PPL = 𝑒𝐿 ; если в битах, PPL = 2𝐿2 . Интерпретация как
«эффективное число равновероятных вариантов» точна для равномерного распределения и полезна
как эквивалентная шкала в общем случае. Она не означает, что на каждом шаге модель буквально
выбирала из целого числа кандидатов.
Перплексия зависит от токенизации: разные токенизаторы разбивают один текст на разное число
событий. Поэтому PPL надёжно сравнивать прежде всего на одном корпусе, с одним токенизатором
и одинаковым протоколом подсчёта. Биты на символ или байт используют внешнюю единицу
нормировки и облегчают сопоставление, но не устраняют зависимость от модели, контекста,
предварительной обработки и состава данных.
То же различие важно для законов масштабирования (scaling laws). Они описывают эмпирическое
снижение тестовой кросс-энтропии в исследованном диапазоне масштабов. Это сильный факт
о моделях и данных, но не доказательство того, что экстраполированная асимптота обязана быть
универсальной энтропией языка.
На этом месте полезно остановиться и свести модуль к одному вопросу. Когда вы видите слово
«энтропия» в ML-статье или на панели метрик, спросите: распределение модели оценивает
само себя, модель оценивается на данных или речь идёт о неизвестном источнике?
Формулы похожи, но научные выводы различаются.
33
Теория информации для машинного обучения
2.6. Литература и первоисточники
1. C. E. Shannon, «A Mathematical Theory of Communication», 1948 — исходная постановка энтропии,
кодирования и шумного канала.
2. C. E. Shannon, «Prediction and Entropy of Printed English», 1951 — первичный источник
экспериментов с угадыванием английского текста.
3. T. M. Cover, J. A. Thomas, «Elements of Information Theory», 2-е изд., 2006 — свойства энтропии,
цепное правило и энтропийная скорость.
4. D. J. C. MacKay, «Information Theory, Inference, and Learning Algorithms», 2003 — интуитивная и
ML-ориентированная подача.
5. Y. Polyanskiy, Y. Wu, «Information Theory: From Coding to Learning», 2025 — современное строгое
изложение.
6. A. Holtzman et al., «The Curious Case of Neural Text Degeneration», 2019 — температура, truncationbased decoding и форма распределения языковой модели.
7. Y. Leviathan, M. Kalman, Y. Matias, «Fast Inference from Transformers via Speculative Decoding»,
ICML 2023 — exact speculative decoding и вероятность принятия draft-токена.
8. G. Delétang et al., «Language Modeling Is Compression», ICLR 2024 — кросс-энтропия языковой
модели как кодовый счёт.
9. J. Kaplan et al., «Scaling Laws for Neural Language Models», 2020 — эмпирические законы
масштабирования тестовой кросс-энтропии.
34
Модуль 3. Кросс-энтропия и
KL-дивергенция
Как читать этот модуль. Основной маршрут — §§3.1–3.7. Он начинается с логарифмической
функции потерь, затем разделяет неопределённость данных и ошибку модели, переносит
это разложение в классификацию и языковое моделирование и заканчивается градиентом
по логитам и перплексией. §3.8 — математическое углубление о направлении KL при
ограниченном модельном семействе. §3.9 — карта применений; её можно читать
выборочно и возвращаться к ней по мере знакомства с вариационным выводом,
дистилляцией и RLHF.
3.1. Модель отвечает распределением, мир — одним исходом
Вероятностная модель почти никогда не отвечает одним классом. Она выдаёт распределение. argmax
оставляет от него только победителя — и тем самым выбрасывает большую часть информации.
Представьте два классификатора для трёх классов:
𝑞𝐴 = (0.55, 0.40, 0.05),
𝑞𝐵 = (0.95, 0.04, 0.01).
Оба выбирают первый класс. Если он действительно наблюдался, модель 𝐵 получает гораздо лучший
логарифмический счёт:
− ln 0.55 ≈ 0.598,
− ln 0.95 ≈ 0.051.
Но если правильным оказался второй класс, картина меняется:
− ln 0.40 ≈ 0.916,
− ln 0.04 ≈ 3.219.
Уверенность полезна, когда она направлена в правильную сторону, и дорога, когда модель уверенно
ошибается. Именно это измеряет логарифмическая потеря (log‐loss): для реализовавшегося
исхода 𝑦
𝓁(𝑞, 𝑦) = − log 𝑞(𝑦).
Логарифм здесь делает две вещи одновременно. Он превращает произведение вероятностей
последовательности в сумму токенных потерь и резко штрафует модель, если та объявила
наблюдавшееся событие почти невозможным.
Теперь введём две роли, которые будут проходить через весь модуль:
• 𝑃 — распределение, порождающее данные;
• 𝑄𝜃 — вероятностная модель с параметрами 𝜃.
В классификации это условные распределения
35
Теория информации для машинного обучения
𝑝(𝑦 ∣ 𝑥),
𝑞𝜃 (𝑦 ∣ 𝑥),
а в авторегрессионной языковой модели —
𝑝(𝑥𝑡 ∣ 𝑥<𝑡 ),
𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
Мы не получаем 𝑃 в виде готовой таблицы. Мы видим отдельные исходы из 𝑃 и каждый раз
спрашиваем: какую вероятность модель дала тому, что произошло? Усреднение этих счетов
и приводит к кросс-энтропии.
В Модуле 2 энтропия измеряла неопределённость одного распределения. Теперь появятся два
распределения, и вопрос станет инженерным: какая часть средней потери неизбежна из-за
самих данных, а какая возникла потому, что модель не совпала с ними?
Если не оговорено иное, алфавит в основном маршруте конечен. Основание логарифма обозначаем
через 𝑏: при 𝑏 = 2 получаем биты, при 𝑏 = 𝑒 — наты. В библиотеках глубокого обучения обычно
используется натуральный логарифм, поэтому обучающая потеря чаще измеряется в натах.
Историческая линия здесь состоит из двух шагов. Шеннон связал − log 𝑝 с информационной
длиной сообщения; Куллбэк и Лейблер формализовали направленный разрыв между двумя
распределениями. Современная кросс-энтропийная функция потерь соединяет эти две идеи.
3.2. Кросс-энтропия: средний счёт по вероятностям модели
Для распределений 𝑃 = (𝑝(𝑥)) и 𝑄 = (𝑞(𝑥)) на одном алфавите кросс-энтропия определяется как
𝑝(𝑥) log𝑏 𝑞(𝑥) .
𝐻𝑏 (𝑃, 𝑄) = 𝔼𝑋∼𝑃 [− log𝑏 𝑞(𝑋)] = −
𝑥
Формулу удобно читать по ролям:
• первый аргумент 𝑃 говорит, откуда приходят события и по чему усредняем;
• второй аргумент 𝑄 говорит, чьи вероятности стоят внутри логарифма.
Поэтому кросс-энтропия направлена:
𝐻(𝑃, 𝑄) ≠ 𝐻(𝑄, 𝑃)
в общем случае. Перестановка аргументов меняет не запись одной и той же ошибки, а сам
эксперимент: меняются источник событий и модель, которой мы выставляем счёт.
От отдельной потери к ожидаемой
Если 𝑥1 , … , 𝑥𝑁 — наблюдения из 𝑃, то средняя выборочная потеря
1
𝐿𝑏 (𝑄) = −
𝑁
𝑁
log𝑏 𝑞(𝑥𝑖 )
𝑖=1
оценивает 𝐻𝑏 (𝑃, 𝑄). При стандартных условиях закон больших чисел превращает выборочное
среднее в ожидаемое. Именно поэтому цикл обучения (training loop) может работать с отдельными
примерами, хотя формальное утверждение о качестве модели записано на уровне распределения.
Для условного прогноза — классификации, регрессии с вероятностным выходом или предсказания
следующего токена — естественная величина имеет вид
36
Влад Куликов · Открытая редакция 2026.1
𝐻𝑃 (𝑌 ∣ 𝐶; 𝑄) ∶= 𝔼(𝐶,𝑌)∼𝑃 [− log 𝑞(𝑌 ∣ 𝐶)].
Точка с запятой отделяет распределение данных 𝑃 от оцениваемого предиктора 𝑄 . Ниже мы обычно
будем говорить просто «условная кросс-энтропия».
Одна метка — одно наблюдение, а не весь условный закон
В обучении с учителем целевую метку 𝑦 часто записывают one-hot-вектором 𝑒𝑦 . Тогда потеря одного
примера равна
𝐾
−
(𝑒𝑦 )𝑘 log 𝑞𝑘 = − log 𝑞𝑦 .
𝑘=1
Это удобная запись фактически полученного исхода. Она не превращает истинное 𝑃(𝑌 ∣ 𝑋 = 𝑥)
в вырожденный one-hot закон. Для одного и того же объекта могут существовать неоднозначная
разметка, несколько допустимых продолжений, шум или скрытый контекст. Набор данных
показывает по одному исходу за раз; распределение проявляется только через повторение и
структуру выборки.
Когда модель объявляет возможное невозможным
На границе нужны два соглашения. Нулевой по 𝑃 исход не вносит вклад:
0 log
0
∶= 0.
𝑞
Но если 𝑝(𝑥) > 0, а 𝑞(𝑥) = 0, то
−𝑝(𝑥) log 𝑞(𝑥) = +∞.
Модель назначила нулевую вероятность событию, которое иногда происходит, поэтому средний
логарифмический счёт становится бесконечным. Условие конечности записывают как 𝑃 ≪ 𝑄 :
носитель 𝑃 должен содержаться в носителе 𝑄 .
В нейросетях softmax при конечных логитах формально даёт положительные вероятности всем
классам. Численно, однако, слишком малые значения могут округляться до нуля, поэтому кроссэнтропию вычисляют через устойчивую форму log_softmax, а не через отдельные операции softmax
и log.
3.3. KL-дивергенция: часть потери, за которую отвечает
модель
Энтропия источника равна
𝐻𝑏 (𝑃) = −
𝑝(𝑥) log𝑏 𝑝(𝑥).
𝑥
Добавим и вычтем log𝑏 𝑝(𝑥) внутри кросс-энтропии:
37
Теория информации для машинного обучения
𝐻𝑏 (𝑃, 𝑄) = −
𝑝(𝑥) log𝑏 𝑞(𝑥)
𝑥
=−
𝑝(𝑥) log𝑏 𝑝(𝑥) +
𝑥
𝑝(𝑥) log𝑏
𝑥
𝑝(𝑥)
.
𝑞(𝑥)
Второе слагаемое называется KL-дивергенцией, или относительной энтропией:
𝐷KL,𝑏 (𝑃‖𝑄) ∶=
𝑝(𝑥) log𝑏
𝑥
𝑝(𝑥)
.
𝑞(𝑥)
Получаем центральное тождество модуля:
𝐻𝑏 (𝑃, 𝑄) = 𝐻𝑏 (𝑃) + 𝐷KL,𝑏 (𝑃‖𝑄) .
Это разложение стоит прочитать словами.
• 𝐻(𝑃) — неопределённость, которая остаётся даже у идеального предиктора, знающего 𝑃;
• 𝐷KL (𝑃‖𝑄) — дополнительный счёт за несовпадение модели 𝑄 с распределением данных 𝑃.
Поэтому полезная короткая формулировка такова:
KL — средняя доплата за чужую вероятностную модель.
KL не является метрикой: она несимметрична и не обязана удовлетворять неравенству треугольника.
Для оптимизации это не дефект. Нам как раз нужна направленная величина: данные приходят из 𝑃,
а счёт выставляется вероятностями 𝑄 .
Почему доплата неотрицательна
Если существует 𝑥 с 𝑝(𝑥) > 0 и 𝑞(𝑥) = 0, KL равна +∞.
положительный носитель
38
В конечном случае рассмотрим
Влад Куликов · Открытая редакция 2026.1
𝒮 = {𝑥 ∶ 𝑝(𝑥) > 0}
и используем неравенство ln 𝑢 ≤ 𝑢 − 1:
−𝐷KL (𝑃‖𝑄) =
𝑝(𝑥) ln
𝑥∈𝒮
≤
𝑝(𝑥)
𝑥∈𝒮
=
𝑞(𝑥)
𝑝(𝑥)
𝑞(𝑥)
−1
𝑝(𝑥)
𝑞(𝑥) − 1
𝑥∈𝒮
≤ 0.
Следовательно,
𝐷KL (𝑃‖𝑄) ≥ 0.
Равенство требует одновременно 𝑞(𝑥) = 𝑝(𝑥) на 𝒮 и отсутствия массы 𝑄 вне 𝒮 . Значит,
𝐷KL (𝑃‖𝑄) = 0
⟺
𝑃 = 𝑄.
Это неравенство Гиббса. В Модуле 4 мы увидим, как тот же результат получается из неравенства
Йенсена и логарифмического неравенства сумм. Здесь важен механизм: средняя логарифмическая
потеря распадается на неизбежную часть и неотрицательную ошибку модели.
Логарифмическая потеря просит сообщить всё распределение
Из разложения немедленно следует
𝔼𝑌∼𝑃 [− log 𝑞(𝑌)] ≥ 𝔼𝑌∼𝑃 [− log 𝑝(𝑌)],
и минимум единственно достигается при 𝑄 = 𝑃. Поэтому логарифмическая потеря является строго
правильным правилом оценки (strictly proper scoring rule): в ожидании выгоднее всего
сообщать истинное распределение, а не только правильный наиболее вероятный класс.
Это сильнее гарантии для argmax. Два предиктора могут иметь одинаковую точность (accuracy),
но разную кросс-энтропию, потому что один лучше распределяет вероятность между правильным
исходом и альтернативами. Именно поэтому логарифмическая потеря подходит для задач, где
важны вероятности, калибровка и последующее принятие решений под разными стоимостями
ошибок.
Что именно делает максимальное правдоподобие
Для модели 𝑞𝜃 максимизация правдоподобия равна минимизации эмпирического отрицательного
логарифмического правдоподобия (negative log‐likelihood, NLL). На уровне ожидаемой целевой
функции это
min 𝐷KL (𝑃‖𝑄𝜃 ),
𝜃
поскольку 𝐻(𝑃) не зависит от 𝜃.
Если модельное семейство содержит 𝑃 и выполняются обычные статистические условия, оптимум
целевой функции на уровне распределения находится в истинном распределении. Если семейство
ограничено, модель выбирает лучшую доступную KL-проекцию:
39
Теория информации для машинного обучения
𝜃 ∗ ∈ arg min 𝐷KL (𝑃‖𝑄𝜃 ).
𝜃
Это не ослабляет смысл MLE, а точно его формулирует. Целевая функция говорит, какое
приближение считается лучшим внутри выбранного семейства. Конечность данных, качество
выборки и оптимизатор определяют, насколько конкретный запуск приблизится к этому теоретическому
решению.
3.4. Чужой код: как KL превращается в лишние биты
В битах величина
𝓁𝑄 (𝑥) = − log2 𝑞(𝑥)
служит идеальной информационной длиной исхода 𝑥 под моделью 𝑄 . Если реальные символы
приходят из 𝑃, средний счёт такого кода равен
𝔼𝑃 [𝓁𝑄 (𝑋)] = 𝐻2 (𝑃, 𝑄).
Идеальный код, согласованный с самим источником, имел бы среднюю информационную длину
𝐻2 (𝑃). Разница составляет
𝐻2 (𝑃, 𝑄) − 𝐻2 (𝑃) = 𝐷KL,2 (𝑃‖𝑄).
Так возникает операционное чтение KL: сколько бит в среднем мы переплачиваем, кодируя
данные из 𝑃 вероятностями модели 𝑄 .
У реального двоичного префиксного кода длины должны быть целыми. Но и здесь связь остаётся
точной с небольшой накладной платой. Для шенноновского кода, построенного под 𝑄 ,
𝐿𝑄 (𝑥) = − log2 𝑞(𝑥) ,
и потому
𝐻2 (𝑃, 𝑄) ≤ 𝔼𝑃 [𝐿𝑄 (𝑋)] < 𝐻2 (𝑃, 𝑄) + 1.
Для блоков длины 𝑛 надбавка меньше одного бита на весь блок, то есть меньше 1/𝑛 бита на символ.
Арифметическое и интервальное кодирование реализуют эту идею практически. Поэтому «KL —
лишние биты» является не только образом, но и асимптотическим инженерным утверждением.
Диадический пример: одинаковая энтропия, разная цена ошибки
Пусть
𝑃=
1 1 1 1
, , ,
,
2 4 8 8
𝑄=
1 1 1 1
, , ,
.
8 2 4 8
Оба распределения диадические, поэтому идеальные длины целые:
исход
𝑝(𝑥)
𝑞(𝑥)
− log2 𝑝(𝑥)
− log2 𝑞(𝑥)
𝑥1
𝑥2
𝑥3
1/2
1/4
1/8
1/8
1/2
1/4
1
2
3
3
1
2
40
Влад Куликов · Открытая редакция 2026.1
исход
𝑝(𝑥)
𝑞(𝑥)
− log2 𝑝(𝑥)
− log2 𝑞(𝑥)
𝑥4
1/8
1/8
3
3
Энтропии совпадают:
𝐻2 (𝑃) = 𝐻2 (𝑄) = 1.75 бит/символ.
Но код под 𝑄 особенно дорог для самого частого события 𝑥1 , поэтому
𝐻2 (𝑃, 𝑄) = 2.375,
𝐷KL,2 (𝑃‖𝑄) = 0.625 бита.
В обратном направлении
𝐻2 (𝑄, 𝑃) = 2.25,
𝐷KL,2 (𝑄‖𝑃) = 0.5 бита.
Одинаковая энтропия говорит, что два источника имеют одинаковую среднюю неопределённость.
Она не говорит, что ошибки взаимной подстановки будут одинаковыми. Направление определяет,
какие события встречаются часто и какие цены назначил им чужой код.
41
Теория информации для машинного обучения
3.5. Одна формула для классификации и языковой модели
Пусть 𝐶 — контекст, а 𝑌 — метка или следующий токен. Ожидаемая условная логарифмическая
потеря модели равна
ℒ(𝜃) = 𝔼(𝐶,𝑌)∼𝑃 [− log 𝑞𝜃 (𝑌 ∣ 𝐶)].
Применим разложение предыдущего раздела отдельно при каждом контексте, а затем усредним по
𝐶:
ℒ(𝜃) = 𝐻𝑃 (𝑌 ∣ 𝐶) + 𝔼𝐶∼𝑃 𝐷KL (𝑃(⋅ ∣ 𝐶)‖𝑄𝜃 (⋅ ∣ 𝐶)) .
Теперь различие между «неопределённостью задачи» и «ошибкой модели» видно особенно ясно.
• 𝐻𝑃 (𝑌 ∣ 𝐶) — неоднозначность следующего исхода после доступного контекста;
• условная KL — средний разрыв между истинным и модельным распределениями продолжений.
Если один и тот же контекст допускает несколько естественных ответов, даже идеальная модель
не обязана иметь нулевую потерю на каждом примере. Она должна правильно распределить
вероятность между допустимыми продолжениями.
Авторегрессионная последовательность
Для последовательности длины 𝑇
𝑇
𝑝(𝑥1∶𝑇 ) =
𝑇
𝑝(𝑥𝑡 ∣ 𝑥<𝑡 ),
𝑞𝜃 (𝑥1∶𝑇 ) =
𝑡=1
𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
Логарифм превращает произведение в сумму:
𝑇
− log 𝑞𝜃 (𝑥1∶𝑇 ) =
− log 𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
После усреднения получаем
𝔼𝑃 [− log 𝑞𝜃 (𝑋1∶𝑇 )] = 𝐻𝑃 (𝑋1∶𝑇 ) + 𝐷KL (𝑃1∶𝑇 ‖𝑄𝜃,1∶𝑇 ).
А цепное правило для KL раскладывает общий разрыв по шагам:
𝑇
𝔼𝑋<𝑡 ∼𝑃 𝐷KL (𝑃(⋅ ∣ 𝑋<𝑡 )‖𝑄𝜃 (⋅ ∣ 𝑋<𝑡 )) .
𝐷KL (𝑃1∶𝑇 ‖𝑄𝜃,1∶𝑇 ) =
𝑡=1
Вот точная информационно-теоретическая запись стандартного обучения языковой модели:
каждый токен выставляет модели логарифмический счёт, а общий NLL складывает счета вдоль
последовательности.
Teacher forcing: модель проверяют там, где живут данные
При teacher forcing контекст 𝑋<𝑡 берётся из данных. Это делает целевую функцию вычислимой
и даёт прямую оценку условных вероятностей модели на реальных префиксах. Именно по этим
префиксам взвешена KL в формуле выше.
42
Влад Куликов · Открытая редакция 2026.1
Во время свободной генерации контексты постепенно создаёт сама модель. Ранняя ошибка меняет
следующий вход, затем следующий, и распределение посещаемых префиксов может уйти от 𝑃
к распределению, индуцированному 𝑄𝜃 . Поэтому NLL при teacher forcing точно измеряет
качество условной модели на распределении данных, но не заменяет отдельную оценку поведения
на собственных траекториях генерации.
Это полезная граница, а не приговор к кросс-энтропии. Она подсказывает устройство оценки:
NLL на отложенной выборке проверяет вероятностное моделирование данных; генеративные
тесты, интерактивные сценарии и проверки устойчивости оценивают поведение после накопления
собственных решений.
Что обещает целевая функция следующего токена
На уровне распределения целевая функция поощряет совпадение
𝑄𝜃 (⋅ ∣ 𝐶) ≈ 𝑃(⋅ ∣ 𝐶)
для контекстов из данных. Это сильное и точное утверждение. Фактическая корректность, полезный
отказ от ответа и соответствие предпочтениям появляются в той мере, в какой они представлены
в данных и постановке задачи. Retrieval, инструменты проверки, дообучение по предпочтениям и
специальные оценивания добавляют сигналы, которых в обычном next-token NLL нет.
Поэтому низкий NLL — фундаментальная характеристика вероятностной языковой модели, но не
единственная метрика готовой системы.
3.6. Почему CrossEntropyLoss так удобно оптимизировать
Пусть сеть выдаёт логиты 𝑧 ∈ ℝ𝐾 , а вероятности получаются через softmax:
𝑞𝑗 = softmax(𝑧)𝑗 =
𝑒 𝑧𝑗
.
∑ 𝑘 𝑒 𝑧𝑘
Для целевого распределения 𝑟 = (𝑟1 , … , 𝑟𝐾 ), где 𝑟𝑗 ≥ 0 и ∑𝑗 𝑟𝑗 = 1, кросс-энтропийная потеря равна
𝐾
𝓁(𝑧; 𝑟) = −
𝑟𝑗 log 𝑞𝑗
𝑗=1
𝐾
𝐾
𝑒 𝑧𝑘 −
= log
𝑘=1
𝑟𝑗 𝑧𝑗 .
𝑗=1
Эта форма сразу показывает устройство оптимизации: logsumexp учитывает все классы, а второй
член поднимает логиты в соответствии с целевым распределением.
Дифференцирование даёт одну из самых полезных формул в глубоком обучении:
𝜕𝓁
= 𝑞𝑗 − 𝑟𝑗 .
𝜕𝑧𝑗
Для one-hot-цели 𝑟 = 𝑒𝑦
∇𝑧 𝓁 = 𝑞 − 𝑒𝑦 .
Модель уменьшает логиты классов, которым дала больше вероятности, чем требуется целью, и
увеличивает логит целевого класса. Величина поправки уже масштабирована текущей вероятностью
— отдельный ручной коэффициент для softmax не нужен.
43
Теория информации для машинного обучения
Матрица Гессе равна
∇2𝑧 𝓁 = diag(𝑞) − 𝑞𝑞⊤ .
Для любого вектора 𝑣
2
𝑞𝑗 𝑣𝑗2 −
𝑣 ⊤ ∇2𝑧 𝓁 𝑣 =
𝑗
𝑞𝑗 𝑣𝑗
𝑗
= Var𝐽∼𝑞 (𝑣𝐽 ) ≥ 0.
Значит, кросс-энтропия выпукла по логитам. Глубокая сеть при этом не становится выпуклой по
весам: логиты являются нелинейной функцией параметров многих слоёв.
Численно устойчивая форма
Вычислять softmax, а затем log отдельно не следует: экспоненты больших логитов могут
переполниться, а малые вероятности — округлиться к нулю. Используется тождество
𝑒 𝑧𝑘 = 𝑚 + log
log
𝑘
𝑒 𝑧𝑘 −𝑚 ,
𝑘
𝑚 = max 𝑧𝑘 .
𝑘
Поэтому в PyTorch nn.CrossEntropyLoss и F.cross_entropy принимают сырые ненормированные
логиты. Для целевых индексов классов слитая операция соответствует log_softmax плюс NLL:
import torch
import torch.nn.functional as F
logits = torch.tensor([[2.0, ‐1.0, 0.5]], requires_grad=True)
target = torch.tensor([2])
loss_fused = F.cross_entropy(logits, target)
loss_manual = F.nll_loss(F.log_softmax(logits, dim=‐1), target)
assert torch.allclose(loss_fused, loss_manual)
loss_fused.backward()
Слитая реализация нужна не только ради скорости: она сохраняет правильную численную шкалу
вычисления.
Один API может задавать разные статистические задачи
При сглаживании меток (label smoothing) one-hot-цель заменяется, например, на
𝑟 = (1 − 𝜀)𝑒𝑦 + 𝜀𝑢,
где 𝑢 — распределение сглаживания, часто равномерное. Градиент по-прежнему равен 𝑞 − 𝑟, но
оптимум на уровне распределения теперь соответствует сглаженному условному распределению. Это
осознанная регуляризация, а не обычный NLL исходных one-hot-наблюдений.
Веса классов меняют относительную стоимость ошибок. ignore_index, маскирование и режим re‐
duction определяют, какие элементы и с какими коэффициентами входят в среднее. Поэтому имя
CrossEntropyLoss ещё не описывает целиком оцениваемый риск: нужно смотреть на цели, веса и
нормировку.
Для токенной перплексии обычно нужен несглаженный и невзвешенный средний NLL по тем
целевым токенам, которые действительно входят в протокол оценки.
44
Влад Куликов · Открытая редакция 2026.1
3.7. Перплексия: возврат из логарифмической шкалы
NLL удобен для сложения и оптимизации, но его логарифмическая шкала не всегда интуитивна.
Перплексия (perplexity, PPL) возвращает среднюю потерю из логарифмической шкалы в
мультипликативную, экспоненцируя её.
Для 𝑁 наблюдаемых целей
𝐿𝑏 = −
1
𝑁
𝑁
log𝑏 𝑞𝑖 (𝑦𝑖 ),
𝑖=1
а
PPL = 𝑏𝐿𝑏 .
Если NLL измерен в натах,
PPL = 𝑒𝐿 ,
если в битах,
PPL = 2𝐿2 .
Эквивалентная форма особенно полезна:
1/𝑁
𝑁
PPL =
𝑖=1
1
𝑞𝑖 (𝑦𝑖 )
.
То есть PPL — геометрическое среднее обратных вероятностей, назначенных моделью
наблюдаемым целям.
Небольшой пример
Пусть на трёх шагах модель назначила фактически наблюдаемым токенам вероятности
1
,
4
1
,
2
1
.
8
Средний NLL в битах равен
𝐿2 =
1+2+3
= 2,
3
поэтому
PPL = 22 = 4.
То же самое видно из геометрического среднего:
(2 ⋅ 4 ⋅ 8)1/3 = 4.
Фраза «эффективное число равновероятных вариантов» точна, когда модель на каждом шаге
действительно равномерна на одинаковом числе исходов. Для общего распределения это полезная
шкала, а не буквальный подсчёт кандидатов.
45
Теория информации для машинного обучения
PPL и предиктивная энтропия отвечают на разные вопросы
Предиктивная энтропия модели при контексте 𝑐
𝑞𝜃 (𝑦 ∣ 𝑐) log 𝑞𝜃 (𝑦 ∣ 𝑐)
𝐻(𝑄𝜃 (⋅ ∣ 𝑐)) = −
𝑦
измеряет, насколько распределена сама модель. NLL и PPL смотрят на вероятность реализовавшегося
исхода.
Поэтому уверенная модель может иметь очень низкую предиктивную энтропию и огромную PPL,
если она уверена не в том ответе. И наоборот, объективно неоднозначный контекст может давать
высокую энтропию, но хороший ожидаемый NLL, если модель правильно распределила массу между
возможными продолжениями.
На уровне ожидаемого риска разложение из §3.5 даёт нижнюю границу
ℒ(𝜃) ≥ 𝐻𝑃 (𝑌 ∣ 𝐶),
с равенством для идеального условного предиктора. В ограниченном модельном семействе минимум
может быть выше. Конкретная оценка на конечной выборке случайна и иногда оказывается ниже
своего ожидания, поэтому одно validation-число или экстраполированную асимптоту нельзя
автоматически объявлять «истинной энтропией языка».
Сравнимость перплексии
PPL зависит от того, какие события считаются шагами предсказания. Разные токенизаторы
разбивают одну строку на разное число токенов, поэтому их токенные PPL нельзя сравнивать
напрямую.
Корректное сравнение требует как минимум:
• одного корпуса и одинаковой предобработки;
46
Влад Куликов · Открытая редакция 2026.1
• одного токенизатора;
• одинаковой длины и политики контекста;
• одинаковой маски целевых токенов и нормировки.
Биты на байт или символ дают общую физическую единицу и улучшают сопоставимость, хотя состав
корпуса и контекстный протокол всё равно остаются частью эксперимента. В Модуле 6 эта связь
станет буквальной: вероятностная модель превратится в компрессор, а NLL — в измеримую длину
файла.
3.8. Математическое углубление: почему направление KL
меняет ответ
Можно пропустить при первом чтении. Для основного маршрута достаточно знать,
что MLE минимизирует 𝐷(𝑃‖𝑄), а направление начинает особенно влиять на решение,
когда модельное семейство не может точно представить целевое распределение.
Далее удобно перейти от сумм к плотностям:
𝐷KL (𝑃‖𝑄) =
𝑝(𝑥) log
𝑝(𝑥)
𝑑𝑥.
𝑞(𝑥)
В этом разделе будем называть
𝐷KL (𝑃‖𝑄)
прямой KL (forward KL) от цели 𝑃 к приближению 𝑄 , а
𝐷KL (𝑄‖𝑃)
— обратной KL (reverse KL). Термины зависят от того, какое распределение объявлено целью,
поэтому важнее всегда смотреть на порядок аргументов.
У двух направлений различается место усреднения:
• прямая KL берёт ожидание по 𝑃: каждый регион, где находятся данные, получает голос;
• обратная KL берёт ожидание по 𝑄 : модель платит прежде всего за те регионы, куда сама
поместила массу.
Если допустимы все распределения и 𝑃 представимо точно, оба направления имеют общий минимум
𝑄 = 𝑃. Разница становится видимой при неверной спецификации модельного семейства
(model misspecification).
Канонический пример: два пика и один гауссиан
Пусть целевая плотность — симметричная смесь
1
2
1
2
𝑝(𝑥) = 𝒩(𝑥; −3, 1) + 𝒩(𝑥; 3, 1),
а модель ограничена одним гауссианом
𝑞𝜇,𝜎 (𝑥) = 𝒩(𝑥; 𝜇, 𝜎 2 ).
Прямая KL: каждый пик должен быть объяснён
При фиксированном 𝑃 минимизация 𝐷(𝑃‖𝑄𝜇,𝜎 ) эквивалентна минимизации
47
Теория информации для машинного обучения
−𝔼𝑃 [log 𝑞𝜇,𝜎 (𝑋)] =
1
𝔼𝑃 [(𝑋 − 𝜇)2 ]
log(2𝜋𝜎 2 ) +
.
2
2𝜎 2
Оптимальный гауссиан совпадает с 𝑃 по среднему и дисперсии:
𝜇∗ = 𝔼𝑃 [𝑋] = 0,
(𝜎 ∗ )2 = Var𝑃 (𝑋) = 1 + 32 = 10.
Итак,
𝜇∗ = 0,
𝜎 ∗ = √10 ≈ 3.162.
Модель накрывает обе моды и неизбежно помещает массу между ними. В этом конкретном
семействе возникает поведение, которое обычно называют покрытием мод (mode‐covering) или
стремлением к среднему (mean‐seeking).
Обратная KL: выгодно выбрать один безопасный регион
Для
min 𝐷KL (𝑄𝜇,𝜎 ‖𝑃)
𝜇,𝜎
замкнутой формулы здесь нет.
минимума приблизительно
Численная оптимизация даёт два симметричных глобальных
𝜇∗ ≈ ±2.984,
𝜎 ∗ ≈ 1.023.
Каждый из них хорошо описывает одну моду и почти игнорирует вторую.
стремление к моде (mode‐seeking).
Ландшафт при этом богаче одного лозунга.
локальный минимум около
𝜇 ≈ 0,
Это каноническое
Существует также более широкий центральный
𝜎 ≈ 2.744,
но его значение обратной KL выше. Оптимизатор, инициализация и параметризация влияют на то,
какое решение будет найдено.
48
Влад Куликов · Открытая редакция 2026.1
Если носители распределений имеют жёсткие нули, направленность усиливается до бесконечных
штрафов: 𝐷(𝑃‖𝑄) не допускает нулей 𝑄 на массе 𝑃, а 𝐷(𝑄‖𝑃) — массы 𝑄 там, где 𝑃 = 0. В гауссовском
примере оба распределения положительны на всей прямой, поэтому различие возникает и без
жёстких нулей — из-за разных весов в ожидании и ограниченности модельного семейства.
Картинку «прямая KL покрывает, обратная выбирает моду» полезно помнить как сильную эвристику.
Это не универсальная теорема о каждой архитектуре, каждой дивергенции и каждом запуске
оптимизации.
3.9. Карта KL-целевых функций в ML
Справочный раздел. Здесь одна и та же математика появляется в разных ролях. Для
каждого примера сначала смотрите, кто стоит в первом аргументе KL, кто — во втором и
по каким данным берётся ожидание.
Максимальное правдоподобие и языковое моделирование
Обычный NLL данных минимизирует
𝐷KL (𝑃data ‖𝑄𝜃 ),
точнее — среднюю условную KL на контекстах из данных. Это строгий вывод §3.5. Эвристика
покрытия мод может помогать думать об ограниченных семействах, но поведение большой LLM
дополнительно определяется конечностью данных, архитектурой, декодированием, дообучением
(post‐training) и распределением эксплуатации.
49
Теория информации для машинного обучения
Вариационный вывод
Для латентной модели стандартное тождество ELBO имеет вид
log 𝑝𝜃 (𝑥) = ELBO(𝑥) + 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝𝜃 (𝑧 ∣ 𝑥) .
При фиксированной генеративной модели максимизация ELBO по вариационному распределению
𝑞𝜙 минимизирует обратную KL к апостериорному распределению. Если вариационное семейство
слишком бедно, оно может недопредставлять некоторые моды апостериорного распределения.
Коллапс апостериорного распределения (posterior collapse) в VAE — другое явление: часто
под ним понимают режим
𝑞𝜙 (𝑧 ∣ 𝑥) ≈ 𝑝(𝑧),
в котором латентная переменная почти перестаёт нести информацию об 𝑥 . Недопокрытие мод и
коллапс апостериорного распределения могут встречаться в одной системе, но это не два названия
одного эффекта.
Дистилляция знаний
Классическая дистилляция с мягкими целями учителя минимизирует
𝐻(𝑃𝑇 , 𝑃𝑆 ),
что при фиксированном учителе эквивалентно
𝐷KL (𝑃𝑇 ‖𝑃𝑆 ).
Ученик получает не только победивший класс, но и скрытую структуру относительных вероятностей
остальных классов — то, что в исходной работе названо dark knowledge учителя.
Для авторегрессионной модели важен ещё один выбор: на чьих префиксах сравниваются
распределения. Обучение на фиксированном наборе использует префиксы из данных или генераций
учителя. Generalized Knowledge Distillation (GKD) добавляет последовательности, сгенерированные
текущей политикой ученика (on‐policy), и допускает разные дивергенции. Тем самым отдельно
настраиваются два аспекта: распределение контекстов и локальная мера расхождения между
учителем и учеником.
KL-регуляризованное обучение по предпочтениям
Идеализированная задача для запроса 𝑥 записывается как
max 𝔼𝑦∼𝜋(⋅∣𝑥) [𝑟(𝑥, 𝑦)] − 𝛽𝐷KL 𝜋(⋅ ∣ 𝑥)‖𝜋ref (⋅ ∣ 𝑥)
𝜋
.
Награда тянет политику к предпочтительным ответам, а KL назначает цену за отклонение от базовой
политики. Коэффициент 𝛽 задаёт обменный курс между этими силами. В Модуле 8 мы точно решим
эту вариационную задачу и получим экспоненциальный перенаклон базового распределения.
Практический PPO включает целевую функцию градиента политики (policy‐gradient objec‐
tive), ограничение шага (clipping), сэмплирование и приближённый контроль отклонения; его
нельзя свести к одному KL-члену. DPO выводится из той же KL-регуляризованной постановки,
но оптимизирует парную функцию потерь классификации предпочтений. Поэтому связь DPO с
KL находится в исходной модели и выводе, а не в обязательном явном вычислении KL-штрафа на
каждом мини-батче.
50
Влад Куликов · Открытая редакция 2026.1
3.11. Литература и первоисточники
1. C. E. Shannon, «A Mathematical Theory of Communication», Bell System Technical Journal, 1948.
2. S. Kullback, R. A. Leibler, «On Information and Sufficiency», Annals of Mathematical Statistics,
22(1):79–86, 1951.
3. T. M. Cover, J. A. Thomas, «Elements of Information Theory», 2-е изд., Wiley, 2006.
4. T. Gneiting, A. E. Raftery, «Strictly Proper Scoring Rules, Prediction, and Estimation», JASA,
102(477):359–378, 2007.
5. D. M. Blei, A. Kucukelbir, J. D. McAuliffe, «Variational Inference: A Review for Statisticians», JASA,
2017.
6. G. Hinton, O. Vinyals, J. Dean, «Distilling the Knowledge in a Neural Network», 2015.
7. R. Agarwal et al., «On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes», 2023.
8. L. Ouyang et al., «Training Language Models to Follow Instructions with Human Feedback», 2022.
9. R. Rafailov et al., «Direct Preference Optimization: Your Language Model Is Secretly a Reward Model»,
2023.
10. J. He et al., «Lagging Inference Networks and Posterior Collapse in Variational Autoencoders», 2019.
11. Документация PyTorch: torch.nn.CrossEntropyLoss и torch.nn.functional.cross_entropy.
51
Модуль 4. Неравенство Йенсена:
когда среднее встречает
нелинейность
Как читать этот модуль. Основной маршрут — §§4.1–4.5. Одна теорема пройдёт через
три знакомые ML-конструкции: ансамбли, ELBO и уменьшение KL при укрупнении
состояний. Математическое углубление о разрыве Йенсена и дивергенции Брэгмана
можно оставить на второй проход. Для перехода к Модулю 5 достаточно понимать
направление неравенства, условия равенства и два рабочих следствия — для ансамблей и
log-sum inequality.
4.1. Сначала усреднить или сначала посчитать функцию
потерь?
В машинном обучении среднее почти никогда не ходит одно. Рядом обычно стоит нелинейность:
логарифм, экспонента, квадрат, softmax или logsumexp. И тогда порядок операций начинает иметь
значение.
Возьмём самый короткий пример. Две модели назначили правильному классу вероятности
𝑞1 (𝑦 ∣ 𝑥) = 0.9,
𝑞2 (𝑦 ∣ 𝑥) = 0.1.
Средний NLL моделей равен
− ln 0.9 − ln 0.1
≈ 1.204 ната.
2
Если сначала усреднить вероятности, получим 0.5, а затем
− ln 0.5 ≈ 0.693 ната.
Ни одна из исходных моделей не стала лучше. Мы лишь поменяли порядок действий:
− log
𝑞1 + 𝑞2
2
вместо
− log 𝑞1 − log 𝑞2
.
2
Разница возникает из-за кривизны функции − log 𝑢. Тот же сюжет повторяется в гораздо более
серьёзных местах:
• ансамбль сначала смешивает предсказания, а затем получает логарифмический счёт;
• модель с латентной переменной сначала суммирует или интегрирует скрытые объяснения, а
затем берёт логарифм;
52
Влад Куликов · Открытая редакция 2026.1
• обработка данных объединяет состояния, а затем мы сравниваем укрупнённые распределения
по KL;
• усреднение логитов проходит через выпуклую функцию logsumexp.
Во всех случаях вопрос один:
𝜙(𝔼𝑋)
или
𝔼[𝜙(𝑋)]?
Неравенство Йенсена — это компас для ситуаций, где мы пытаемся протащить
среднее через нелинейность. Оно показывает направление изменения; разрыв
Йенсена показывает цену такой перестановки.
Если не оговорено иное, в модуле используются натуральные логарифмы. Смена основания лишь
умножает все логарифмические величины на положительную константу и не меняет направления
неравенств.
4.2. Неравенство Йенсена: направление задаёт кривизна
От хорды к случайной величине
Пусть 𝐶 ⊆ ℝ𝑑 — выпуклое множество. Функция 𝜙 ∶ 𝐶 → ℝ называется выпуклой, если для любых
𝑥1 , 𝑥2 ∈ 𝐶 и 𝜆 ∈ [0, 1]
𝜙 𝜆𝑥1 + (1 − 𝜆)𝑥2 ≤ 𝜆𝜙(𝑥1 ) + (1 − 𝜆)𝜙(𝑥2 ).
Геометрически это означает: хорда между двумя точками графика лежит не ниже графика. Для
вогнутой функции знак разворачивается.
Взвешенная версия для нескольких точек имеет вид
𝑀
𝜙
𝑀
𝜆𝑗 𝑥𝑗
𝑗=1
≤
𝜆𝑗 𝜙(𝑥𝑗 ),
𝜆𝑗 ≥ 0,
𝑗=1
𝜆𝑗 = 1.
𝑗
Переход от конечной смеси к случайной величине даёт привычную форму Йенсена. Если ожидания
существуют и 𝑋 принимает значения в 𝐶 , то
𝜙(𝔼[𝑋]) ≤ 𝔼[𝜙(𝑋)] .
Для вогнутой 𝜙
𝜙(𝔼[𝑋]) ≥ 𝔼[𝜙(𝑋)] .
53
Теория информации для машинного обучения
Вот четыре функции, которые будут постоянно возвращаться в курсе:
Функция
Кривизна
Что она даст
− log 𝑢, 𝑢 > 0
log 𝑢, 𝑢 > 0
LSE(𝑧) = log ∑𝑘 𝑒 𝑧𝑘
𝑢 log 𝑢, 𝑢 ≥ 0
строго выпуклая
строго вогнутая
выпуклая
выпуклая
гарантию для смеси вероятностей
ELBO и другие нижние границы
гарантию для усреднения логитов
log-sum inequality и выпуклость KL
Квадрат даёт самый знакомый частный случай:
(𝔼𝑋)2 ≤ 𝔼[𝑋 2 ],
или, что то же самое,
Var(𝑋) = 𝔼[𝑋 2 ] − (𝔼𝑋)2 ≥ 0.
Короткое доказательство, которое стоит увидеть один раз
Пусть 𝜙 дифференцируема и выпукла, а
𝑚 = 𝔼𝑋.
54
Влад Куликов · Открытая редакция 2026.1
Касательная плоскость к выпуклой функции является глобальной нижней опорой:
𝜙(𝑥) ≥ 𝜙(𝑚) + ∇𝜙(𝑚)⊤ (𝑥 − 𝑚).
Берём ожидание обеих частей:
𝔼[𝜙(𝑋)] ≥ 𝜙(𝑚) + ∇𝜙(𝑚)⊤ (𝔼𝑋 − 𝑚)
= 𝜙(𝑚).
Линейный член исчезает именно потому, что касательная проведена в среднем 𝑚. Вот и вся механика.
В общей недифференцируемой постановке ту же роль играет опорный субградиент; для наших MLприменений дифференцируемой версии достаточно.
Когда неравенство становится равенством
Если 𝜙 строго выпукла на выпуклой оболочке существенного носителя 𝑋, то
𝜙(𝔼𝑋) = 𝔼𝜙(𝑋)
возможно только тогда, когда 𝑋 почти наверное постоянна. В конечной смеси с положительными
весами это означает: все аргументы, которые действительно участвуют в смеси, совпадают.
Для нестрого выпуклой функции возможны и нетривиальные случаи равенства — например, когда
весь носитель лежит на участке, где функция аффинна.
Это условие не является технической сноской. Оно отвечает на практический вопрос: когда
усреднение действительно что-то меняет? Если модели выдают одинаковый релевантный
аргумент, Йенсен не создаёт выигрыша; если аргументы различаются и функция изгибается,
возникает ненулевой разрыв.
Математическое углубление: разрыв, кривизна и дивергенция Брэгмана
Для выпуклой 𝜙 определим разрыв Йенсена
𝐽𝜙 (𝑋) ∶= 𝔼𝜙(𝑋) − 𝜙(𝔼𝑋) ≥ 0.
Если 𝑋 — скалярная случайная величина, сосредоточенная около 𝑚 = 𝔼𝑋, а 𝜙 дважды дифференцируема,
разложение Тейлора даёт локальную оценку
𝐽𝜙 (𝑋) ≈
1 ″
𝜙 (𝑚) Var(𝑋).
2
В многомерном случае аналогичная формула имеет вид
𝐽𝜙 (𝑋) ≈
1
tr ∇2 𝜙(𝑚) Cov(𝑋) .
2
Эта формула даёт полезную инженерную интуицию: эффект усреднения требует одновременно
разброса аргументов и кривизны функции в соответствующих направлениях. Поэтому лозунг
«чем разнообразнее модели, тем лучше ансамбль» слишком груб. Важен разброс их предсказаний
именно там, где функция потерь имеет существенную кривизну.
Для дифференцируемой выпуклой функции введём дивергенцию Брэгмана
𝐷𝜙 (𝑥, 𝑚) = 𝜙(𝑥) − 𝜙(𝑚) − ∇𝜙(𝑚)⊤ (𝑥 − 𝑚).
55
Теория информации для машинного обучения
Тогда линейный член снова исчезает после усреднения:
𝐽𝜙 (𝑋) = 𝔼𝐷𝜙 (𝑋, 𝔼𝑋) .
При 𝜙(𝑥) = 𝑥 2 /2 правая часть равна Var(𝑋)/2. Так разрыв Йенсена можно читать как среднюю
«криволинейную дистанцию» от случайного аргумента до его среднего. Эта связь полезна, но для
дальнейшего основного маршрута не обязательна.
4.3. Ансамбли: точная гарантия для log-loss
Пусть 𝑀 моделей выдают распределения
𝑞1 (𝑦 ∣ 𝑥), … , 𝑞𝑀 (𝑦 ∣ 𝑥),
а веса 𝜆𝑗 ≥ 0 суммируются в единицу. Есть как минимум два естественных способа построить
ансамбль — и это разные модели.
Смешивание вероятностей
Определим арифметическую смесь
𝑀
𝑞mix (𝑦 ∣ 𝑥) =
𝜆𝑗 𝑞𝑗 (𝑦 ∣ 𝑥).
𝑗=1
Для целевой метки 𝑦 функция − log 𝑢 строго выпукла, поэтому
𝑀
− log 𝑞mix (𝑦 ∣ 𝑥) ≤
𝜆𝑗 [− log 𝑞𝑗 (𝑦 ∣ 𝑥)] .
𝑗=1
Это сильнее, чем утверждение о среднем качестве на тестовой выборке: неравенство выполняется
для каждого отдельного примера.
После усреднения по набору данных оно, конечно,
сохраняется.
Равенство достигается тогда, когда все модели с положительным весом назначают целевому классу
одну и ту же вероятность. Полные распределения при этом могут различаться: для per-example NLL
важна только координата правильного класса.
Формула гарантирует сравнение со средним участником, но не с лучшим. Она также не обещает
автоматически повысить top‐1 accuracy, улучшить калибровку на любом распределении или
защитить от сдвига данных. Это не слабость результата, а его точная область действия: для
фиксированных предсказаний смесь вероятностей не хуже среднего участника по
log-loss.
Усреднение логитов
Пусть
𝑞𝑗 = softmax(𝑧𝑗 )
и усредняются не вероятности, а логиты:
56
Влад Куликов · Открытая редакция 2026.1
𝑧̄ =
𝜆𝑗 𝑧𝑗 .
𝑗
Кросс-энтропийная потеря для класса 𝑦 равна
𝓁(𝑧, 𝑦) = LSE(𝑧) − 𝑧𝑦 ,
𝑒 𝑧𝑘 .
LSE(𝑧) = log
𝑘
logsumexp выпукла, а вычитание линейного члена не меняет выпуклость. Поэтому
𝓁(𝑧,̄ 𝑦) ≤
𝜆𝑗 𝓁(𝑧𝑗 , 𝑦) .
𝑗
И здесь ансамбль не хуже среднего участника по NLL. Но его распределение уже не является
арифметической смесью. Из определения softmax следует
softmax(𝑧)̄ 𝑘 =
∏𝑗 𝑞𝑗 (𝑘)𝜆𝑗
∑𝑟 ∏𝑗 𝑞𝑗 (𝑟)𝜆𝑗
.
То есть усреднение логитов строит нормированное геометрическое среднее распределений,
также известное как логарифмический пул (logarithmic opinion pool).
Полезно почувствовать разницу.
• Арифметическая смесь терпима к разногласиям: высокой вероятности одного участника может
быть достаточно, чтобы класс сохранил заметную массу.
• Геометрическая смесь требует большего согласия: очень малая вероятность у одного участника
сильнее подавляет класс.
Для конечных логитов равенство в логитном неравенстве возникает, в частности, когда все модели
задают одно и то же softmax-распределение, то есть их логиты отличаются лишь общей добавочной
константой.
57
Теория информации для машинного обучения
Ни один способ не побеждает всегда
Рассмотрим два примера с правильным классом 1 и равными весами.
Пример
Средний NLL моделей
Смесь вероятностей
Средние логиты
0.983
0.799
0.812
1.197
0.755
0.367
𝑞1 = (0.7, 0.2, 0.1),
𝑞2 = (0.2, 0.3, 0.5)
𝑞1 =
(0.83, 0.01, 0.16),
𝑞2 =
(0.11, 0.88, 0.01)
В первом примере лучше арифметическая смесь, во втором — геометрическая.
выполняют свою гарантию Йенсена, но универсального порядка между ними нет.
Оба ансамбля
Практическая деталь: это две разные строки кода
Если модели уже дали логиты, вероятностную смесь лучше считать в логарифмическом пространстве:
import torch
import torch.nn.functional as F
# logits: [num_models, num_classes]
# weights: [num_models], positive and summing to one
# target: scalar class index
log_probs = F.log_softmax(logits, dim=‐1)
log_weights = weights.log()
# Arithmetic mixture of probabilities, computed stably.
log_q_mix = torch.logsumexp(
58
Влад Куликов · Открытая редакция 2026.1
log_probs + log_weights[:, None], dim=0
)
loss_probability_mix = ‐log_q_mix[target]
# Averaging logits gives a normalized geometric pool.
mean_logits = (weights[:, None] * logits).sum(dim=0)
loss_logit_mix = F.cross_entropy(
mean_logits[None, :],
torch.tensor([target], device=logits.device),
)
Среднее логитов нельзя использовать как численно удобную замену среднему вероятностей: оно
реализует другую операцию и может дать другой ответ.
4.4. ELBO: логарифм стоит снаружи скрытых объяснений
В модели с латентной переменной наблюдение 𝑥 может иметь много скрытых объяснений 𝑧.
Маргинальное правдоподобие складывает их:
𝑝𝜃 (𝑥) =
𝑝𝜃 (𝑥, 𝑧) 𝑑𝑧.
Для обучения нужен логарифм
log 𝑝𝜃 (𝑥) = log
𝑝𝜃 (𝑥, 𝑧) 𝑑𝑧,
но интеграл часто трудно вычислить. Проблема снова имеет знакомую форму: логарифм стоит
после суммирования по скрытым состояниям.
Введём вариационное распределение 𝑞𝜙 (𝑧 ∣ 𝑥), положительное там, где 𝑝𝜃 (𝑥, 𝑧) > 0. Тогда
log 𝑝𝜃 (𝑥) = log
𝑞𝜙 (𝑧 ∣ 𝑥)
= log 𝔼𝑞𝜙 (𝑧∣𝑥)
𝑝𝜃 (𝑥, 𝑧)
𝑑𝑧
𝑞𝜙 (𝑧 ∣ 𝑥)
𝑝𝜃 (𝑥, 𝑍)
.
𝑞𝜙 (𝑍 ∣ 𝑥)
Логарифм вогнут, поэтому Йенсен разворачивает знак:
log 𝑝𝜃 (𝑥) ≥ 𝔼𝑞𝜙 (𝑧∣𝑥) log 𝑝𝜃 (𝑥, 𝑍) − log 𝑞𝜙 (𝑍 ∣ 𝑥) .
Правая часть называется нижней границей свидетельства (evidence lower bound, ELBO):
ELBO(𝑥) ∶= 𝔼𝑞𝜙 (𝑧∣𝑥) log 𝑝𝜃 (𝑥, 𝑍) − log 𝑞𝜙 (𝑍 ∣ 𝑥) .
Здесь Йенсен не просто доказывает существование какой-то границы. Он превращает трудный
логарифм интеграла в ожидание, которое можно оценивать сэмплами из 𝑞𝜙 и оптимизировать
стохастическим градиентом.
Разрыв известен точно
Используем
𝑝𝜃 (𝑧 ∣ 𝑥) =
59
𝑝𝜃 (𝑥, 𝑧)
.
𝑝𝜃 (𝑥)
Теория информации для машинного обучения
Тогда
log 𝑝𝜃 (𝑥) − ELBO(𝑥) = 𝔼𝑞𝜙 log
𝑞𝜙 (𝑍 ∣ 𝑥)
𝑝𝜃 (𝑍 ∣ 𝑥)
= 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝𝜃 (𝑧 ∣ 𝑥) .
Итак,
log 𝑝𝜃 (𝑥) = ELBO(𝑥) + 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝𝜃 (𝑧 ∣ 𝑥) .
Теперь условие равенства Йенсена получает вероятностный смысл. Вес
𝑊(𝑧) =
𝑝𝜃 (𝑥, 𝑧)
𝑞𝜙 (𝑧 ∣ 𝑥)
должен быть постоянным при 𝑧 ∼ 𝑞𝜙 . Это происходит тогда и только тогда, когда
𝑞𝜙 (𝑧 ∣ 𝑥) = 𝑝𝜃 (𝑧 ∣ 𝑥)
почти всюду: в этом случае 𝑊(𝑧) = 𝑝𝜃 (𝑥) и граница становится точной.
Небольшой дискретный пример
Для фиксированного 𝑥 пусть
𝑝(𝑥, 𝑧 = 0) = 0.09,
𝑝(𝑥, 𝑧 = 1) = 0.01.
60
Влад Куликов · Открытая редакция 2026.1
Тогда
𝑝(𝑥) = 0.1,
𝑝(𝑧 ∣ 𝑥) = (0.9, 0.1).
Возьмём грубое приближение
𝑞(𝑧 ∣ 𝑥) = (0.5, 0.5).
Получаем
log 𝑝(𝑥) = ln 0.1 ≈ −2.303,
ELBO(𝑥) =
1 0.09 1 0.01
ln
+ ln
≈ −2.813.
2
0.5
2
0.5
Разрыв равен
−2.303 − (−2.813) ≈ 0.511 ната,
и в точности совпадает с
𝐷KL (0.5, 0.5)‖(0.9, 0.1) .
Число 0.511 здесь не «штраф, добавленный вручную». Это точная цена несовпадения выбранного 𝑞
с истинным апостериорным распределением.
Форма, знакомая по VAE
Если совместное распределение факторизуется как
𝑝𝜃 (𝑥, 𝑧) = 𝑝(𝑧)𝑝𝜃 (𝑥 ∣ 𝑧),
то ELBO переписывается как
ELBO(𝑥) = 𝔼𝑞𝜙 (𝑧∣𝑥) [log 𝑝𝜃 (𝑥 ∣ 𝑧)] − 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝(𝑧) .
Первое слагаемое обычно называют реконструкционным, хотя математически это ожидаемое
условное log-likelihood и его конкретная форма зависит от декодера. Второе сравнивает приближённое
апостериорное распределение с априорным распределением (prior). Оно возникает из вероятностного
разложения, а не как внешняя регуляризация, приклеенная к функции потерь.
Положительный результат уже достаточно силён:
• максимизация ELBO повышает вычислимую нижнюю границу на log 𝑝𝜃 (𝑥);
• точность границы определяется KL до истинного апостериорного распределения;
• более выразительное семейство 𝑞𝜙 может уменьшить лучший достижимый вариационный
разрыв.
Граница утверждения тоже важна. Более высокая ELBO не гарантирует глобальный оптимум,
полезность латентного представления для любой внешней задачи или отсутствие проблем
оптимизации. IWAE, амортизационный разрыв и posterior collapse будут естественнее обсуждаться в
Модуле 9, где для них уже появится вся VAE-постановка.
61
Теория информации для машинного обучения
4.5. Log-sum inequality:
состояний
что теряется при объединении
Представьте, что 𝑃 и 𝑄 различаются на четырёх состояниях, а затем мы склеиваем их в две группы.
После такого укрупнения у нас стало меньше деталей. Может ли различимость распределений по KL
увеличиться?
Ответ — нет. Алгебраический механизм этого факта называется логарифмическим неравенством
сумм (log‐sum inequality).
Формулировка
Пусть 𝑎𝑖 , 𝑏𝑖 ≥ 0,
𝐴=
𝑎𝑖 ,
𝐵=
𝑖
𝑏𝑖 .
𝑖
Используем соглашения
0 log
0
∶= 0,
𝑏
𝑎 log
𝑎
∶= +∞ (𝑎 > 0).
0
Тогда
𝑎𝑖 log
𝑖
𝑎𝑖
𝐴
≥ 𝐴 log .
𝑏𝑖
𝐵
Если 𝐴, 𝐵 > 0 и левая часть конечна, равенство достигается тогда и только тогда, когда совпадают
нормированные векторы:
𝑎𝑖
𝑏𝑖
=
𝐴
𝐵
для всех релевантных 𝑖 . Эквивалентно, отношения 𝑎𝑖 /𝑏𝑖 постоянны.
Почему это та же неотрицательность KL
Нормируем последовательности:
𝑎𝑖
,
𝐴
𝑞𝑖 =
𝑏𝑖
.
𝐵
𝑎𝑖
=𝐴
𝑏𝑖
𝑝𝑖 log
𝐴𝑝𝑖
𝐵𝑞𝑖
𝑝𝑖 =
Тогда
𝑎𝑖 log
𝑖
𝑖
𝐴
+ 𝐴𝐷KL (𝑃‖𝑄)
𝐵
𝐴
≥ 𝐴 log .
𝐵
= 𝐴 log
Log-sum — не отдельный фокус, который нужно запоминать рядом с KL. Это неотрицательность KL
после правильной нормировки.
Его можно также вывести напрямую из Йенсена для выпуклой функции 𝑢 log 𝑢, используя веса 𝑏𝑖 /𝐵.
Оба доказательства показывают одну структуру с двух сторон.
62
Влад Куликов · Открытая редакция 2026.1
Совместная выпуклость KL: смешивание скрывает индекс компонента
Пусть есть пары распределений (𝑃𝑗 , 𝑄𝑗 ) и веса 𝜆𝑗 . Для каждого исхода применим log-sum к
𝑎𝑗 = 𝜆𝑗 𝑝𝑗 (𝑥),
𝑏𝑗 = 𝜆𝑗 𝑞𝑗 (𝑥),
а затем просуммируем по 𝑥 . Получим
𝐷KL
𝜆𝑗 𝑃𝑗
𝜆𝑗 𝑄𝑗
𝑗
≤
𝑗
𝜆𝑗 𝐷KL (𝑃𝑗 ‖𝑄𝑗 ) .
𝑗
Это совместная выпуклость KL.
Формулу полезно прочитать как эксперимент. Сначала выбирается индекс 𝐽 = 𝑗, затем исход
приходит либо из 𝑃𝑗 , либо из 𝑄𝑗 . Пока индекс 𝐽 известен, средняя различимость равна правой части.
Если индекс скрыть и оставить только смеси, различимость не может вырасти. Смешивание удалило
информацию о том, из какого компонента пришёл объект.
При фиксированном 𝑃 получаем частный случай
𝐷KL 𝑃
≤
𝜆𝑗 𝑄𝑗
𝜆𝑗 𝐷KL (𝑃‖𝑄𝑗 ),
𝑗
𝑗
который снова объясняет гарантию вероятностного ансамбля на уровне распределений.
Укрупнение состояний не увеличивает KL
Пусть детальное состояние 𝑋 заменяется группой
𝑌 = 𝑇(𝑋).
Для каждой группы 𝑦 применим log-sum к значениям 𝑝(𝑥) и 𝑞(𝑥) внутри множества {𝑥 ∶ 𝑇(𝑥) = 𝑦}.
После суммирования по группам получаем
𝐷KL (𝑃𝑌 ‖𝑄𝑌 ) ≤ 𝐷KL (𝑃𝑋 ‖𝑄𝑋 ) .
63
Теория информации для машинного обучения
Для примера
𝑃 = (0.4, 0.3, 0.2, 0.1),
𝑄 = (0.1, 0.2, 0.3, 0.4)
имеем
𝐷(𝑃‖𝑄) ≈ 0.4564 ната.
Объединим первые два и последние два состояния:
𝑄̄ = (0.3, 0.7).
𝑃̄ = (0.7, 0.3),
Теперь
̄ ≈ 0.3389 ната.
̄ 𝑄)
𝐷(𝑃‖
Различимость уменьшилась, потому что мы больше не видим, как масса распределена внутри
каждой группы.
Условие равенства особенно содержательно. KL сохраняется тогда и только тогда, когда отношение
правдоподобий
𝑝(𝑥)
𝑞(𝑥)
постоянно внутри каждой группы. Эквивалентно, при положительных групповых массах
𝑃(𝑋 = 𝑥 ∣ 𝑌 = 𝑦) = 𝑄(𝑋 = 𝑥 ∣ 𝑌 = 𝑦).
64
Влад Куликов · Открытая редакция 2026.1
Зная группу, детальное состояние больше не помогает различить 𝑃 и 𝑄 . Это точная алгебраическая
форма идеи «сжатие ничего существенного не потеряло». В дальнейшем тот же рисунок приведёт к
неравенству обработки данных (Data Processing Inequality) и к достаточным статистикам.
Для произвольного стохастического канала доказательство устроено так же: применяем log-sum к
членам 𝑝(𝑥)𝐾(𝑦 ∣ 𝑥) и 𝑞(𝑥)𝐾(𝑦 ∣ 𝑥). В Модуле 5 эта конструкция станет основой DPI для взаимной
информации.
4.6. Одна теорема — четыре рабочих механизма
Теперь полезно собрать маршрут в одну таблицу.
Где возникает среднее
Нелинейность
Что даёт Йенсен
вероятности моделей
логиты моделей
− log
logsumexp
скрытые объяснения 𝑧
компоненты сумм или
объединяемые состояния
log
𝑢 log 𝑢
NLL смеси не хуже среднего NLL
NLL средних логитов не хуже
среднего NLL
нижнюю границу ELBO
log-sum, выпуклость KL и сжатие
различимости
Важна не сама способность узнать слово «Йенсен» внутри очередного доказательства.
переносимый вопрос:
Важен
Что именно усредняется, какая функция применяется после усреднения и
какова её кривизна на нужной области?
Этот вопрос защищает сразу от двух ошибок. Первая — переставить операции как будто линейность
сохраняется. Вторая — увидеть выпуклость и сделать слишком сильный вывод о качестве всей
системы. Йенсен сравнивает конкретные величины при фиксированной постановке; обобщение,
оптимизация и поведение при сдвиге распределения требуют отдельных аргументов.
Дальше аппарат будет возвращаться в более богатых формах:
• в Модуле 5 log-sum станет DPI для KL и взаимной информации;
• в Модуле 8 условия равенства встретятся рядом с достаточными статистиками и экспоненциальными
семействами;
• в Модуле 9 ELBO войдёт в VAE, Information Bottleneck и rate–distortion;
• в Модуле 11 выпуклость породит вариационные представления дивергенций;
• в Модуле 12 KL появится как мера сложности в PAC-Bayes.
4.7. Ключевые выводы модуля
1. Для выпуклой функции
𝜙(𝔼𝑋) ≤ 𝔼𝜙(𝑋),
а для вогнутой знак меняется.
2. Разрыв возникает из сочетания разброса аргументов и кривизны функции. Усреднение
одинаковых предсказаний ничего не даёт.
3. Смесь вероятностей и средние логиты — разные ансамбли. Оба не хуже среднего участника по
NLL, но ни один не доминирует другой всегда.
4. ELBO — прямой Йенсен для логарифма маргинального правдоподобия; её точный разрыв равен
𝐷KL (𝑞(𝑧 ∣ 𝑥)‖𝑝(𝑧 ∣ 𝑥)).
5. Log-sum — рабочая форма неотрицательности KL. Она объясняет совместную выпуклость и то,
почему объединение состояний не может увеличить различимость.
6. Выпуклость даёт точную локальную гарантию для заданных величин. Она не заменяет проверку
оптимизации, обобщения, калибровки и качества на целевом распределении.
65
Теория информации для машинного обучения
4.9. Литература и первоисточники
• Boyd & Vandenberghe, Convex Optimization — выпуклые функции, опорные гиперплоскости, log‐
sumexp и неравенство Йенсена.
• Cover & Thomas, Elements of Information Theory — log-sum inequality, совместная выпуклость KL
и неравенство обработки данных.
• Kingma & Welling, Auto-Encoding Variational Bayes — вариационная нижняя граница и
амортизованный вывод в моделях с непрерывными латентными переменными.
• Lakshminarayanan, Pritzel & Blundell, Simple and Scalable Predictive Uncertainty Estimation Using
Deep Ensembles — практический контекст для усреднения вероятностных предсказаний.
• Bregman, The relaxation method of finding the common point of convex sets and its application to the
solution of problems in convex programming — исходная конструкция дивергенций Брэгмана.
66
Модуль 5. Взаимная информация:
сколько один объект говорит о
другом
Как читать этот модуль. Основной маршрут — §§5.1–5.12. Мы начнём с привычного
для ML вопроса о качестве вероятностного предсказания, затем перейдём к условной
взаимной информации, представлениям, шумным меткам, InfoNCE и оцениванию MI по
конечной выборке. Усиленное неравенство обработки данных в §5.5 и неравенство Фано в
упражнениях — математические углубления для второго прохода.
5.1. Признак полезен не сам по себе
Пусть целевая переменная 𝑌 — честный бит. До того как модель увидела признаки, её лучший
вероятностный прогноз прост:
𝑞(𝑦) =
1
.
2
Средняя логарифмическая потеря такого прогноза равна одному биту:
𝔼[− log2 𝑞(𝑌)] = 1.
Теперь появляется признак 𝑋, который совпадает с 𝑌 с вероятностью 0.9 и инвертирован с
вероятностью 0.1. Оптимальный предиктор уже не обязан отвечать 50/50: увидев 𝑋, он назначает
соответствующему значению 𝑌 вероятность 0.9. Его средняя потеря становится
ℎ2 (0.1) = −0.1 log2 0.1 − 0.9 log2 0.9 ≈ 0.469
бита. Признак сэкономил
1 − ℎ2 (0.1) ≈ 0.531
бита логарифмической потери (log‐loss) на одно наблюдение.
Это и есть взаимная информация:
𝐼(𝑋; 𝑌) = 𝐻(𝑌) − 𝐻(𝑌 ∣ 𝑋) .
Взаимная информация — это ожидаемый выигрыш в оптимальной логарифмической
потере, который даёт знание одной переменной при предсказании другой.
Эта формулировка сразу связывает классическую теорию информации с ML. Взаимная информация
отвечает не на расплывчатый вопрос «хороший ли это признак вообще?», а на точный вопрос:
67
Теория информации для машинного обучения
насколько признак уменьшает неизбежную неопределённость целевой переменной при
идеальном вероятностном предсказании на данном распределении?
Слово «идеальном» здесь существенно. Реальная модель конечной мощности может не извлечь всю
доступную информацию; конечная выборка может не позволить её надёжно оценить; распределение
на проде может отличаться от обучающего. MI описывает связь случайных величин на уровне
распределения, а не автоматически качество конкретного обученного классификатора.
В ML этот вопрос возникает постоянно:
•
•
•
•
•
•
насколько признак полезен для целевой переменной;
что новый признак добавляет сверх уже выбранных;
сколько информации о метке сохранил энкодер;
связаны ли изображение и подпись сильнее, чем случайная пара;
не попала ли целевая переменная в признаки через утечку данных;
какую часть общего содержания сохраняют две аугментации одного объекта.
Корреляция — естественный первый кандидат, но она видит прежде всего линейную связь. Возьмём
𝑋 ∼ Unif{−2, −1, 1, 2},
𝑌 = 𝑋2.
Из симметрии Cov(𝑋, 𝑌) = 0. Однако 𝑌 полностью определяется по 𝑋 и принимает два равновероятных
значения, поэтому
𝐼(𝑋; 𝑌) = 𝐻(𝑌) = 1 бит.
Нулевая корреляция здесь означает отсутствие линейного тренда, а не отсутствие зависимости.
Если не сказано обратное, дискретные примеры используют логарифм по основанию 2 и измеряются
в битах. В функциях потерь ML обычно берут натуральный логарифм; тогда те же величины
измеряются в натах.
68
Влад Куликов · Открытая редакция 2026.1
5.2. Одна величина — три чтения
У взаимной информации несколько эквивалентных форм. Каждая отвечает на свой вопрос, и
полезнее не выбирать «главную», а научиться переходить между ними.
Выигрыш в предсказании
Представим, что мы предсказываем дискретную 𝑌 по логарифмической потере. Без доступа к
𝑋 лучший на уровне распределения прогноз — маргинальное распределение 𝑃𝑌 , а минимальная
ожидаемая потеря равна
𝐻(𝑌).
С доступом к 𝑋 = 𝑥 лучший прогноз — 𝑃𝑌∣𝑋=𝑥 , а средняя минимальная потеря равна
𝐻(𝑌 ∣ 𝑋).
Поэтому
𝐼(𝑋; 𝑌) = 𝐻(𝑌) − 𝐻(𝑌 ∣ 𝑋) .
Ту же формулу можно прочитать в обратную сторону:
𝐼(𝑋; 𝑌) = 𝐻(𝑋) − 𝐻(𝑋 ∣ 𝑌).
Именно поэтому MI симметрична. Предсказательные задачи «угадывать 𝑌 по 𝑋» и «угадывать 𝑋 по
𝑌» различаются, но среднее сокращение логарифмической неопределённости оказывается одним и
тем же.
Расстояние от мира независимости
Наиболее общая формулировка — через KL-дивергенцию:
𝐼(𝑋; 𝑌) = 𝐷KL 𝑃𝑋𝑌 ‖ 𝑃𝑋 ⊗ 𝑃𝑌 .
𝑃𝑋 ⊗ 𝑃𝑌 — совместное распределение, которое получилось бы, если бы связь между переменными
была разорвана, а маргинальные распределения остались прежними. Поэтому MI измеряет среднюю
цену подмены реального совместного мира независимой моделью.
Для дискретных переменных
𝐼(𝑋; 𝑌) =
𝑝(𝑥, 𝑦) log
𝑥,𝑦
𝑝(𝑥, 𝑦)
.
𝑝(𝑥)𝑝(𝑦)
Из свойств KL сразу следуют
𝐼(𝑋; 𝑌) ≥ 0
и
𝐼(𝑋; 𝑌) = 0
⟺
𝑋 ⟂ 𝑌.
Это отличие от корреляции принципиально: нулевая MI означает полную статистическую
независимость, а не только исчезновение одного момента.
69
Теория информации для машинного обучения
Перекрытие неопределённостей
По цепному правилу
𝐼(𝑋; 𝑌) = 𝐻(𝑋) + 𝐻(𝑌) − 𝐻(𝑋, 𝑌) .
Для дискретных величин отсюда следуют границы
0 ≤ 𝐼(𝑋; 𝑌) ≤ min{𝐻(𝑋), 𝐻(𝑌)}.
Если 𝑌 = 𝑔(𝑋) — дискретная детерминированная функция, то
𝐼(𝑋; 𝑌) = 𝐻(𝑌).
Это не обязано равняться 𝐻(𝑋): необратимое отображение может забыть часть различий между
значениями 𝑋. При взаимно однозначном преобразовании сохраняется вся энтропия:
𝐼(𝑋; 𝑌) = 𝐻(𝑋) = 𝐻(𝑌).
Диаграмма с пересекающимися областями — хороший мнемонический якорь для двух дискретных
переменных. Но это не буквальная евклидова геометрия. Для трёх и более переменных появляются
избыточность, синергия и взаимодействующая информация; простая картинка с кругами быстро
перестаёт быть надёжной картой.
Где заканчиваются безопасные формулы.
KL-определение остаётся базовым и для
непрерывных величин. Записи через разности дифференциальных энтропий требуют, чтобы
соответствующие величины были корректно определены и не возникало неопределённостей вида
∞ − ∞. Кроме того, для непрерывной неатомарной величины 𝐼(𝑋; 𝑋) обычно бесконечна. А термин
собственная информация (self‐information) обычно означает неожиданность отдельного
исхода − log 𝑝(𝑥), а не энтропию распределения.
70
Влад Куликов · Открытая редакция 2026.1
5.3. PMI: локальный логарифм связи
MI усредняет зависимость по всем парам. Для конкретной пары исходов используется поточечная
взаимная информация (pointwise mutual information, PMI):
pmi(𝑥; 𝑦) = log
𝑝(𝑥, 𝑦)
𝑝(𝑦 ∣ 𝑥)
= log
.
𝑝(𝑥)𝑝(𝑦)
𝑝(𝑦)
Это логарифм коэффициента, показывающего, во сколько раз наблюдение 𝑥 изменило вероятность
𝑦 относительно базовой частоты.
Например, пусть
𝑝(𝑥) = 0.01,
𝑝(𝑦) = 0.02,
𝑝(𝑥, 𝑦) = 0.001.
При независимости совместная вероятность была бы 0.0002. Реальная пара встречается в пять раз
чаще, поэтому
pmi(𝑥; 𝑦) = log2 5 ≈ 2.32 бита.
Знак PMI имеет прямое чтение:
• pmi(𝑥; 𝑦) > 0: пара встречается чаще независимого ожидания;
• pmi(𝑥; 𝑦) = 0: конкретная пара согласуется с независимостью;
• pmi(𝑥; 𝑦) < 0: пара встречается реже независимого ожидания.
В отличие от MI, отдельная PMI может быть отрицательной. Взаимная информация — её среднее по
реальному совместному распределению:
𝐼(𝑋; 𝑌) = 𝔼(𝑋,𝑌)∼𝑃𝑋𝑌 [pmi(𝑋; 𝑌)].
В NLP PMI и её варианты используются для оценки ассоциации слова и контекста. Здесь же возникает
типичная ловушка: редкая пара с одним-двумя наблюдениями может получить огромное значение
из-за малого знаменателя. Поэтому практический анализ почти всегда требует порога по частоте,
сглаживания, перестановочного контроля или другой проверки устойчивости. Большой логарифм
ещё не означает надёжное свидетельство.
5.4.
Условная MI: что новый признак добавляет сверх
известных
Маргинальная 𝐼(𝑋; 𝑌) отвечает на вопрос, полезен ли 𝑋 сам по себе. В модели с десятками признаков
этого мало. Нужно понять, приносит ли 𝑋 что-то новое после того, как уже известна переменная 𝑍.
Определим условную взаимную информацию:
𝐼(𝑋; 𝑌 ∣ 𝑍) = 𝔼𝑍 𝐷KL 𝑃𝑋𝑌∣𝑍 ‖ 𝑃𝑋∣𝑍 𝑃𝑌∣𝑍 .
Для дискретных переменных
𝐼(𝑋; 𝑌 ∣ 𝑍) = 𝐻(𝑌 ∣ 𝑍) − 𝐻(𝑌 ∣ 𝑋, 𝑍) .
Это ожидаемая экономия в оптимальной логарифмической потере от добавления 𝑋 к уже известному
𝑍.
Цепное правило имеет вид
71
Теория информации для машинного обучения
𝐼(𝑋; 𝑌, 𝑍) = 𝐼(𝑋; 𝑌) + 𝐼(𝑋; 𝑍 ∣ 𝑌) .
В отборе признаков эта формула объясняет два противоположных эффекта.
Избыточность
Новый признак может иметь высокую 𝐼(𝑋𝑖 ; 𝑌), но почти нулевую
𝐼(𝑋𝑖 ; 𝑌 ∣ 𝑋𝑆 ),
потому что он повторяет уже выбранные признаки. Например, температура в градусах Цельсия
и Фаренгейта по отдельности одинаково информативны о некоторой погодной метке, но второй
признак почти ничего не добавляет после первого.
Синергия
Информация может появляться только в комбинации. Пусть 𝑋1 , 𝑋2 — независимые честные биты, а
𝑌 = 𝑋1 ⊕ 𝑋2 .
Тогда
𝐼(𝑋1 ; 𝑌) = 𝐼(𝑋2 ; 𝑌) = 0,
но
𝐼((𝑋1 , 𝑋2 ); 𝑌) = 1 бит.
Более того,
𝐼(𝑋1 ; 𝑌 ∣ 𝑋2 ) = 1 бит.
До знания 𝑋2 первый бит бесполезен; после знания 𝑋2 он полностью определяет метку. Это
чистый пример взаимодействия, которое деревья, нейросети и признаки-пересечения способны
использовать, а одномерный фильтр по 𝐼(𝑋𝑖 ; 𝑌) — нет.
Условная MI даёт правильный язык для добавочной ценности, но не бесплатный алгоритм. В
высокой размерности её оценивание ещё сложнее, чем оценивание маргинальной MI. Поэтому
реальные методы часто используют приближения, жадные критерии или непосредственно
проверяют улучшение целевой метрики на отложенных данных.
5.5. DPI: энкодер может перепаковать информацию, но не
напечатать новые биты
Пусть
𝑌→𝑋→𝑇
— марковская цепь: представление 𝑇 строится из входа 𝑋 и не получает целевую переменную 𝑌 по
другому пути. Тогда
𝐼(𝑌; 𝑇) ≤ 𝐼(𝑌; 𝑋) .
72
Влад Куликов · Открытая редакция 2026.1
Это неравенство обработки данных (Data Processing Inequality, DPI).
Фиксированная обработка может сохранить, отбросить или переупаковать
информацию о метке, но не создать ту информацию, которой не было во
входе.
Короткое доказательство показывает, откуда берётся потеря. По цепному правилу
𝐼(𝑌; 𝑋, 𝑇) = 𝐼(𝑌; 𝑋) + 𝐼(𝑌; 𝑇 ∣ 𝑋)
и одновременно
𝐼(𝑌; 𝑋, 𝑇) = 𝐼(𝑌; 𝑇) + 𝐼(𝑌; 𝑋 ∣ 𝑇).
Из марковости 𝐼(𝑌; 𝑇 ∣ 𝑋) = 0. Поэтому
𝐼(𝑌; 𝑋) = 𝐼(𝑌; 𝑇) + 𝐼(𝑌; 𝑋 ∣ 𝑇) ≥ 𝐼(𝑌; 𝑇).
Остаток
𝐼(𝑌; 𝑋 ∣ 𝑇)
имеет содержательное значение: это информация о 𝑌, которая ещё была во входе 𝑋, но уже
недоступна после перехода к 𝑇.
Почему после энкодера классифицировать бывает легче
На первый взгляд DPI спорит с опытом deep learning: хороший энкодер повышает качество
линейного пробника, иногда радикально. Противоречия нет. DPI ограничивает количество
информации на уровне распределения, но не её доступность конкретному классу моделей.
73
Теория информации для машинного обучения
Энкодер может:
•
•
•
•
•
сделать релевантную информацию линейно доступной;
удалить нерелевантные факторы, мешающие обучению на конечной выборке;
сформировать полезные инвариантности;
улучшить обусловленность и геометрию задачи;
внести индуктивное смещение, усвоенное при предобучении.
Информация могла присутствовать во входе, но быть представлена в форме, которую простой
считывающий слой не умеет извлечь. Нейросеть не обязана увеличивать 𝐼(𝑌; 𝑇), чтобы увеличить
точность ограниченного считывающего слоя.
Где в вероятностной схеме находятся обученные веса
DPI относится к фиксированному каналу 𝑋 ↦ 𝑇. Предобученная модель приносит информацию
из обучающего набора в параметрах. Если параметры Θ считаются случайными, корректная схема
должна включать их явно, например
𝑌 → (𝑋, Θ) → 𝑇.
После фиксации весов для нового примера действует обычная DPI относительно выбранного
совместного распределения. Поэтому лозунг «сеть ничего не знает сверх текущего входа» слишком
груб: она не создаёт информацию из пустоты, но использует знание, закодированное в параметрах.
Достаточное для задачи представление
Если 𝑇 = 𝑓(𝑋) и
𝑌 ⟂ 𝑋 ∣ 𝑇,
то 𝑇 сохраняет всю информацию о 𝑌, доступную во входе:
𝐼(𝑌; 𝑇) = 𝐼(𝑌; 𝑋).
Такое представление называют достаточным для задачи.
Оно может отбросить цвет фона,
идентификатор камеры или точную текстуру, если эти детали не помогают предсказывать целевую
переменную.
Здесь важно развести две цели:
• сохранить 𝐼(𝑌; 𝑇) близкой к 𝐼(𝑌; 𝑋);
• при необходимости уменьшить 𝐼(𝑋; 𝑇), не перенося в представление все детали входа.
Этот компромисс лежит в основе информационного бутылочного горлышка (Information Bottle‐
neck):
max 𝐼(𝑇; 𝑌) − 𝛽𝐼(𝑋; 𝑇) .
𝑃𝑇∣𝑋
В M9 мы разберём, когда эта постановка полезна и почему её нельзя автоматически считать
описанием динамики любой детерминированной нейросети.
Математическое углубление: усиленное DPI
Этот подраздел можно пропустить при первом чтении.
Обычная DPI говорит только, что информация не растёт. Для некоторых шумных каналов можно
получить количественную контракцию:
74
Влад Куликов · Открытая редакция 2026.1
𝐼(𝑈; 𝑍) ≤ 𝜂𝐼(𝑈; 𝑋),
𝑈 → 𝑋 → 𝑍,
0 ≤ 𝜂 < 1.
Тогда каскад каналов даёт геометрическую верхнюю границу. Для двоичного симметричного канала
с вероятностью инверсии 𝜀 ∈ [0, 1/2] глобальный коэффициент KL-контракции равен
𝜂 = (1 − 2𝜀)2 .
Это сильный результат о конкретном стохастическом канале. Но он не превращается автоматически в
теорему о том, что информация в любой глубокой детерминированной сети обязана экспоненциально
исчезать, а residual-связь обязана иметь коэффициент контракции ровно единица. Для такого
переноса нужно сначала определить случайные величины, канал и область супремума. SDPI —
точный инструмент, а не универсальная архитектурная метафора.
5.6. MI, корреляция и причинность отвечают на разные
вопросы
MI и корреляция
Корреляция Пирсона измеряет нормированную линейную ковариацию. MI проверяет, отличается
ли всё совместное распределение от произведения маргиналов.
Поэтому
𝐼(𝑋; 𝑌) = 0
⟺
𝑋 ⟂ 𝑌,
но
Corr(𝑋, 𝑌) = 0
не гарантирует независимость.
75
Теория информации для машинного обучения
Для совместно гауссовской пары связь особенно проста:
1
𝐼(𝑋; 𝑌) = − log(1 − 𝜌2 ).
2
При натуральном логарифме результат измеряется в натах, при log2 — в битах. Это формула для
совместно гауссовского распределения, а не универсальный перевод корреляции в MI. За пределами
гауссовского семейства одно значение 𝜌 не определяет всю зависимость.
MI и причинность
Большая 𝐼(𝑋; 𝑌) говорит, что переменные статистически связаны. Она не сообщает, почему именно:
•
•
•
•
•
𝑋 может влиять на 𝑌;
𝑌 может влиять на 𝑋;
обе переменные могут зависеть от общего фактора 𝑍;
связь может возникнуть из-за отбора наблюдений;
признак может содержать утечку из будущего или из этапа предобработки.
Высокая MI может сделать признак отличным предиктором и одновременно плохой переменной
для вмешательства. Взаимная информация измеряет зависимость, а причинный эффект требует
интервенционной или каузальной постановки.
5.7. Шумные метки: когда 100% ошибок всё ещё несут один
бит
Рассмотрим двоичный симметричный канал (binary symmetric channel, BSC):
𝑌 = 𝑌 ⊕ 𝐸,
𝐸 ∼ Bern(𝜀),
76
Влад Куликов · Открытая редакция 2026.1
где 𝑌 — честный бит, а 𝑌 — наблюдаемая метка.
При равномерном входе наблюдаемая метка тоже равномерна, а
𝐻(𝑌 ∣ 𝑌) = ℎ2 (𝜀).
Следовательно,
𝐼(𝑌; 𝑌) = 1 − ℎ2 (𝜀) .
Кривая содержит три режима:
• 𝜀 = 0: метка передаётся без ошибок, MI равна одному биту;
• 𝜀 = 1/2: наблюдаемая метка независима от истинной, MI равна нулю;
• 𝜀 = 1: метка всегда неправильна, но инверсия детерминирована и обратима, поэтому MI снова
равна одному биту.
Последняя точка особенно полезна. Взаимная информация измеряет предсказуемую связь,
а не семантическую правильность символа. Если известно, что разметчик всегда меняет 0
на 1 и 1 на 0, его ответы легко исправить. Гораздо хуже разметчик, который в половине случаев
подбрасывает монету.
Для BSC равномерное входное распределение достигает пропускной способности:
𝐶 = 1 − ℎ2 (𝜀)
бит на использование канала. В ML эта модель служит чистым базовым случаем симметричного
шума меток. Реальные ошибки часто зависят от класса, сложности примера, разметчика и скрытого
контекста; тогда одной 𝜀 недостаточно.
77
Теория информации для машинного обучения
5.8. Отбор признаков: полезный фильтр, но не оракул
Простейший фильтр ранжирует признаки по
𝐼(𝑋𝑖 ; 𝑌).
В сравнении с корреляцией это серьёзное расширение: можно обнаружить нелинейную зависимость.
Но универсальность меры не делает процедуру универсально надёжной.
Риск
Что происходит
Что проверять
Избыточность
несколько признаков повторяют
одну и ту же информацию
признаки бесполезны по одному,
но полезны совместно
условную MI или качество после
добавления к выбранному набору
взаимодействия,
признаки-пересечения, модели с
подходящим классом функций
бутстрэп, повторные разбиения,
перестановочный контроль
Синергия
Ошибка оценки
Утечка
ранжирование меняется из-за
малого 𝑛, размерности и
гиперпараметров оценивателя
признаки выбираются с
использованием валидационной
части
выполнять отбор внутри каждого
обучающего фолда
mRMR-подобные критерии пытаются совместить релевантность и штраф за избыточность. Это
разумная эвристика, но не точное решение общей многомерной задачи: попарные штрафы не
обязаны замечать синергию высокого порядка.
Практический минимальный протокол:
1.
2.
3.
4.
5.
определить случайные величины и единицу наблюдения;
считать оцениватель и его гиперпараметры частью обучающего конвейера;
выполнять отбор только на обучающей части каждого разбиения;
сравнивать оценки с перестановочной базовой линией;
повторять оценивание для нескольких начальных состояний генератора (seeds) и размеров
выборки;
6. принимать решение по качеству на отложенных данных, а не по одному числу MI.
MI здесь полезна как фильтр и диагностический сигнал. Она не заменяет валидацию модели и не
доказывает причинную полезность признака.
5.9. InfoNCE: найти согласованную пару среди случайных
Пусть (𝑋, 𝑌) — согласованная пара: две аугментации одного объекта, изображение и подпись,
аудиофрагмент и его контекст. Для якоря 𝑥 берётся один положительный кандидат
𝑦1 ∼ 𝑝(𝑦 ∣ 𝑥)
и 𝑁 − 1 отрицательных кандидатов
iid
𝑦2 , … , 𝑦𝑁 ∼ 𝑝(𝑦).
Модель получает 𝑁 вариантов и должна определить, какой из них образует реальную пару с 𝑥 . Для
функции совместимости 𝑠𝜃 (𝑥, 𝑦) потеря InfoNCE равна
ℒNCE = −𝔼 log
exp 𝑠𝜃 (𝑥, 𝑦1 )
𝑁
∑𝑗=1 exp 𝑠𝜃 (𝑥, 𝑦𝑗 )
78
.
Влад Куликов · Открытая редакция 2026.1
Это обычная 𝑁-классовая кросс-энтропия. Но классы здесь необычны: «правильный класс» —
позиция кандидата, пришедшего из условного распределения, а остальные пришли из маргинального.
При этой стандартной схеме выборки выполняется
𝐼(𝑋; 𝑌) ≥ log 𝑁 − ℒNCE .
Основание логарифма должно совпадать с функцией потерь.
В большинстве реализаций
используется натуральный логарифм, поэтому граница измеряется в натах.
Почему классификация связана с MI
Оптимальный критик имеет вид
𝑠 ∗ (𝑥, 𝑦) = log
𝑝(𝑦 ∣ 𝑥)
+ 𝑐(𝑥),
𝑝(𝑦)
где добавка 𝑐(𝑥) сокращается внутри softmax. То есть классификатор учится оценивать логарифм
отношения:
насколько кандидат 𝑦 вероятнее рядом с данным 𝑥 , чем в среднем по набору данных?
Это та же локальная величина, которая появилась в PMI. Контрастивная классификация учит
представление различать совместное распределение и произведение маргиналов.
Положительный результат достаточно силён: уменьшение ожидаемой InfoNCE-потери повышает
соответствующую нижнюю границу на MI. Но точная область действия границы определяется схемой
выборки кандидатов.
79
Теория информации для машинного обучения
Где заканчивается точное утверждение
• log 𝑁 — потолок этой конкретной нижней границы, а не потолок истинной MI или качества
представления;
• значение InfoNCE-потери не является точной оценкой MI;
• больше отрицательных примеров не гарантирует лучшую целевую метрику;
• кандидаты из одного батча могут быть зависимы и не совпадать с независимыми выборками из
𝑝(𝑦);
• ложные отрицательные пары могут отталкивать семантически близкие объекты;
• температура, аугментации, состав батча и класс критика меняют обучающую задачу.
SimCLR и CLIP используют контрастивные классификационные цели этого семейства. Для CLIP
задача симметризована: изображение ищет соответствующий текст, а текст — изображение.
Корректная формулировка состоит в том, что такая цель связана с MI через контрастивную границу
при соответствующей вероятностной схеме. Фраза «CLIP буквально измеряет истинную MI между
изображением и текстом» была бы сильнее математики.
Не всё обучение без разметки является InfoNCE. BYOL, SimSiam и DINO используют другие
механизмы предотвращения коллапса и не сводятся к стандартной классификации одного
положительного примера среди независимых отрицательных.
5.10. Почему число MI трудно получить из выборки
Формула взаимной информации короткая. Её надёжная оценка по конечным данным — нет.
Дискретный подстановочный оцениватель
Для конечных алфавитов можно подставить эмпирические частоты:
𝐼=
𝑝(𝑥, 𝑦) log
𝑥,𝑦
𝑝(𝑥, 𝑦)
.
𝑝(𝑥)𝑝(𝑦)
Когда таблица сопряжённости мала и хорошо заполнена, метод прозрачен. При большом числе ячеек
она становится разреженной: случайные единичные наблюдения выглядят как структура, а нулевые
счётчики заставляют вводить сглаживание.
Дискретизация непрерывных величин
Разбиение на интервалы превращает непрерывные данные в дискретные. Результат зависит от числа
и границ интервалов, выбросов, размера выборки и размерности. Слишком грубая сетка стирает
зависимость; слишком мелкая начинает запоминать шум выборки.
Оцениватели на основе ближайших соседей
KSG-подобные методы выбирают локальный масштаб по расстояниям до 𝑘 ближайших соседей.
В низкой размерности они часто полезнее фиксированного binning, но чувствительны к метрике,
размерности, совпадающим значениям и предобработке. Выбор 𝑘 снова задаёт компромисс
смещения и дисперсии.
Нейросетевые вариационные границы
MINE и родственные методы обучают критик для вариационной нижней границы на
𝐷KL (𝑃𝑋𝑌 ‖𝑃𝑋 𝑃𝑌 ).
80
Влад Куликов · Открытая редакция 2026.1
Это превращает MI в дифференцируемую целевую функцию, но не отменяет статистическую
трудность. Критик может переобучиться, а оценка и её градиент могут иметь большое смещение или
дисперсию. Для нижних границ существует фундаментальное ограничение: без предположений о
распределении высокодоверительная нижняя граница, построенная по 𝑁 наблюдениям, в общем
случае не может надёжно расти существенно быстрее порядка log 𝑁.
Важно различать два утверждения:
• нейросеть способна вывести произвольное большое число;
• это число является гарантированной нижней границей истинной MI на генеральном
распределении.
Первое возможно. Второе требует теоремы, условий и контроля обобщения.
Протокол, который делает число осмысленным
Перед публикацией «MI = 3.7 бита» стоит ответить:
1.
2.
3.
4.
5.
6.
Какие случайные величины и какое распределение генеральной совокупности определены?
Дискретны переменные или непрерывны?
Какой оцениватель используется и какие у него предпосылки?
На тех же данных обучался оцениватель и сообщается результат или есть отложенная проверка?
Как выглядит перестановочная базовая линия?
Стабильно ли число при изменении размера выборки, начального состояния генератора и
гиперпараметров?
В обучении представлений MI часто полезнее как принцип построения цели или сравнительный
диагностический сигнал, чем как абсолютный измерительный прибор.
5.11. Энтропия attention — не взаимная информация
Веса внимания после softmax образуют распределение по ключам:
81
Теория информации для машинного обучения
𝛼𝑖𝑗 ≥ 0,
𝛼𝑖𝑗 = 1.
𝑗
Поэтому для запроса 𝑖 можно вычислить
𝐻(𝛼𝑖,⋅ ).
Эта величина точно описывает концентрацию весов:
• низкая энтропия — масса сосредоточена на нескольких позициях;
• высокая энтропия — масса распределена шире.
Но MI требует совместного распределения двух случайных величин. Одна строка attention-весов сама
по себе такого объекта не задаёт. Кроме того, выход слоя зависит не только от 𝛼𝑖𝑗 , но и от векторов
значений, остаточного потока, последующих слоёв и нелинейностей.
Поэтому энтропия attention может быть полезной описательной статистикой маршрутизации, но из
неё не следуют автоматически:
•
•
•
•
количество информации, переданной между токенами;
причинное влияние позиции на ответ;
полнота объяснения решения модели;
превосходство более резкого или более диффузного внимания.
Здесь не нужно отказываться от информационного языка. Нужно сначала задать случайные
величины, канал и совместное распределение, а уже затем вычислять MI. В M7 мы сделаем это для
настоящих каналов связи; к attention будем возвращаться как к механизму, для которого каналовая
интерпретация требует отдельной модели.
5.12. Ключевые выводы модуля
Взаимная информация объединяет несколько задач, которые в ML часто обсуждают разными
словами:
• зависимость: насколько совместное распределение отличается от независимой модели;
• предсказательная ценность: сколько оптимальной логарифмической потери экономит
признак;
• добавочная ценность: что новый признак сообщает сверх уже известных;
• представления: какую информацию о целевой переменной сохранил энкодер;
• контрастивное обучение: насколько хорошо можно найти согласованную пару среди
случайных;
• пределы обработки: что нельзя восстановить после необратимого преобразования.
Главная формула модуля теперь читается не как абстрактная разность энтропий:
𝐼(𝑋; 𝑌) = 𝐻(𝑌) − 𝐻(𝑌 ∣ 𝑋).
Она говорит:
до наблюдения 𝑋 мы платили 𝐻(𝑌) бит оптимальной логарифмической потери; после
наблюдения — 𝐻(𝑌 ∣ 𝑋); разница и есть ценность информации 𝑋 о 𝑌.
Но для практической работы нужно держать раздельно три объекта:
истинная MI
≠
её оценка по конечной выборке
≠
обучающая прокси-цель .
InfoNCE может быть хорошей целью, даже если не даёт точного измерения MI. Высокая оценка MI
может быть артефактом переобученного критика. Признак с высокой MI может оказаться утечкой.
82
Влад Куликов · Открытая редакция 2026.1
А представление может улучшить линейный считывающий слой, не нарушая DPI и не увеличивая
истинную информацию о метке.
Это не набор исключений из красивой теории. Это и есть зрелое использование теории: сначала
понять точный положительный результат, затем проверить, какой объект вычисляет конкретный
код.
5.14. Источники и дальнейшее чтение
1.
2.
3.
4.
5.
6.
7.
8.
9.
10.
11.
12.
13.
14.
C. E. Shannon, A Mathematical Theory of Communication, 1948.
T. M. Cover, J. A. Thomas, Elements of Information Theory, 2nd ed., 2006.
A. van den Oord, Y. Li, O. Vinyals, Representation Learning with Contrastive Predictive Coding, 2018.
B. Poole et al., On Variational Bounds of Mutual Information, 2019.
M. I. Belghazi et al., MINE: Mutual Information Neural Estimation, 2018.
D. McAllester, K. Stratos, Formal Limitations on the Measurement of Mutual Information, 2020.
A. Kraskov, H. Stögbauer, P. Grassberger, Estimating Mutual Information, 2004.
N. Tishby, F. C. Pereira, W. Bialek, The Information Bottleneck Method, 2000.
Y. Polyanskiy, Y. Wu, Strong Data-Processing Inequalities for Channels and Bayesian Networks,
2017.
T. Chen et al., A Simple Framework for Contrastive Learning of Visual Representations, 2020.
A. Radford et al., Learning Transferable Visual Models From Natural Language Supervision, 2021.
M. Caron et al., Emerging Properties in Self-Supervised Vision Transformers, 2021.
J.-B. Grill et al., Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning, 2020.
X. Chen, K. He, Exploring Simple Siamese Representation Learning, 2020.
В Модуле 6 мы перейдём от зависимости к кодированию источника. Там энтропия перестанет быть
только мерой неопределённости и станет операционным пределом средней длины кода.
83
Модуль 6. Кодирование
источника: от энтропии к
реальным битам
Как читать этот модуль. Основной маршрут — §§6.1–6.8: от вероятностной модели
и неравенства Крафта до арифметического кодирования, AEP, энтропийной скорости
и метрик языковых моделей. §6.9 — математическое углубление про универсальное
последовательное предсказание. §§6.10–6.11 возвращают теорию к оценке качества LLM
и к воспроизводимому компрессионному эксперименту.
6.1.
Инженерная постановка:
энтропийный кодер
вероятностная модель и
В предыдущих модулях величина − log 𝑞(𝑥) появлялась прежде всего как функция потерь: чем
меньшую вероятность модель назначила наблюдению, тем выше штраф. Теперь мы прочитаем ту
же величину как длину описания.
Представим, что две модели оценивают один и тот же фрагмент данных 𝑥 и возвращают следующие
вероятности этого фрагмента:
𝑞𝐴 (𝑥) = 2−1200 ,
𝑞𝐵 (𝑥) = 2−1116 .
Это вероятности всего фрагмента, а не отдельного токена. Для авторегрессионной модели каждая
из них является произведением условных вероятностей последовательных токенов, поэтому для
длинного текста такие числа естественно оказываются очень малыми.
Перейдём от вероятностей к длинам:
− log2 𝑞𝐴 (𝑥) = 1200,
− log2 𝑞𝐵 (𝑥) = 1116.
У второй модели отрицательное логарифмическое правдоподобие меньше на
1200 − 1116 = 84 бита.
Иначе говоря, модель 𝐵 назначает этому фрагменту идеальную информационную длину на 84
бита меньше. Чтобы получить реальный обратимый файл, к вероятностям ещё нужно подключить
энтропийный кодер; его служебная избыточность будет рассмотрена ниже.
Здесь у модели и кодера разные роли.
Вероятностная модель задаёт вероятности следующего символа. Энтропийный
кодер использует эти вероятности, чтобы построить обратимый битовый
поток.
84
Влад Куликов · Открытая редакция 2026.1
Пусть источник порождает последовательность 𝑋1∶𝑛 по распределению 𝑃, а авторегрессионная модель
задаёт
𝑛
𝑞𝜃 (𝑥1∶𝑛 ) =
𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
Идеальная информационная длина конкретной последовательности под моделью равна
𝑛
𝐿ideal (𝑥1∶𝑛 ; 𝑞𝜃 ) = − log2 𝑞𝜃 (𝑥1∶𝑛 ) =
− log2 𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ) .
𝑡=1
Это та же по-токенная отрицательная логарифмическая потеря, только измеренная в битах. Если
библиотека считает NLL натуральным логарифмом, достаточно разделить результат на ln 2.
Например, если модель назначила трём последовательным наблюдениям условные вероятности
1
,
2
1
,
8
1
,
4
то идеальный счёт равен
1 + 3 + 2 = 6 бит.
Логарифм делает здесь ту же работу, что и в Модуле 1: произведение условных вероятностей
превращается в сумму кодовых затрат.
Идеальная длина, длина потока и полная длина описания
Для компрессионного эксперимента полезно держать рядом три величины.
1. Идеальная длина данных
𝐿ideal = − log2 𝑞𝜃 (𝑥).
Именно её измеряет NLL в битах.
2. Фактически выпущенный поток
𝐿stream = 𝐿ideal + Δcoder .
Поправка Δcoder включает конечную точность вероятностей, завершение кода, заголовки и
выравнивание.
3. Полная длина самостоятельного описания
𝐿total = 𝐿(𝜃) + 𝐿(токенизатор) + 𝐿(кодер и протокол) + 𝐿stream + 𝐿(служебные данные).
Она отвечает на вопрос, сколько стоит архив, если у декодера заранее нет модели и протокола.
Обычная валидационная функция потерь измеряет первый счёт. Практический кодер диапазонов
(range coder) приближает второй. Автономный архив обязан оплатить третий.
Ещё одна граница понадобится на протяжении всего модуля. Энтропия ограничивает среднюю
длину относительно заданного источника. Она не запрещает сжать отдельную регулярную строку
значительно короче среднего. Строка из миллиона нулей может оказаться очень дешёвой; теорема
утверждает, что для фиксированного источника нельзя систематически опустить ожидаемую длину
без потерь ниже его энтропийной границы.
85
Теория информации для машинного обучения
6.2. Префиксные коды и неравенство Крафта—Макмиллана
Начнём с простейшего кодера: каждому символу конечного алфавита
𝒳 = {𝑥1 , … , 𝑥𝑚 }
назначается отдельная двоичная строка.
Код называется префиксным (prefix code), если ни одно кодовое слово не является началом
другого. Например,
{0, 10, 110, 111}
— префиксный код, а
{0, 01, 11}
— нет: после чтения первого нуля декодер ещё не знает, закончился символ или началось слово 01.
Префиксность даёт мгновенное декодирование без разделителей. Но за это удобство приходится
соблюдать строгий бюджет.
Теорема Крафта. Положительные целые числа 𝓁1 , … , 𝓁𝑚 являются длинами некоторого двоичного
префиксного кода тогда и только тогда, когда
𝑚
2−𝓁𝑖 ≤ 1 .
𝑖=1
86
Влад Куликов · Открытая редакция 2026.1
Почему возникает неравенство Крафта
Полное бинарное дерево удобно читать как единицу ресурса. Кодовое слово длины 𝓁 занимает долю
2−𝓁
всех достаточно длинных двоичных продолжений. Короткое слово дорого: код длины 1 сразу
откусывает половину дерева; длины 2 — четверть; длины 3 — восьмую часть.
Для кода
{0, 10, 110, 111}
бюджет использован полностью:
1 1 1 1
+ + + = 1.
2 4 8 8
Хочется сделать частый символ короче — придётся освободить для него
крупную ветвь и вытеснить другие символы глубже.
Именно поэтому не существует набора произвольно коротких кодовых слов. Неравенство Крафта —
не техническая формальность, а геометрия ограниченного ресурса.
Обратная часть теоремы конструктивна: если длины укладываются в бюджет, листья можно
разместить в дереве без пересечений. Для более общего класса однозначно декодируемых кодов
та же необходимая оценка известна как часть теоремы Крафта—Макмиллана. В дальнейшем
префиксных кодов достаточно: они дают ту же границу на среднюю длину и проще устроены.
87
Теория информации для машинного обучения
6.3. Односимвольная теорема кодирования
Пусть 𝑋 ∼ 𝑃, где
𝑝𝑖 = 𝑃(𝑋 = 𝑥𝑖 ),
а символу 𝑥𝑖 назначено кодовое слово длины 𝓁𝑖 . Средняя длина равна
𝐿=
𝑝𝑖 𝓁𝑖 .
𝑖
Теперь возникает центральный вопрос: насколько малым может быть 𝐿?
Нижняя граница средней длины кода
Для любого двоичного префиксного кода
𝐿 ≥ 𝐻2 (𝑃) .
Короткое доказательство стоит оставить в основном маршруте: оно показывает, из чего именно
складывается цена неоптимального кода.
Положим
2−𝓁𝑖 ≤ 1,
𝑍=
𝑞𝑖 =
𝑖
2−𝓁𝑖
.
𝑍
Тогда 𝑄 = (𝑞𝑖 ) — распределение, неявно заданное длинами кода. Получаем
𝐿 − 𝐻2 (𝑃) =
𝑝𝑖 log2
𝑖
𝑝𝑖
2−𝓁𝑖
= 𝐷KL,2 (𝑃‖𝑄) − log2 𝑍
≥ 0.
На этом месте удобно остановиться и прочитать формулу словами:
𝐿 − 𝐻2 (𝑃) =
+
𝐷KL,2 (𝑃‖𝑄)
код настроен не на тот источник
(− log2 𝑍)
.
часть дерева не использована
Это доказательство — бухгалтерия префиксного кода. Зазор возникает по двум причинам: длины
ведут себя так, будто источник имеет распределение 𝑄 , а не 𝑃, и код может оставить часть бюджета
Крафта пустой.
Равенство 𝐿 = 𝐻2 (𝑃) возможно только если
𝑄=𝑃
и
𝑍 = 1.
Следовательно,
𝑝𝑖 = 2−𝓁𝑖 .
Точный односимвольный оптимум достигается для диадических распределений, у которых все
− log2 𝑝𝑖 являются целыми числами.
88
Влад Куликов · Открытая редакция 2026.1
Верхняя граница: шенноновский код
Идеальные вещественные длины
− log2 𝑝𝑖
автоматически исчерпывают бюджет Крафта, потому что ∑𝑖 𝑝𝑖 = 1. Но двоичное кодовое слово не
может иметь длину 2.37 бита. Округлим вверх:
𝓁𝑖 = − log2 𝑝𝑖 .
Тогда
2−𝓁𝑖 ≤ 𝑝𝑖 ,
поэтому длины удовлетворяют Крафту, а
𝓁𝑖 < − log2 𝑝𝑖 + 1.
Следовательно, существует префиксный код со средней длиной
𝐻2 (𝑃) ≤ 𝐿 < 𝐻2 (𝑃) + 1 .
Число +1 — не фундаментальная потеря на каждый символ. Это плата за то, что в односимвольном
коде каждая длина должна быть целой. В §6.5 мы отложим округление до конца длинного блока и
разделим эту постоянную на число символов.
Код, построенный по неверной модели
Пусть данные идут из 𝑃, а код строится по модели 𝑄 :
𝓁𝑄 (𝑥) = − log2 𝑞(𝑥) ,
причём 𝑞(𝑥) > 0 на носителе 𝑃. Тогда
𝐻2 (𝑃, 𝑄) ≤ 𝐿𝑄 < 𝐻2 (𝑃, 𝑄) + 1.
Используя
𝐻2 (𝑃, 𝑄) = 𝐻2 (𝑃) + 𝐷KL,2 (𝑃‖𝑄),
получаем
𝐻2 (𝑃) + 𝐷KL,2 (𝑃‖𝑄) ≤ 𝐿𝑄 < 𝐻2 (𝑃) + 𝐷KL,2 (𝑃‖𝑄) + 1 .
Теперь операционный смысл KL становится совсем буквальным:
при идеальном дробном кодировании 𝐷KL,2 (𝑃‖𝑄) — средняя доплата в битах за
использование неверной вероятностной модели.
Односимвольный префиксный код добавляет к этой доплате менее одного бита округления.
89
Теория информации для машинного обучения
6.4. Хаффман, арифметическое кодирование и кодирование
диапазонов
Два классических алгоритма решают одну задачу, но округляют в разных местах.
Хаффман округляет длину каждого символа.
откладывает округление до конца сообщения.
Арифметический кодер
Код Хаффмана
Алгоритм Хаффмана строит оптимальный бинарный префиксный код для известного конечного
распределения.
1. Берём два узла с наименьшими вероятностями.
2. Объединяем их в узел с суммарной вероятностью.
3. Повторяем, пока не останется корень дерева.
Для
𝑃 = (0.40, 0.20, 0.15, 0.15, 0.10)
один из оптимальных кодов имеет длины
(1, 3, 3, 3, 3),
поэтому
𝐿 = 2.20 бит/символ,
𝐻2 (𝑃) ≈ 2.1464 бит/символ.
90
Влад Куликов · Открытая редакция 2026.1
Зазор невелик. Но целочисленная гранулярность особенно заметна у сильно скошенного бинарного
источника:
𝑃 = (0.99, 0.01).
Любой непустой двоичный префиксный код тратит по одному биту на символ, тогда как
𝐻2 (𝑃) = ℎ2 (0.01) ≈ 0.0808.
Это не провал Хаффмана и не нарушение теоремы. Алгоритм оптимален в своём классе; слишком
груб сам класс односимвольных целых длин.
Арифметическое кодирование
Арифметическое кодирование не выдаёт каждому символу отдельное слово. Оно кодирует всю
последовательность подынтервалом единичного отрезка.
Пусть
𝑝(𝐴) = 0.5,
𝑝(𝐵) = 0.3,
91
𝑝(𝐶) = 0.2.
Теория информации для машинного обучения
Разобьём [0, 1) на интервалы
𝐴 ∶ [0, 0.5),
𝐵 ∶ [0.5, 0.8),
𝐶 ∶ [0.8, 1).
Для строки ACB получаем
[0, 1) → [0, 0.5) → [0.40, 0.50) → [0.45, 0.48).
Ширина финального интервала равна
0.03 = 𝑝(𝐴)𝑝(𝐶)𝑝(𝐵) = 𝑝(𝐴𝐶𝐵).
Идеальная информационная длина строки:
− log2 0.03 ≈ 5.06 бит.
Но передать нужно не просто точку внутри [0.45, 0.48), а конечный двоичный префикс, все
продолжения которого остаются внутри целевого интервала. Пятибитное число
0.011112 =
15
= 0.46875
32
лежит внутри, однако префикс 01111 задаёт весь диадический интервал
92
Влад Куликов · Открытая редакция 2026.1
15 16
,
,
32 32
который выходит за правую границу 0.48.
Зато шестибитный интервал
29 30
,
= [0.453125, 0.46875)
64 64
целиком помещается внутри финального. Ему соответствует префикс 011101.
Эта маленькая деталь полезна: арифметический код передаёт не «удачно выбранное вещественное
число», а конечное двоичное описание, по которому декодер однозначно остаётся в нужном
интервале.
Для стандартной идеализированной конструкции можно выбрать длину
𝓁AC (𝑥1∶𝑛 ) ≤ − log2 𝑞(𝑥1∶𝑛 ) + 1 < − log2 𝑞(𝑥1∶𝑛 ) + 2.
Округление теперь платится один раз за сообщение, а не на каждом символе.
Условные вероятности и авторегрессионные модели
У фиксированного источника интервалы делятся одной и той же таблицей вероятностей. У языковой
модели таблица меняется после каждого токена:
𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
После 𝑛 шагов ширина выбранного интервала равна
𝑛
𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ) = 𝑞𝜃 (𝑥1∶𝑛 ),
𝑡=1
а идеальная длина —
𝑛
− log2 𝑞𝜃 (𝑥1∶𝑛 ) =
− log2 𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
Вот и вся механика связи между языковым моделированием и сжатием:
вероятности, а кодер обновляет интервал.
модель обновляет
Реальные реализации чаще используют кодирование диапазонов (range coding) или Asymmetric Numeral Systems (ANS). Чтобы декодирование было точным, кодер и декодер должны
одинаково воспроизводить:
•
•
•
•
дискретизированные вероятности;
токенизатор и порядок словаря;
начальный контекст, EOS и правила сброса;
конечную арифметику и обработку границ.
Поэтому фактический поток близок к NLL-длине, но не обязан отличаться от неё одной универсальной
константой для любого программного стека. Конечная точность может давать малую накопительную
избыточность; заголовки и служебные данные добавляют отдельную цену.
93
Теория информации для машинного обучения
6.5. Длинные последовательности: блочное кодирование,
AEP и энтропийная скорость
Односимвольный код спотыкается о целые длины. Длинный блок позволяет распределить одну
единицу округления между многими символами.
Блочный код без потерь
Пусть 𝑋1 , … , 𝑋𝑛 независимы и одинаково распределены.
суперсимвол. Тогда
Рассмотрим весь блок 𝑋 𝑛 как один
𝐻(𝑋 𝑛 ) = 𝑛𝐻(𝑋).
По односимвольной теореме для распределения блоков существует префиксный код с
𝐻(𝑋 𝑛 ) ≤ 𝐿𝑛 < 𝐻(𝑋 𝑛 ) + 1.
Разделив на 𝑛, получаем
𝐻(𝑋) ≤
1
𝐿𝑛
< 𝐻(𝑋) + .
𝑛
𝑛
Это код переменной длины (variable‐length) с нулевой ошибкой: исходный блок восстанавливается
точно, а средняя цена на символ стремится к энтропии.
Теперь утверждение «энтропия достижима» получает точный смысл. Мы не строим слово длины 2.37
бита для отдельного символа; мы кодируем длинный блок и позволяем дробным длинам взаимно
компенсироваться.
AEP и концентрация удельной информационной длины
Для i.i.d.-источника с конечным алфавитом
1
1
− log2 𝑝(𝑋 𝑛 ) =
𝑛
𝑛
𝑛
a.s.
− log2 𝑝(𝑋𝑡 ) −−→ 𝐻2 (𝑋).
𝑡=1
Это асимптотическое свойство равнораспределённости (Asymptotic Equipartition Prop‐
erty, AEP).
Формулу удобно читать так: для длинной случайной последовательности её собственная информационная
длина на символ почти наверняка оказывается близка к энтропии.
Определим типичное множество
(𝑛)
𝐴𝜀
1
= 𝑥 𝑛 ∶ − log2 𝑝(𝑥 𝑛 ) − 𝐻2 (𝑋) < 𝜀 .
𝑛
При больших 𝑛 оно обладает тремя свойствами:
1. в нём сосредоточена вероятность, сколь угодно близкая к единице;
2. каждая типичная последовательность имеет вероятность порядка 2−𝑛𝐻2 (𝑋) ;
3. число типичных последовательностей имеет порядок 2𝑛𝐻2 (𝑋) .
94
Влад Куликов · Открытая редакция 2026.1
Получается характерная картина: типичных строк экспоненциально много, каждая из них
экспоненциально маловероятна, но вместе они несут почти всю массу.
Индексирование типичного множества даёт другой вариант теоремы кодирования: код фиксированной
скорости (fixed‐rate) со скоростью немного выше 𝐻(𝑋) и вероятностью ошибки, стремящейся к
нулю. Это не то же самое, что предыдущий код переменной длины с нулевой ошибкой. Нетипичные
строки здесь либо объявляются ошибками, либо получают отдельный механизм исключений
(escape).
Источники с зависимостями
Для текста важна не энтропия отдельного токена, а то, сколько нового остаётся после знания
прошлого. Для стационарного источника естественной величиной служит энтропийная скорость
ℎ = lim
𝑛→∞
1
𝐻(𝑋1∶𝑛 ),
𝑛
когда предел существует.
Для стационарного эргодического источника с конечным алфавитом теорема Шеннона—Макмиллана—
Бреймана даёт
1
a.s.
− log2 𝑝(𝑋1∶𝑛 ) −−→ ℎ.
𝑛
Именно ℎ задаёт асимптотическую стоимость источника с зависимостями. Маргинальная энтропия
𝐻(𝑋1 ) может быть значительно выше: она не использует контекст и каждый раз платит за
неопределённость заново.
95
Теория информации для машинного обучения
6.6. Метрики языковой модели: PPL, BPC и BPB
Перплексия, биты на символ и биты на байт — это один и тот же кодовый счёт, разделённый на разные
единицы.
Пусть текст превратился в 𝑚 токенов 𝑡1∶𝑚 . Средняя по-токенная NLL в битах равна
𝐿token = −
1
𝑚
𝑚
log2 𝑞𝜃 (𝑡𝑖 ∣ 𝑡<𝑖 ).
𝑖=1
Тогда
PPL = 2𝐿token .
Перплексия — это средняя кодовая длина, у которой логарифм экспоненцировали
обратно.
Если модель в среднем тратит 3 бита на токен, её PPL равна 23 = 8. В специальном равномерном
случае это действительно похоже на восемь равновероятных продолжений. Для произвольного
распределения PPL лучше читать как экспоненту средней логарифмической цены, а не как
буквальное число кандидатов.
Нормировки: на токен, символ и байт
Token PPL зависит от того, что называется токеном. Если одна и та же вероятность сообщения просто
перегруппирована из шести токенов в три пары, суммарные биты не меняются, но средняя длина на
новую единицу удваивается.
Например:
𝐿total = 12 бит.
Для шести токенов:
2 бита/токен,
PPLtoken = 4.
4 бита/пару,
PPLpair = 16.
Для трёх пар:
96
Влад Куликов · Открытая редакция 2026.1
Поэтому PPL моделей с разными токенизаторами обычно нельзя сравнивать напрямую. Для общего
знаменателя используют
BPC =
− log2 𝑞𝜃 (𝑡1∶𝑚 )
,
𝑁chars
BPB =
− log2 𝑞𝜃 (𝑡1∶𝑚 )
.
𝑁bytes
или
BPB обычно воспроизводимее: байты требуют лишь зафиксировать исходный файл.
BPC
дополнительно зависит от того, что считается символом — байт, Unicode code point или графемой.
Сравнимость метрик и роль токенизации
BPC и BPB не становятся неизменными при замене токенизатора вместе с моделью. Новый
токенизатор меняет длину контекста, словарь, вычислительную задачу и обычно само распределение
𝑞𝜃 .
Верно более узкое утверждение: если вероятность одного и того же байтового сообщения уже задана
и мы только перегруппировали её множители, суммарное число бит и BPB сохранятся, а PPL на новую
единицу изменится.
Поэтому BPC/BPB делают сравнение содержательнее, но не отменяют протокол. Нужно по-прежнему
фиксировать корпус, кодировку, Unicode-нормализацию, границы документов, доступный контекст
и способ обработки длинных последовательностей.
97
Теория информации для машинного обучения
6.7. Языковая модель как часть компрессора
Теперь соберём конструкцию полностью.
Кодер и декодер заранее разделяют:
•
•
•
•
•
параметры модели;
токенизатор или другое обратимое представление входа;
способ вычисления и квантования вероятностей;
энтропийный кодер;
правила начала, конца и сброса контекста.
Кодер видит следующий символ, получает 𝑞𝜃 (⋅ ∣ 𝑥<𝑡 ) и сужает интервал. Декодер, уже восстановив
тот же префикс, вычисляет то же распределение и понимает, какой символ выбрал битовый поток.
В таком протоколе
𝐿stream (𝑥1∶𝑛 ) ≈ − log2 𝑞𝜃 (𝑥1∶𝑛 ),
а после усреднения по данным из 𝑃:
𝔼𝑃 [− log2 𝑄𝜃 (𝑋)] = 𝐻2 (𝑃) + 𝐷KL,2 (𝑃‖𝑄𝜃 ).
Именно поэтому снижение отложенной логарифмической потери (log loss) на одном и том же
распределении означает сокращение ожидаемого кода данных.
Здесь есть одна инженерная тонкость. Если токенизация нормализует текст необратимо, компрессор
восстанавливает нормализованный текст, а не исходные байты. Для настоящего архива без потерь
представление входа должно быть обратимым; иначе само преобразование и потерянные детали
нужно отдельно включить в служебные данные.
Эксперимент Delétang et al.
В работе Language Modeling Is Compression (ICLR 2024) предварительно обученные модели
соединялись с арифметическим кодером и применялись к байтовым потокам текста, изображений и
аудио.
В таблице 1 статьи все наборы имели размер 1 GB и для Transformer-моделей разбивались на
независимые блоки по 2048 байта. Для Chinchilla 70B приведены следующие необработанные
коэффициенты сжатия (raw compression rates) — отношение длины сжатого кода данных к
исходному размеру без стоимости весов:
• 8.3% на enwik9;
• 48.0% на grayscale-патчах ImageNet;
• 21.0% на LibriSpeech.
98
Влад Куликов · Открытая редакция 2026.1
Результат действительно впечатляет: модель, предварительно обученная преимущественно на
тексте, назначала полезные вероятности и нетекстовым байтовым последовательностям.
Но правильная интерпретация уже содержится в самом протоколе. Эксперимент показывает
способность к вероятностному предсказанию байтов в конкретных 2048-байтовых блоках. Он не
является доказательством семантического понимания изображения или речи. И необработанный
коэффициент отвечает на вопрос: «насколько короток код данных, если модель уже бесплатна для
обеих сторон?»
В аннотации статьи сообщаются несколько лучшие числа 43.4% и 16.4% для ImageNet и LibriSpeech.
Чтобы не смешивать режимы, здесь и на диаграмме используются значения из таблицы 1 вместе с её
явным 2048-байтовым протоколом.
6.8. Размер модели, законы масштабирования и полная
длина описания
Валидационная функция потерь задаёт хороший вопрос:
сколько бит нужно данным, если модель уже лежит у кодера и декодера?
Автономный архив задаёт более строгий:
кто заплатит за саму модель?
Для двухчастного описания
𝐿two-part (𝜃, 𝑥) = 𝐿(𝜃) + 𝐿(𝑥 ∣ 𝜃) .
Большая модель обычно уменьшает второй член и увеличивает первый. Поэтому для фиксированного
объёма данных может существовать промежуточный размер модели, минимизирующий полную
длину.
99
Теория информации для машинного обучения
Delétang et al. считают веса нейросетей по 2 байта на параметр. Для Chinchilla 70B это примерно 140
GB только весов. На корпусе размером 1 GB код данных enwik9 занимает около 0.083 GB, но полный
двухчастный счёт становится примерно
140 + 0.083 GB,
то есть adjusted compression rate из таблицы равна примерно 14008.3%.
Это не опровержение пользы больших моделей. Если одна модель многократно используется для
огромного потока данных, стоимость весов амортизируется. Но вопрос «хороший ли это предиктор?»
и вопрос «хороший ли это самостоятельный архив для данного объёма?» имеют разные ответы.
Законы масштабирования и длина описания
Если отложенная кросс-энтропия уменьшается с масштабом, то уменьшается и длина кода данных
при уже известной модели. Это точное и полезное чтение кривой масштабирования (scaling curve).
Более сильный вывод требует дополнительных предпосылок. Из гладкой степенной кривой само по
себе не следует, что
𝐷KL (𝑃‖𝑄𝜃 ) → 0
или что подогнанная асимптота обязательно равна «истинной энтропии языка».
Причины не экзотические:
•
•
•
•
семейство моделей может не содержать источник;
оптимизация может не достигать лучшей модели семейства;
конечное окно ограничивает доступное условное распределение;
предобработка и токенизация определяют другую задачу;
100
Влад Куликов · Открытая редакция 2026.1
• отложенный корпус не является универсальным распределением всего языка;
• эмпирическая кривая наблюдается на конечном диапазоне масштабов.
Точная формула по-прежнему сильна:
𝐻(𝑃, 𝑄𝜃 ) = 𝐻(𝑃) + 𝐷KL (𝑃‖𝑄𝜃 ).
Но чтобы прочитать эмпирическую асимптоту как 𝐻(𝑃), нужно отдельно обосновать, что KL-разрыв
действительно исчезает для конкретно заданного источника и режима контекста.
6.9. Математическое углубление: универсальное кодирование,
последовательная логарифмическая потеря и ICL
Можно пропустить при первом чтении.
Здесь связь «предсказание = код»
расширяется на ситуацию, когда источник заранее неизвестен и предиктор адаптируется
по ходу последовательности.
Пусть на шаге 𝑡 последовательный предиктор выдаёт
𝑞𝑡 (𝑥𝑡 ∣ 𝑥<𝑡 ).
Его суммарная логарифмическая потеря в битах равна
𝑛
𝐿𝑛 = −
log2 𝑞𝑡 (𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
Это одновременно идеальная длина последовательного кода. Онлайн-предсказание по логарифмической
потере и последовательное сжатие — одна и та же бухгалтерия.
Смесь конечного числа моделей
Пусть имеются модели 𝑃1 , … , 𝑃𝐾 с априорными весами
𝑤𝑗 > 0,
𝑤𝑗 = 1.
𝑗
Байесовская смесь задаёт
𝐾
𝑄(𝑥1∶𝑛 ) =
𝑤𝑗 𝑃𝑗 (𝑥1∶𝑛 ).
𝑗=1
Для любой модели 𝑗
𝑄(𝑥1∶𝑛 ) ≥ 𝑤𝑗 𝑃𝑗 (𝑥1∶𝑛 ),
поэтому
− log2 𝑄(𝑥1∶𝑛 ) ≤ − log2 𝑃𝑗 (𝑥1∶𝑛 ) + log2
1
.
𝑤𝑗
При равномерных весах смесь проигрывает лучшей модели из конечного класса не более log2 𝐾 бит
на всю последовательность.
101
Теория информации для машинного обучения
Это красивый результат универсального предсказания: не зная заранее, какая гипотеза окажется
лучшей, мы платим за адаптацию конечным сожалением (regret). Но форма гарантии зависит
от класса. Lempel—Ziv, CTW, байесовские смеси и другие универсальные кодеры имеют разные
предпосылки и разные скорости избыточности; одной универсальной формулы 𝑂(log 𝑛) для всех
источников нет.
Связь с in-context learning и её ограничения
Промпт с демонстрациями меняет следующие условные распределения модели без обновления
весов. В этом операционном смысле ICL напоминает адаптивный последовательный кодер: контекст
помогает предсказывать продолжение, а уменьшение логарифмической потери сокращает код.
Теоретические работы дают более содержательные механизмы при специальных предпосылках.
Xie et al. выводят неявный байесовский вывод для распределения предварительного обучения в
виде смеси HMM. Hahn и Goyal связывают возникновение ICL со структурой и композиционностью
обучающих данных.
Эти результаты не превращают произвольную LLM в оптимальный универсальный байесовский
предиктор для любого промпта. Корректный измеримый вопрос звучит скромнее:
насколько быстро уменьшается последовательная логарифмическая потеря при
добавлении релевантного контекста и относительно какого класса сравнения измеряется
сожаление?
6.10. Связь качества сжатия и возможностей модели
Связь
лучшее вероятностное предсказание ⟹ более короткий код данных без потерь
является математическим утверждением. Переход от него к фразе «лучший компрессор умнее» уже
требует выбрать определение способностей и протокол измерения.
Hutter Prize использует сжатие без потерь фиксированного 1 GB файла enwik9 как тест поиска
структуры в большом текстовом корпусе. Официальный размер результата включает не только
сжатые данные, но и программу, которая их восстанавливает. Поэтому конкурсная постановка
ближе к полной длине описания, чем к NLL при бесплатной модели.
Huang et al. в работе Compression Represents Intelligence Linearly (COLM 2024) сравнили 31
публичную базовую LLM на 12 тестах знаний, программирования и математического рассуждения.
В их протоколе средний результат на тестах коррелировал со средней BPC внешних корпусов с
коэффициентом Пирсона около −0.93.
Это сильный эмпирический сигнал: хорошее моделирование распределения внешних данных
действительно может служить метрикой возможностей без разметки. Но сама работа показывает
зависимость силы связи от согласования корпуса с оцениваемой областью. А более позднее
исследование моделей для кода (Xuyang et al., 2025) сообщило в своём протоколе скорее логарифмическую,
чем универсально линейную зависимость.
Поэтому полезный вывод выглядит так:
эффективность сжатия на отложенном корпусе — содержательная безразметочная
метрика качества вероятностной модели и возможный прокси некоторых
способностей; форма связи зависит от домена, моделей и тестов и не является
общим определением интеллекта.
Низкая BPC сама по себе не гарантирует фактическую истинность, согласование с целями,
причинное рассуждение, устойчивое планирование или безопасное поведение. Это не ослабляет
компрессионную метрику: она просто отвечает на свой точный вопрос.
102
Влад Куликов · Открытая редакция 2026.1
6.11. Практический протокол оценки LLM как компрессора
Перед публикацией числа «модель получила 1.1 BPB» стоит зафиксировать весь договор между
кодером и декодером.
1. Исходные данные. Точный файл, версия, лицензия и контрольная сумма.
2. Предобработка. Кодировка, Unicode-нормализация, переносы строк и удаление служебных
областей.
3. Единица. Bits/token, BPC или BPB; для BPC — что считается символом.
4. Токенизатор. Версия, специальные токены и обратимость к исходным байтам.
5. Границы. Как задаются BOS, EOS, длина сообщения и сброс контекста.
6. Контекстная политика. Независимые блоки, скользящее окно или непрерывный поток;
каждая целевая позиция должна быть посчитана ровно один раз.
7. Модель. Точная ревизия, base или instruction-tuned версия, численная точность и режим
вычисления.
8. Вероятности кодера. Как логиты превращаются в целочисленные частоты; совпадает ли
процедура у кодера и декодера.
9. Что измерено. Эквивалентная NLL-длина или реально выпущенный битовый поток.
10. Стоимость модели. Считаются ли веса и токенизатор заранее разделяемыми или входят в
архив.
11. Контаминация. Мог ли оценочный файл присутствовать в предварительном обучении.
12. Сравнимость. Получили ли все методы один исходный байтовый поток и одинаковый
доступный контекст.
Особенно легко ошибиться при оценке авторегрессионной модели со скользящим окном (sliding
window). Библиотечная функция потерь обычно сравнивает
logits[:, :‐1]
с
labels[:, 1:],
поэтому число учтённых целевых позиций нужно проверять после сдвига. Иначе один токен можно
потерять или посчитать дважды на границе окон.
Хороший отчёт публикует отдельно:
•
•
•
•
эквивалентное NLL число бит;
размер фактического сжатого потока;
служебные накладные расходы;
стоимость модели, если она включена.
Тогда фраза «LLM сжимает данные» становится не аналогией, а воспроизводимым инженерным
результатом.
6.13. Заключение
В начале модуля − log 𝑞 была знакомой функцией потерь. Теперь у неё появился физически
проверяемый смысл: это идеальный счёт в битах, который вероятностная модель выставляет
наблюдаемой последовательности.
Основную конструкцию можно собрать в одну строку:
вероятностная модель + энтропийный кодер = компрессор без потерь .
Неравенство Крафта показало, почему короткие кодовые слова конкурируют за конечный бюджет.
Теорема Шеннона разложила избыточность кода на несовпадение модели и неиспользованный
ресурс. Хаффман дал лучший односимвольный префиксный код, а арифметическое кодирование
позволило отложить округление до конца сообщения. AEP объяснило, почему длинные последовательности
получают устойчивую удельную длину, а энтропийная скорость перенесла результат на источники с
зависимостями.
103
Теория информации для машинного обучения
Для ML главное следствие особенно простое:
меньшая отложенная логарифмическая потеря означает более короткий
ожидаемый код данных — при том же источнике, той же единице и том же
протоколе.
Дальше начинается инженерная честность. PPL зависит от токена; BPC и BPB требуют общего
байтового протокола; фактический поток имеет кодовые накладные расходы; самостоятельный
архив оплачивает модель; хороший компрессор является сильным предиктором, но не получает
автоматически сертификат общего интеллекта.
Теория здесь не разрушает красивую связь предсказания и сжатия. Она делает её сильнее:
показывает точное равенство, точную цену несовпадения и точное место, где к коду данных
добавляется остальная система.
Основные источники
•
•
•
•
•
•
•
•
C. E. Shannon, «A Mathematical Theory of Communication» (1948).
D. A. Huffman, «A Method for the Construction of Minimum-Redundancy Codes» (1952).
T. Cover, J. Thomas, «Elements of Information Theory», глава 5.
G. Delétang et al., «Language Modeling Is Compression», ICLR 2024.
Y. Huang et al., «Compression Represents Intelligence Linearly», COLM 2024.
S. Xuyang, X. Luo et al., «Is Compression Really Linear with Code Intelligence?» (2025).
S. M. Xie et al., «An Explanation of In-Context Learning as Implicit Bayesian Inference», ICLR 2022.
M. Hahn, N. Goyal, «A Theory of Emergent In-Context Learning as Implicit Structure Induction»
(2023).
• M. Hutter, «Human Knowledge Compression Contest» — официальные правила enwik9.
104
Модуль 7. Канал и пропускная
способность
Как читать этот модуль. §§7.1–7.7 образуют классическое ядро: модель канала,
пропускная способность, три базовых примера и обе части теоремы кодирования. В
§7.6 стоит пройти хотя бы интуитивный подсчёт случайного кодирования — именно там
становится видно, откуда берётся порог 𝑅 < 𝐼(𝑋; 𝑌). Нормальное приближение в конце
§7.7 относится ко второму проходу. §§7.8–7.10 переносят канальный язык в ML: к шумным
меткам, ECOC, обучаемой связи и LLM.
7.1. Надёжная передача через шум
В Модуле 6 мы старались убрать из сообщения всё предсказуемое и записать его как можно короче.
Теперь задача почти противоположна: сообщение нужно провести через среду, которая меняет,
стирает или зашумляет символы. И здесь избыточность, от которой мы только что избавлялись,
внезапно становится полезной.
Представим двоичный канал, который независимо переворачивает каждый переданный бит с
вероятностью 0.1. Если отправить тысячу информационных бит без защиты, получатель в среднем
увидит около ста ошибок. Самая очевидная защита — повторять каждый бит несколько раз и
голосовать по большинству. Она действительно помогает, но быстро съедает скорость: трёхкратное
повторение даёт лишь 1/3 информационного бита на одно использование канала и всё равно не
устраняет ошибку полностью.
Результат Шеннона говорит нечто гораздо более сильное. Для этого канала существует число
𝐶 = 1 − ℎ2 (0.1) ≈ 0.531
бита на использование. При любой скорости ниже 𝐶 можно выбрать всё более длинные блочные
коды так, чтобы вероятность ошибки стремилась к нулю. В первом асимптотическом приближении
тысяча информационных бит требует не меньше
1000
≈ 1883
𝐶
использований канала, а не трёх тысяч. Это число ещё не обещает хороший короткий код длины 1883
— конечные блоки мы обсудим отдельно. Но оно уже разрушает наивную дилемму «либо скорость,
либо надёжность».
Шум не обязательно оплачивается повторением каждого символа. Хороший
код раздвигает целые сообщения в пространстве длинных последовательностей
так, чтобы типичный шум не перепутал их.
Отсюда полезно сразу развести две операции.
105
Теория информации для машинного обучения
Операция
Что делает
Главный критерий
Кодирование источника
(source coding)
Канальное кодирование
(channel coding)
удаляет статистическую
избыточность
добавляет структурированную
избыточность
средняя длина описания
вероятность ошибки при заданной
скорости
Ключевое слово здесь — структурированную.
Случайно дописанные биты не помогают.
Дополнительные символы должны сделать кодовые слова различимыми после характерных
для канала искажений.
Именно это утверждает теорема кодирования для канала: у заданного канала есть порог 𝐶 . Ниже
него надёжная передача асимптотически достижима; выше него никакой код не заставит ошибку
исчезнуть. Вторая часть особенно важна: пропускная способность — не характеристика конкретного
алгоритма, а предел самой вероятностной модели канала при заданных ограничениях.
Для ML это не декоративная аналогия. Ошибки аннотатора, шумный латентный слой, квантованный
сигнал, беспроводная передача признаков и кодовые представления классов действительно задают
каналы, если мы можем назвать вход, выход и переходный закон. С LLM канальный язык тоже
полезен, но там сначала придётся аккуратно отделить строгую модель от метафоры.
7.2. Дискретный канал без памяти и блочный код
Чтобы говорить о пределе надёжности, зафиксируем задачу. Нам понадобятся три объекта: сам
канал, кодовая книга и декодер.
Дискретный канал без памяти
Дискретный канал без памяти (discrete memoryless channel, DMC) задаётся:
• конечным входным алфавитом 𝒳 ;
• конечным выходным алфавитом 𝒴 ;
• переходным законом
𝑊(𝑦 ∣ 𝑥) = Pr(𝑌 = 𝑦 ∣ 𝑋 = 𝑥).
При 𝑛 использованиях канала условное распределение факторизуется:
106
Влад Куликов · Открытая редакция 2026.1
𝑛
𝑛
𝑛
𝑛
𝑊 (𝑦 ∣ 𝑥 ) =
𝑊(𝑦𝑖 ∣ 𝑥𝑖 ).
𝑖=1
Слово «без памяти» относится к шуму при фиксированной входной последовательности.
Оно не требует, чтобы сами входные символы были независимыми. Напротив, хорошее кодовое
слово обычно содержит сильную зависимость между координатами: именно она и создаёт защитную
структуру.
Два базовых канала
Двоичный симметричный канал (binary symmetric channel, BSC) с вероятностью инверсии 𝜀
имеет матрицу
𝑊BSC =
1−𝜀
𝜀
𝜀
.
1−𝜀
Переданный бит независимо меняется на противоположный с вероятностью 𝜀 . Приёмник видит 0
или 1, но не знает, в какой позиции произошла ошибка.
Двоичный канал со стиранием (binary erasure channel, BEC) с вероятностью стирания 𝜀 имеет
выходной алфавит {0, 1, ?}:
𝑊BEC =
1−𝜀
0
0
1−𝜀
𝜀
.
𝜀
Здесь приёмник не знает значение стёртого бита, зато точно знает место потери. Позже мы увидим,
насколько ценна эта дополнительная информация.
Блочный код
Пусть отправитель выбирает одно из 𝑀 равновероятных сообщений:
𝐽 ∼ Unif{1, … , 𝑀}.
107
Теория информации для машинного обучения
Код длины 𝑛 состоит из энкодера
𝑓𝑛 ∶ {1, … , 𝑀} → 𝒳 𝑛
и декодера
𝑔𝑛 ∶ 𝒴 𝑛 → {1, … , 𝑀}.
Энкодер отправляет кодовое слово
𝑋 𝑛 = 𝑓𝑛 (𝐽),
канал выдаёт 𝑌 𝑛 , а декодер строит оценку
𝐽 ̂ = 𝑔𝑛 (𝑌 𝑛 ).
Средняя вероятность блочной ошибки равна
(𝑛)
𝑃𝑒
= Pr(𝐽 ̂ ≠ 𝐽).
Иногда требуется контролировать и худшее сообщение:
(𝑛)
𝑃𝑒,max = max Pr(𝐽 ̂ ≠ 𝑗 ∣ 𝐽 = 𝑗).
𝑗
Максимальная ошибка не меньше средней и предъявляет более сильное требование. Для обычного
DMC обе постановки приводят к одной и той же пропускной способности; переход к максимальной
ошибке требует дополнительного удаления худших кодовых слов (expurgation).
Скорость кода
𝑅𝑛 =
1
log2 𝑀
𝑛
измеряется в информационных битах на одно использование канала. Если 𝑀 = 2𝑛𝑅 , код
различает 2𝑛𝑅 сообщений и передаёт 𝑛𝑅 бит выбора за 𝑛 использований.
Скорость 𝑅 называется достижимой, если существует последовательность кодов, для которой
lim inf 𝑅𝑛 ≥ 𝑅,
𝑛→∞
(𝑛)
𝑃𝑒
→ 0.
Пропускная способность определяется как
𝐶 = sup{𝑅 ∶ 𝑅 достижима}.
Пока это только операционное определение. Оно говорит, что мы хотим измерить, но ещё не
даёт способа вычислить 𝐶 . Следующая формула связывает эту инженерную величину с взаимной
информацией из Модуля 5.
Важно также не подменить единицу: бит на использование канала — не бит в секунду. Для
физической скорости нужно знать, сколько независимых или эффективно независимых использований
приходится на секунду.
108
Влад Куликов · Открытая редакция 2026.1
7.3. Пропускная способность дискретного канала
Для конечного DMC без дополнительного ограничения на вход теорема Шеннона даёт
𝐶 = max 𝐼(𝑋; 𝑌) .
𝑃𝑋
Распределение 𝑃𝑋 вместе с переходным законом 𝑊(𝑦 ∣ 𝑥) задаёт совместное распределение
𝑃𝑋𝑌 (𝑥, 𝑦) = 𝑃𝑋 (𝑥)𝑊(𝑦 ∣ 𝑥).
Для фиксированного 𝑃𝑋 величина 𝐼(𝑋; 𝑌) отвечает на вопрос:
Сколько информации о случайном входе в среднем остаётся в одном выходе при данном
способе использования канала?
Пропускная способность задаёт следующий вопрос:
Какое распределение входов использует канал лучше всего?
Это различие легко пропустить, потому что обе величины измеряются в битах на использование. Но
𝐼(𝑋; 𝑌) — рабочая точка при выбранном 𝑃𝑋 , а 𝐶 — оптимум по всем допустимым рабочим точкам.
Теорема состоит из двух половин.
(𝑛)
• Достижимость (achievability): для любого 𝑅 < 𝐶 существуют коды, у которых 𝑃𝑒 → 0.
• Обратная часть (converse): если 𝑅 > 𝐶 , ошибка не может стремиться к нулю. Для DMC
(𝑛)
сильная обратная теорема утверждает даже 𝑃𝑒 → 1.
Таким образом, взаимная информация получает операционный смысл. Она не просто измеряет
статистическую зависимость между 𝑋 и 𝑌: после оптимизации по входу она становится максимально
возможной скоростью надёжной связи.
Как читать оптимизацию по 𝑃𝑋
Предположим, что матрица ошибок аннотатора рассматривается как канал от истинной метки 𝑌 к
наблюдаемой 𝑌. В реальном наборе данных распределение классов уже задано, поэтому
𝐼(𝑌; 𝑌)
измеряет информацию, сохранившуюся при фактической частоте классов. А
max 𝐼(𝑌; 𝑌)
𝑃𝑌
описывает лучшее возможное использование той же матрицы переходов. Это разные вопросы:
первый относится к данным, второй — к каналу как математическому объекту.
Несколько следствий
Для конечного DMC
0 ≤ 𝐶 ≤ min{log2 |𝒳|, log2 |𝒴|}.
Пропускная способность равна нулю тогда и только тогда, когда все строки переходной матрицы
совпадают:
𝑊(⋅ ∣ 𝑥) = 𝑊(⋅ ∣ 𝑥 ′ ) для всех 𝑥, 𝑥 ′ .
109
Теория информации для машинного обучения
В этом случае выход имеет одно и то же распределение при любом входе, а значит, не позволяет
различать сообщения.
Если входы имеют разную стоимость, оптимизация получает ограничение:
𝐶(Γ) =
max
𝑃𝑋 ∶ 𝔼[𝑐(𝑋)]≤Γ
𝐼(𝑋; 𝑌).
Эта строка особенно важна для непрерывных каналов. Без ограничения мощности можно было бы
раздвигать сигналы всё дальше и получать неограниченную скорость. Ограничение ресурса — часть
определения задачи, а не техническое приложение к формуле.
7.4. BSC, BEC и Z-канал
Три двоичных канала показывают, почему одного слова «шум» недостаточно. Важна не только
частота повреждений, но и то, какую структуру ошибки наблюдает получатель.
Двоичный симметричный канал
Пусть 𝑋 ∼ Bernoulli(1/2). Для BSC выход также равномерен, а условная энтропия равна ℎ2 (𝜀).
Поэтому
𝐼(𝑋; 𝑌) = 𝐻(𝑌) − 𝐻(𝑌 ∣ 𝑋) = 1 − ℎ2 (𝜀).
Симметрия канала гарантирует оптимальность равномерного входа:
𝐶BSC = 1 − ℎ2 (𝜀) .
При 𝜀 = 0.1 получаем
𝐶BSC ≈ 0.5310 бит/использование.
Обычно достаточно рассматривать 0 ≤ 𝜀 ≤ 1/2. Если 𝜀 > 1/2, приёмник может инвертировать
каждый выход и получить эквивалентный BSC с вероятностью ошибки 1 − 𝜀 . В крайней точке 𝜀 = 1
канал снова передаёт один бит без потери: он детерминированно меняет 0 на 1 и 1 на 0.
Двоичный канал со стиранием
Пусть 𝑋 ∼ Bernoulli(𝑝). Если символ не стёрт, вход известен точно; если стёрт, остаётся вся исходная
неопределённость. Поэтому
𝐻(𝑋 ∣ 𝑌) = 𝜀𝐻(𝑋)
и
𝐼(𝑋; 𝑌) = (1 − 𝜀)𝐻(𝑋).
Максимум достигается при 𝑝 = 1/2:
𝐶BEC = 1 − 𝜀 .
При 𝜀 = 0.1 это 0.9 бит/использование — заметно больше, чем у BSC с тем же численным параметром.
Причина не в том, что стирание «слабее» само по себе. BEC сообщает позицию повреждения, а BSC
заставляет декодер сначала угадать, где ошибка вообще произошла.
110
Влад Куликов · Открытая редакция 2026.1
Асимметричный Z-канал
Теперь рассмотрим канал
𝑊=
1
0
.
𝛼 1−𝛼
Символ 0 проходит безошибочно, а 1 превращается в 0 с вероятностью 𝛼 . Если
𝑝 = Pr(𝑋 = 1),
то
𝐼(𝑝) = ℎ2 (1 − 𝛼)𝑝 − 𝑝 ℎ2 (𝛼).
При 𝛼 = 0.25 максимум достигается приблизительно при
𝑝∗ ≈ 0.4278,
𝐶 ≈ 0.5582 бита/использование.
Равномерный вход даёт немного меньше:
𝐼(1/2) ≈ 0.5488.
Разница численно невелика, но концептуально важна. Уязвимый символ следует использовать реже.
Именно поэтому в формуле пропускной способности стоит максимум по 𝑃𝑋 , а не автоматическое
«возьмём равномерное распределение».
Для произвольной конечной матрицы этот максимум удобно находить алгоритмом Блахута—
Аримото (Blahut–Arimoto); его реализация входит в вычислительное упражнение.
111
Теория информации для машинного обучения
7.5. Гауссовский канал и ограничение мощности
В дискретном канале размер входного алфавита сам ограничивает число различимых сигналов. В
вещественном канале такого естественного потолка нет, поэтому ресурс нужно задать явно.
Рассмотрим дискретновременной AWGN-канал
𝑌 = 𝑋 + 𝑍,
𝑍 ∼ 𝒩(0, 𝑁),
где шум независим от входа, а средняя мощность сигнала ограничена:
𝔼[𝑋 2 ] ≤ 𝑃.
Пропускная способность одного вещественного использования равна
𝐶AWGN =
𝑃
1
log2 1 +
2
𝑁
бит/использование. Оптимальный вход — гауссовский:
𝑋 ∼ 𝒩(0, 𝑃).
Механика формулы прозрачна. Поскольку 𝑌 = 𝑋 + 𝑍,
𝐼(𝑋; 𝑌) = ℎ(𝑌) − ℎ(𝑍).
112
Влад Куликов · Открытая редакция 2026.1
Шумовая энтропия фиксирована, а при заданной дисперсии 𝑃 + 𝑁 энтропию выхода максимизирует
гауссовское распределение. Гауссовский вход делает выход гауссовским и достигает верхней
границы.
Для непрерывного канала с полосой 𝐵 Гц, средней мощностью сигнала 𝑆 и полной мощностью шума
𝑁 в этой полосе формула Шеннона—Хартли записывается как
𝐶bps = 𝐵 log2 1 +
𝑆
𝑁
бит/с. Первая формула измеряет биты на одно вещественное использование; вторая — биты в
секунду. Совпадение логарифма не делает единицы взаимозаменяемыми.
Что говорит форма кривой
Обозначим отношение сигнал/шум (signal‐to‐noise ratio, SNR) через 𝜌 = 𝑃/𝑁. Тогда
• при 𝜌 ≪ 1
𝜌
;
2 ln 2
𝐶≈
• при 𝜌 ≫ 1
1
log2 𝜌.
2
На малой SNR дополнительная мощность почти линейно увеличивает скорость. На большой SNR
начинается логарифмический режим убывающей отдачи. Точное приращение при удвоении SNR
равно
𝐶≈
𝐶(2𝜌) − 𝐶(𝜌) =
1 + 2𝜌
1
log2
.
2
1+𝜌
Оно меньше 0.5 бита/использование и лишь при высокой SNR приближается к 0.5. Поэтому правило
«удвоение мощности даёт полбита» — полезная высоко-SNR оценка, а не точное равенство для всей
кривой.
Формула задаёт предел идеализированной модели. Реальная система добавляет замирания (fading),
интерференцию, конечную модуляцию, ограничения оборудования, задержку, служебные данные и
конечный блок. Фраза «близко к пределу Шеннона» всегда должна заканчиваться уточнением: к
пределу какой именно модели и при каком критерии ошибки.
113
Теория информации для машинного обучения
7.6. Почему случайное кодирование достигает 𝑅 < 𝐼(𝑋; 𝑌)
Теперь мы подошли к самой неожиданной части теоремы. Чтобы доказать существование хорошего
кода, Шеннон не начал с хитрой явной конструкции. Он предложил выбрать всю кодовую книгу
случайно и оценить её среднюю ошибку.
Это один из тех случаев, когда случайный объект анализировать легче, чем лучший конкретный
объект. Если средняя ошибка по ансамблю случайных кодовых книг стремится к нулю, то хотя бы
одна детерминированная книга работает не хуже среднего.
Сначала полезно увидеть весь подсчёт в одной строке. Пусть в книге около 2𝑛𝑅 кодовых слов.
Для фиксированного неверного слова вероятность случайно выглядеть правдоподобным рядом с
принятым выходом имеет порядок 2−𝑛𝐼(𝑋;𝑌) . Тогда суммарный риск ложного совпадения имеет
порядок
2𝑛𝑅 ⋅ 2−𝑛𝐼(𝑋;𝑌) = 2−𝑛(𝐼(𝑋;𝑌)−𝑅) .
Если 𝑅 < 𝐼(𝑋; 𝑌), количество конкурентов растёт медленнее, чем убывает вероятность ложного
совпадения. В этом балансе и находится порог.
Теперь запишем аргумент точно. Зафиксируем входное распределение 𝑃𝑋 и скорость
𝑅 < 𝐼(𝑋; 𝑌).
Пусть 𝑃𝑌 — выходное распределение, индуцированное 𝑃𝑋 и каналом.
114
Влад Куликов · Открытая редакция 2026.1
Шаг 1. Случайная кодовая книга
Для каждого сообщения 𝑗 ∈ {1, … , 𝑀}, где
𝑀 ≈ 2𝑛𝑅 ,
независимо генерируем кодовое слово
𝑋 𝑛 (𝑗) ∼ 𝑃𝑋𝑛 .
Шаг 2. Информационная плотность
Для одной пары введём информационную плотность (information density)
𝚤(𝑥; 𝑦) = log2
𝑊(𝑦 ∣ 𝑥)
.
𝑃𝑌 (𝑦)
Её среднее под совместным распределением равно взаимной информации:
𝔼𝑃𝑋 𝑊 [𝚤(𝑋; 𝑌)] = 𝐼(𝑋; 𝑌).
Для канала без памяти
𝑛
𝑛
𝑛
𝚤(𝑥 ; 𝑦 ) =
𝚤(𝑥𝑖 ; 𝑦𝑖 ).
𝑖=1
По закону больших чисел у истинной пары
1
𝑃
𝚤(𝑋 𝑛 (𝐽); 𝑌 𝑛 ) −
→ 𝐼(𝑋; 𝑌).
𝑛
Шаг 3. Пороговый декодер
Декодер ищет единственное сообщение 𝑗, для которого
𝚤(𝑋 𝑛 (𝑗); 𝑌 𝑛 ) ≥ 𝑛 𝐼(𝑋; 𝑌) − 𝛿 .
Ошибка возникает по двум причинам.
1. Истинная пара не достигает порога. Вероятность этого стремится к нулю по закону больших
чисел.
2. Какое-то неверное кодовое слово достигает порога.
Для неверного 𝑗 ′ ≠ 𝐽 кодовое слово 𝑋 𝑛 (𝑗 ′ ) независимо от 𝑌 𝑛 . Под произведением распределений
𝑃𝑋𝑛 𝑃𝑌𝑛
𝔼 2𝚤(𝑋
𝑛 ;𝑌 𝑛 )
= 1.
По неравенству Маркова
Pr [𝚤(𝑋 𝑛 ; 𝑌 𝑛 ) ≥ 𝑛(𝐼 − 𝛿)] ≤ 2−𝑛(𝐼−𝛿) .
Неверных слов около 2𝑛𝑅 , поэтому объединение событий даёт
115
Теория информации для машинного обучения
Pr(ложное совпадение) ≤ 2𝑛𝑅 2−𝑛(𝐼−𝛿) = 2−𝑛(𝐼−𝑅−𝛿) .
Выбираем 𝛿 > 0 так, чтобы
𝑅 < 𝐼(𝑋; 𝑌) − 𝛿.
Тогда обе части ошибки стремятся к нулю. Поскольку это верно для любого фиксированного 𝑃𝑋 ,
оптимизация по 𝑃𝑋 даёт достижимость всех скоростей ниже
𝐶 = max 𝐼(𝑋; 𝑌).
𝑃𝑋
Что дал этот аргумент
Во-первых, он доказал существование детерминированного кода: малая средняя ошибка по
случайной книге означает, что среди реализаций есть хорошая. Более того, если средняя ошибка
ансамбля стремится к нулю, доля книг с заметно большей ошибкой тоже исчезает при подходящем
пороге. Хорошие книги в этом асимптотическом смысле не являются единственными иголками в
стоге сена.
Во-вторых, доказательство показало, почему в формуле появляется взаимная информация.
Она управляет экспонентой, с которой случайное чужое кодовое слово может притвориться
согласованным с выходом.
Но доказательство существования ещё не является удобным кодеком. Случайная книга содержит
порядка 2𝑛𝑅 слов, её дорого хранить, а полный перебор при декодировании экспоненциален.
Практические семейства — LDPC-, турбо- и полярные коды — добавляют структуру и эффективные
116
Влад Куликов · Открытая редакция 2026.1
декодеры. Теорема сначала показала, что искать имеет смысл; инженерная теория кодов научилась
искать конструктивно.
7.7. Обратная теорема и конечная длина блока
Достижимость отвечает на вопрос «что можно сделать ниже 𝐶 ?». Обратная часть ставит предел
любому возможному коду: выше 𝐶 надёжность нельзя вернуть более умным энкодером или
декодером.
Короткая обратная граница через неравенство Фано
Пусть 𝐽 равномерно распределено по 𝑀 сообщениям, а
1
log2 𝑀.
𝑛
𝑅=
Неравенство Фано даёт
(𝑛)
𝐻(𝐽 ∣ 𝑌 𝑛 ) ≤ 1 + 𝑃𝑒
log2 𝑀.
С другой стороны,
log2 𝑀 = 𝐼(𝐽; 𝑌 𝑛 ) + 𝐻(𝐽 ∣ 𝑌 𝑛 )
(𝑛)
≤ 𝐼(𝑋 𝑛 ; 𝑌 𝑛 ) + 1 + 𝑃𝑒
≤ 𝑛𝐶 + 1 +
log2 𝑀
(𝑛)
𝑃𝑒 log2 𝑀.
Последняя строка использует отсутствие памяти:
𝑛
𝑛
𝑛
𝐼(𝑋 ; 𝑌 ) ≤
𝐼(𝑋𝑖 ; 𝑌𝑖 ) ≤ 𝑛𝐶.
𝑖=1
Отсюда
(𝑛)
𝑃𝑒
≥1−
𝐶
1
−
.
𝑅 𝑛𝑅
Если 𝑅 > 𝐶 , правая часть при больших 𝑛 остаётся положительной. Значит, ошибка не может
стремиться к нулю. Это слабая обратная теорема (weak converse).
Для DMC верна и сильная обратная теорема (strong converse): при фиксированном 𝑅 > 𝐶
(𝑛)
𝑃𝑒
→ 1.
Иначе говоря, выше пропускной способности канал не переходит в режим «чуть хуже». При
растущем блоке он почти полностью теряет способность надёжно различать сообщения на такой
скорости.
Почему 𝑅 < 𝐶 ещё не отвечает на инженерный вопрос
Пропускная способность — результат первого асимптотического порядка. Реальная система задаёт
тройку
(𝑛, 𝑅, 𝜖),
117
Теория информации для машинного обучения
где 𝑛 — длина блока, 𝑅 — скорость, а 𝜖 — допустимая ошибка. Для короткого блока скорость ниже 𝐶
может всё ещё сопровождаться большой ошибкой. Между «асимптотически возможно» и «работает
с задержкой 10 мс» лежит существенная инженерная задача.
Математическое углубление: нормальное приближение
Для многих регулярных каналов максимальная скорость при длине блока 𝑛 и целевой ошибке 𝜖
приближённо равна
𝑅∗ (𝑛, 𝜖) ≈ 𝐶 −
𝑉 −1
log 𝑛
𝑄 (𝜖) + 𝑂
,
𝑛
𝑛
где 𝑉 — дисперсия канала (channel dispersion), а 𝑄 −1 — обратная функция гауссовского хвоста.
Пропускная способность задаёт центр, а 𝑉 описывает флуктуации информационной плотности и
тем самым цену короткого блока. Чем больше требуемая надёжность и чем меньше 𝑛, тем дальше
приходится отступить от 𝐶 .
7.8. Шумные метки как канал
Теперь перенесём ту же схему из линии связи в набор данных. Пусть 𝑌 — истинная метка, а 𝑌 — метка,
записанная после работы аннотатора или автоматического конвейера. Если ошибка зависит только
от класса, переход задаётся матрицей
𝑇𝑖𝑗 = Pr(𝑌 = 𝑗 ∣ 𝑌 = 𝑖).
Получается буквальный вероятностный канал
𝑌 ⟶ 𝑌.
Если признаки 𝑋 влияют на наблюдаемую метку только через чистую метку,
𝑋⟶𝑌⟶𝑌
— марковская цепь, и неравенство обработки данных даёт
118
Влад Куликов · Открытая редакция 2026.1
𝐼(𝑋; 𝑌) ≤ 𝐼(𝑋; 𝑌).
Шумная метка не может сохранить больше информации о входе, чем чистая. Но величина потери
зависит не только от доли ошибок, а от всей матрицы переходов и распределения классов.
Симметричный 𝐾 -классовый шум
Пусть метка остаётся верной с вероятностью 1 − 𝜂 , а при ошибке равномерно заменяется одним из
𝐾 − 1 других классов:
Pr(𝑌 = 𝑗 ∣ 𝑌 = 𝑖) =
1 − 𝜂,
𝑗 = 𝑖,
𝜂/(𝐾 − 1), 𝑗 ≠ 𝑖.
При равномерном 𝑌 выход также равномерен, поэтому
𝐼(𝑌; 𝑌) = log2 𝐾 − ℎ2 (𝜂) − 𝜂 log2 (𝐾 − 1) .
Для этого слабосимметричного канала равномерный вход оптимален, так что та же формула задаёт
его пропускную способность.
При 𝐾 = 10 и 𝜂 = 0.2
𝐼(𝑌; 𝑌) ≈ 1.9660 бита
из исходных log2 10 ≈ 3.3219 бит.
Самая интересная точка — не 𝜂 = 1, а
𝜂=
𝐾−1
.
𝐾
Здесь каждая строка матрицы становится равномерной, и информация исчезает полностью. При 𝜂 =
1 точность аннотатора равна нулю, но записанная метка сообщает одну достоверную вещь: истинный
класс с ней не совпадает. Поэтому
𝐼(𝑌; 𝑌) = log2
𝐾
> 0.
𝐾−1
Для 𝐾 = 10 остаётся около 0.152 бита. Этот пример хорошо показывает, почему точность и
взаимная информация отвечают на разные вопросы: систематически неправильный сигнал
может быть полностью или частично обратимым.
Где заканчивается матрица шума
Реальные ошибки разметки часто зависят от самого объекта 𝑋, от аннотатора, неоднозначности
примера и процедуры фильтрации. Тогда одной матрицы классового шума (class‐conditional
noise) 𝑇 недостаточно.
Если 𝑇 известна, её можно использовать для прямой или обратной коррекции функции потерь.
Однако обращение плохо обусловленной матрицы усиливает статистический шум, а оценённая 𝑇
добавляет собственную ошибку. Информационная потеря канала, идентифицируемость матрицы и
численная устойчивость коррекции — три разные проблемы.
119
Теория информации для машинного обучения
7.9. Канальное кодирование в ML: ECOC и DeepJSCC
В этом разделе слово «код» используется уже не как образ. В обеих конструкциях энкодер, канал и
декодер являются частью алгоритма.
Коды выходов с исправлением ошибок
В кодах выходов с исправлением ошибок (error‐correcting output codes, ECOC) каждому
из 𝐾 классов назначается кодовое слово
𝑐𝑘 ∈ {−1, +1}𝑚 .
Каждый столбец кодовой матрицы задаёт бинарную задачу, поэтому обучаются 𝑚 бинарных
классификаторов. Их ответы образуют предсказанное слово 𝑐(𝑥), после чего выбирается ближайший
класс-код.
Если минимальное расстояние Хэмминга между кодовыми словами равно 𝑑min , идеализированный
декодер ближайшего слова исправляет до
𝑑min − 1
2
битовых ошибок. Геометрия та же, что в канальном кодировании: шары ошибок вокруг разных
классов не должны пересекаться.
Но в классификации «канал ошибок» редко является независимым BSC. Бинарные классификаторы
обучаются на одних данных, их ошибки коррелированы, столбцы имеют разную сложность, а
вероятность ошибки зависит от 𝑥 . Поэтому большой 𝑑min создаёт полезный геометрический запас,
но не является самостоятельной гарантией качества классификатора.
120
Влад Куликов · Открытая редакция 2026.1
Обучаемое совместное кодирование источника и канала
Классическая цифровая система часто разделяет три этапа:
1. сжатие источника;
2. защиту от ошибок;
3. отображение кодовых символов в физический сигнал.
В совместном кодировании источника и канала (joint source‐channel coding, JSCC)
отображение оптимизируется целиком под меру искажения и модель канала. В DeepJSCC нейронный
энкодер, дифференцируемый слой канала и нейронный декодер образуют цепочку
𝑓𝜃
𝑊
𝑔𝜙
𝑥 −−→ 𝑧 −→ 𝑧 −−→ 𝑥.
Параметры минимизируют реконструкционную или задачную функцию потерь. В исходных
экспериментах с изображениями DeepJSCC выигрывал у выбранных раздельных базовых систем
в ряде режимов низкой SNR и малого канального бюджета, а при рассогласовании SNR качество
ухудшалось плавно, без резкого «обрыва» цифровой схемы.
Этот результат не отменяет теорему разделения источника и канала. При стандартных стационарных
моделях, асимптотически длинных блоках и согласованных критериях раздельная схема может
быть оптимальной. Если на один символ источника приходится 𝜅 использований канала, условие
достижимости искажения имеет вид 𝑅(𝐷) < 𝜅𝐶 ; запись 𝑅(𝐷) < 𝐶 предполагает 𝜅 = 1 и согласованные
единицы. DeepJSCC работает в том месте, где практическая постановка отличается от идеальной
асимптотики: блок короток, задержка ограничена, модель канала может быть неточной, а качество
измеряется непрерывным искажением, а не только безошибочным восстановлением битов.
7.10. LLM как канал: точная постановка и границы аналогии
Слово «канал» естественно возникает и вокруг языковых моделей. Здесь полезно не отказываться от
аналогии, а сначала построить версию, в которой она математически точна.
121
Теория информации для машинного обучения
Канал от промпта к ответу
Зафиксируем веса модели, правила формирования контекста и алгоритм генерации. Пусть 𝑋 —
случайный промпт, а 𝑌 — сгенерированный ответ. Тогда
𝑞𝜃 (𝑦 ∣ 𝑥)
задаёт условное распределение выхода и, следовательно, стохастический канал от 𝑋 к 𝑌.
фиксированном распределении промптов можно вычислять
При
𝐼(𝑋; 𝑌).
Если декодирование детерминировано, канал просто становится детерминированным отображением.
Если используется сэмплирование с температурой, top-𝑝 или иная случайная процедура, её правила
входят в переходный закон.
Чтобы говорить именно о пропускной способности, нужно добавить операционную задачу.
Например, отправитель выбирает сообщение 𝐽, кодирует его допустимым промптом 𝑥(𝐽) длины
не более 𝐿, модель генерирует ответ, а декодер пытается восстановить 𝐽. Только после задания
множества промптов, стоимости, единицы использования и критерия ошибки выражение
«максимальная скорость» получает точный смысл.
Такой эксперимент можно поставить. Но он будет измерять пропускную способность конкретного
протокола «промпт → модель → ответ», а не универсальную величину, присущую архитектуре
трансформера вне задачи.
122
Влад Куликов · Открытая редакция 2026.1
Контекстное окно как ресурс
Окно длины 𝐿 токенов — реальный ресурс: оно ограничивает объём входа и вычислительную
стоимость. Но из числа токенов нельзя напрямую получить количество надёжно переданных битов.
Причины теперь можно сформулировать положительно. Чтобы перевести длину окна в канальную
величину, пришлось бы задать:
•
•
•
•
•
•
распределение и допустимый набор промптов;
стоимость разных токенов или последовательностей;
переходное распределение ответов;
кодер и декодер сообщений;
критерий ошибки;
роль знаний, уже находящихся в параметрах модели.
Без этих элементов длина контекста остаётся размером ресурса, а не шенноновской пропускной
способностью.
Работа Lost in the Middle показала, что качество извлечения релевантной информации может
существенно зависеть от её позиции: в исследованных задачах модели часто лучше использовали
начало и конец длинного контекста, чем середину. Это важное эмпирическое свойство конкретных
моделей и протоколов. Оно не выводится автоматически из DPI или из абстрактной «ёмкости окна»;
механизм зависит от архитектуры, позиционного кодирования, обучения и задачи.
RAG меняет протокол ещё до входа в модель: ретривер выбирает небольшой набор свидетельств
вместо помещения всего корпуса в промпт. Практический выигрыш можно описать как экономию
контекстного бюджета и уменьшение конкуренции со стороны нерелевантных фрагментов. Называть
это автоматическим увеличением пропускной способности нет необходимости — более точная
формулировка уже достаточно сильна.
Что измеряют веса внимания
Строка весов внимания (attention weights)
𝛼𝑖,⋅
суммируется в единицу и потому внешне похожа на распределение. Но она является коэффициентами
смешивания значений, а не переходным законом от входного токена к выходному сообщению.
Результат слоя зависит также от векторов значений (value vectors), нескольких голов, остаточного
потока и последующих нелинейностей.
Энтропия
𝐻(𝛼𝑖,⋅ )
имеет ясный локальный смысл: она описывает концентрацию весов маршрутизации по ключам.
Низкое значение означает, что масса сосредоточена на нескольких позициях; высокое — что она
распределена шире. Из одной этой величины не следует число переданных битов, причинное
влияние или важность токена для конечного ответа.
Цепочка рассуждений
Цепочка рассуждений (chain‐of‐thought, CoT) увеличивает число сгенерированных токенов,
объём внешнего промежуточного состояния и вычисления во время вывода (test‐time compute).
Это может улучшать решение сложных задач. Канальная метафора — «модель получила больше
последовательных использований внешнего носителя» — может быть полезна как исследовательская
интуиция. Но она пока не является теоремой о росте шенноновской пропускной способности модели.
В Модуле 13 мы вернёмся к этой границе подробнее.
123
Теория информации для машинного обучения
7.11. Как формализовать канал в ML-системе
Канальный язык наиболее полезен не тогда, когда даёт эффектную метафору, а когда заставляет
точно описать эксперимент. Перед вычислением MI или пропускной способности удобно заполнить
короткую спецификацию.
Элемент
Вопрос
Вход
Выход
Переходной закон
Какая случайная величина передаётся?
Что наблюдает получатель или следующая модель?
Откуда берётся случайность и как записывается
𝑊(𝑦 ∣ 𝑥)?
Что ограничено: мощность, длина, число токенов,
число бит, задержка?
Как сообщения отображаются во входы и как
восстанавливаются?
Блочная ошибка, MSE, top-1 точность, семантическая
полезность?
Фиксированный 𝑛 или асимптотика? Фактическое 𝑃𝑋
или максимум по 𝑃𝑋 ?
Ограничение
Код и декодер
Критерий
Режим
Сравним две постановки.
Система
Что определено строго
Какой вопрос можно задать
Шумные метки
𝑌, 𝑌 и матрица 𝑇
LLM с фиксированной процедурой
сэмплирования
промпт 𝑋, ответ 𝑌, закон 𝑞𝜃 (𝑦 ∣ 𝑥)
фактическая 𝐼(𝑌; 𝑌); при
оптимизации по классам —
пропускная способность матрицы
𝐼(𝑋; 𝑌) при заданном
распределении промптов;
пропускная способность — только
после задания кодовой задачи и
стоимости
Отсюда следуют два ключевых различия:
пропускная способность ≠ взаимная информация при фиксированном входе ≠ размер тензора или окна
и
теорема о канале ≠ эмпирический результат ≠ архитектурная аналогия .
Это не запрет на аналогии. Это способ сделать их плодотворными: сначала понять, какая часть
конструкции является настоящим каналом, а затем ясно обозначить, где начинается эвристика.
7.13. Заключение
В Модуле 6 вероятностная модель превратилась в счёт в битах. В Модуле 7 взаимная информация
получила второй операционный смысл: после оптимизации по входу она задаёт предельную скорость
надёжной передачи через шум.
𝐶 = max 𝐼(𝑋; 𝑌) .
𝑃𝑋
За короткой формулой стоит целая конструкция.
124
Влад Куликов · Открытая редакция 2026.1
•
•
•
•
•
Канал задаёт переходный закон и ограничения ресурса.
Кодовая книга превращает сообщения в длинные, хорошо разделённые последовательности.
При 𝑅 < 𝐶 случайное кодирование доказывает существование кодов с исчезающей ошибкой.
При 𝑅 > 𝐶 обратная теорема запрещает надёжную передачу любому коду.
При конечном 𝑛 одной пропускной способности недостаточно: важны допустимая ошибка и
дисперсия канала.
Главная интеллектуальная перемена состоит в том, что шум перестаёт быть локальной помехой,
которую нужно исправлять по одному символу. Код работает с геометрией всего блока. Ошибки
отдельных использований остаются, но целое сообщение можно сделать надёжно различимым.
Для ML эта идея имеет два уровня. В шумных метках, ECOC и DeepJSCC канал является частью
строгой модели или алгоритма. В рассуждениях о контексте, внимании (attention) и CoT канальный
язык пока чаще служит дисциплинирующей аналогией. В обоих случаях полезен один и тот же
вопрос: можем ли мы явно записать вход, выход, переходный закон, ресурс и задачу
декодирования?
Так завершается классическое ядро теории Шеннона. Кодирование источника убирает предсказуемую
избыточность; канальное кодирование добавляет избыточность, специально устроенную для борьбы
с шумом; взаимная информация связывает обе стороны с точными пределами.
В Модуле 8 мы перейдём от описания источников и каналов к нормативному вопросу: какое
распределение выбирать, когда известны лишь ограничения? Ответом станет принцип максимальной
энтропии (maximum entropy).
Основные источники
1. C. E. Shannon, A Mathematical Theory of Communication, 1948.
2. T. Cover, J. Thomas, Elements of Information Theory, 2nd ed., 2006, Chapters 7–9.
3. Y. Polyanskiy, Y. Wu, Information Theory: From Coding to Learning, 2025, главы о канальном
кодировании и конечной длине блока.
4. Y. Polyanskiy, H. V. Poor, S. Verdú, Channel Coding Rate in the Finite Blocklength Regime, 2010.
5. R. Blahut, Computation of Channel Capacity and Rate-Distortion Functions, 1972; S. Arimoto, An
Algorithm for Computing the Capacity of Arbitrary Discrete Memoryless Channels, 1972.
6. G. Patrini et al., Making Deep Neural Networks Robust to Label Noise: A Loss Correction Approach,
2017.
7. T. Dietterich, G. Bakiri, Solving Multiclass Learning Problems via Error-Correcting Output Codes,
1995.
8. E. Bourtsoulatze, D. B. Kurka, D. Gündüz, Deep Joint Source-Channel Coding for Wireless Image
Transmission, 2019.
9. N. F. Liu et al., Lost in the Middle: How Language Models Use Long Contexts, 2024.
10. S. Jain, B. C. Wallace, Attention is not Explanation, 2019; S. Wiegreffe, Y. Pinter, Attention is not not
Explanation, 2019.
125
Модуль 8. Максимальная
энтропия, экспоненциальные
модели и KL-регуляризация
Как читать этот модуль. Основной маршрут — §§8.1–8.9. В §§8.1–8.5 мы построим
принцип MaxEnt от постановки задачи до условных лог-линейных моделей; §§8.6–8.9
покажут ту же вариационную механику в softmax, энергетических моделях и постобучении
LLM. §8.10 — самостоятельное математическое углубление об экспоненциальных
семействах, основных распределениях и достаточных статистиках; его можно оставить на
второй проход.
8.1. От неполного знания к распределению
До сих пор распределение обычно стояло в условии задачи. Нам давали 𝑃, и мы вычисляли энтропию;
давали 𝑃 и 𝑄 , и мы находили KL; задавали канал, и мы исследовали его пропускную способность.
Теперь само распределение должно стать ответом.
Представим обычную шестигранную кость. Мы не видели её бросков, но знаем, что среднее значение
равно 4.5. Этого явно недостаточно, чтобы восстановить все шесть вероятностей. Например, оба
распределения
1 1
2 2
𝑞𝐴 = (0, 0, 0, , , 0)
и
1 1 1 1
4 4 4 4
𝑞𝐵 = (0, 0, , , , )
имеют среднее 4.5. Между ними — бесконечно много других вариантов. Ограничение отсекает часть
симплекса, но не выбирает одну точку.
В ML эта ситуация встречается чаще, чем кажется.
• Мы знаем эмпирические средние признаков и хотим получить условное распределение классов.
• Сеть выдала логиты, и нужно превратить систему оценок в вероятности.
• У нас есть базовая политика и функция награды; требуется улучшить поведение, не разрушив
всё, чему модель научилась раньше.
• Энергетическая модель умеет назначать состояниям оценки, но ещё должна согласовать их в
одно нормированное распределение.
Во всех этих задачах известна часть структуры, а полное вероятностное описание ещё нужно
достроить.
Принцип максимальной энтропии (maximum entropy, MaxEnt), сформулированный Эдвином
Джейнсом как правило вывода из неполной информации, предлагает простой ответ: среди
126
Влад Куликов · Открытая редакция 2026.1
распределений, удовлетворяющих явно заданным ограничениям, выбрать распределение с
наибольшей энтропией.
На конечном множестве состояний:
𝑞∗ = arg max 𝐻(𝑞) при 𝔼𝑞 [𝑓𝑗 (𝑋)] = 𝜇𝑗 .
𝑞∈Δ
Содержательная часть этого принципа не в лозунге «выбрать самое случайное».
аккуратной дисциплине:
Она в более
не вводить различия между допустимыми состояниями, для которых в
постановке нет основания.
Если нам уже дано базовое распределение 𝑚, естественный вопрос меняется. Теперь не нужно
возвращаться к равномерности; нужно изменить базу ровно настолько, насколько требуют новые
ограничения. Получается относительная форма MaxEnt:
𝑞∗ = arg min 𝐷KL (𝑞‖𝑚) ,
𝑞∈𝒞
где 𝒞 — множество распределений, совместимых с известными средними, а 𝑚 — базовое распределение
(reference distribution). Если 𝑚 равномерно на конечном множестве, то
𝐷KL (𝑞‖𝑚) = −𝐻(𝑞) + log |𝒳|,
и минимизация KL совпадает с обычным MaxEnt.
Эта относительная запись особенно важна для ML. Базой может быть не абстрактная равномерность,
а предобученная языковая модель, априорное распределение, прежняя версия политики или
естественная мера на пространстве состояний.
127
Теория информации для машинного обучения
Но прежде чем выводить формулу, нужно честно назвать три моделирующих решения.
1. Пространство состояний. Что считается одним элементарным исходом: число успехов,
бинарная конфигурация, класс, токенная последовательность?
2. База. От какого распределения или меры мы считаем отклонение?
3. Ограничения. Какие средние действительно известны и почему именно они считаются
существенными?
MaxEnt не угадывает «истинное распределение» за пределами этих решений. Он делает другое:
после того как модель задачи задана, убирает произвол из её достройки.
В этом модуле одна и та же конструкция появится несколько раз:
база
экспоненциальный наклон
−−−−−−−−−−−−−−−−−→
новое распределение.
У MaxEnt наклон задают ограничения на моменты. У softmax — логиты и температура. У
энергетической модели — отрицательная энергия. У KL-регуляризованной политики — награда
относительно базовой модели. Это не четыре названия одной теоремы, а четыре задачи, в которых
оптимум строится одной математической операцией.
8.2. Экспоненциальный наклон и информационная проекция
Рассмотрим конечное пространство 𝒳 и строго положительную базу
𝑚(𝑥) > 0,
𝑚(𝑥) = 1.
𝑥
Пусть известны средние функций 𝑓1 , … , 𝑓𝑘 :
𝔼𝑞 [𝑓𝑗 (𝑋)] = 𝜇𝑗 ,
𝑗 = 1, … , 𝑘.
Нужно решить
min 𝐷KL (𝑞‖𝑚)
𝑞
при нормировке и этих линейных ограничениях.
Вывод через множители Лагранжа
Лагранжиан можно записать как
ℒ(𝑞, 𝜆, 𝜈) =
𝑞(𝑥) log
𝑥
− 𝜆⊤
𝑞(𝑥)
𝑚(𝑥)
𝑞(𝑥)𝑓(𝑥) − 𝜇 + 𝜈
𝑥
𝑞(𝑥) − 1 .
𝑥
Для внутреннего решения 𝑞(𝑥) > 0:
𝑞(𝑥)
𝜕ℒ
= log
+ 1 − 𝜆⊤ 𝑓(𝑥) + 𝜈 = 0.
𝜕𝑞(𝑥)
𝑚(𝑥)
Перенесём члены и прочитаем результат в логарифмической шкале:
128
Влад Куликов · Открытая редакция 2026.1
log 𝑞(𝑥) − log 𝑚(𝑥) = 𝜆⊤ 𝑓(𝑥) − log 𝑍(𝜆).
Ограничения меняют логарифм вероятности линейно. После экспоненцирования получаем
𝑞𝜆 (𝑥) =
𝑚(𝑥) exp 𝜆⊤ 𝑓(𝑥)
,
𝑍(𝜆)
где
𝑚(𝑥) exp 𝜆⊤ 𝑓(𝑥)
𝑍(𝜆) =
𝑥
— нормировочная константа (partition function).
Вот и вся механика экспоненциального наклона (exponential tilting). База сохраняет исходную
⊤
относительную массу состояний, а множитель 𝑒 𝜆 𝑓(𝑥) усиливает или ослабляет её согласно
ограничениям. Если 𝑚 равномерно, остаётся знакомая форма
⊤ 𝑓(𝑥)
𝑞𝜆 (𝑥) ∝ 𝑒 𝜆
.
Знак параметра зависит от языка задачи. В статистике удобно писать положительную оценку 𝜆⊤ 𝑓(𝑥);
в физике часто вводят энергию 𝐸(𝑥) и получают 𝑞(𝑥) ∝ 𝑒 −𝛽𝐸(𝑥) . Распределение одно и то же —
меняется интерпретация функции в экспоненте.
Нормировочная константа как вычислительный объект
Положим
𝐴(𝜆) = log 𝑍(𝜆).
Тогда
∇𝐴(𝜆) = 𝔼𝑞𝜆 [𝑓(𝑋)]
и
∇2 𝐴(𝜆) = Cov𝑞𝜆 (𝑓(𝑋)) ⪰ 0 .
Эти две строки превращают красивую форму распределения в рабочий алгоритм. Чтобы выполнить
ограничения, нужно решить уравнение
∇𝐴(𝜆) = 𝜇.
Градиент сообщает текущие модельные средние, а гессиан показывает, как они меняются при сдвиге
параметров. Поскольку гессиан является ковариационной матрицей, 𝐴 выпукла. Если признаки
линейно избыточны, параметры 𝜆 могут быть неединственными; после удаления избыточности
выпуклость становится строгой в соответствующих направлениях.
Полезно заметить знакомую форму. В softmax 𝐴 превратится в logsumexp; в экспоненциальном
семействе — в логарифм нормировочной константы; в KL-регуляризованной политике — в мягкую
ценность базовой политики. Одна и та же функция будет одновременно нормировать распределение
и хранить его моменты в производных.
129
Теория информации для машинного обучения
Точный KL-разрыв
Пусть 𝑞 ∗ удовлетворяет ограничениям и имеет найденную форму. Для любого другого допустимого
𝑞:
𝐷KL (𝑞‖𝑚) = 𝐷KL (𝑞‖𝑞∗ ) + 𝐷KL (𝑞∗ ‖𝑚) .
Это пифагорово тождество для информационной проекции (I‐projection).
Его короткое
доказательство показывает, почему результат сильнее простого условия стационарности. Из
log
𝑞∗ (𝑥)
= 𝜆⊤ 𝑓(𝑥) − log 𝑍
𝑚(𝑥)
следует
𝐷KL (𝑞‖𝑚) − 𝐷KL (𝑞‖𝑞∗ ) = 𝔼𝑞 log
𝑞∗ (𝑋)
𝑚(𝑋)
= 𝜆⊤ 𝜇 − log 𝑍.
То же выражение получается при 𝑞 = 𝑞 ∗ , потому что оба распределения имеют одинаковые средние
признаков. Значит, разность равна 𝐷KL (𝑞 ∗ ‖𝑚).
Формулу удобно прочитать словами: любой другой способ выполнить те же ограничения
отклоняется от базы сильнее ровно на KL до оптимума. MaxEnt-решение не просто одно из
допустимых; оно является ближайшей к базе точкой в выбранном направлении KL.
Почему максимум энтропии не является случайным рецептом
Есть и комбинаторная интуиция. Для равномерной базы число последовательностей длины 𝑛 с
эмпирическим распределением 𝑞 имеет порядок
exp{𝑛𝐻(𝑞) + 𝑜(𝑛)}.
Высокоэнтропийные типы реализуются большим числом микроскопических последовательностей.
Для общего i.i.d.-распределения 𝑚 вероятность увидеть тип 𝑞 имеет экспоненциальный порядок
exp{−𝑛𝐷KL (𝑞‖𝑚) + 𝑜(𝑛)}.
После условления на ограничения доминирует тип с минимальным KL к базе. Это не отдельная
магия: та же информационная проекция появляется теперь как наиболее вероятная макроскопическая
конфигурация длинной выборки.
Условия, которые нужно держать рядом с формулой
Основной результат силён, но не безусловен.
• Ограничения должны быть совместимы.
• Если требуемый вектор 𝜇 лежит на границе выпуклой оболочки значений 𝑓(𝑥), оптимум может
иметь нули, а некоторые компоненты 𝜆 — уходить в бесконечность.
• В непрерывном случае нужно выбрать базовую меру и проверить конечность 𝑍(𝜆).
• Ограничения-неравенства требуют условий Каруша—Куна—Таккера.
Эти оговорки не меняют главного механизма. Они лишь говорят, когда внутренняя гладкая формула
описывает оптимум напрямую, а когда к нему нужно прийти предельным переходом или более
общим выпуклым анализом.
130
Влад Куликов · Открытая редакция 2026.1
8.3. Пространство состояний и базовая мера
У MaxEnt есть полезная неприятная черта: он заставляет заметить решения, которые в другой модели
легко принять за «нейтральные». Даже идеально решённая оптимизация даст другой ответ, если мы
изменим то, что считаем элементарным состоянием.
Пусть 𝐾 — число успехов в 𝑛 бинарных испытаниях и известно только
𝔼[𝐾] = 𝜇.
Рассмотрим две постановки.
Модель A: элементарное состояние — значение счётчика
Если пространство состояний равно
{0, 1, … , 𝑛}
и база равномерна по значениям 𝐾 , то MaxEnt даёт
𝑞𝐴 (𝑘) =
𝑒 𝜆𝑘
𝑛
∑𝑗=0 𝑒 𝜆𝑗
.
Это усечённое геометрическое распределение. Каждое число 𝑘 считается одним состоянием,
независимо от того, сколькими способами оно может возникнуть.
Модель B: элементарное состояние — бинарная конфигурация
Теперь состоянием является полный вектор
𝑥 = (𝑥1 , … , 𝑥𝑛 ) ∈ {0, 1}𝑛 ,
𝐾(𝑥) =
𝑥𝑖 ,
𝑖
а база равномерна по всем 2𝑛 микросостояниям. Тогда
𝑞𝐵 (𝑥) ∝ exp 𝜆
𝑥𝑖
𝑒 𝜆𝑥𝑖 .
=
𝑖
𝑖
Нормировка факторизуется, поэтому координаты становятся независимыми случайными величинами
Бернулли с
𝑝=
𝑒𝜆
𝜇
= .
𝜆
𝑛
1+𝑒
Следовательно,
𝐾 ∼ Binomial(𝑛, 𝑝).
Почему ответы различаются? Значению 𝐾 = 𝑘 соответствует
𝑛
𝑘
131
Теория информации для машинного обучения
бинарных конфигураций. Поэтому равномерная база по микросостояниям индуцирует на счётчиках
вовсе не равномерную меру, а массу, пропорциональную 𝑛 :
𝑘
𝑞𝐵 (𝑘) ∝
𝑛 𝜆𝑘
𝑒 .
𝑘
Разницу легко увидеть численно. При 𝑛 = 10 и 𝔼[𝐾] = 7 модель A имеет 𝜆 ≈ 0.2187 и оставляет
заметную массу на всём диапазоне; в частности, 𝑞𝐴 (10) ≈ 0.216. Модель B даёт 𝑝 = 0.7 и
биномиальное распределение, сосредоточенное около семи; здесь 𝑞𝐵 (10) = 0.710 ≈ 0.028.
Обе модели точно удовлетворяют одному среднему. Они отвечают на разные вопросы.
Это не экзотическая ловушка статистической механики. В ML выбор состояния появляется повсюду:
•
•
•
•
•
считать ли многометочный ответ одной категорией или набором бинарных решений;
моделировать ли последовательность целиком или факторизовать её по токенам;
считать ли перестановки объектов разными состояниями;
использовать ли равномерную базу по классам или предобученное распределение;
считать ли две параметризации одной функции разными гипотезами.
Отсюда практическое правило:
Перед фразой «выберем максимально неопределённое распределение»
назовите пространство состояний, базу и ограничения.
Для непрерывных величин этот вопрос ещё острее. Дифференциальная энтропия меняется при
смене координат и единиц измерения. Относительная энтропия к явно выбранной базовой мере
делает моделирующее предположение видимым и потому часто является более надёжной отправной
точкой.
8.4. Классические MaxEnt-распределения и AWGN-канал
После выбора пространства состояний знакомые распределения перестают выглядеть случайным
меню из учебника. Они возникают как ответы на разные наборы информации.
132
Влад Куликов · Открытая редакция 2026.1
Равномерное распределение
На конечном множестве из 𝐾 состояний, если известно только условие нормировки,
𝑞∗ (𝑥) =
1
.
𝐾
Это тот же факт, который в Модуле 2 записывался как
𝐻(𝑞) ≤ log 𝐾.
Здесь он получает другую интерпретацию: равномерность — не универсальный априорный закон, а
MaxEnt-ответ на конечном симметричном пространстве без дополнительных ограничений.
Экспоненциальное распределение
На полуоси [0, ∞) среди плотностей с заданным положительным средним
𝔼[𝑋] = 𝜇
максимальную дифференциальную энтропию имеет
𝑞∗ (𝑥) =
1 −𝑥/𝜇
𝑒
,
𝜇
𝑥 ≥ 0.
Носитель здесь является частью информации. На всей прямой одного ограничения на среднее
недостаточно: распределение можно растягивать, не меняя среднее, и увеличивать дифференциальную
энтропию без границы.
Гауссовское распределение
На ℝ среди плотностей с фиксированными средним и дисперсией
Var(𝑋) = 𝜎 2
𝔼[𝑋] = 𝜇,
максимальную дифференциальную энтропию имеет
𝑞∗ (𝑥) =
1
√2𝜋𝜎 2
exp −
(𝑥 − 𝜇)2
.
2𝜎 2
В натах
ℎ(𝑋) =
1
log(2𝜋𝑒𝜎 2 ).
2
133
Теория информации для машинного обучения
Это свойство даёт важную характеристику гауссовского распределения: при фиксированной
ковариации никакая другая плотность не имеет большей дифференциальной энтропии. Но оно не
заменяет центральную предельную теорему. У энтропийных версий CLT есть собственные условия
и доказательства; фраза «сумма становится гауссовской, потому что энтропия растёт» слишком
быстро соединяет разные результаты.
Почему гауссовский вход достигает пропускной способности AWGN
Теперь вернёмся к каналу из Модуля 7:
𝑌 = 𝑋 + 𝑁,
𝑁 ∼ 𝒩(0, 𝜎𝑁2 ),
𝔼[𝑋 2 ] ≤ 𝑃,
где 𝑋 и 𝑁 независимы. В битах
𝐼(𝑋; 𝑌) = ℎ2 (𝑌) − ℎ2 (𝑁).
Шум фиксирован, значит максимизировать нужно энтропию выхода. Его дисперсия удовлетворяет
Var(𝑌) = Var(𝑋) + 𝜎𝑁2 ≤ 𝑃 + 𝜎𝑁2 .
По MaxEnt-свойству гауссиана
ℎ2 (𝑌) ≤
1
log2 2𝜋𝑒(𝑃 + 𝜎𝑁2 ) .
2
Вычитая
134
Влад Куликов · Открытая редакция 2026.1
1
log2 (2𝜋𝑒𝜎𝑁2 ),
2
ℎ2 (𝑁) =
получаем
𝐼(𝑋; 𝑌) ≤
1
𝑃
log2 1 + 2 .
2
𝜎𝑁
Равенство достигается при
𝑋 ∼ 𝒩(0, 𝑃),
потому что тогда выход 𝑌 тоже гауссовский и использует всю допустимую дисперсию.
На этом месте легко сократить рассуждение до «гауссовский вход максимизирует энтропию, поэтому
максимизирует MI». Правильная цепочка чуть длиннее и важнее: гауссовский вход делает
гауссовским выход; именно максимальная энтропия выхода даёт максимальную
взаимную информацию при фиксированном шуме.
8.5. Условный MaxEnt и лог-линейные модели
До трансформеров многие NLP-системы строились из признаков, которые инженер задавал вручную:
текущее слово начинается с заглавной буквы, предыдущая метка была B‐PER, суффикс равен ‐ing,
слово встречается в словаре организаций. Задача была знакомой и по-прежнему актуальной:
превратить множество частичных сигналов в нормированное условное распределение.
Пусть 𝑝(𝑥) — эмпирическое распределение входов, 𝑦 — метка, а
𝑓𝑗 (𝑥, 𝑦)
— признаки пары «вход — ответ». Потребуем, чтобы модель воспроизводила их эмпирические
средние:
𝑝(𝑥)𝑞(𝑦 ∣ 𝑥)𝑓𝑗 (𝑥, 𝑦) = 𝜇𝑗 .
𝑥,𝑦
Среди всех условных распределений, удовлетворяющих этим ограничениям, максимизируем
условную энтропию
𝐻𝑞 (𝑌 ∣ 𝑋) = −
𝑝(𝑥)𝑞(𝑦 ∣ 𝑥) log 𝑞(𝑦 ∣ 𝑥).
𝑥,𝑦
Тот же лагранжев ход приводит к условной лог-линейной модели:
𝑞𝜃 (𝑦 ∣ 𝑥) =
exp 𝜃 ⊤ 𝑓(𝑥, 𝑦)
,
𝑍𝜃 (𝑥)
𝑍𝜃 (𝑥) =
exp 𝜃 ⊤ 𝑓(𝑥, 𝑦 ′ ) .
где
𝑦′
Каждый признак добавляет свой вклад в логит, а нормировочная константа превращает сумму
вкладов в распределение по ответам. Если 𝑓(𝑥, 𝑦) — выход последнего скрытого слоя, а 𝜃 — веса
135
Теория информации для машинного обучения
линейной головы, перед нами обычный softmax-классификатор. Разница в том, откуда взялись
признаки: раньше их проектировал человек, теперь их чаще учит глубокая сеть.
Максимальное правдоподобие и согласование моментов
Для выборки (𝑥𝑖 , 𝑦𝑖 )𝑛𝑖=1 условное логарифмическое правдоподобие равно
𝑛
𝜃 ⊤ 𝑓(𝑥𝑖 , 𝑦𝑖 ) − log 𝑍𝜃 (𝑥𝑖 ) .
𝓁(𝜃) =
𝑖=1
Его градиент:
∇𝜃 𝓁(𝜃) =
𝑓(𝑥𝑖 , 𝑦𝑖 ) −
𝔼𝑌∼𝑞𝜃 (⋅∣𝑥𝑖 ) [𝑓(𝑥𝑖 , 𝑌)] .
𝑖
𝑖
Формулу стоит прочитать до того, как двигаться дальше.
Первый член считает признаки,
действительно встреченные в данных. Второй спрашивает, сколько тех же признаков ожидает
текущая модель. Обучение уменьшает разницу между двумя описаниями выборки.
Если существует конечный внутренний максимум нерегуляризованного правдоподобия, нулевой
градиент даёт точное согласование моментов (moment matching):
𝑓(𝑥𝑖 , 𝑦𝑖 ) =
𝑖
𝔼𝑞𝜃 (⋅∣𝑥𝑖 ) [𝑓(𝑥𝑖 , 𝑌)].
𝑖
Это не декоративная аналогия с MaxEnt. В условном экспоненциальном семействе максимальное
правдоподобие и условный MaxEnt являются двумя сторонами одной выпуклой двойственности.
136
Влад Куликов · Открытая редакция 2026.1
Где заканчивается точное утверждение
Теперь можно компактно обозначить область действия.
• Регуляризация добавляет к уравнению моментов собственный член, поэтому равенство
меняется.
• Линейно зависимые признаки делают параметры неидентифицируемыми, хотя распределение
может быть определено однозначно.
• При линейной разделимости конечного MLE может не существовать: нормы параметров растут,
а правдоподобие приближается к супремуму.
• У глубокой сети логиты нелинейно зависят от миллионов весов. Обучение по кросс-энтропии
остаётся максимальным правдоподобием условной модели, но не превращает всю сеть в одну
простую MaxEnt-задачу с явными ограничениями на внутренние признаки.
Положительный результат при этом остаётся сильным: для лог-линейной головы градиент
действительно сравнивает эмпирические и модельные средние признаков.
Историческая линия NLP
Классификаторы максимальной энтропии использовали такие условные модели для разметки
и классификации. Maximum Entropy Markov Models (MEMM) нормировали переходы локально
для каждого состояния. Conditional Random Fields (CRF) перенесли нормировку на всю
последовательность меток:
𝑞𝜃 (𝑦1∶𝑇 ∣ 𝑥1∶𝑇 ) =
exp 𝜃 ⊤ 𝐹(𝑥1∶𝑇 , 𝑦1∶𝑇 )
.
𝑍𝜃 (𝑥1∶𝑇 )
Современная архитектура может строить признаки гораздо сложнее, но экспоненциальная
нормировка никуда не исчезла. Поэтому историческая связь с MaxEnt содержательна: изменилась
машина, которая производит оценки, а способ превратить эти оценки в условное распределение
сохранился.
Следующий шаг — рассмотреть сам softmax отдельно. Он знаком каждому ML-инженеру, но за одной
строкой API скрывается законченная вариационная задача.
8.6. Softmax как решение задачи «оценка + энтропия»
Современный ML использует softmax настолько часто, что он почти перестал выглядеть как идея.
Обычно его вводят процедурно: сеть выдаёт логиты, мы применяем экспоненту, нормируем сумму
до единицы — и получаем вероятности. Это правильно, но оставляет без ответа более интересный
вопрос: почему именно такая нормировка возникает в классификации, генерации и
обучении политик снова и снова?
Сильный ответ звучит так: softmax — это MaxEnt-решение. В этой фразе есть важная правда, но
её нужно сформулировать точно. Softmax не максимизирует энтропию «вообще» и не выводится из
ограничений, которые заранее фиксируют искомые вероятности. Он решает конкретный конфликт:
мы хотим предпочитать варианты с высокой оценкой, но не хотим концентрировать распределение
сильнее, чем требует эта оценка.
Пусть 𝑧 = (𝑧1 , … , 𝑧𝐾 ) ∈ ℝ𝐾 — логиты, 𝑞 ∈ Δ𝐾 — распределение по 𝐾 вариантам, а энтропия измеряется
в натах:
𝐾
𝑞𝑘 log 𝑞𝑘 .
𝐻(𝑞) = −
𝑘=1
Для температуры 𝜏 > 0 рассмотрим задачу
137
Теория информации для машинного обучения
max 𝑞 ⊤ 𝑧 + 𝜏𝐻(𝑞) .
𝑞∈Δ𝐾
У двух членов здесь разные роли.
• 𝑞 ⊤ 𝑧 — ожидаемая оценка. Он тянет массу к вариантам с большими логитами.
• 𝐻(𝑞) — сопротивление преждевременной концентрации. Он вознаграждает распределения,
которые сохраняют неопределённость.
• 𝜏 — обменный курс между этими требованиями. Он показывает, сколько единиц ожидаемой
оценки мы готовы отдать за дополнительную единицу энтропии.
Решение этой задачи — softmax:
𝑞𝑘∗ =
exp(𝑧𝑘 /𝜏)
𝐾
∑𝑗=1 exp(𝑧𝑗 /𝜏)
.
А оптимальное значение равно
𝐾
⊤
𝑒 𝑧𝑘 /𝜏 .
max {𝑞 𝑧 + 𝜏𝐻(𝑞)} = 𝜏 log
𝑞∈Δ𝐾
𝑘=1
Иными словами, logsumexp — это не случайная гладкая замена максимума, а цена оптимального
компромисса между оценкой и энтропией.
Точный KL-разрыв
Обозначим
𝑠𝑘 =
𝑒 𝑧𝑘 /𝜏
,
𝑍
𝑒 𝑧𝑗 /𝜏 .
𝑍=
𝑗
Для любого 𝑞 ∈ Δ𝐾 :
𝑞⊤ 𝑧 + 𝜏𝐻(𝑞) = 𝜏
𝑞𝑘 log
𝑒 𝑧𝑘 /𝜏
𝑞𝑘
𝑞𝑘 log
𝑍𝑠𝑘
𝑞𝑘
𝑘
=𝜏
𝑘
= 𝜏 log 𝑍 − 𝜏𝐷KL (𝑞‖𝑠).
KL-дивергенция неотрицательна, поэтому максимум единственно достигается при 𝑞 = 𝑠. Но главное
здесь не только ответ. Мы получили точный разрыв:
𝜏 log 𝑍 − 𝑞 ⊤ 𝑧 + 𝜏𝐻(𝑞) = 𝜏𝐷KL (𝑞‖𝑞∗ ).
Любое отклонение от softmax-распределения оплачивается KL-дивергенцией до оптимума. Это уже
не метафора про «мягкий выбор», а полная геометрия задачи.
В каком смысле softmax является MaxEnt
Теперь можно вернуть исходный сильный тезис — но без логической подмены.
Пусть 𝑞 ∗ = softmax(𝑧/𝜏) и
138
Влад Куликов · Открытая редакция 2026.1
𝜇𝜏 = (𝑞 ∗ )⊤ 𝑧.
Среди всех распределений с тем же ожидаемым логитом,
𝑞 ⊤ 𝑧 = 𝜇𝜏 ,
распределение 𝑞 ∗ имеет максимальную энтропию. Действительно, на этом множестве ожидаемая
оценка одинакова, поэтому максимизация 𝑞 ⊤ 𝑧 + 𝜏𝐻(𝑞) сводится к максимизации 𝐻(𝑞).
Таким образом, корректны две эквивалентные точки зрения:
1. регуляризованная: softmax максимизирует «ожидаемая оценка + 𝜏 × энтропия»;
2. MaxEnt: softmax максимизирует энтропию при фиксированном уровне ожидаемой оценки,
причём этот уровень связан с 𝜏.
А вот ограничения вида
𝔼𝑞 [1{𝑌 = 𝑘}] = 𝜋𝑘
не выводят softmax: они уже означают 𝑞𝑘 = 𝜋𝑘 и тем самым заранее задают ответ. Это полезный
пример того, как верная интуиция может быть испорчена неудачной формализацией.
Температура как параметр обмена
Для логитов 𝑧 = (2, 1, 0) получаем:
𝜏
𝑞 ∗ = softmax(𝑧/𝜏)
𝐻(𝑞 ∗ ), наты
0.5
1
2
(0.867, 0.117, 0.016)
(0.665, 0.245, 0.090)
(0.506, 0.307, 0.186)
0.441
0.832
1.020
При малой температуре один дополнительный пункт логита стоит дорого: распределение быстро
концентрируется. При большой температуре тот же разрыв между логитами слабее влияет на
вероятности, и энтропия растёт.
139
Теория информации для машинного обучения
Предельные режимы тоже читаются точно:
• при 𝜏 → 0 масса концентрируется на максимизаторах 𝑧; если максимум достигается в
нескольких классах, предельное распределение равномерно между ними;
• при 𝜏 → ∞ распределение стремится к равномерному на всех 𝐾 классах;
• добавление одной константы ко всем логитам не меняет softmax;
• умножение логитов на 𝑐 > 0 эквивалентно делению температуры на 𝑐 .
Функция
𝑒 𝑧𝑘 /𝜏
𝐹𝜏 (𝑧) = 𝜏 log
𝑘
сглаживает максимум:
max 𝑧𝑘 ≤ 𝐹𝜏 (𝑧) ≤ max 𝑧𝑘 + 𝜏 log 𝐾,
𝑘
𝑘
а её градиент возвращает само оптимальное распределение:
∇𝑧 𝐹𝜏 (𝑧) = softmax(𝑧/𝜏).
Поэтому softmax одновременно играет три роли: превращает оценки в распределение, решает
энтропийно-регуляризованную задачу и является градиентом гладкого максимума.
140
Влад Куликов · Открытая редакция 2026.1
Граница утверждения
Softmax — не «единственно честный» способ превратить оценки в вероятности. Он единственен как
решение этой задачи, с энтропией Шеннона и линейным членом ожидаемой оценки. Если заменить
регуляризатор, изменится и отображение: некоторые регуляризаторы, например, дают разреженные
распределения с точными нулями.
Но ослаблять основной вывод из-за этого не нужно. Он уже достаточно силён:
softmax — точный оптимум задачи, в которой логиты голосуют за варианты, а
энтропия не даёт этим голосам превратиться в более уверенное распределение,
чем оправдывает выбранная температура.
На конечном множестве классов нормировочная сумма дёшева. Теперь заменим классы всеми
возможными изображениями, конфигурациями или текстовыми последовательностями — и та же
идея превратится в энергетическую модель.
8.7. Энергетические модели и нормировочная константа
Softmax можно считать простейшей энергетической моделью. Возьмём состояние 𝑥 = 𝑘 , положим
𝐸(𝑘) = −
𝑧𝑘
𝜏
и нормируем 𝑒 −𝐸(𝑘) по всем классам. Получится тот же softmax.
Пока состояний несколько тысяч, эта операция выглядит почти бесплатной. Но если состоянием
является изображение, молекула или вся последовательность токенов, сумма по всем возможным
𝑥 становится астрономической. Именно здесь привычная нормировка превращается из последней
строки кода в центральную вычислительную проблему.
Энергетическая модель (energy‐based model, EBM) задаёт распределение в виде
𝑞𝜃 (𝑥) =
𝑚(𝑥)𝑒 −𝐸𝜃 (𝑥)
,
𝑍𝜃
𝑍𝜃 =
𝑚(𝑥)𝑒 −𝐸𝜃 (𝑥) 𝑑𝑥.
Здесь:
• 𝐸𝜃 (𝑥) — энергия состояния: меньшая энергия означает большую ненормированную правдоподобность;
• 𝑚(𝑥) — базовая плотность или базовая мера;
• 𝑍𝜃 — нормировочная константа (partition function).
Энергия умеет отвечать на локальный вопрос: «насколько это состояние совместимо с моделью?»
Нормировочная константа заставляет все локальные ответы согласоваться глобально. 𝑍𝜃 — цена
превращения системы оценок в вероятностную модель.
Связь EBM с MaxEnt
Здесь тоже легко произнести красивую фразу слишком широко: «любая EBM — это MaxEnt». Точная
связь зависит от формы энергии.
Если
𝐸𝜃 (𝑥) = −𝜃 ⊤ 𝑓(𝑥),
то
𝑞𝜃 (𝑥) ∝ 𝑚(𝑥)𝑒 𝜃
141
⊤ 𝑓(𝑥)
Теория информации для машинного обучения
является экспоненциальным семейством.
Такая форма возникает из относительного MaxEnt при ограничениях на моменты 𝔼[𝑓(𝑋)]. В этом случае признаки 𝑓 имеют прямой смысл
макроскопических величин, а параметры 𝜃 — множителей Лагранжа.
Если же 𝐸𝜃 — произвольная глубокая сеть, Gibbs-форма остаётся корректной, но известной
нам системы MaxEnt-ограничений может не существовать в явном виде. Gibbs-форма шире
конкретной истории, из которой она могла быть выведена. Это не делает нейросетевую
EBM менее содержательной; просто её энергия задаётся моделью, а не списком интерпретируемых
моментов.
Градиент логарифмического правдоподобия
Для одного наблюдения 𝑥 отрицательное логарифмическое правдоподобие равно
− log 𝑞𝜃 (𝑥) = 𝐸𝜃 (𝑥) + log 𝑍𝜃 − log 𝑚(𝑥).
Если 𝑚 не зависит от 𝜃, то
∇𝜃 log 𝑍𝜃 = −𝔼𝑋∼𝑞𝜃 [∇𝜃 𝐸𝜃 (𝑋)],
и поэтому
∇𝜃 [− log 𝑞𝜃 (𝑥)] = ∇𝜃 𝐸𝜃 (𝑥) − 𝔼𝑋∼𝑞𝜃 [∇𝜃 𝐸𝜃 (𝑋)].
На этом месте формулу лучше прочитать как динамику обучения.
Первый член просит понизить энергию наблюдаемого примера. Если бы он был единственным,
модель могла бы понизить энергию вообще всех состояний и ничего не выучить. Второй член
сравнивает данные с тем, что сейчас генерирует сама модель, и не даёт выиграть таким тривиальным
способом.
В литературе эти части часто называют положительной и отрицательной фазами (positive phase,
negative phase):
• данные тянут свою энергию вниз;
• модельные примеры получают компенсирующее давление;
• обучение меняет не абсолютный уровень энергии, а рельеф, отделяющий данные от
альтернатив.
142
Влад Куликов · Открытая редакция 2026.1
Для линейной энергии 𝐸𝜃 (𝑥) = −𝜃 ⊤ 𝑓(𝑥) градиент принимает особенно прозрачный вид:
∇𝜃 [− log 𝑞𝜃 (𝑥)] = −𝑓(𝑥) + 𝔼𝑞𝜃 [𝑓(𝑋)].
После усреднения по данным стационарное условие требует
𝔼data [𝑓(𝑋)] = 𝔼𝑞𝜃 [𝑓(𝑋)].
Так в EBM снова появляется согласование моментов (moment matching). Это тот же механизм,
который стоял за классическими MaxEnt-моделями NLP, но теперь он виден непосредственно в
градиенте правдоподобия.
Вычислительная трудность
Первый член градиента вычисляется на данных. Второй требует ожидания по текущей модели.
Чтобы его оценить, нужно уметь получать образцы из 𝑞𝜃 или достаточно хорошо аппроксимировать
это ожидание. Для сложной энергии именно это часто оказывается труднее, чем вычислить саму
𝐸𝜃 (𝑥).
Отсюда возникают MCMC, contrastive divergence и другие способы приблизить отрицательную фазу.
Их общая задача — понять, какие состояния модель сейчас считает правдоподобными, не перебирая
всё пространство.
Согласование скор-функций (score matching) идёт другим путём. Если плотность дифференцируема
по 𝑥 , то
∇𝑥 log 𝑞𝜃 (𝑥) = −∇𝑥 𝐸𝜃 (𝑥) + ∇𝑥 log 𝑚(𝑥).
143
Теория информации для машинного обучения
Нормировочная константа исчезает, потому что она не зависит от 𝑥 . Поэтому можно обучать скорфункцию (score) без явного вычисления 𝑍𝜃 .
Эта связь действительно ведёт к современным моделям на основе скор-функции (score‐based
models) и диффузионным моделям, но не сводит их к одной статической EBM. Диффузионная
модель обычно обучает семейство зависящих от времени скор-функций для распределений
с разными уровнями шума, а генерация реализует обращение соответствующего стохастического
процесса. Физическая интуиция здесь полезна; буквальное тождество было бы слишком грубым.
Главный переход уже перед нами. В EBM базовая мера 𝑚 задаёт, где масса находилась до
энергетического наклона. Если вместо 𝑚 подставить базовую языковую модель, а вместо −𝐸 —
награду, получится точная формула KL-регуляризованной политики.
8.8. KL-регуляризованная политика и Gibbs-оптимум
Теперь сделаем одну замену смысла переменных:
• состояние 𝑥 станет ответом 𝑦 на контекст 𝑥 ;
• базовое распределение 𝑚 станет базовой политикой 𝜋ref (𝑦 ∣ 𝑥);
• отрицательная энергия станет нормированной наградой 𝑟(𝑥, 𝑦)/𝛽 .
Именно поэтому формула, знакомая по статистической физике и MaxEnt, возникает в RLHF и DPO
не как украшение, а как аналитический оптимум.
Для фиксированного контекста 𝑥 рассмотрим
𝐽𝑥 (𝜋) = 𝔼𝑦∼𝜋(⋅∣𝑥) [𝑟(𝑥, 𝑦)] − 𝛽𝐷KL 𝜋(⋅ ∣ 𝑥)‖𝜋ref (⋅ ∣ 𝑥) ,
где 𝛽 > 0. Оптимизация ведётся по всем распределениям 𝜋(⋅ ∣ 𝑥), абсолютно непрерывным
относительно 𝜋ref : политика не может создать массу там, где базовая политика имеет нулевую
вероятность.
Предположим, что
𝑍(𝑥) = 𝔼𝑦∼𝜋ref (⋅∣𝑥) 𝑒 𝑟(𝑥,𝑦)/𝛽 < ∞.
Тогда единственный оптимум имеет вид
𝜋 ∗ (𝑦 ∣ 𝑥) =
𝜋ref (𝑦 ∣ 𝑥) exp(𝑟(𝑥, 𝑦)/𝛽)
.
𝑍(𝑥)
Эту формулу действительно стоит запомнить. Она говорит не «выберите softmax-параметризацию
и попробуйте её обучить», а нечто сильнее: если целевая функция именно такая, то
оптимальное распределение обязано быть экспоненциальным наклоном базовой
политики.
Точный разрыв целевой функции
Из определения 𝜋 ∗ :
𝜋(𝑦 ∣ 𝑥)
𝑟(𝑥, 𝑦)
𝜋(𝑦 ∣ 𝑥)
= log
−
+ log 𝑍(𝑥).
∗
𝜋 (𝑦 ∣ 𝑥)
𝜋ref (𝑦 ∣ 𝑥)
𝛽
log
Усредним это равенство по 𝜋:
𝐷KL (𝜋‖𝜋 ∗ ) = 𝐷KL (𝜋‖𝜋ref ) −
144
1
𝔼 [𝑟] + log 𝑍.
𝛽 𝜋
Влад Куликов · Открытая редакция 2026.1
После перегруппировки:
𝐽𝑥 (𝜋) = 𝛽 log 𝑍(𝑥) − 𝛽𝐷KL (𝜋‖𝜋 ∗ ).
Отсюда
𝐽𝑥 (𝜋 ∗ ) = 𝛽 log 𝑍(𝑥),
и точный недобор любой другой политики равен
𝐽𝑥 (𝜋 ∗ ) − 𝐽𝑥 (𝜋) = 𝛽𝐷KL (𝜋‖𝜋 ∗ ).
Мы получили сразу три факта:
1. 𝜋 ∗ — глобальный, а не локальный оптимум;
2. на носителе базовой политики он единственен;
3. недобор любой другой политики измеряется KL-дивергенцией до него.
Это вариационный принцип Гиббса (Gibbs variational principle), или относительный MaxEnt.
При равномерной базовой политике он превращается в обычную задачу «награда + энтропия». При
неравномерной базе энтропия становится относительной: политика платит не за концентрацию саму
по себе, а за отход от того распределения, которое уже умела порождать модель.
Численный пример
Пусть базовая политика распределяет массу по трём ответам так:
𝜋ref = (0.7, 0.2, 0.1),
𝑟 = (0, 1, 2).
Тогда:
𝛽
𝜋∗
2
(0.538, 0.253, 0.209)
145
Теория информации для машинного обучения
𝛽
𝜋∗
1
0.5
(0.353, 0.274, 0.373)
(0.092, 0.193, 0.715)
Третий ответ начинал с вероятности 0.1, но высокая награда постепенно перетягивает к нему массу.
При этом наклон не забывает базовую модель: два ответа с одинаковой наградой сохраняли бы
отношение вероятностей, заданное 𝜋ref .
Это важнее, чем кажется. Формула не складывает «вероятность базы» и «награду». Она складывает
их в логарифмическом пространстве:
log 𝜋 ∗ (𝑦 ∣ 𝑥) = log 𝜋ref (𝑦 ∣ 𝑥) +
𝑟(𝑥, 𝑦)
− log 𝑍(𝑥).
𝛽
Награда действует как добавка к лог-вероятности, а затем вся система заново нормируется.
Аддитивные разности награды поэтому превращаются в отношения вероятностей: это мультипликативное
обновление и есть определяющая черта наклона Гиббса.
Интерпретация 𝛽
𝛽 имеет те же единицы, что и награда. Поэтому число вроде 𝛽 = 0.1 ничего не говорит без масштаба
модели награды.
• Добавление к 𝑟(𝑥, 𝑦) константы, зависящей только от 𝑥 , не меняет 𝜋 ∗ : константа поглощается в
𝑍(𝑥).
• Умножение награды на 𝑐 > 0 эквивалентно делению 𝛽 на 𝑐 .
• При 𝛽 → ∞ политика стремится к 𝜋ref .
• При 𝛽 → 0 масса концентрируется на ответах с максимальной наградой внутри носителя
базы. Если максимизаторов несколько, предельные веса между ними пропорциональны их
вероятностям под 𝜋ref , а не обязаны быть равными.
Штрафованная задача является лагранжевой формой задачи с ограничением
max 𝔼𝜋 [𝑟]
𝜋
при
𝐷KL (𝜋‖𝜋ref ) ≤ 𝜀.
При обычных условиях граничным значениям KL-бюджета соответствуют значения 𝛽 . Поэтому 𝛽
можно читать и как температуру, и как цену единицы ухода от базы, и как множитель Лагранжа
области доверия (trust region). Это три языка одной оптимизационной конструкции.
Связь с DPO
Из Gibbs-формы можно выразить награду через оптимальную политику:
𝑟(𝑥, 𝑦) = 𝛽 log
𝜋 ∗ (𝑦 ∣ 𝑥)
+ 𝛽 log 𝑍(𝑥).
𝜋ref (𝑦 ∣ 𝑥)
В модели предпочтений Bradley–Terry используются разности наград двух ответов. Член 𝛽 log 𝑍(𝑥)
зависит только от контекста и сокращается:
𝑟(𝑥, 𝑦𝑤 ) − 𝑟(𝑥, 𝑦𝑙 ) = 𝛽 log
− log
146
𝜋 ∗ (𝑦𝑤 ∣ 𝑥)
𝜋ref (𝑦𝑤 ∣ 𝑥)
𝜋 ∗ (𝑦𝑙 ∣ 𝑥)
.
𝜋ref (𝑦𝑙 ∣ 𝑥)
Влад Куликов · Открытая редакция 2026.1
После подстановки этой разности в логистическое правдоподобие предпочтений получается функция
потерь DPO. В этом смысле DPO действительно использует аналитическую форму оптимальной KLрегуляризованной политики и устраняет необходимость обучать отдельную модель награды (reward
model), а затем запускать RL-цикл.
Но здесь важно назвать тезис, который мы не доказывали. Формула 𝜋 ∗ описывает неограниченный
оптимум по всем распределениям при фиксированных 𝑟 и 𝜋ref . Реальная LLM ограничена
параметризацией, конечными данными и оптимизатором. PPO — алгоритм приближения к
своей целевой функции; DPO — оценивание политики из пар предпочтений при дополнительной
модели этих предпочтений. Из общей Gibbs-формы не следует, что их конечные решения обязаны
совпадать.
И всё же формула снимает значительную часть терминологического тумана вокруг постобучения
(post‐training). В центре остаётся одна операция:
награда экспоненциально перераспределяет массу базовой модели, а KL
задаёт цену этого перераспределения.
Красота этой конструкции одновременно показывает её уязвимость. Оптимум безошибочно
максимизирует именно ту награду, которую мы записали. Если награда является несовершенной
прокси, математика так же безошибочно усилит и её ошибки.
8.9. Переоптимизация награды и роль KL
Старую интуицию удобно сформулировать прямо: KL-якорь защищает от закона Гудхарта.
Как практическая эвристика это часто полезно — удержание около базовой модели действительно
ограничивает область, в которой модель награды можно эксплуатировать. Как математическое
утверждение фраза слишком сильна.
KL знает только две политики: текущую и базовую. Он не видит неизвестную истинную цель и не
умеет проверять, правильно ли задана награда. Поэтому точный вопрос звучит иначе:
Что гарантированно происходит вдоль Gibbs-траектории, когда мы всё сильнее
оптимизируем прокси-награду, и где в этой картине может сломаться связь с истинным
качеством?
Пусть
𝜋𝛼 (𝑦) =
𝜋ref (𝑦)𝑒 𝛼𝑟proxy (𝑦)
,
𝑍(𝛼)
𝛼=
1
.
𝛽
Параметр 𝛼 удобен как мера оптимизационного давления: чем он больше, тем сильнее политика
наклоняется по прокси-награде.
Ковариационное тождество
Для любой интегрируемой функции 𝑔(𝑦):
𝑑
𝔼 [𝑔(𝑌)] = Cov𝜋𝛼 𝑔(𝑌), 𝑟proxy (𝑌) .
𝑑𝛼 𝜋𝛼
Доказательство занимает одну строку, если сначала продифференцировать само распределение:
𝑑
𝜋 (𝑦) = 𝜋𝛼 (𝑦) 𝑟proxy (𝑦) − 𝔼𝜋𝛼 [𝑟proxy ] .
𝑑𝛼 𝛼
После умножения на 𝑔(𝑦) и суммирования получается ковариация.
Это, пожалуй, самая содержательная формула раздела. Она говорит: экспоненциальный наклон
увеличивает не все полезные величины, а те, которые положительно ковариируют
147
Теория информации для машинного обучения
с прокси-наградой под текущей политикой. Причём слово «текущей» критично: по мере
движения политики сама область усреднения меняется.
Динамика прокси-награды
Подставим 𝑔 = 𝑟proxy :
𝑑
𝔼 [𝑟
] = Var𝜋𝛼 (𝑟proxy ) ≥ 0.
𝑑𝛼 𝜋𝛼 proxy
Пока прокси-награда не стала константой на поддержке политики, усиление оптимизации строго
повышает её ожидаемое значение. Оптимизатор делает именно то, что от него просили. Закон
Гудхарта начинается не с отказа оптимизации, а с её успеха.
Динамика истинного качества
Теперь положим 𝑔 = 𝑟true :
𝑑
𝔼 [𝑟 ] = Cov𝜋𝛼 (𝑟true , 𝑟proxy ).
𝑑𝛼 𝜋𝛼 true
Пока прокси и истинная цель положительно связаны в области, где находится масса политики,
истинное качество растёт. Но сильный наклон отбирает всё более экстремальные состояния. В хвосте
распределения могут находиться ошибки модели награды, редкие артефакты или стратегии, которые
получают высокую прокси-награду по неправильной причине. Тогда ковариация уменьшается,
проходит через ноль и может стать отрицательной.
Получается точная версия привычной Goodhart-кривой:
• сначала прокси помогает найти действительно лучшие ответы;
• затем полезный сигнал исчерпывается;
• после этого дополнительное давление преимущественно отбирает ошибки самой прокси.
Это не универсальная теорема о том, что истинная награда обязана сначала расти, а затем падать.
Такое поведение возникает, когда ковариация меняет знак. Но формула показывает ровно тот
механизм, который нужно проверять.
В вычислительном примере модуля базовая политика приписывает редкому действию-эксплойту
вероятность 0.001. Прокси ошибочно оценивает его высоко, тогда как истинная награда низка.
При умеренном 𝛼 политика улучшает обычные действия; при большом 𝛼 редкая ошибка начинает
доминировать. Прокси-награда продолжает расти, а истинная — после максимума падает.
148
Влад Куликов · Открытая редакция 2026.1
Подобную переоптимизацию наблюдали и в контролируемых экспериментах с моделями награды:
при усилении оптимизации прокси-награда может продолжать расти, тогда как оценка фиксированной
эталонной моделью ухудшается. Это эмпирический факт конкретного протокола, а не следствие
одной абстрактной KL-формулы.
Что контролирует KL
Вдоль той же Gibbs-траектории
𝐷KL (𝜋𝛼 ‖𝜋ref ) = 𝛼𝔼𝜋𝛼 [𝑟proxy ] − log 𝑍(𝛼),
поэтому
𝑑
𝐷 (𝜋 ‖𝜋 ) = 𝛼 Var𝜋𝛼 (𝑟proxy ) ≥ 0.
𝑑𝛼 KL 𝛼 ref
Для фиксированной прокси-награды меньшее 𝛽 действительно ведёт дальше от базовой политики.
Это и есть точная роль якоря: он регулирует сдвиг распределения (distribution shift)
относительно режима, в котором базовая модель и, предположительно, модель награды были
лучше изучены.
Есть и более операционное следствие. Если некоторая величина 𝑔 ограничена интервалом [𝑎, 𝑏], то
из неравенства Пинскера следует
𝔼𝜋 [𝑔] − 𝔼𝜋ref [𝑔] ≤ (𝑏 − 𝑎)
149
1
𝐷 (𝜋‖𝜋ref ).
2 KL
Теория информации для машинного обучения
Малый KL ограничивает изменение любой ограниченной статистики по сравнению с базой. Но знак
изменения он не определяет. Если базовая политика была плоха по истинной цели, близость к ней
не делает политику хорошей; если модель награды ошибается уже рядом с базой, KL не обнаружит
эту ошибку.
Поэтому удачная формула для практики звучит так:
KL задаёт область доверия по распределению, а не сертификат корректности
награды.
Почему нет общего закона 1/𝛽
Пусть идеальные наклоны по прокси- и истинной награде равны
∗
∝ 𝜋ref 𝑒 𝑟proxy /𝛽 ,
𝜋proxy
∗
𝜋true
∝ 𝜋ref 𝑒 𝑟true /𝛽 .
Тогда
∗
∗
𝐷KL (𝜋proxy
‖𝜋true
)=
1
𝑍true
∗
𝔼𝜋proxy
[𝑟proxy − 𝑟true ] + log
.
𝛽
𝑍proxy
Перед первым членом действительно стоит 1/𝛽 , но и ожидание, и обе нормировочные константы
зависят от 𝛽 . Поэтому из этой записи нельзя заключить ни линейный рост, ни даже монотонность.
Простой контрпример показывает проблему наглядно. Возьмём равномерную базу на трёх действиях
и
𝑟proxy = (2, 1, 0),
𝑟true = (2, 0, 1).
Прокси и истинная награда по-разному ранжируют второе и третье действия, но имеют один и тот
же уникальный максимум. При усилении давления KL между двумя наклонёнными политиками
сначала растёт, а затем снова стремится к нулю: обе политики в пределе концентрируются на первом
действии. Значит, тезис «KL растёт как 1/𝛽 » неверен даже на трёх состояниях.
Практические следствия
Из математики следует не запрет на сильную оптимизацию, а дисциплина измерения.
• 𝛽 нужно выбирать относительно масштаба награды и наблюдаемого KL-отклонения, а не как
безразмерную магическую константу.
• Помимо значения прокси-награды нужна независимая человеческая или эталонная оценка, не
оптимизируемая тем же циклом.
• Полезно строить кривую качества по нескольким уровням давления и останавливать
оптимизацию до области, где связь между прокси- и истинной наградами начинает ломаться.
• Нужно смотреть не только на среднее вознаграждение, но и на хвосты, редкие режимы, потерю
разнообразия и новые способы эксплуатации модели награды.
Именно здесь сходятся MaxEnt, EBM и RLHF. Экспоненциальный наклон — мощная машина
перераспределения вероятности. Он честно усиливает заданный сигнал, но не умеет отличать
цель от её несовершенного измерителя. Эту часть задачи нельзя делегировать нормировочной
константе или KL-штрафу: её решают качеством прокси, независимой проверкой и контролем
сдвига распределения.
150
Влад Куликов · Открытая редакция 2026.1
8.10.
Математическое углубление:
семейства и достаточность
экспоненциальные
Этот раздел не нужен для первого прохождения M8. Его лучше читать как самостоятельную
вторую главу внутри модуля: сначала мы разберём устройство экспоненциального
семейства, затем соберём в канонической форме основные дискретные и непрерывные
распределения и только после этого вернёмся к достаточности и теореме Питмана—
Купмана—Дармуа.
К этому месту одна и та же формула появилась уже слишком много раз, чтобы считать совпадение
случайным:
база × exp{линейная функция статистик} × нормировка.
Но повторение формы ещё не делает все утверждения эквивалентными. Здесь особенно полезно
разделить три вопроса.
1. Какое распределение получается из оптимизации энтропии при ограничениях?
2. Как устроен заранее выбранный параметрический класс распределений?
3. Когда выборку можно сжать до статистики фиксированной размерности без потери информации
о параметре?
MaxEnt отвечает на первый вопрос. Определение экспоненциального семейства — на второй. Теория
достаточности и теорема Питмана—Купмана—Дармуа связывают второй вопрос с третьим. Между
этими историями есть глубокая общая геометрия, но ни одна из них не является автоматической
заменой остальных.
Каноническая форма: что в ней фиксировано, а что обучается
Пусть 𝜈 — фиксированная базовая мера: считающая мера в дискретном случае или, например, мера
Лебега для плотности на ℝ. Семейство распределений называется экспоненциальным, если его
плотности относительно 𝜈 можно записать как
𝑝(𝑥 ∣ 𝜂) = ℎ(𝑥) exp 𝜂⊤ 𝑇(𝑥) − 𝐴(𝜂) .
Здесь
𝐴(𝜂) = log
ℎ(𝑥)𝑒 𝜂
⊤ 𝑇(𝑥)
𝑑𝜈(𝑥)
— логарифм нормировочной константы, а допустимое пространство натуральных параметров равно
Ω = {𝜂 ∈ ℝ𝑑 ∶ 𝐴(𝜂) < ∞}.
Если Ω открыто, семейство называют регулярным. Эта короткая оговорка понадобится ниже:
она позволяет двигать параметр в малой окрестности и дифференцировать лог-нормировку без
столкновения с границей пространства параметров.
Каждый элемент формулы выполняет отдельную работу.
• 𝜈 и ℎ(𝑥) задают носитель и базовую геометрию. В ℎ попадают индикаторы носителя,
комбинаторные множители вроде 1/𝑥! и другие части плотности, не зависящие от параметра.
• 𝑇(𝑥) — вектор достаточных статистик одного наблюдения. Именно через него
параметрическая часть модели «видит» исход 𝑥 .
• 𝜂 — натуральный, или канонический, параметр. Он линейно взвешивает статистики в
логарифме плотности.
• 𝐴(𝜂) нормирует распределение. Одновременно эта функция хранит его моменты и
локальную геометрию.
151
Теория информации для машинного обучения
Такое разложение удобно читать как инструкцию. Чтобы распознать экспоненциальное семейство,
нужно взять логарифм плотности, собрать все зависящие от параметра коэффициенты при функциях
от 𝑥 и вынести оставшуюся параметр-зависимую часть в 𝐴(𝜂).
Представление не единственно
Одна и та же модель может быть записана несколькими способами. К статистикам можно добавить
линейно избыточную координату, а параметры преобразовать обратно; распределение не изменится.
Поэтому различают минимальные и избыточные представления.
Семейство минимально, если не существует ненулевого вектора 𝑎 и константы 𝑏, для которых
𝑎⊤ 𝑇(𝑥) = 𝑏
почти всюду. В минимальном регулярном семействе 𝐴 строго выпукла, а натуральный параметр
идентифицируется однозначно. Softmax с 𝐾 свободными логитами — знакомое избыточное
представление: прибавление одной константы ко всем логитам не меняет распределение.
Минимальная категориальная параметризация использует 𝐾 − 1 логарифмов отношений шансов.
Это не педантичная деталь. Избыточность создаёт нулевые направления в гессиане и неединственность
параметров, хотя само распределение может быть определено совершенно однозначно.
Почему 𝐴(𝜂) хранит моменты
Главные свойства лог-нормировки удобно не запоминать, а один раз вывести из условия нормировки.
По определению
1=
ℎ(𝑥) exp 𝜂⊤ 𝑇(𝑥) − 𝐴(𝜂) 𝑑𝜈(𝑥).
Продифференцируем по компоненте 𝜂𝑗 , предполагая, что производную можно перенести под знак
интеграла:
152
Влад Куликов · Открытая редакция 2026.1
0=
𝑝(𝑥 ∣ 𝜂) 𝑇𝑗 (𝑥) −
𝜕𝐴
𝜕𝜂𝑗
𝑑𝜈(𝑥).
Следовательно,
𝜕𝐴
= 𝔼𝜂 [𝑇𝑗 (𝑋)] .
𝜕𝜂𝑗
В векторной форме:
∇𝐴(𝜂) = 𝔼𝜂 [𝑇(𝑋)] .
Ещё одна производная даёт
𝜕2𝐴
= 𝔼𝜂 [𝑇𝑗 (𝑋)𝑇𝑘 (𝑋)] − 𝔼𝜂 [𝑇𝑗 (𝑋)]𝔼𝜂 [𝑇𝑘 (𝑋)]
𝜕𝜂𝑗 𝜕𝜂𝑘
= Cov𝜂 𝑇𝑗 (𝑋), 𝑇𝑘 (𝑋) .
То есть
∇2 𝐴(𝜂) = Cov𝜂 (𝑇(𝑋)) ⪰ 0 .
Вот почему 𝐴 выпукла. Её градиент переводит натуральные координаты 𝜂 в координаты
средних
𝜇 = 𝔼𝜂 [𝑇(𝑋)],
а кривизна сообщает, насколько чувствительны эти средние к сдвигу параметров.
Та же механика видна через скор-функцию по натуральному параметру:
∇𝜂 log 𝑝(𝑋 ∣ 𝜂) = 𝑇(𝑋) − ∇𝐴(𝜂).
Её ожидание равно нулю, а ковариация равна
ℐ(𝜂) = Cov𝜂 (𝑇(𝑋)) = ∇2 𝐴(𝜂),
то есть гессиан лог-нормировки одновременно является информацией Фишера в натуральных
координатах. Геометрический смысл этой формулы мы подробно разберём в M15.
Есть и ещё одно точное тождество. Для двух распределений одного экспоненциального семейства:
𝐷KL 𝑝(⋅ ∣ 𝜂)‖𝑝(⋅ ∣ 𝜉) = 𝐴(𝜉) − 𝐴(𝜂) − ∇𝐴(𝜂)⊤ (𝜉 − 𝜂).
Правая часть — дивергенция Брэгмана, порождённая 𝐴, с определённым порядком аргументов.
Поэтому выпуклая геометрия лог-нормировки и KL-геометрия семейства — не аналогия, а одна
формула.
Двойственность с MaxEnt
Положим
153
Теория информации для машинного обучения
𝐴∗ (𝜇) = sup{𝜂⊤ 𝜇 − 𝐴(𝜂)}.
𝜂
Если 𝜇 лежит во внутренности допустимого пространства средних и уравнение
∇𝐴(𝜂) = 𝜇
имеет решение, то
𝐴∗ (𝜇) = 𝜂 ⊤ 𝜇 − 𝐴(𝜂).
С другой стороны, максимум энтропии относительно базовой меры ℎ(𝑥)𝑑𝜈(𝑥) при ограничении
𝔼𝑞 [𝑇] = 𝜇 равен
max
𝑞∶ 𝔼𝑞 𝑇=𝜇
−
𝑞(𝑥) log
𝑞(𝑥)
𝑑𝜈(𝑥) = 𝐴(𝜂) − 𝜂 ⊤ 𝜇 = −𝐴∗ (𝜇).
ℎ(𝑥)
Если ℎ нормирована и задаёт плотность базового распределения 𝑚, эта цель равна −𝐷KL (𝑞‖𝑚); для
ненормированной ℎ её естественнее читать как энтропию относительно базовой меры.
Именно здесь MaxEnt и экспоненциальное семейство действительно сходятся: ограничения задают
координату 𝜇, множители Лагранжа становятся натуральным параметром 𝜂 , а 𝐴 связывает две
системы координат. Это глубокая связь, но она не означает, что любое произвольно выбранное
подсемейство автоматически является решением любой MaxEnt-задачи.
Как читать каноническую форму на дискретных распределениях
Полезнее не заучивать таблицу, а каждый раз выполнять одну операцию: раскрыть логарифм
вероятности и собрать коэффициенты при функциях от наблюдения.
Бернулли: логит появляется из алгебры
Для 𝑋 ∈ {0, 1}:
𝑝(𝑥 ∣ 𝑝) = 𝑝 𝑥 (1 − 𝑝)1−𝑥 .
Берём логарифм:
log 𝑝(𝑥 ∣ 𝑝) = 𝑥 log 𝑝 + (1 − 𝑥) log(1 − 𝑝)
𝑝
= 𝑥 log
+ log(1 − 𝑝).
1−𝑝
Вводим натуральный параметр
𝜂 = log
𝑝
.
1−𝑝
Поскольку 𝑝 = 𝑒 𝜂 /(1 + 𝑒 𝜂 ),
log(1 − 𝑝) = − log(1 + 𝑒 𝜂 ).
Получаем
𝑝(𝑥 ∣ 𝜂) = exp 𝜂𝑥 − log(1 + 𝑒 𝜂 ) .
154
Влад Куликов · Открытая редакция 2026.1
Значит,
𝐴(𝜂) = log(1 + 𝑒 𝜂 ).
𝑇(𝑥) = 𝑥,
Производные немедленно возвращают знакомые величины:
𝐴′ (𝜂) = 𝜎(𝜂) = 𝑝,
𝐴″ (𝜂) = 𝑝(1 − 𝑝).
Логистическая функция здесь не приклеена к распределению извне. Она является отображением из
натурального параметра в средний параметр.
Категориальное распределение: softmax и избыточность логитов
Пусть 𝑋 ∈ {1, … , 𝐾} и вероятности классов равны 𝜋1 , … , 𝜋𝐾 . Выберем 𝐾 -й класс опорным и положим
𝑇𝑗 (𝑥) = 1{𝑥 = 𝑗},
𝜋𝑗
,
𝜋𝐾
𝜂𝑗 = log
𝑗 = 1, … , 𝐾 − 1.
Тогда
𝐾−1
𝑒 𝜂𝑗 ,
𝐴(𝜂) = log 1 +
𝑗=1
а
𝑝(𝑋 = 𝑗 ∣ 𝜂) =
𝑒 𝜂𝑗
𝐾−1
1 + ∑𝑟=1 𝑒 𝜂𝑟
𝑝(𝑋 = 𝐾 ∣ 𝜂) =
,
𝑗 < 𝐾,
1
1+
.
𝐾−1
∑𝑟=1 𝑒 𝜂𝑟
Это минимальная параметризация. Привычный softmax с 𝐾 логитами использует избыточную форму
𝑝(𝑋 = 𝑘 ∣ 𝑧) =
𝑒 𝑧𝑘
,
∑𝑟 𝑒 𝑧𝑟
потому что 𝑧 и 𝑧 + 𝑐 1 задают одно распределение. Производная logsumexp даёт вектор вероятностей,
а гессиан — ковариационную матрицу one-hot-вектора.
Пуассон: базовая мера хранит факториал
Для 𝑋 ∈ {0, 1, 2, …}:
𝑝(𝑥 ∣ 𝜆) = 𝑒 −𝜆
𝜆𝑥
.
𝑥!
Логарифм равен
log 𝑝(𝑥 ∣ 𝜆) = 𝑥 log 𝜆 − 𝜆 − log 𝑥!.
Следовательно,
𝑇(𝑥) = 𝑥,
𝜂 = log 𝜆,
ℎ(𝑥) =
155
1
,
𝑥!
𝐴(𝜂) = 𝑒 𝜂 .
Теория информации для машинного обучения
Поэтому
𝐴′ (𝜂) = 𝐴″ (𝜂) = 𝑒 𝜂 = 𝜆.
Равенство среднего и дисперсии распределения Пуассона теперь видно непосредственно из
производных 𝐴.
Натуральный параметр 𝜂 = log 𝜆 одновременно объясняет стандартную
логарифмическую функцию связи (log link) в пуассоновской регрессии: линейный предиктор
может принимать любые действительные значения, а интенсивность 𝜆 = 𝑒 𝜂 остаётся положительной.
Здесь легко сделать слишком сильный вывод. Обычный MaxEnt на неотрицательных целых при
единственном ограничении 𝔼[𝑋] = 𝜆 и считающей базовой мере даёт геометрическое, а не
пуассоновское распределение. Для Пуассона существенна относительная база
ℎ(𝑥) =
1
.
𝑥!
Иными словами, одинаковая статистика 𝑇(𝑥) = 𝑥 ещё не определяет семейство: носитель и базовая
мера участвуют в ответе наравне с ограничением.
Биномиальное распределение возникает как закон суммы 𝑛 независимых переменных Бернулли:
𝑝(𝑥) =
𝑛
exp 𝜂𝑥 − 𝑛 log(1 + 𝑒 𝜂 ) .
𝑥
Комбинаторный множитель 𝑛 переходит в ℎ(𝑥), а натуральный параметр остаётся логитом
𝑥
вероятности успеха.
Мультиномиальное распределение устроено аналогично: достаточной
статистикой становится вектор чисел наблюдений каждого класса.
Непрерывные семейства: носитель меняет допустимые параметры
В непрерывном случае особенно важно не потерять носитель. Он входит либо в базовую меру, либо в
индикатор внутри ℎ(𝑥) и определяет, для каких 𝜂 нормировочный интеграл конечен.
156
Влад Куликов · Открытая редакция 2026.1
Экспоненциальное распределение
Для скорости 𝜆 > 0:
𝑝(𝑥 ∣ 𝜆) = 𝜆𝑒 −𝜆𝑥 1{𝑥 ≥ 0}.
Положим
𝑇(𝑥) = 𝑥,
𝜂 = −𝜆 < 0,
ℎ(𝑥) = 1{𝑥 ≥ 0}.
Тогда
𝐴(𝜂) = − log(−𝜂),
𝜂 < 0,
и
𝐴′ (𝜂) = −
𝐴″ (𝜂) =
1
1
= ,
𝜂
𝜆
1
1
= 2.
2
𝜂
𝜆
Натуральное пространство не является всей прямой: при 𝜂 ≥ 0 интеграл на [0, ∞) расходится.
Это простой пример того, почему область 𝐴(𝜂) < ∞ является частью модели, а не техническим
приложением.
Гамма-распределение
Пусть используются параметр формы 𝛼 > 0 и параметр скорости 𝛽 > 0:
𝑝(𝑥 ∣ 𝛼, 𝛽) =
𝛽 𝛼 𝛼−1 −𝛽𝑥
𝑥
𝑒
1{𝑥 > 0}.
Γ(𝛼)
Собираем зависящие от 𝑥 функции:
𝑇(𝑥) =
log 𝑥
,
𝑥
𝜂=
𝛼−1
.
−𝛽
При ℎ(𝑥) = 1{𝑥 > 0}:
𝐴(𝜂) = log Γ(𝜂1 + 1) − (𝜂1 + 1) log(−𝜂2 ),
где
𝜂1 > −1,
𝜂2 < 0.
Градиент возвращает не только обычное среднее:
𝜕𝐴
= 𝔼[log 𝑋] = 𝜓(𝛼) − log 𝛽,
𝜕𝜂1
𝛼
𝜕𝐴
= 𝔼[𝑋] = ,
𝜕𝜂2
𝛽
157
Теория информации для машинного обучения
где 𝜓 — дигамма-функция. Экспоненциальное распределение является одномерным срезом гаммасемейства при 𝛼 = 1.
Этот пример важен педагогически: «согласование моментов» в экспоненциальном семействе
означает согласование средних достаточных статистик. Одной из них может быть log 𝑋, а не
обычная степень 𝑋.
Гауссовское семейство с неизвестными средним и дисперсией
Раскроем квадрат в логарифме плотности:
(𝑥 − 𝜇)2
1
log 𝑝(𝑥 ∣ 𝜇, 𝜎 2 ) = − log(2𝜋𝜎 2 ) −
2
2𝜎 2
𝜇2
𝜇
1 2
1
= 2𝑥 −
𝑥
−
+ log(2𝜋𝜎 2 ) .
2
2
𝜎
2𝜎
2𝜎
2
Поэтому можно взять
𝑇(𝑥) =
𝑥
,
𝑥2
𝜂1 =
𝜇
,
𝜎2
𝜂2 = −
1
< 0,
2𝜎 2
и
𝐴(𝜂) = −
1
𝜋
𝜂12
+ log −
.
4𝜂2 2
𝜂2
Производные дают
𝜕𝐴
= 𝜇,
𝜕𝜂1
𝜕𝐴
= 𝜇2 + 𝜎 2 = 𝔼[𝑋 2 ].
𝜕𝜂2
То есть координаты средних — это первый и второй моменты, а не непосредственно 𝜇 и 𝜎 2 . Дисперсия
восстанавливается как
𝜎 2 = 𝔼[𝑋 2 ] − 𝔼[𝑋]2 .
Если дисперсия заранее фиксирована, остаётся одномерный экспоненциальный срез с достаточной
статистикой 𝑇(𝑥) = 𝑥 .
Бета- и Дирихле-распределения
Для 0 < 𝑥 < 1:
𝑝(𝑥 ∣ 𝛼, 𝛽) =
𝑥 𝛼−1 (1 − 𝑥)𝛽−1
.
𝐵(𝛼, 𝛽)
Канонические компоненты:
𝑇(𝑥) =
log 𝑥
,
log(1 − 𝑥)
𝐴(𝜂) = log 𝐵(𝜂1 + 1, 𝜂2 + 1),
158
𝜂=
𝛼−1
,
𝛽−1
𝜂1 , 𝜂2 > −1.
Влад Куликов · Открытая редакция 2026.1
Здесь средние координаты равны
𝔼[log 𝑋] = 𝜓(𝛼) − 𝜓(𝛼 + 𝛽),
𝔼[log(1 − 𝑋)] = 𝜓(𝛽) − 𝜓(𝛼 + 𝛽).
Среднее 𝛼/(𝛼 + 𝛽) важно для интерпретации, но именно средние логарифмов входят в уравнения
согласования достаточных статистик при оценке обоих параметров.
Распределение Дирихле переносит ту же конструкцию на симплекс:
𝑇𝑘 (𝑥) = log 𝑥𝑘 ,
𝜂𝑘 = 𝛼𝑘 − 1.
Поэтому бета- и Дирихле-распределения естественно появляются там, где случайным объектом
является вероятность, доля или вектор вероятностей.
Как эти семейства становятся выходными распределениями в ML
Для практики полезно перевести каноническую запись в язык выходного слоя модели. Для одного
наблюдения отрицательное логарифмическое правдоподобие любого семейства в канонической
форме равно
− log 𝑝(𝑦 ∣ 𝜂) = 𝐴(𝜂) − 𝜂 ⊤ 𝑇(𝑦) − log ℎ(𝑦),
а его градиент по натуральному параметру имеет особенно знакомый вид:
∇𝜂 [− log 𝑝(𝑦 ∣ 𝜂)] = 𝔼𝜂 [𝑇(𝑌)] − 𝑇(𝑦).
159
Теория информации для машинного обучения
Модель снова сравнивает предсказанные средние достаточных статистик с тем, что произошло в
данных. Конкретное распределение определяет, какие именно статистики и ограничения стоят за
этой общей формулой.
Тип целевой величины
Частое распределение
Что удобно
предсказывать сети
бинарная метка
класс или следующий
токен
действительное значение
Бернулли
категориальное
логит 𝜂
логиты 𝑧𝑘
гауссовское
среднее, иногда
дисперсию
число событий
положительная величина
Пуассон
гамма-распределение
доля в (0, 1)
случайный вектор
вероятностей
бета-распределение
Дирихле
log 𝜆
форму и скорость либо
среднее и дисперсию
положительные 𝛼, 𝛽
концентрации 𝛼𝑘
Обычная функция потерь
бинарная кросс-энтропия
многоклассовая
кросс-энтропия
MSE при фиксированной
дисперсии или
гауссовский NLL
пуассоновский NLL
NLL
гамма-распределения
NLL бета-распределения
NLL распределения
Дирихле или
специализированная
целевая функция
Эта таблица не предписывает одну параметризацию. Сеть может выдавать натуральный параметр
напрямую, преобразовывать свободный выход через softplus или использовать более интерпретируемые
координаты вроде среднего и дисперсии. Важно другое: преобразование должно попадать в
допустимую область распределения, а функция потерь должна соответствовать той вероятностной
гипотезе, которую мы действительно хотим сделать.
Не нужно запоминать все нормировочные функции наизусть. Рабочий навык состоит в другом:
раскрыть лог-плотность, определить носитель, найти функции 𝑇(𝑥), собрать их коэффициенты в 𝜂 и
проверить, при каких параметрах интеграл конечен.
i.i.d.-выборка и достаточная статистика
Для независимых наблюдений 𝑥1∶𝑛 :
𝑛
ℎ(𝑥𝑖 ) exp 𝜂⊤ 𝑇(𝑥𝑖 ) − 𝐴(𝜂)
𝑝(𝑥1∶𝑛 ∣ 𝜂) =
𝑖=1
𝑛
=
𝑛
ℎ(𝑥𝑖 ) exp 𝜂
𝑖=1
⊤
𝑇(𝑥𝑖 ) − 𝑛𝐴(𝜂) .
𝑖=1
Вся зависимость правдоподобия от 𝜂 проходит через
𝑛
𝑇(𝑋𝑖 ) .
𝑇𝑛 =
𝑖=1
По теореме факторизации 𝑇𝑛 является достаточной статистикой. Конкретный вид сжатия зависит от
семейства.
•
•
•
•
•
Бернулли: число единиц ∑𝑖 𝑋𝑖 .
Категориальное распределение: вектор чисел объектов каждого класса.
Пуассон: сумма счётчиков ∑𝑖 𝑋𝑖 .
Гауссовское семейство с неизвестными 𝜇 и 𝜎 2 : пара ∑𝑖 𝑋𝑖 , ∑𝑖 𝑋𝑖2 .
Гамма-семейство с неизвестными формой и скоростью: ∑𝑖 log 𝑋𝑖 , ∑𝑖 𝑋𝑖 .
160
Влад Куликов · Открытая редакция 2026.1
• Бета-семейство с неизвестными 𝛼 и 𝛽 : ∑𝑖 log 𝑋𝑖 , ∑𝑖 log(1 − 𝑋𝑖 ) .
Смысл достаточности очень конкретен: условное распределение исходной выборки при фиксированном
𝑇𝑛 не зависит от 𝜂. После вычисления статистики сырые наблюдения не добавляют информации о
параметре внутри принятой модели.
Последние слова существенны. Порядок наблюдений, выбросы, мультимодальность или систематическая
зависимость могут быть не нужны для оценки параметра внутри семейства, но именно они способны
показать, что само i.i.d.-семейство выбрано плохо. Достаточная статистика сжимает данные
относительно заданного вопроса; она не является универсальным без потерь представлением набора
данных.
Максимальное правдоподобие как согласование средних статистик
Среднее логарифмическое правдоподобие имеет вид
1
1
log 𝑝(𝑥1∶𝑛 ∣ 𝜂) = 𝜂 ⊤ 𝑇 − 𝐴(𝜂) +
𝑛
𝑛
где
161
log ℎ(𝑥𝑖 ),
𝑖
Теория информации для машинного обучения
𝑇=
1
𝑛
𝑇(𝑥𝑖 ).
𝑖
С точностью до части, не зависящей от 𝜂 , среднее отрицательное логарифмическое правдоподобие
равно
ℒ𝑛 (𝜂) = 𝐴(𝜂) − 𝜂 ⊤ 𝑇.
Её градиент:
∇ℒ𝑛 (𝜂) = 𝔼𝜂 [𝑇(𝑋)] − 𝑇 .
Гессиан:
∇2 ℒ𝑛 (𝜂) = Cov𝜂 (𝑇(𝑋)) ⪰ 0.
Если семейство минимально и существует конечный внутренний максимум правдоподобия, то
𝔼𝜂 [𝑇(𝑋)] = 𝑇 .
Это точная область знаменитого согласования моментов (moment matching). Но слово «моменты»
здесь легко прочитать слишком узко. Речь идёт о средних достаточных статистик:
•
•
•
•
•
для Бернулли получается 𝑝 = 𝑥 ;
для Пуассона — 𝜆 = 𝑥 ;
для категориального распределения модельные вероятности совпадают с частотами классов;
для полного гауссовского семейства согласуются первый и второй эмпирические моменты;
для бета- и гамма-семейств уравнения включают средние логарифмов и обычно решаются
численно.
Когда конечного решения нет
Выпуклая форма не гарантирует, что оптимум лежит в конечной точке натурального пространства.
• Если все наблюдения Бернулли равны единице, MLE даёт 𝑝 = 1, но натуральный параметр 𝜂
стремится к +∞.
• Если в категориальной выборке класс не встретился, соответствующая оценка вероятности
лежит на границе, а минимальный логарифм отношения шансов стремится к −∞.
• При линейной разделимости в условной логистической регрессии конечный нерегуляризованный
MLE может отсутствовать.
• Регуляризация меняет условие стационарности, поэтому точное согласование эмпирических и
модельных статистик дополняется градиентом штрафа.
• В кривом экспоненциальном семействе, где 𝜂 ограничен нелинейным подмногообразием
меньшей размерности, все координаты 𝑇 вообще не обязаны согласовываться независимо.
Эти случаи не опровергают геометрию семейства.
Они показывают, что нужно различать
существование распределения, существование конечного натурального параметра и существование
внутреннего MLE.
Теорема Питмана—Купмана—Дармуа
До сих пор мы шли от экспоненциальной формы к достаточной статистике. Теорема Питмана—
Купмана—Дармуа (Pitman–Koopman–Darmois, PKD) при стандартных регулярных условиях движется
в обратную сторону:
162
Влад Куликов · Открытая редакция 2026.1
Для регулярного доминируемого i.i.d.-семейства с общим носителем, не зависящим
от параметра, существование достаточной статистики, размерность которой остаётся
ограниченной при росте 𝑛, резко ограничивает модель и приводит к конечномерной
экспоненциальной форме.
Это структурная теорема, а не рецепт выбора распределения. Её условия выполняют реальную
работу.
Например,
𝑋𝑖 ∼ Uniform(0, 𝜃)
имеет одномерную достаточную статистику
max 𝑋𝑖 ,
𝑖
но носитель [0, 𝜃] зависит от параметра.
неприменима.
Поэтому стандартная PKD-теорема к этому семейству
Оговорки нужны и в других нерегулярных случаях: при параметр-зависимом носителе, вырожденных
моделях, некоторых дискретных постановках и нарушении гладкости простая формулировка
может требовать уточнения. Правильный вывод не в том, что «любая достаточная статистика
доказывает экспоненциальность», а в том, что при регулярной i.i.d.-структуре сжатие выборки до
фиксированного числа координат является крайне сильным свойством.
Три связи, а не одна теорема
Теперь можно собрать картину без лишнего слияния терминов.
163
Теория информации для машинного обучения
1. MaxEnt / информационная проекция. Оптимизация по всем распределениям при
ограничениях на средние 𝑇(𝑋) даёт экспоненциальный наклон базы.
⊤
2. Экспоненциальное семейство. Параметрический класс заранее имеет форму ℎ(𝑥)𝑒 𝜂 𝑇(𝑥)−𝐴(𝜂) ;
𝐴 переводит натуральные параметры в средние и задаёт KL-геометрию класса.
3. Достаточность / PKD. Для i.i.d.-выборки сумма ∑𝑖 𝑇(𝑋𝑖 ) достаточна, а при регулярности
существование статистики фиксированной размерности тесно связано с экспоненциальной
формой.
Одна и та же статистика 𝑇(𝑥) действительно играет во всех трёх историях заметную роль.
Именно поэтому связь настолько плодотворна для ML: она объединяет вероятностные головы,
выпуклые функции потерь, согласование статистик и компактное представление данных для оценки
параметров.
Но границы тоже важны. MaxEnt не доказывает PKD; PKD не утверждает, что любое удобное
ML-распределение выбрано принципом максимальной энтропии; принадлежность головы к
экспоненциальному семейству не делает всю глубокую сеть экспоненциальным семейством по её
весам.
Рабочий навык после этого раздела можно сформулировать просто:
Не запоминайте экспоненциальное семейство как список распределений.
Учитесь читать лог-плотность: носитель и база, достаточные статистики,
натуральные параметры, лог-нормировка и область, где она конечна.
8.12. Заключение
Мы начали с ситуации, в которой нескольких известных средних недостаточно, чтобы восстановить
распределение. MaxEnt не добавил недостающие факты и не угадал скрытую истину. Он сделал
более скромную и более полезную вещь: выбрал ближайшее к базе распределение среди тех, которые
действительно согласуются с известными ограничениями.
Центральная конструкция модуля имеет вид
𝑞∗ (𝑥) ∝ 𝑚(𝑥)𝑒 𝑠(𝑥) .
В разных разделах менялся смысл двух компонентов:
Задача
База 𝑚
Наклон 𝑠
MaxEnt с моментами
исходная мера или равномерная
база
равномерная база по вариантам
базовая мера
𝜋ref
𝜆⊤ 𝑓(𝑥)
softmax
энергетическая модель
KL-регуляризованная политика
𝑧𝑖 /𝜏
−𝐸𝜃 (𝑥)
𝑟(𝑥, 𝑦)/𝛽
Эта таблица объясняет единство модуля лучше любого лозунга. Ограничения, оценки, энергии и
награды входят в логарифм вероятности аддитивно; после экспоненцирования они перераспределяют
массу мультипликативно; нормировочная константа собирает локальные предпочтения в одно
распределение.
Но одинаковая алгебра не стирает различия между задачами. В MaxEnt мы оптимизируем по
распределениям при заданных моментах. В EBM энергия может быть произвольной нейросетью
без явной системы физических ограничений. В DPO аналитическая Gibbs-форма входит в вывод
функции потерь, но реальная политика остаётся ограниченной параметризацией и данными. KL
удерживает распределение рядом с базой, однако не проверяет истинность награды.
Именно такой баланс и нужен дальше: видеть общую конструкцию достаточно ясно, чтобы
переносить интуицию, и одновременно помнить условия, без которых перенос превращается в
метафору.
164
Влад Куликов · Открытая редакция 2026.1
В Модуле 9 мы сменим объект оптимизации. Вместо вопроса «какое распределение выбрать?»
появится вопрос «какое представление сохранить?». Information Bottleneck, rate–distortion и
вариационные автоэнкодеры снова сведут обучение к обмену между двумя требованиями —
количеством сохранённой информации и ценой её передачи.
Основные источники
1. E. T. Jaynes, «Information Theory and Statistical Mechanics», 1957, и Part II, Physical Review 108,
171.
2. A. Berger, S. Della Pietra, V. Della Pietra, «A Maximum Entropy Approach to Natural Language Processing», 1996.
3. J. Lafferty, A. McCallum, F. Pereira, «Conditional Random Fields: Probabilistic Models for Segmenting
and Labeling Sequence Data», ICML 2001.
4. M. Wainwright, M. Jordan, «Graphical Models, Exponential Families, and Variational Inference»,
2008.
5. Y. LeCun et al., «A Tutorial on Energy-Based Learning», 2006.
6. Y. Song et al., «Score-Based Generative Modeling through Stochastic Differential Equations», 2021.
7. J. Schulman et al., «Proximal Policy Optimization Algorithms», 2017.
8. R. Rafailov et al., «Direct Preference Optimization: Your Language Model Is Secretly a Reward Model»,
2023.
9. L. Gao, J. Schulman, J. Hilton, «Scaling Laws for Reward Model Overoptimization», 2022.
10. Y. Polyanskiy, Y. Wu, «Information Theory: From Coding to Learning», 2025, разделы об
экспоненциальных семействах и информационной проекции.
11. L. D. Brown, «Fundamentals of Statistical Exponential Families», 1986.
165
Модуль 9. Скорость–искажение и
Information Bottleneck: как
управлять потерей информации
Как читать этот модуль. Основной маршрут — §§9.1–9.8. Сначала мы разберём
классическую теорию скорости–искажения, затем Information Bottleneck, его вариационную
версию, VAE и реальные задачи сжатия и квантизации. §9.9 — математическое углубление
про I–MMSE и гауссовское зашумление; его можно оставить на второй проход. §9.10 —
упражнения.
9.1. Зачем модели забывать
После Модуля 6 легко прийти к правильной, но неполной интуиции: чем больше информации
удалось сохранить, тем лучше. Для сжатия без потерь это действительно так — декодер обязан
восстановить исходный объект точно.
Но большинство ML-систем решают другую задачу.
Изображение рукописной цифры содержит класс цифры, почерк автора, толщину линии, положение
на холсте, фон и шум сенсора. Для распознавания цифры часть этих различий можно отбросить. Для
идентификации автора почерка — уже нельзя. Для точной реконструкции изображения понадобится
ещё больше деталей.
Одна и та же информация может быть:
• полезным сигналом для одной задачи;
• помехой для другой;
• обязательной частью исходного объекта для третьей.
Поэтому слово «лишняя» не имеет смысла без указания цели.
JPEG может забыть мелкие высокочастотные детали ради меньшего файла. Нейронный кодек
может тратить больше бит на лицо, чем на гладкий фон. Энкодер классификатора может отбросить
освещение и сохранить форму. Квантизатор LLM может грубо округлить многие веса, пока
предиктивное распределение модели меняется мало.
Во всех случаях вопрос один:
Какой минимум информации нужно сохранить, чтобы качество по выбранному
критерию осталось приемлемым?
Бутылочное горлышко здесь — не призыв забыть как можно больше. Это контракт: что разрешено
потерять, какой ценой и ради какой задачи.
В модуле встретятся четыре тесно связанные конструкции:
1. теория скорости–искажения (rate–distortion theory) отвечает, сколько бит нужно при
допустимой потере качества;
166
Влад Куликов · Открытая редакция 2026.1
2. Information Bottleneck (IB) выводит цену ошибки из переменной, которую мы хотим
предсказывать;
3. Variational Information Bottleneck (VIB) и VAE заменяют недоступные информационные
величины обучаемыми вариационными целями;
4. обучаемое сжатие и квантизация показывают, когда абстрактная «скорость» становится
реальным числом бит, а когда остаётся лишь полезным суррогатом.
Сквозная пара понятий будет такой:
• скорость — сколько информации прошло через представление;
• искажение — чем мы заплатили за уменьшение этой скорости.
Если не сказано иное, классическая теория скорости–искажения записывается в битах. Вариационные
ML-цели обычно реализуются с натуральным логарифмом и измеряются в натах. Основание
логарифма будет указано там, где оно меняет численный коэффициент.
9.2. Теория скорости–искажения:
нужно сохранить
сколько информации
От двух крайних кодов к целой кривой
Пусть
𝑋 ∼ Bernoulli(0.25),
а ошибка измеряется искажением Хэмминга:
𝑑(𝑥, 𝑥) = 1{𝑥 ≠ 𝑥}.
Есть два очевидных решения.
Точное кодирование. Чтобы восстановить источник без ошибок, асимптотически требуется
𝐻2 (𝑋) = ℎ2 (0.25) ≈ 0.811 бита на символ.
Нулевая скорость. Можно не передавать ничего и всегда восстанавливать 𝑋 = 0. Скорость равна
нулю, а среднее искажение равно
167
Теория информации для машинного обучения
𝑃(𝑋 = 1) = 0.25.
Между этими точками находится целая область компромиссов. Например, если мы допускаем
среднюю ошибку 𝐷 = 0.1, оптимальная асимптотическая скорость уже равна
𝑅(0.1) = ℎ2 (0.25) − ℎ2 (0.1) ≈ 0.342 бита на символ.
Теория скорости–искажения описывает именно эту границу: сколько информации неизбежно нужно
передать при каждом допустимом качестве реконструкции.
Формальная постановка
Пусть источник выдаёт 𝑋 ∼ 𝑃𝑋 , а декодер строит реконструкцию 𝑋 из воспроизводящего алфавита 𝒳 .
Функция
𝑑(𝑥, 𝑥) ≥ 0
назначает цену замены 𝑥 на 𝑥 .
Типичные варианты:
•
•
•
•
•
•
искажение Хэмминга: 1{𝑥 ≠ 𝑥};
квадратичная ошибка: (𝑥 − 𝑥)2 ;
отрицательный логарифм правдоподобия реконструкции;
KL между выходными распределениями исходной и сжатой моделей;
перцептивное расстояние в пространстве признаков;
рост ошибки в последующей задаче.
Для дискретного источника без памяти функция скорость–искажение определяется как
𝑅(𝐷) =
inf
𝑃𝑋∣𝑋 ∶ 𝔼[𝑑(𝑋,𝑋)]≤𝐷
𝐼(𝑋; 𝑋) .
Условное распределение 𝑃𝑋∣𝑋 называют тестовым каналом (test channel). Это не обязательно
физический канал и не обязательно готовый алгоритм кодирования. Оно задаёт желаемое
совместное распределение исходов и реконструкций: какие замены допустимы и как часто они
происходят.
Почему взаимная информация становится числом бит
На первый взгляд в определении нет ни файла, ни кодовых слов — только взаимная информация.
Операционный смысл появляется на длинных блоках.
При стандартных условиях теорема Шеннона утверждает:
• любая скорость выше 𝑅(𝐷) асимптотически достижима при среднем искажении не больше 𝐷 ;
• любая скорость ниже 𝑅(𝐷) асимптотически недостаточна.
Кодер не обязан передавать независимое описание каждого символа. Он кодирует целый типичный
блок и использует статистическую повторяемость источника.
Поэтому минимум взаимной
информации после оптимизации по тестовому каналу становится минимальной скоростью в
битах на символ.
Это тот же интеллектуальный ход, что и в обычной теореме кодирования источника: локальные
вероятности превращаются в глобальную геометрию длинных последовательностей.
168
Влад Куликов · Открытая редакция 2026.1
Геометрия компромисса
Функция 𝑅(𝐷) невозрастает и выпукла. Разрешили больше искажения — минимально необходимая
скорость не может вырасти. Выпуклость означает, что смешивание двух режимов кодирования не
хуже соответствующего среднего компромисса.
Нулевая скорость достигается при
𝐷max = min 𝔼[𝑑(𝑋, 𝑥)],
𝑥
потому что без сообщения декодер может выдавать только заранее выбранную константу.
Точка 𝑅(0) = 𝐻(𝑋) требует условий. Она верна для конечного дискретного источника, если
нулевое искажение возможно только при точном воспроизведении. Для непрерывного источника с
квадратичной ошибкой обычно
𝑅(𝐷) → ∞
при
𝐷↓0∶
точное вещественное число требует неограниченной точности.
На практике часто оптимизируют лагранжиан
𝐼(𝑋; 𝑋) + 𝜆 𝔼[𝑑(𝑋, 𝑋)].
Если граница дифференцируема в рабочей точке, то
𝜆 = −𝑅′ (𝐷).
То есть 𝜆 — локальный обменный курс: сколько дополнительной скорости мы готовы заплатить за
уменьшение искажения. Позже та же геометрия появится в IB, VAE и обучаемом сжатии.
Два эталонных источника
Для 𝑋 ∼ Bernoulli(𝑝), 𝑝 ≤ 1/2, и искажения Хэмминга:
𝑅(𝐷) =
ℎ2 (𝑝) − ℎ2 (𝐷), 0 ≤ 𝐷 ≤ 𝑝,
0,
𝐷 ≥ 𝑝.
Для гауссовского источника
𝑋 ∼ 𝒩(0, 𝜎 2 )
с квадратичным искажением, при логарифме по основанию 2:
𝜎2
1
log2
, 0 < 𝐷 < 𝜎2,
𝑅(𝐷) = 2
𝐷
0,
𝐷 ≥ 𝜎2.
В этой конкретной модели уменьшение MSE вдвое стоит ещё 0.5 бита на вещественный символ.
169
Теория информации для машинного обучения
Искажение не дано природой
Вот где легко сделать слишком сильный вывод. Теория находит оптимальный код для заданной
функции искажения. Она не выбирает за нас, какая ошибка важна человеку или последующей
системе.
MSE удобно согласуется с гауссовским правдоподобием и PSNR, но может дорого штрафовать
небольшой сдвиг изображения и поощрять усреднённую размытую реконструкцию. Перцептивная
функция потерь может лучше сохранять визуальную структуру, но уже наследует предположения
выбранной сети признаков. Для сжатой LLM естественным искажением может оказаться не MSE
весов, а рост NLL или KL между предиктивными распределениями.
В визуальном сжатии появляется и третий объект — перцептивная правдоподобность
распределения реконструкций. Низкое среднее искажение и реалистичный вид не тождественны;
дополнительное требование к восприятию в общем случае поднимает достижимую границу скорость–
искажение.
Это не ослабляет теорию. Напротив, она заставляет явно назвать то, что инженерные обсуждения
часто прячут в слове «качество».
9.3. Information Bottleneck: сохранить то, что важно для 𝑌
В классической задаче функцию 𝑑(𝑥, 𝑥) задаёт инженер. Но в обучении представлений часто трудно
заранее сказать, какие различия между входами существенны.
Представим два изображения одной и той же цифры. Пиксели отличаются, почерк отличается, фон
отличается. Если их условные распределения метки почти одинаковы, классификатору выгодно
считать их близкими. Если же целевая переменная — автор почерка, эти же различия становятся
релевантными.
170
Влад Куликов · Открытая редакция 2026.1
Information Bottleneck предлагает дать задаче самой определить цену забывания.
Пусть 𝑌 — релевантная переменная, а представление 𝑇 строится только из 𝑋:
𝑌 ⟶ 𝑋 ⟶ 𝑇.
Мы хотим одновременно:
• уменьшить 𝐼(𝑋; 𝑇) — не переносить через представление все детали входа;
• сохранить 𝐼(𝑇; 𝑌) — не потерять предиктивную информацию о цели.
Одна постановка минимизирует скорость при заданной релевантности:
min 𝐼(𝑋; 𝑇)
𝑃𝑇∣𝑋
при
𝐼(𝑇; 𝑌) ≥ 𝐽.
Соответствующая лагранжева форма:
ℒIB = 𝐼(𝑋; 𝑇) − 𝛽𝐼(𝑇; 𝑌) .
При таком соглашении большое 𝛽 сильнее защищает информацию о 𝑌. В других статьях встречаются
обратные параметризации, поэтому роль коэффициента нужно читать из формулы, а не из буквы.
Предиктивная цена ошибки возникает сама
Из марковской цепи 𝑌 → 𝑋 → 𝑇 следует
𝐼(𝑋; 𝑌) = 𝐼(𝑇; 𝑌) + 𝐼(𝑋; 𝑌 ∣ 𝑇).
171
Теория информации для машинного обучения
Условную взаимную информацию можно записать как среднюю KL-дивергенцию:
𝐼(𝑋; 𝑌 ∣ 𝑇) = 𝔼𝑋,𝑇 𝐷KL 𝑃𝑌∣𝑋 ‖𝑃𝑌∣𝑇 .
Следовательно,
𝐼(𝑋; 𝑌) − 𝐼(𝑇; 𝑌) = 𝔼𝑋,𝑇 𝐷KL 𝑃𝑌∣𝑋 ‖𝑃𝑌∣𝑇 .
Определим
𝑑IB (𝑥, 𝑡) = 𝐷KL 𝑃𝑌∣𝑋=𝑥 ‖𝑃𝑌∣𝑇=𝑡 .
Тогда
𝐼(𝑋; 𝑇) − 𝛽𝐼(𝑇; 𝑌) = 𝐼(𝑋; 𝑇) + 𝛽 𝔼[𝑑IB (𝑋, 𝑇)] − 𝛽𝐼(𝑋; 𝑌).
Последний член не зависит от энкодера. Поэтому IB действительно является задачей скорость–
искажение, где искажение измеряет не расстояние между входом и кодом, а ущерб предсказанию
𝑌.
Это один из центральных результатов курса:
Два входа можно объединить, если после объединения почти не меняется то,
что мы можем сказать о целевой переменной.
Если
𝐼(𝑇; 𝑌) = 𝐼(𝑋; 𝑌),
то
𝐼(𝑋; 𝑌 ∣ 𝑇) = 0,
172
Влад Куликов · Открытая редакция 2026.1
и представление сохраняет всю доступную во входе информацию о 𝑌. В этом смысле оно является
достаточным для предсказания 𝑌. IB ищет не просто достаточное представление, а по возможности
самое компактное среди таких представлений.
Самосогласованное решение
Для конечных алфавитов стационарная точка классической IB-задачи удовлетворяет
𝑃(𝑡 ∣ 𝑥) =
𝑃(𝑡)
exp −𝛽𝐷KL 𝑃(𝑌 ∣ 𝑥)‖𝑃(𝑌 ∣ 𝑡) .
𝑍𝛽 (𝑥)
Форма знакома по Модулю 8. Базовая масса 𝑃(𝑡) экспоненциально наклоняется в пользу кодов с
малым предиктивным искажением.
Но теперь уравнение самосогласованно:
• 𝑃(𝑡) зависит от 𝑃(𝑡 ∣ 𝑥);
• 𝑃(𝑌 ∣ 𝑡) тоже зависит от 𝑃(𝑡 ∣ 𝑥);
• а 𝑃(𝑡 ∣ 𝑥) вычисляется через них обоих.
Итерации, родственные алгоритму Blahut–Arimoto, находят согласованное мягкое кластеризование.
В большой нейросети истинные 𝑃(𝑌 ∣ 𝑥) неизвестны, пространства огромны, а взаимные
информации недоступны напрямую. Поэтому следующий шаг — заменить точные величины
вариационными границами.
9.4.
Variational Information Bottleneck:
обучаемым
как сделать IB
Классическая цель красива, но в ней есть три неудобных объекта:
• неизвестное истинное 𝑃(𝑌 ∣ 𝑇);
• агрегированное распределение представления 𝑃(𝑇);
• взаимные информации, которые трудно оценивать в высокой размерности.
VIB заменяет каждый из них обучаемой вероятностной моделью.
Пусть энкодер задаёт стохастическое представление
𝑞𝜙 (𝑡 ∣ 𝑥),
классификатор — вариационный декодер
𝑟𝜓 (𝑦 ∣ 𝑡),
а 𝑟(𝑡) — простое априорное распределение, например 𝒩(0, 𝐼).
Релевантность: классификатор как нижняя граница
Для любого 𝑟𝜓 (𝑦 ∣ 𝑡):
𝔼[− log 𝑟𝜓 (𝑌 ∣ 𝑇)] = 𝐻(𝑌 ∣ 𝑇)
+ 𝔼 𝑇 𝐷KL 𝑃𝑌∣𝑇 ‖𝑟𝜓 (⋅ ∣ 𝑇)
≥ 𝐻(𝑌 ∣ 𝑇).
Значит,
𝐼(𝑇; 𝑌) = 𝐻(𝑌) − 𝐻(𝑌 ∣ 𝑇) ≥ 𝐻(𝑌) + 𝔼[log 𝑟𝜓 (𝑌 ∣ 𝑇)].
173
Теория информации для машинного обучения
Кросс-энтропия не равна −𝐼(𝑇; 𝑌) буквально. Она даёт обучаемую нижнюю границу на релевантность.
Чем лучше декодер приближает истинное 𝑃(𝑌 ∣ 𝑇), тем плотнее граница.
Скорость: KL к априорному распределению как верхняя граница
Определим агрегированное распределение представления:
𝑞𝜙 (𝑡) = 𝔼𝑋∼𝑃𝑋 [𝑞𝜙 (𝑡 ∣ 𝑋)].
Тогда
𝔼𝑋 𝐷KL 𝑞𝜙 (𝑇 ∣ 𝑋)‖𝑟(𝑇) = 𝐼𝑞 (𝑋; 𝑇) + 𝐷KL 𝑞𝜙 (𝑇)‖𝑟(𝑇) .
Отсюда
𝐼𝑞 (𝑋; 𝑇) ≤ 𝔼𝑋 𝐷KL 𝑞𝜙 (𝑇 ∣ 𝑋)‖𝑟(𝑇) .
У среднего KL два счёта:
1. информация о конкретном входе, действительно прошедшая через 𝑇;
2. цена несовпадения агрегированного распределения кодов с выбранным априорным распределением.
Если 𝑟(𝑡) = 𝑞𝜙 (𝑡), второй счёт исчезает. Для простого фиксированного априорного распределения
он обычно остаётся.
Обучаемая цель
Стандартная минимизируемая форма VIB:
𝒥VIB = 𝔼[− log 𝑟𝜓 (𝑌 ∣ 𝑇)] + 𝛽𝔼𝑋 𝐷KL 𝑞𝜙 (𝑇 ∣ 𝑋)‖𝑟(𝑇) .
Первый член платит за потерю предсказательной информации. Второй выставляет цену за ёмкость
представления.
Для диагонального гауссовского энкодера
174
Влад Куликов · Открытая редакция 2026.1
𝑞𝜙 (𝑡 ∣ 𝑥) = 𝒩 𝜇𝜙 (𝑥), diag 𝜎𝜙2 (𝑥) ,
и 𝑟(𝑡) = 𝒩(0, 𝐼) KL вычисляется аналитически:
𝐷KL 𝑞𝜙 (𝑇 ∣ 𝑥)‖𝑟(𝑇) =
1
2
𝜇𝑗2 + 𝜎𝑗2 − log 𝜎𝑗2 − 1 .
𝑗
Это уже знакомая ML-функция потерь. Большое |𝜇𝑗 | стоит дорого; слишком узкое условное
распределение тоже стоит дорого, потому что оно позволяет передать много информации о
конкретном 𝑥 .
Сэмплирование записывается через репараметризацию:
𝑇 = 𝜇𝜙 (𝑋) + 𝜎𝜙 (𝑋) ⊙ 𝜀,
𝜀 ∼ 𝒩(0, 𝐼).
Стохастичность здесь не только технический трюк. Она позволяет определить и управлять
вероятностной ёмкостью представления; конечность конкретного счёта обеспечивается конечностью
выбранного KL.
Что именно гарантирует VIB
Положительный результат уже достаточно силён: мы получили обычную обучаемую функцию
потерь, в которой предсказательная ошибка и цена представления имеют точное информационное
происхождение.
Но нужно помнить, что именно оптимизируется:
•
•
•
•
классификационный член — вариационная граница на релевантность;
KL-член — верхняя граница на 𝐼(𝑋; 𝑇);
разрыв скорости зависит от несовпадения 𝑞𝜙 (𝑡) и 𝑟(𝑡);
малая скорость является индуктивным предположением, а не универсальным сертификатом
обобщения или робастности.
Поэтому в эксперименте полезно логировать не только общую функцию потерь, но и её части:
предиктивный NLL, средний KL, число активных координат и качество на отложенных данных.
Один скаляр 𝛽 задаёт компромисс, но не объясняет автоматически, куда именно модель потратила
свой информационный бюджет.
9.5. VAE как система скорость–искажение
VIB сохраняет информацию о внешней целевой переменной 𝑌. У VAE такой переменной нет: модель
должна объяснить сам объект 𝑋 через латентную переменную 𝑍.
Генеративная модель задаётся как
𝑝𝜃 (𝑥, 𝑧) = 𝑝(𝑧)𝑝𝜃 (𝑥 ∣ 𝑧),
а энкодер приближает апостериорное распределение:
𝑞𝜙 (𝑧 ∣ 𝑥) ≈ 𝑝𝜃 (𝑧 ∣ 𝑥).
Для одного объекта
ELBO(𝑥) = 𝔼𝑞𝜙 (𝑧∣𝑥) [log 𝑝𝜃 (𝑥 ∣ 𝑧)] − 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝(𝑧) .
175
Теория информации для машинного обучения
Как мы видели в Модуле 4,
log 𝑝𝜃 (𝑥) = ELBO(𝑥) + 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝𝜃 (𝑧 ∣ 𝑥) .
То есть ELBO одновременно является обучаемой нижней границей на логарифм правдоподобия и
точной целью вариационного вывода.
После усреднения по данным отрицательная ELBO принимает форму
−𝔼[ELBO] = 𝔼[− log 𝑝𝜃 (𝑋 ∣ 𝑍)] + 𝔼𝑋 𝐷KL 𝑞𝜙 (𝑍 ∣ 𝑋)‖𝑝(𝑍) .
𝒟 — искажение
ℛ — скорость
На этом месте удобно остановиться и прочитать формулу словами:
VAE платит за две вещи: насколько трудно восстановить объект по латенту
и сколько информации латент потребовал относительно априорного
распределения.
Правдоподобие декодера задаёт искажение
Если
𝑝𝜃 (𝑥 ∣ 𝑧) = 𝒩 𝜇𝜃 (𝑧), 𝜎 2 𝐼
с фиксированной 𝜎 2 , то
− log 𝑝𝜃 (𝑥 ∣ 𝑧) = const +
‖𝑥 − 𝜇𝜃 (𝑧)‖2
.
2𝜎 2
Искажение пропорционально MSE. Но коэффициент 1/(2𝜎 2 ) важен: изменение предполагаемого
шума меняет обменный курс между реконструкцией и скоростью даже при формальном 𝛽 = 1.
Для бернуллиевского декодера возникает бинарная кросс-энтропия. Для дискретного категориального
декодера — многоклассовый NLL. Выбор правдоподобия — это выбор геометрии ошибок, а не только
последней строки кода.
Скорость включает информацию и несовпадение с априорным распределением
Пусть
𝑞𝜙 (𝑧) = 𝔼𝑋 [𝑞𝜙 (𝑧 ∣ 𝑋)].
Тогда
ℛ = 𝐼𝑞 (𝑋; 𝑍) + 𝐷KL 𝑞𝜙 (𝑍)‖𝑝(𝑍) .
Поэтому KL VAE — не просто «примерная взаимная информация». Он оплачивает:
1. сведения о конкретном объекте 𝑋;
2. несовпадение агрегированного распределения кодов с априорным распределением генеративной
модели.
Второй член важен для генерации и для кодирования: декодер должен уметь получать латенты из
того распределения, которое было объявлено априорным.
176
Влад Куликов · Открытая редакция 2026.1
VAE, 𝛽 -VAE и IB: одна геометрия, разные задачи
𝛽 -VAE минимизирует
𝒟 + 𝛽ℛ.
При большем 𝛽 использование латентного канала штрафуется сильнее. В хорошо оптимизированной
серии моделей это обычно сдвигает рабочую точку к меньшей скорости и большему искажению, хотя
не выпуклая оптимизация не обещает идеальной монотонности для каждого запуска.
Важно не перепутать соглашения:
• в 𝐼(𝑋; 𝑇) − 𝛽𝐼(𝑇; 𝑌) большое 𝛽 сильнее защищает релевантность;
• в 𝒟 + 𝛽ℛ большое 𝛽 сильнее штрафует скорость.
Стандартный VAE лучше понимать как вариационную систему скорость–искажение для
генеративного моделирования и реконструкции. Он родствен IB общей математикой узкого
места, но не является буквально supervised IB: внешней переменной 𝑌 здесь нет, а «полезность»
латента определяется правдоподобием 𝑝𝜃 (𝑥 ∣ 𝑧).
Коллапс апостериорного распределения
Если декодер достаточно мощный, он может хорошо моделировать 𝑋, почти не используя 𝑍:
𝑞𝜙 (𝑧 ∣ 𝑥) ≈ 𝑝(𝑧),
ℛ ≈ 0.
Это коллапс апостериорного распределения (posterior collapse). С точки зрения ELBO
модель нашла дешёвое решение: перестала платить за латентный канал. С точки зрения задачи, где
нужен информативный латент, это неудача.
Практические способы управлять режимом:
•
•
•
•
постепенное включение KL (KL warm‐up);
free bits или минимальная бесплатная ёмкость по координатам;
явная целевая ёмкость 𝐶 вместо немедленного давления к нулю;
менее всесильный декодер;
177
Теория информации для машинного обучения
• более выразительное априорное распределение;
• контроль активных латентных координат и фактической скорости.
Разделение факторов не следует из одного коэффициента
Повышенный штраф за скорость может поощрять более простые и факторизованные латенты. Но из
цели 𝒟 + 𝛽ℛ не следует, что координаты обязаны совпасть с «истинными» факторами данных.
Без индуктивных предположений о данных, архитектуре или слабого учительского сигнала
несупервизорное разделение факторов в общем случае неидентифицируемо. Поэтому 𝛽 -VAE
— полезный механизм управления ёмкостью, но не автоматический извлекатель семантически
правильных осей.
Факультативно: IWAE
IWAE использует 𝐾 сэмплов:
1
ℒ𝐾 = 𝔼 log
𝐾
𝐾
𝑘=1
𝑝𝜃 (𝑥, 𝑧𝑘 )
.
𝑞𝜙 (𝑧𝑘 ∣ 𝑥)
При стандартных условиях
ℒ1 ≤ ℒ2 ≤ ⋯ ≤ log 𝑝𝜃 (𝑥).
Более плотная граница полезна для оценивания правдоподобия, но сама по себе не гарантирует
более интерпретируемого или более полезного представления. Она меняет и геометрию градиента
энкодера, поэтому «более плотная граница» и «более полезное представление» — разные вопросы.
9.6. Когда скорость становится реальными битами
В VIB и VAE слово «скорость» пока обозначало информационную цену внутри вероятностной модели.
Чтобы получить файл, нужен ещё кодер и точный протокол — тот же урок, который мы уже видели в
Модуле 6.
Есть два особенно полезных случая.
Обучаемое сжатие с потерями
Современный нейронный кодек обычно строит:
1.
2.
3.
4.
непрерывный латент 𝑌 = 𝑔𝑎 (𝑋);
квантизованный латент 𝑌;
энтропийную модель 𝑝𝜓 (𝑦);
реконструкцию 𝑋 = 𝑔𝑠 (𝑌).
Типичная цель:
𝑅 + 𝜆𝐷 = 𝔼[− log2 𝑝𝜓 (𝑌)] + 𝜆 𝔼[𝑑(𝑋, 𝑋)] .
Если 𝑝𝜓 затем используется совместимым арифметическим или ANS-кодером, первый член уже
имеет буквальный смысл ожидаемого числа бит, с точностью до конечной длины, округления и
служебных данных.
В кодеке с гиперприором передаются и основные латенты, и служебные латенты:
𝑅 ≈ 𝔼 − log2 𝑝(𝑍) − log2 𝑝(𝑌 ∣ 𝑍) .
178
Влад Куликов · Открытая редакция 2026.1
Гиперлатент увеличивает собственный счёт, но может настолько улучшить предсказание 𝑌, что
общая скорость уменьшается. Это хороший пример того, почему «добавить ещё одну переменную»
иногда означает сжать лучше, а не хуже.
Во время обучения жёсткое округление обычно заменяют дифференцируемым приближением:
добавлением равномерного шума, прямым оценивателем градиента или другим суррогатом. На
валидации нужно вернуться к настоящему квантизатору и физическому потоку бит.
ELBO как длина кода: идея bits-back
У VAE связь с кодированием тоже может быть буквальной. Рассмотрим один объект 𝑥 и латент 𝑧.
Наивный код заплатил бы:
− log 𝑝(𝑧) − log 𝑝𝜃 (𝑥 ∣ 𝑧).
Но энкодер знает распределение 𝑞𝜙 (𝑧 ∣ 𝑥). В bits-back-схеме часть случайных бит используется, чтобы
выбрать 𝑧 ∼ 𝑞𝜙 (𝑧 ∣ 𝑥), а после декодирования эти биты можно восстановить, снова закодировав 𝑧 под
𝑞𝜙 (𝑧 ∣ 𝑥).
Чистая длина для выбранного 𝑧 становится
− log 𝑝𝜃 (𝑥 ∣ 𝑧) − log 𝑝(𝑧) + log 𝑞𝜙 (𝑧 ∣ 𝑥).
Если логарифмы взяты по основанию 2, то после усреднения по 𝑞𝜙 (𝑧 ∣ 𝑥) это ровно
− ELBO(𝑥).
Таким образом, отрицательная ELBO — не только удобная функция потерь. При подходящей bitsback-реализации она является ожидаемой чистой длиной кода латентной генеративной модели.
Практическая схема сложнее формулы: нужны начальные случайные биты, согласованный порядок
операций, конечная точность и удобный стековый кодер вроде ANS. Но этот механизм объясняет,
почему качество вариационного вывода влияет на компрессию: большой вариационный разрыв
означает, что код не возвращает столько бит, сколько мог бы.
Квантизация весов LLM: та же дисциплина, но не тот же код
Пусть обученные веса 𝑊 заменяются на 𝑊 . Фраза «4 бита на параметр» задаёт только номинальную
разрядность. Фактический размер может дополнительно включать:
•
•
•
•
•
масштабы групп;
нулевые точки;
кодовые книги и индексы;
выбросы, сохранённые в повышенной точности;
выравнивание, упаковку и заголовки.
Искажение тоже нужно определить. Возможны:
‖𝑊 − 𝑊‖22 ,
𝔼‖𝑊𝑋 − 𝑊𝑋‖22 ,
𝔼𝐷KL 𝑃original (⋅ ∣ 𝑐)‖𝑃quantized (⋅ ∣ 𝑐) ,
или рост NLL и ошибки последующей задачи.
179
Теория информации для машинного обучения
Одинаковая MSE весов в двух направлениях параметрического пространства может иметь
совершенно разный функциональный эффект. Поэтому методы квантизации фактически ищут
более полезный суррогат искажения:
• GPTQ использует приближённую информацию второго порядка для последовательной
компенсации ошибки;
• AWQ определяет важные каналы по статистике активаций;
• SmoothQuant эквивалентным масштабированием переносит часть трудности квантизации
между активациями и весами.
Эти методы естественно читать на языке скорости–искажения: они неравномерно распределяют
ограниченный бюджет там, где ошибка дороже. Но они не являются доказательством достижения
шенноновской 𝑅(𝐷) для некоторого универсального источника весов.
9.7. Как построить честную кривую скорость–искажение
Одна модель при одном значении 𝛽 или одной разрядности — ещё не компромисс. Это всего одна
точка, и она может оказаться плохо оптимизированной.
Полезный эксперимент строится как серия:
1.
2.
3.
4.
5.
6.
фиксируем обучающее и оценочное распределения;
точно определяем скорость;
точно определяем искажение;
меняем 𝜆, 𝛽 , ёмкость или разрядность;
оставляем недоминируемые точки — эмпирическую границу Парето;
отдельно измеряем задержку, память и аппаратную стоимость.
Одни и те же слова в разных задачах обозначают разные величины:
Что играет роль
искажения
Постановка
Что играет роль скорости
VIB
средний KL энкодера к
априорному
распределению
средний KL 𝑞(𝑧 ∣ 𝑥) к 𝑝(𝑧)
VAE
Реальные биты?
предиктивный NLL
обычно нет, это верхняя
граница и регуляризатор
− log 𝑝𝜃 (𝑥 ∣ 𝑧)
возможны через bits-back
при полном протоколе
180
Влад Куликов · Открытая редакция 2026.1
Постановка
Что играет роль скорости
обучаемый кодек
NLL квантизованных
латентов под
энтропийной моделью
фактический размер
весов и служебных
данных
квантизованная LLM
Что играет роль
искажения
Реальные биты?
MSE, MS-SSIM,
перцептивная или иная
заданная мера
рост NLL, KL выходов
или качество задачи
да, после энтропийного
кодирования
да для размера; функция
искажения остаётся
инженерным выбором
Перед публикацией красивой кривой стоит задать четыре вопроса:
•
•
•
•
Единица скорости — бит на пиксель, объект, параметр, токен или латент?
Включены ли служебные данные и параметры энтропийной модели?
Искажение измерено на отложенных данных и совпадает ли оно с задачей пользователя?
Не скрывает ли среднее небольшое число катастрофических ошибок?
И ещё одна практическая граница: меньший файл не гарантирует более быстрый инференс.
Неудобная распаковка, неподдерживаемая разрядность или лишние обращения к памяти могут
уничтожить выигрыш. Теория задаёт информационную ось; инженерная система добавляет
вычислительную.
Скорость–искажение — не название одной метрики.
постановки задачи.
9.8.
Информационная плоскость:
описание динамики?
Information Bottleneck как нормативный принцип точен:
отображение 𝑃𝑇∣𝑋 и оптимизируем явную цель.
Это дисциплина
цель обучения или
мы сами выбираем стохастическое
Более сильное утверждение звучит иначе: обычная глубокая сеть, обучаемая стандартным SGD без
IB-регуляризатора, якобы сама проходит характерную траекторию в плоскости
𝐼(𝑋; 𝑇), 𝐼(𝑇; 𝑌) .
В ранних работах была предложена двухфазная картина:
1. подгонка (fitting) — растёт информация о метках;
2. сжатие (compression) — 𝐼(𝑋; 𝑇) уменьшается при почти неизменной 𝐼(𝑇; 𝑌).
Это красивая гипотеза: сначала сеть учится предсказывать, затем забывает детали входа. Но спор
вокруг неё оказался полезнее самого лозунга, потому что заставил спросить: что именно нанесено
на оси?
Для детерминированной сети 𝑇 = 𝑓(𝑋) возникают два режима.
Если 𝑋 дискретна, то
𝐼(𝑋; 𝑇) = 𝐻(𝑇).
Если отображение инъективно на носителе, то
𝐻(𝑇) = 𝐻(𝑋),
и истинная MI не обязана уменьшаться во время обучения.
Если 𝑋 непрерывна и 𝑇 = 𝑓(𝑋) детерминированно, совместное распределение часто лежит на
подмногообразии, и взаимная информация в стандартной непрерывной постановке может быть
бесконечной.
181
Теория информации для машинного обучения
Чтобы получить конечную изменяющуюся величину, исследователь добавляет шум, квантование или
дискретизацию. Но тогда он уже измеряет MI конкретной зашумлённой или квантованной
модели, а не абстрактную «информацию слоя вообще».
Saxe и соавторы показали, что наблюдаемая фаза сжатия зависит от активаций и оценивателя.
Goldfeld и соавторы уточнили, что старые биннинговые оценки могли хорошо отслеживать
геометрическое сближение представлений одного класса, даже когда не оценивали буквальную
истинную MI детерминированного слоя.
Главный вывод здесь — не запрет на информационные плоскости, а правильная иерархия
утверждений:
• нормативный IB — строгая оптимизационная задача;
• VIB — конкретная обучаемая вариационная реализация;
• информационная плоскость шумной сети — осмысленный объект после явного задания
шума и оценивателя;
• универсальная естественная IB-траектория всех глубоких сетей — эмпирическая
гипотеза, а не следствие DPI.
Это хороший пример общей привычки курса: сначала определить случайные величины и
распределения, а уже потом интерпретировать картинку.
9.9. Математическое углубление: I–MMSE и гауссовское
зашумление
Этот раздел не нужен для понимания VIB и VAE. Он показывает ещё один точный мост
между количеством оставшейся информации и качеством восстановления.
182
Влад Куликов · Открытая редакция 2026.1
Теория скорости–искажения спрашивает: сколько информации нужно для заданной MSE?
Тождество I–MMSE задаёт локальный обратный вопрос:
Насколько быстро растёт взаимная информация, если немного повысить SNR
гауссовского наблюдения?
Рассмотрим канал
𝑌𝛾 = √𝛾𝑋 + 𝑁,
𝑁 ∼ 𝒩(0, 1),
где 𝔼[𝑋 2 ] < ∞.
Определим минимальную среднеквадратичную ошибку:
mmse(𝛾) = 𝔼
𝑋 − 𝔼[𝑋 ∣ 𝑌𝛾 ]
2
.
Для взаимной информации в натах:
𝑑
1
𝐼(𝑋; 𝑌𝛾 ) = mmse(𝛾) .
𝑑𝛾
2
В битах правая часть дополнительно делится на ln 2.
Для любого конечного Γ:
𝐼(𝑋; 𝑌Γ ) =
Γ
1
2
mmse(𝛾) 𝑑𝛾.
0
Формула говорит буквально: площадь под кривой оптимальной ошибки восстановления равна
накопленной информации, вошедшей в гауссовский канал.
Гауссовский пример замыкает круг
Пусть
𝑋 ∼ 𝒩(0, 𝜎 2 ).
Тогда
mmse(𝛾) =
𝜎2
,
1 + 𝛾𝜎 2
а
𝐼(𝑋; 𝑌𝛾 ) =
1
ln(1 + 𝛾𝜎 2 ).
2
Обозначим достигнутую ошибку восстановления через
𝐷=
𝜎2
.
1 + 𝛾𝜎 2
Тогда
1 + 𝛾𝜎 2 =
183
𝜎2
,
𝐷
Теория информации для машинного обучения
и
𝐼(𝑋; 𝑌𝛾 ) =
1 𝜎2
ln
.
2
𝐷
В битах это ровно гауссовская функция скорость–искажение:
1
𝜎2
log2
.
2
𝐷
𝑅(𝐷) =
Так два раздела модуля сходятся в одной формуле: оптимальная ошибка оценивания вдоль
гауссовского канала воспроизводит границу скорости–искажения гауссовского источника.
Почему интеграл до бесконечности требует осторожности
Для дискретного 𝑋 с конечной энтропией при Γ → ∞ обычно
𝐼(𝑋; 𝑌Γ ) → 𝐻(𝑋).
Для невырожденного абсолютно непрерывного 𝑋 взаимная информация обычно растёт без границы.
Поэтому нельзя без дополнительной перенормировки писать
ℎ(𝑋) =
1
2
∞
mmse(𝛾) 𝑑𝛾.
0
184
Влад Куликов · Открытая редакция 2026.1
1
У стандартного гауссиана интеграл расходится как ln(1 + Γ), хотя дифференциальная энтропия
2
конечна. Здесь снова важно не переносить формулу из дискретной интуиции в непрерывный случай
без проверки опорной меры.
Связь с диффузионными моделями
Прямое зашумление в DDPM имеет вид
𝑋𝑡 =
𝛼̄ 𝑡 𝑋0 + 1 − 𝛼̄ 𝑡 𝜀,
𝜀 ∼ 𝒩(0, 𝐼).
После нормировки это гауссовский канал с
𝛾𝑡 =
𝛼̄ 𝑡
.
1 − 𝛼̄ 𝑡
Для истинного зашумлённого распределения формула Тведи даёт
𝔼[𝑋0 ∣ 𝑋𝑡 = 𝑥𝑡 ] =
𝑥𝑡 + (1 − 𝛼̄ 𝑡 )∇𝑥𝑡 log 𝑝𝑡 (𝑥𝑡 )
𝛼̄ 𝑡
.
Точная скор-функция (score function) определяет апостериорное среднее — оптимальный по MSE
денойзер. Поэтому обучение скор-функции можно читать как обучение семейства оптимальных
восстановителей на разных уровнях шума.
Но из I–MMSE одного не следуют:
•
•
•
•
конкретные веса любой диффузионной функции потерь;
перцептивно оптимальный график шума;
число шагов сэмплирования;
эквивалентность диффузии, flow matching и IB.
Variational Diffusion Models связывают непрерывновременную вариационную границу с SNR и
показывают важные инвариантные свойства графика шума. Это уже дополнительная структура
конкретной вероятностной модели, а не автоматическое следствие одного тождества I–MMSE.
9.11. Ключевые выводы модуля
Потеря информации полезна только относительно задачи.
Различия, ненужные
классификатору, могут быть необходимы реконструктору или другой целевой переменной.
Теория скорости–искажения задаёт фундаментальную границу после выбора источника
и цены ошибки:
𝑅(𝐷) =
inf
𝑃𝑋∣𝑋 ∶ 𝔼𝑑≤𝐷
𝐼(𝑋; 𝑋).
Information Bottleneck делает искажение предиктивным:
𝑑IB (𝑥, 𝑡) = 𝐷KL 𝑃(𝑌 ∣ 𝑥)‖𝑃(𝑌 ∣ 𝑡) .
VIB превращает недоступные MI в обучаемую цель, но использует нижнюю границу на
релевантность и верхнюю границу на скорость.
VAE естественно читается в координатах скорость–искажение:
− ELBO = искажение + скорость.
185
Теория информации для машинного обучения
Это роднит VAE с IB, но не делает их одной и той же задачей.
правдоподобие реконструкции, а внешний 𝑌 отсутствует.
В VAE цену ошибки задаёт
В реальном кодеке скорость должна дойти до битового потока. NLL латентов, KLрегуляризатор, номинальная разрядность и физический размер файла — связанные, но разные
величины.
Информационная плоскость осмысленна только после определения случайности
и оценивателя. Нормативный IB — теорема и оптимизационная постановка; естественная
IB-динамика обычной сети — эмпирическая гипотеза.
И наконец, I–MMSE показывает ещё один способ прочитать информацию: как накопленную по SNR
способность оптимально восстанавливать сигнал. Для гауссовского источника эта связь возвращает
нас ровно к функции скорость–искажение, замыкая модуль.
Основные источники
1.
2.
3.
4.
5.
6.
7.
8.
9.
10.
11.
12.
C. E. Shannon, Coding Theorems for a Discrete Source With a Fidelity Criterion.
N. Tishby, F. Pereira, W. Bialek, The Information Bottleneck Method.
A. Alemi et al., Deep Variational Information Bottleneck.
D. P. Kingma, M. Welling, Auto-Encoding Variational Bayes.
Y. Burda, R. Grosse, R. Salakhutdinov, Importance Weighted Autoencoders.
C. Burgess et al., Understanding Disentangling in 𝛽 -VAE; F. Locatello et al., Challenging Common
Assumptions in the Unsupervised Learning of Disentangled Representations.
J. Ballé et al., Variational Image Compression with a Scale Hyperprior; J. Townsend, T. Bird, D. Barber, Practical Lossless Compression with Latent Variables using Bits Back Coding.
Y. Blau, T. Michaeli, Rethinking Lossy Compression: The Rate-Distortion-Perception Tradeoff .
E. Frantar et al., GPTQ; J. Lin et al., AWQ; G. Xiao et al., SmoothQuant.
A. Saxe et al., On the Information Bottleneck Theory of Deep Learning; Z. Goldfeld et al., Estimating
Information Flow in Deep Neural Networks.
D. Guo, S. Shamai, S. Verdú, Mutual Information and Minimum Mean-Square Error in Gaussian
Channels.
J. Ho, A. Jain, P. Abbeel, Denoising Diffusion Probabilistic Models; D. P. Kingma et al., Variational
Diffusion Models.
186
Модуль 10. Алгоритмическая
теория информации: кратчайшие
описания, MDL и универсальное
предсказание
Как читать этот модуль. Основной маршрут — §§10.1–10.8. Сначала мы перейдём от
среднего числа бит для источника к длине описания одного конкретного объекта, затем
свяжем эту идею с энтропией Шеннона, универсальным предсказанием, MDL и сходством
через сжатие. §§10.9–10.10 — факультативные углубления об AIXI и принципе Ландауэра;
их можно оставить на второй проход.
10.1. От распределения к одному конкретному объекту
Представим три файла одинакового размера — по миллиону бит каждый.
• Первый состоит из одних нулей.
• Второй содержит первые миллион двоичных знаков числа 𝜋.
• Третий получен из физического источника случайности.
На уровне сырого представления они одинаковы: в каждом ровно миллион записанных бит. Но
как описания они различаются радикально. Для первого достаточно команды «напечатай миллион
нулей». Для второго — программы вычисления 𝜋 и числа знаков. Для третьего, вероятнее всего, не
найдётся описания существенно короче самого файла.
Здесь возникает вопрос, которого не было в классической постановке источника:
Сколько бит нужно не в среднем для распределения, а для воспроизведения
именно этого объекта?
Алгоритмическая теория информации (algorithmic information theory, AIT) отвечает: нужно
искать кратчайшее эффективное описание, то есть программу, которая печатает объект и
останавливается.
Это не замена теории Шеннона, а другой масштаб рассмотрения.
• Энтропия начинает с распределения и спрашивает о среднем счёте за множество возможных
сообщений.
• Алгоритмическая сложность начинает с конкретной строки и спрашивает о кратчайшем
исполнимом объяснении этой строки.
187
Теория информации для машинного обучения
Такой взгляд особенно полезен в ML.
Выбор модели. Сложная модель может сильнее уменьшить функцию потерь, но за саму модель
тоже приходится платить. Отсюда возникает MDL-счёт «модель + данные при модели».
Анализ представлений. Высокая точность диагностического классификатора (probe) ещё не
говорит, легко ли извлекается признак. Предиктивно-последовательный код учитывает, сколько
примеров и сколько бит понадобилось, чтобы научиться его извлекать.
Сходство объектов. Если после передачи 𝑥 объект 𝑦 требует лишь короткого дополнения, у них
есть общая алгоритмическая структура. Практическая версия этой идеи приводит к NCD.
Универсальное предсказание.
Если коротким вычислимым объяснениям дать больший
априорный вес, можно определить идеализированный предиктор, который конкурирует со всеми
вычислимыми моделями сразу.
Сразу установим границу понятия. Краткость описания говорит о регулярности, но не измеряет
смысл, истинность, полезность или красоту. Короткая программа может печатать бессодержательную
строку и работать астрономически долго.
Алгоритмическая теория информации измеряет
описательную сложность, а не все свойства объекта одновременно.
10.2. Колмогоровская сложность и язык описания
Кратчайшая программа
Описание имеет смысл только вместе с языком, на котором его умеет выполнять декодер.
Зафиксируем универсальную префиксную машину 𝑈. Её завершившиеся программы устроены
так, что ни одна допустимая программа не является началом другой. Благодаря этому поток бит
можно однозначно разделять на программы, а их длины ведут себя как длины префиксного кода.
Префиксная колмогоровская сложность строки 𝑥 определяется как
𝐾𝑈 (𝑥) =
min
𝑝∶ 𝑈(𝑝)=𝑥
|𝑝| .
Это длина кратчайшей самоделимитирующейся программы, которая печатает 𝑥 и останавливается.
Индекс 𝑈 часто опускают, но машина не исчезает из определения. Вопрос всегда звучит так:
насколько коротко объект описывается в выбранном универсальном языке?
188
Влад Куликов · Открытая редакция 2026.1
Самоделимитирующееся буквальное описание
Для обычной, или простой, сложности 𝐶(𝑥) можно положить строку внутрь программы и добавить
фиксированную команду «напечатать остаток». Поэтому
𝐶(𝑥) ≤ |𝑥| + 𝑂(1).
Префиксная программа должна сообщить декодеру, где заканчивается описание длины и начинается
сама строка. Один стандартный способ даёт
𝐾(𝑥) ≤ |𝑥| + 𝐾(|𝑥|) + 𝑂(1) .
Для 𝑛 = |𝑥| стоимость 𝐾(𝑛) растёт лишь логарифмически; например,
𝐾(𝑛) ≤ log2 𝑛 + 2 log2 log2 𝑛 + 𝑂(1)
при достаточно большом 𝑛. Надбавка мала по сравнению с длинной строкой, но принципиальна:
именно самоделимитируемость делает веса 2−|𝑝| совместимыми с вероятностной суммой.
Теорема инвариантности
Теперь возникает естественное возражение. Одна и та же идея записывается на Python, C и языке
машины Тьюринга разным числом бит. Не становится ли сложность просто свойством выбранного
синтаксиса?
Пусть 𝑈 и 𝑉 — две оптимальные универсальные префиксные машины. Тогда существует константа
𝑐𝑈,𝑉 , не зависящая от 𝑥 , такая что
|𝐾𝑈 (𝑥) − 𝐾𝑉 (𝑥)| ≤ 𝑐𝑈,𝑉 .
Механика проста. На машине 𝑈 можно один раз написать интерпретатор для 𝑉 , а затем присоединять
к нему любую 𝑉 -программу. Стоимость интерпретатора фиксирована и не растёт вместе с объектом.
Теорема позволяет говорить о 𝐾(𝑥) с точностью до аддитивной константы. Для больших объектов это
сильная устойчивость. Для коротких строк константа может быть сопоставима с самой сложностью,
189
Теория информации для машинного обучения
поэтому абсолютное значение без указания машины не превращается в физическую константу
объекта.
Условная сложность
Если декодеру уже известен объект 𝑦, определяют
𝐾(𝑥 ∣ 𝑦) =
min
𝑝∶ 𝑈(𝑝,𝑦)=𝑥
|𝑝| .
Это длина кратчайшего дополнительного описания 𝑥 при доступном 𝑦.
Если 𝑥 и 𝑦 — две версии репозитория, то 𝐾(𝑥 ∣ 𝑦) может быть близка к длине короткого разностного
описания (patch), хотя каждый репозиторий сам по себе велик. Именно эта идея позже превратится
в алгоритмическую меру сходства.
Что именно измеряет 𝐾(𝑥)
Две строки одинаковой длины могут занимать разные места на шкале описательной сложности:
•
•
•
•
миллион нулей задаётся числом повторов;
периодическая строка — шаблоном и числом повторов;
первые 𝑛 цифр 𝜋 — алгоритмом и значением 𝑛;
типичная строка из независимых честных битов требует почти буквального описания.
Здесь важно отделить длину программы от времени её исполнения. Короткая программа может
вычислять результат чрезвычайно долго. И наоборот, большой файл весов может быстро выдавать
ответы. Колмогоровская сложность измеряет длину описания, а не вычислительную стоимость.
190
Влад Куликов · Открытая редакция 2026.1
Есть и ещё одна полезная неожиданность. Поток псевдослучайного генератора с коротким
начальным значением (seed) имеет короткое алгоритмическое описание: генератор, начальное
значение и длина потока. Но gzip может не сжать его вообще. Практический компрессор ищет
ограниченный набор закономерностей; 𝐾(𝑥) оптимизируется по всем программам.
10.3. Несжимаемость, невычислимость и реальные компрессоры
Почему большинство строк нельзя заметно сжать
Рассмотрим все 2𝑛 бинарных строк длины 𝑛. Программ длины меньше 𝑛 − 𝑐 существует меньше 2𝑛−𝑐 .
Каждая завершившаяся программа печатает не более одной строки. Следовательно,
# {𝑥 ∈ {0, 1}𝑛 ∶ 𝐾(𝑥) < 𝑛 − 𝑐} < 2𝑛−𝑐 .
Доля строк, которые можно сжать хотя бы на 𝑐 бит, меньше
2−𝑐 .
Например, сжимаемых минимум на 20 бит строк среди всех строк фиксированной длины меньше
одной миллионной доли. Структурированные объекты занимают очень малую часть пространства
всех возможных битовых последовательностей.
Это чистый подсчёт описаний. Он не утверждает, что несжимаемая строка обязательно «выглядит
случайной» человеку, и ничего не говорит о её семантической ценности.
191
Теория информации для машинного обучения
Почему идеальный счёт нельзя вычислить
Предположим, что существует алгоритм, точно вычисляющий 𝐾(𝑥).
перебрать строки и найти первую строку 𝑥𝑚 , для которой
Тогда по числу 𝑚 можно
𝐾(𝑥𝑚 ) > 𝑚.
Но программа «получи 𝑚, найди первую такую строку и напечатай её» имеет длину
𝐾(𝑚) + 𝑂(1) = 𝑂(log 𝑚),
что для большого 𝑚 намного меньше 𝑚. Получается короткое описание объекта, который по
построению не должен иметь короткого описания. Противоречие.
Следовательно,
𝐾(𝑥) невычислима.
При этом 𝐾(𝑥) полувычислима сверху. Можно параллельно запускать всё больше программ, и всякий
раз, когда находится более короткая программа для 𝑥 , улучшать текущую верхнюю оценку. Нельзя
только узнать, что найденная программа уже кратчайшая: некоторые ещё более короткие кандидаты
могут остановиться через неизвестно сколько времени.
Невычислимость здесь не техническая неприятность, которую исправит более быстрый процессор.
Она является частью самой конструкции.
Что дают gzip, zstd и LZMA
Пусть конкретный компрессор выдаёт поток 𝐶(𝑥), а фиксированный декомпрессор без потерь
восстанавливает 𝑥 . Тогда программа «запусти этот декомпрессор на 𝐶(𝑥)» даёт
𝐾(𝑥) ≤ |𝐶(𝑥)| + 𝑐𝐶 ,
где 𝑐𝐶 оплачивает декомпрессор, формат и соглашения о входе.
Значит, реальный компрессор даёт вычислимую верхнюю границу на 𝐾(𝑥).
известной гарантии близости к идеалу.
Но он не даёт
Если файл плохо сжимается, возможны разные причины:
1.
2.
3.
4.
объект действительно близок к алгоритмически несжимаемому;
его закономерность не входит в класс, который умеет находить компрессор;
файл слишком мал и служебные расходы доминируют;
формат или предобработка скрывают полезную структуру.
Полезная инженерная формулировка звучит так:
Компрессор — это исполнимая теория регулярности.
Его длина кода
показывает, какие закономерности умеет использовать именно эта теория.
Математическое замечание: случайность бесконечной последовательности
Для бесконечных последовательностей недостаточно проверить один длинный префикс. Случайность
по Мартину-Лёфу требует прохождения всех эффективных статистических тестов нулевой меры.
Теорема Левина—Шнорра связывает это определение с префиксной сложностью: бинарная
последовательность 𝜔 случайна по Мартину-Лёфу тогда и только тогда, когда существует константа
𝑐 , для которой
𝐾(𝜔1∶𝑛 ) ≥ 𝑛 − 𝑐
192
Влад Куликов · Открытая редакция 2026.1
для всех 𝑛. В дальнейшем нам в основном понадобятся конечные объекты, но это показывает, что
алгоритмическая случайность — не синоним «архиватор не нашёл повторов».
10.4. Связь с энтропией Шеннона
Шеннон и Колмогоров начинают с разных сторон.
• Шеннон фиксирует распределение 𝑃 и ищет среднюю длину кода.
• Колмогоров фиксирует объект 𝑥 и ищет кратчайшее исполнимое описание.
Тем не менее для вычислимого источника эти два счёта встречаются в среднем.
Пусть 𝑃 — вычислимое распределение на конечных строках, а 𝐾(𝑃) — длина программы, которая
вычисляет его вероятности с нужной точностью. Тогда
𝐻2 (𝑃) ≤ 𝔼𝑋∼𝑃 [𝐾(𝑋)] ≤ 𝐻2 (𝑃) + 𝐾(𝑃) + 𝑂(1) .
Нижняя граница
Выберем для каждого 𝑥 одну кратчайшую префиксную программу. Эти программы образуют
префиксный код. Средняя длина любого префиксного кода не может быть меньше энтропии
источника, поэтому
𝐻2 (𝑃) ≤ 𝔼𝑃 𝐾(𝑋).
Верхняя граница
Можно передать два объекта:
1. программу, описывающую распределение 𝑃;
2. код строки 𝑥 длиной примерно − log2 𝑃(𝑥) бит.
Отсюда
𝐾(𝑥) ≤ 𝐾(𝑃) − log2 𝑃(𝑥) + 𝑂(1).
После усреднения второй член превращается в энтропию.
193
Теория информации для машинного обучения
Для i.i.d.-блока 𝑋1∶𝑛 точнее написать
𝐻2 (𝑋1∶𝑛 ) ≤ 𝔼𝐾(𝑋1∶𝑛 ) ≤ 𝐻2 (𝑋1∶𝑛 ) + 𝐾(𝑃) + 𝐾(𝑛) + 𝑂(1).
Если источник фиксирован и 𝐻2 (𝑋1∶𝑛 ) = 𝑛𝐻2 (𝑋), то
1
𝔼𝐾(𝑋1∶𝑛 ) ⟶ 𝐻2 (𝑋).
𝑛
Стоимость описания источника и длины блока распределяется по всё большему числу символов и
исчезает на один символ.
Вот точный мост между двумя теориями:
Энтропия — типичная средняя алгоритмическая сложность длинных
сообщений из известного вычислимого источника; 𝐾(𝑥) позволяет обсуждать
отдельный объект, когда источник не задан заранее.
Мост не стирает различие. Один файл не определяет единственное истинное распределение,
а короткая программа, идеально воспроизводящая обучающий набор, не обязана хорошо
предсказывать новые данные. Для генерализации важно, какую структуру описание переносит
за пределы уже увиденного объекта.
10.5. Алгоритмическая вероятность и универсальное предсказание
Программы как гипотезы
Префиксность позволяет провести мысленный эксперимент: подбрасывать честную монету и читать
получившиеся биты как программу. Программа длины |𝑝| получает вес
2−|𝑝| .
По неравенству Крафта суммарный вес завершившихся программ не превосходит единицу. Короткие
программы получают больший вес, но длинные не исключаются.
Для программ, которые печатают конечную строку 𝑥 и останавливаются, определим алгоритмическую
вероятность
2−|𝑝| .
𝑚𝑈 (𝑥) =
𝑝∶ 𝑈(𝑝)=𝑥
Одну и ту же строку могут печатать многие программы, поэтому веса суммируются.
кодирования связывает эту сумму с префиксной сложностью:
Теорема
− log2 𝑚𝑈 (𝑥) = 𝐾𝑈 (𝑥) + 𝑂(1) .
Иначе говоря,
𝑚𝑈 (𝑥) ≍ 2−𝐾𝑈 (𝑥) .
Кратчайшая программа определяет главный экспоненциальный масштаб, а остальные программы
добавляют массу.
Предсказание продолжения
Для последовательного предсказания удобнее взять универсальную монотонную машину, которая
читает бесконечный поток честных случайных битов. Определим 𝑀(𝑥) как вероятность того, что её
194
Влад Куликов · Открытая редакция 2026.1
выход начинается с префикса 𝑥 . Эквивалентно можно просуммировать веса минимальных входных
префиксов, уже достаточных для печати 𝑥 :
2−|𝑝| .
𝑀(𝑥) =
𝑝∶ 𝑝 минимален и 𝑈(𝑝)⊒𝑥
Знак 𝑈(𝑝) ⊒ 𝑥 означает, что выведенная строка начинается с 𝑥 ; требование минимальности не
позволяет повторно считать все продолжения одного и того же входного префикса.
Это полумера (semimeasure): часть входной массы может соответствовать программам, которые
остановились после 𝑥 или никогда не выдали следующий символ, поэтому
𝑀(𝑥) ≥ 𝑀(𝑥0) + 𝑀(𝑥1).
Отношения 𝑀(𝑥𝑎)/𝑀(𝑥) задают условные веса продолжений; при необходимости их нормируют,
чтобы получить обычное распределение следующего символа.
Здесь есть техническое различие, которое полезно один раз назвать явно. Конечная алгоритмическая
вероятность 𝑚𝑈 (𝑥) связана с префиксной сложностью 𝐾𝑈 (𝑥). Последовательная полумера 𝑀(𝑥)
естественно связана с монотонной машиной и монотонной сложностью. Популярная формула
«вероятность порядка 2−𝐾 » передаёт общую идею, но строгие теоремы требуют не смешивать
варианты машин.
195
Теория информации для машинного обучения
Универсальное доминирование
Пусть 𝜇 — вычислимая вероятностная модель источника. Универсальная полумера включает
программу, вычисляющую 𝜇, поэтому существует константа, для которой
𝑀(𝑥) ≥ 2−𝐾(𝜇)−𝑂(1) 𝜇(𝑥)
для каждого конечного префикса 𝑥 .
Возьмём минус логарифм:
− log2 𝑀(𝑥) ≤ − log2 𝜇(𝑥) + 𝐾(𝜇) + 𝑂(1).
Эту формулу удобно прочитать как счёт:
Универсальный предиктор платит за незнание вычислимого источника
не линейно с длиной данных, а один раз — длиной описания источника, с
точностью до константы.
Для последовательности условных предсказаний отношение правдоподобий раскладывается по
времени. В ожидаемой форме суммарный условный KL-разрыв между истинным предиктором
𝜇 и нормированной версией универсального предиктора ограничен величиной порядка 𝐾(𝜇) бит.
Поэтому для любого фиксированного вычислимого источника средняя избыточная логарифмическая
потеря на шаг стремится к нулю.
Это одна из самых сильных идей модуля. Бритва Оккама и байесовское усреднение оказываются
одной конструкцией: короткие вычислимые объяснения начинают с большим весом, а наблюдения
перераспределяют массу между ними.
Почему это не практический алгоритм
Чтобы точно вычислить 𝑀(𝑥), пришлось бы узнать, какие программы когда-нибудь напечатают
нужный префикс. Это снова приводит к проблеме остановки. Универсальная полумера нижнеполувычислима,
но невычислима как обычная функция.
Кроме того, априорные веса зависят от выбранной универсальной машины. Теорема инвариантности
контролирует эту зависимость аддитивной константой в сложности, но для коротких данных и
решений, чувствительных к априорному распределению, константа может быть существенной.
Индукция Соломонова — не архитектура, которую можно просто реализовать. Это нормативный
предел: как выглядело бы последовательное предсказание, если бы можно было байесовски
усреднить все вычислимые объяснения с алгоритмическим приоритетом простых программ.
10.6. MDL в машинном обучении
Невычислимость 𝐾(𝑥) не отменяет идею короткого описания. Она меняет инженерную задачу:
вместо неизвестного идеального языка мы проектируем конкретный код и сравниваем модели
внутри него.
Принцип минимальной длины описания (Minimum Description Length, MDL) формулируется так:
Предпочитайте модель, которая даёт самое короткое полное описание
данных.
Двухчастный код: модель и остаток
Для гипотезы ℎ и набора данных 𝐷 простейший счёт имеет вид
𝐿(𝐷, ℎ) = 𝐿(ℎ) + 𝐿(𝐷 ∣ ℎ) .
196
Влад Куликов · Открытая редакция 2026.1
Первый член оплачивает модель. Второй — то, что остаётся передать после её получения.
Пусть модель 𝐴 стоит 100 бит и кодирует данные за 1200 бит. Модель 𝐵 стоит 300 бит, но уменьшает
длину данных до 850 бит. По одной функции потерь 𝐵 выигрывает на 350 бит; после оплаты модели
её общий счёт всё равно меньше:
𝐿𝐴 = 1300,
𝐿𝐵 = 1150.
Если вероятностная модель задаёт 𝑝ℎ (𝐷) и используется согласованный энтропийный кодер, то
𝐿(𝐷 ∣ ℎ) ≈ − log2 𝑝ℎ (𝐷).
MDL делает компромисс между подгонкой и сложностью не метафорой, а бухгалтерией в одной
единице.
Как код связан с априорным распределением и регуляризацией
Для дискретного класса моделей априорное распределение 𝜋(ℎ) задаёт префиксные длины
𝐿(ℎ) = − log2 𝜋(ℎ).
Тогда минимизация
− log 𝑝ℎ (𝐷) − log 𝜋(ℎ)
совпадает с MAP-выбором модели с точностью до основания логарифма.
Для непрерывных параметров нужна дополнительная работа. Плотность априорного распределения
зависит от координат и базовой меры, а точное вещественное число невозможно передать конечным
кодом. Поэтому приходится фиксировать точность параметров, использовать интегрированный
одночастный код или другую универсальную конструкцию.
Отсюда следует аккуратное чтение регуляризации.
Гауссовское априорное распределение в
фиксированной евклидовой параметризации приводит к квадратичному MAP-штрафу. Это полезная
связь, но не доказательство того, что любой weight decay является канонической длиной описания
нейросети. Код должен быть определён, а не подразумеваться.
Предиктивно-последовательный код
Иногда модель не передают отдельным файлом. Отправитель и получатель заранее договариваются
об одном алгоритме обучения и кодируют данные по блокам.
1.
2.
3.
4.
Первые метки отправляются простым базовым кодом.
Обе стороны обучают модель на уже переданных примерах.
Следующий блок кодируется вероятностями этой модели.
После его получения модель переобучается, и процесс повторяется.
Полная длина равна сумме последовательных логарифмических потерь:
𝐿preq = 𝐿(𝑦1∶𝑛0 ) +
− log2 𝑞𝜃(𝐷<𝑗 ) (𝑦𝐵𝑗 ∣ 𝑥𝐵𝑗 ) .
𝑗
197
Теория информации для машинного обучения
Этот код оценивает не только конечное качество, но и скорость обучения. Два представления могут
позволить одному и тому же классификатору достичь одинаковой итоговой точности. Однако если
для первого достаточно сотни примеров, а для второго нужны тысячи, первое даст более короткий
последовательный код.
Именно так работает MDL-анализ представлений (MDL probing). Вопрос «можно ли извлечь
свойство мощным классификатором?» заменяется вопросом «сколько бит нужно, чтобы передать
метки, используя это представление и заранее зафиксированный протокол обучения?». Работа Voita
и Titov рассматривает онлайн- и вариационные коды как практические способы оценить этот счёт.
Что означает результат MDL
MDL не устраняет моделирующие решения; оно заставляет их записать. Сравнение зависит от:
•
•
•
•
•
способа кодировать класс моделей;
точности параметров;
алгоритма обучения;
порядка данных и разбиения на блоки в последовательном коде;
включённых служебных расходов.
Это не делает результат произвольным. Если код и протокол зафиксированы до сравнения, длина
сообщения является точной воспроизводимой величиной для этой постановки. Правильный вывод
звучит не «модель объективно проще вообще», а «в указанном коде она даёт более короткое полное
описание данных».
198
Влад Куликов · Открытая редакция 2026.1
10.7. Сходство через совместное сжатие
Если 𝑥 и 𝑦 разделяют структуру, знание одного должно сокращать описание другого. Условная
сложность превращает эту мысль в расстояние.
Теоретическое нормализованное информационное расстояние (normalized information distance, NID)
имеет вид
NID(𝑥, 𝑦) =
max{𝐾(𝑥 ∣ 𝑦), 𝐾(𝑦 ∣ 𝑥)}
max{𝐾(𝑥), 𝐾(𝑦)}
с точностью до стандартных малых поправок в условных описаниях и нормировке. Оно мало, когда
каждый объект можно коротко восстановить из другого, и близко к единице для объектов без
существенной общей алгоритмической структуры.
Поскольку 𝐾 невычислима, на практике используют длины конкретного компрессора 𝐶 :
NCD𝐶 (𝑥, 𝑦) =
𝐶(𝑥𝑦) − min{𝐶(𝑥), 𝐶(𝑦)}
.
max{𝐶(𝑥), 𝐶(𝑦)}
Например, если
𝐶(𝑥) = 1000,
𝐶(𝑦) = 900,
𝐶(𝑥𝑦) = 1300
байт, то
NCD𝐶 (𝑥, 𝑦) =
1300 − 900
= 0.4.
1000
Идея понятна: после оплаты более короткого объекта совместное сообщение требует ещё
сравнительно небольшого дополнения.
Реальный компрессор может быть чувствителен к порядку конкатенации, поэтому часто сравнивают
𝐶(𝑥𝑦) и 𝐶(𝑦𝑥) и берут минимум или среднее. Из-за заголовков и несовершенства компрессора
практическая NCD может немного выходить за идеальный диапазон [0, 1].
199
Теория информации для машинного обучения
Что именно видит NCD
NCD не требует вручную заданного пространства признаков. Если компрессор замечает общий
словарь, повторяющиеся фрагменты, похожий синтаксис или другую совместную регулярность,
совместный код сокращается. Этот принцип применяли к текстам, геномам, музыке и другим
последовательностям.
Но практическая метрика наследует индуктивное смещение компрессора:
•
•
•
•
•
текстовый словарный кодер и кодек изображений видят разные закономерности;
маленькие файлы чувствительны к заголовкам;
формат и предобработка меняют результат;
порядок конкатенации может создавать асимметрию;
вычислимая NCD не наследует автоматически все универсальные свойства невычислимой NID.
Поэтому NCD полезна как базовая линия, не требующая ручных признаков, и как исследовательский
инструмент, но её всё равно нужно проверять на отложенной задаче и сравнивать с содержательными
альтернативами.
10.8. LLM и универсальное предсказание
LLM и предиктор Соломонова принадлежат одной карте: оба назначают вероятности продолжениям
последовательности. Но они находятся на этой карте в очень разных точках.
Точная общая часть
Для фиксированных весов, токенизатора и контекста языковая модель задаёт вычислимое
распределение
200
Влад Куликов · Открытая редакция 2026.1
𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
Если передать эти вероятности арифметическому или интервальному кодеру (range
получится обратимый компрессор. Поэтому
coder),
вероятностное предсказание + энтропийное кодирование = сжатие без потерь
— точное операциональное утверждение. Работа Language Modeling Is Compression показывает, что
большие предиктивные модели действительно можно оценивать как компрессоры разных типов
данных; для самостоятельного архива, как мы обсуждали в M6, нужно дополнительно учитывать
стоимость модели и протокола.
Концептуальная связь
Индукция Соломонова усредняет все вычислимые объяснения, взвешивая их по длине программы.
LLM реализует одно большое конечное распределение, обученное на конечных данных конкретным
алгоритмом оптимизации.
Тем не менее в её весах могут быть представлены многие регулярности, а контекст способен
выбирать между ними без обновления параметров. В специальных генеративных постановках
обучение в контексте действительно можно вывести как неявный байесовский вывод по скрытой
задаче. Например, Xie и соавторы доказывают такой механизм для структурированной смеси
скрытых марковских моделей.
Это даёт полезную интерпретацию: контекст играет роль данных, а модельное предсказание — роль
приближённого апостериорного предиктивного распределения (posterior predictive). Но область
теоремы определяется устройством предобучающего распределения и класса задач.
Где заканчивается соответствие
Обычная LLM:
•
•
•
•
•
•
имеет конечную архитектуру и конечное число параметров;
обучена на конечном наборе данных;
использует конкретный токенизатор и ограниченный контекст;
не суммирует все вычислимые полумеры;
не обладает универсальной гарантией доминирования;
может быть плохо откалибрована и уверенно ошибаться вне обучающего распределения.
Поэтому наиболее точная формулировка такова:
LLM — вычислимый последовательный предиктор и потенциальный
компрессор. Индукция Соломонова — невычислимый универсальный эталон,
относительно которого можно обсуждать широту априорного распределения
и адаптацию, но которому конкретная LLM не эквивалентна.
Эта граница не обесценивает сравнение. Она делает его полезным: мы видим точное общее ядро —
вероятностное предсказание и кодирование — и отдельно перечисляем свойства, которых конечная
обученная модель не получает автоматически.
Хорошее сжатие выбранного представления данных свидетельствует о хорошем вероятностном
моделировании этого представления. Оно не является само по себе сертификатом понимания,
фактической истинности или причинной модели мира.
10.9. Математическое углубление: AIXI
Предсказатель отвечает на вопрос «что произойдёт дальше?». Агенту нужно дополнительно решить,
что сделать.
201
Теория информации для машинного обучения
AIXI соединяет два компонента:
1. универсальную байесовскую смесь по нижнеполувычислимым хронологическим полумерам
среды; вычислимые среды входят в этот класс;
2. последовательное планирование, максимизирующее ожидаемую награду.
Схематически, после истории ℎ<𝑡 агент выбирает
∞
𝑎𝑡 ∈ arg max 𝔼𝜉
𝑎
𝛾𝑘 𝑟𝑘 ℎ<𝑡 , 𝑎𝑡 = 𝑎 ,
𝑘=𝑡
где 𝜉 — универсальная смесь сред, а 𝛾𝑘 задают горизонт или дисконтирование.
Что даёт эта конструкция
AIXI разделяет три вопроса, которые в практическом агенте легко смешать:
• какие миры считаются возможными;
• как обновляются предсказания после наблюдений;
• как предсказания превращаются в действия через функцию награды.
Поэтому AIXI полезна как нормативная схема универсального байесовского RL. Она показывает, как
алгоритмическая вероятность могла бы войти не только в прогноз, но и в принятие решений.
Почему это не верхняя граница интеллекта
AIXI невычислима. Более того, её поведение зависит от выбранной универсальной машины, класса
сред, системы вознаграждения и горизонта. Для AIXI нет теоремы инвариантности, которая делала
бы все разумные универсальные априорные распределения практически эквивалентными.
Некоторые классические свойства оптимальности также слабее, чем звучат вне контекста. В классе
всех вычислимых сред каждая политика может оказаться Pareto-optimal в слишком широком
смысле; самооптимизация возможна лишь для классов сред, допускающих самооптимизирующиеся
политики. Leike и Hutter показывают, что неудачный выбор универсальной машины способен
радикально изменить поведение агента.
Поэтому AIXI разумно читать как идеализированную математическую декомпозицию
универсального агента, а не как практический алгоритм или машинно-независимый максимум
возможного интеллекта.
10.10. Факультативный физический мост: принцип Ландауэра
Алгоритмическая длина описания и физическая энергия вычисления — разные величины. Связь с
термодинамикой появляется через логически необратимые операции.
Рассмотрим симметричную однобитную память, которая до стирания с равными вероятностями
находится в состояниях 0 и 1. Операция erase переводит оба состояния в один стандартный ноль:
0 ↦ 0,
1 ↦ 0.
По выходу невозможно восстановить вход: операция логически необратима. В изотермическом
квазистатическом пределе при температуре 𝑇 минимальное среднее тепло, передаваемое среде при
таком стирании, равно
𝑄min = 𝑘𝐵 𝑇 ln 2 .
При 𝑇 ≈ 300 K:
202
Влад Куликов · Открытая редакция 2026.1
𝑄min ≈ 2.87 × 10−21 J.
Ландауэр связал этот предел именно с логической необратимостью вычислительной операции.
Эксперимент Bérut и соавторов реализовал однобитную память на коллоидной частице и показал
приближение среднего тепловыделения к пределу при медленном стирании.
Эту формулу легко применить слишком прямолинейно. Нельзя оценить энергию одного токена LLM,
просто умножив 𝑘𝐵 𝑇 ln 2 на число FLOP. Для такого перехода пришлось бы определить:
•
•
•
•
•
какие физические состояния кодируют логические биты;
где именно информация необратимо стирается;
сколько энергии уходит на память и передачу данных;
каковы утечки, тактирование и управление;
насколько устройство далеко от обратимого квазистатического режима.
Логически обратимые вычисления в принципе не требуют платы Ландауэра за каждый логический
шаг.
Реальная система конечной скорости всё равно платит за шум, управление, связь и
несовершенство устройства.
Полезно держать четыре разных счёта отдельно:
•
•
•
•
𝐾(𝑥) — длина кратчайшей программы;
вычислительная сложность — время и память алгоритма;
предел Ландауэра — минимальная термодинамическая цена определённого стирания;
энергопотребление ускорителя — свойство конкретной аппаратуры и нагрузки.
203
Теория информации для машинного обучения
10.12. Ключевые выводы модуля
Алгоритмическая теория информации меняет исходный вопрос. Вместо «сколько бит в среднем
требует источник?» она спрашивает:
Какова длина кратчайшего эффективного описания этого объекта?
Основной объект модуля — префиксная колмогоровская сложность
𝐾(𝑥) = длина кратчайшей самоделимитирующейся программы для 𝑥.
Из неё складывается единая линия.
1. Большинство длинных строк несжимаемо. Коротких программ просто недостаточно,
чтобы описать заметную долю всех строк.
2. Идеальная сложность невычислима. Реальные компрессоры дают исполнимые верхние
границы и отражают собственный класс закономерностей.
3. Шеннон и Колмогоров согласуются в среднем. Для вычислимого источника ожидаемая
𝐾 равна энтропийному счёту с добавочной стоимостью описания источника.
4. Алгоритмическая вероятность превращает краткость в априорный вес. Универсальная
смесь один раз оплачивает описание вычислимого источника и затем конкурирует с ним по
последовательной логарифмической потере.
5. MDL делает идею практической. Код «модель + данные при модели» позволяет сравнивать
подгонку, сложность и скорость обучения в битах.
6. Совместное сжатие даёт меру сходства. NCD полезна тогда, когда выбранный компрессор
видит общую структуру объектов.
7. LLM находится на той же карте предсказания и сжатия, но не является индукцией
Соломонова. Точное общее ядро — условные вероятности и энтропийное кодирование;
универсальные гарантии не переносятся автоматически.
Самая важная инженерная привычка этого модуля:
Когда объект называют «простым» или «сложным», уточняйте язык описания,
декодер, точность, вычислительные ресурсы и включённые расходы.
Основные источники
1.
2.
3.
4.
5.
6.
7.
8.
9.
10.
11.
A. N. Kolmogorov, «Three Approaches to the Quantitative Definition of Information», 1965.
R. J. Solomonoff, «A Formal Theory of Inductive Inference, Part I» и Part II, 1964.
M. Li, P. Vitányi, «An Introduction to Kolmogorov Complexity and Its Applications», 4-е изд., 2019.
J. Rissanen, «Modeling by Shortest Data Description», 1978; P. Grünwald, «The Minimum Description
Length Principle», 2007.
E. Voita, I. Titov, «Information-Theoretic Probing with Minimum Description Length», 2020.
R. Cilibrasi, P. Vitányi, «Clustering by Compression», 2003/2005.
M. Hutter, «Universal Artificial Intelligence: Sequential Decisions Based on Algorithmic Probability»,
2005.
J. Leike, M. Hutter, «Bad Universal Priors and Notions of Optimality», 2015; «On the Computability
of AIXI», 2015/2018.
G. Delétang et al., «Language Modeling Is Compression», 2023/2024.
S. M. Xie et al., «An Explanation of In-context Learning as Implicit Bayesian Inference», 2021/2022.
R. Landauer, «Irreversibility and Heat Generation in the Computing Process», 1961; A. Bérut et al.,
«Experimental Verification of Landauer’s Principle Linking Information and Thermodynamics», 2012.
204
Модуль 11. Сравнение
распределений: f-дивергенции,
вариационные критики и
расстояние Вассерштейна
Как читать этот модуль. Основной маршрут — §§11.1–11.9. Сначала мы соберём
семейство f-дивергенций, затем увидим, как классификатор и вариационный критик
восстанавливают отношение плотностей по выборкам. После этого та же механика
приведёт к GAN, f-GAN, MINE и InfoNCE. В §11.8 мы сменим точку зрения и добавим
геометрию через интегральные вероятностные метрики, расстояние Вассерштейна и
методы на основе ядер. §11.10 — математическое углубление про сингулярные части мер,
совместную выпуклость и точные условия двойственности; его удобно оставить на второй
проход.
11.1. От двух выборок к задаче сравнения распределений
KL-дивергенция была рабочей лошадкой предыдущих модулей. Через неё мы читали кроссэнтропию, взаимную информацию, ELBO, Information Bottleneck, KL-регуляризованную политику
и MDL. Но в современной ML-задаче часто возникает более неудобная ситуация: из двух
распределений можно получать примеры, а вычислять их плотности нельзя.
Так устроен неявный генератор (implicit generator). Он быстро строит выборку
𝑋 = 𝐺𝜃 (𝑍),
но значение 𝑞𝜃 (𝑥) в отдельной точке обычно недоступно. Поэтому формула
𝐷KL (𝑃‖𝑄𝜃 ) = 𝔼𝑃 log
𝑝(𝑋)
𝑞𝜃 (𝑋)
остаётся математически осмысленной, но не превращается напрямую в вычислимую функцию
потерь.
Представим теперь более простую задачу.
вероятностями
Из первого источника приходят значения 𝑎 и 𝑏 с
𝑃 = (0.8, 0.2),
а из второго — с вероятностями
𝑄 = (0.2, 0.8).
205
Теория информации для машинного обучения
Если заранее оба источника равновероятны, оптимальный классификатор источника выдаст
Pr(𝑃 ∣ 𝑎) = 0.8,
Pr(𝑃 ∣ 𝑏) = 0.2.
Его логиты равны log 4 и − log 4. Это уже подсказка: классификатор не просто различает две выборки
— в идеале он кодирует отношение их вероятностей. Точный вывод появится в §11.4.
В реальных задачах эта схема возникает снова и снова:
•
•
•
•
•
данные 𝑃data сравниваются с распределением генератора 𝑄𝜃 ;
совместное распределение 𝑃𝑋𝑌 — с произведением маргиналов 𝑃𝑋 ⊗ 𝑃𝑌 при оценивании MI;
представления двух групп — в задаче обнаружения сдвига распределения;
выборки 𝑃 и 𝑄 — в двухвыборочном тестировании;
базовая и новая политики — при контроле отклонения агента.
Отсюда появляются три отдельных вопроса.
1. Что считать ошибкой между распределениями? Пропущенная масса, лишняя масса и
геометрическое смещение — не одно и то же.
2. Как превратить это расхождение в вычислимую цель по выборкам? Здесь появляются
классификаторы и вариационные критики.
3. Нужна ли метрика на самом пространстве объектов? f-дивергенции работают с
отношениями вероятностей; расстояние Вассерштейна дополнительно учитывает, насколько
далеко расположены точки.
Главная конструкция модуля такова:
Вариационный критик заменяет
обучаемой задачей на выборках.
недоступное
отношение
плотностей
Полезно сразу увидеть всю лестницу, а затем разбирать её по ступеням:
истинное расхождение ⟶ лучший критик в выбранном классе ⟶ критик, обученный на конечной выборке.
Первая стрелка может оставить вариационный разрыв, если класс функций слишком узок.
Вторая добавляет статистическую и оптимизационную ошибки. Это не повод отказываться от
критиков; это карта того, какое именно число мы получили.
206
Влад Куликов · Открытая редакция 2026.1
Если не сказано обратное, логарифмы в модуле натуральные, а информационные величины
измеряются в натах.
11.2. f-дивергенции: одна схема, разные штрафы
Пусть 𝑃 и 𝑄 имеют плотности 𝑝 и 𝑞 относительно общей базовой меры, причём на основном маршруте
пока предположим 𝑃 ≪ 𝑄 . Введём отношение плотностей
𝑟(𝑥) =
𝑝(𝑥)
.
𝑞(𝑥)
У него простое чтение:
• 𝑟(𝑥) = 1 — распределения назначают точке одинаковую относительную массу;
• 𝑟(𝑥) > 1 — 𝑄 недооценивает область по сравнению с 𝑃;
• 𝑟(𝑥) < 1 — 𝑄 выделяет области больше массы, чем 𝑃.
Теперь выберем выпуклую функцию
𝑓 ∶ (0, ∞) → ℝ,
𝑓(1) = 0.
Она задаёт шкалу: насколько дорого обходится каждое значение отношения 𝑟. Соответствующая fдивергенция равна
𝐷𝑓 (𝑃‖𝑄) =
𝑞(𝑥)𝑓
𝑝(𝑥)
𝑑𝑥 = 𝔼𝑄 [𝑓(𝑟(𝑋))] .
𝑞(𝑥)
Иными словами, 𝑓 — это шкала цены для ошибок в отношении плотностей. Разные шкалы
дают разные расхождения.
Почему дивергенция неотрицательна
Поскольку
𝔼𝑄 [𝑟] =
𝑞
𝑝
= 1,
𝑞
неравенство Йенсена даёт
𝐷𝑓 (𝑃‖𝑄) = 𝔼𝑄 [𝑓(𝑟)] ≥ 𝑓(𝔼𝑄 𝑟) = 𝑓(1) = 0.
Здесь есть полезная тонкость: сама функция 𝑓(𝑡) не обязана быть неотрицательной при каждом 𝑡.
Неотрицателен её средний счёт при условии 𝔼𝑄 𝑟 = 1. Именно поэтому на графике некоторые
эквивалентные генераторы могут заходить ниже нуля, не создавая отрицательной дивергенции.
Равенство всегда выполняется при 𝑃 = 𝑄 . Чтобы из 𝐷𝑓 (𝑃‖𝑄) = 0 следовало 𝑃 = 𝑄 , нужна достаточная
строгость выпуклости 𝑓 на фактическом диапазоне 𝑟.
Основные представители
В курсе используется следующая нормировка:
Расхождение
Генератор 𝑓(𝑡)
Явная форма
Прямая KL 𝐷KL (𝑃‖𝑄)
Обратная KL 𝐷KL (𝑄‖𝑃)
𝑡 log 𝑡
− log 𝑡
∫ 𝑝 log(𝑝/𝑞)
∫ 𝑞 log(𝑞/𝑝)
207
Теория информации для машинного обучения
Расхождение
2
𝜒 Пирсона
Квадрат расстояния Хеллингера
Полная вариация (TV)
Jensen–Shannon
Генератор 𝑓(𝑡)
Явная форма
2
∫ 𝑞(𝑝/𝑞 − 1)2
1
∫(√𝑝 − √𝑞)2
2
1
∫ |𝑝 − 𝑞|
(𝑡 − 1)
1
(√𝑡 − 1)2
2
1
|𝑡 − 1|
2
1
2
𝑡 log
2𝑡
1+𝑡
+ log
2
1
2
1
𝐷KL (𝑃‖𝑀) + 𝐷KL (𝑄‖𝑀),
2
𝑀 = (𝑃 + 𝑄)/2
1+𝑡
2
При этой нормировке
0 ≤ 𝐻2 (𝑃, 𝑄) ≤ 1,
0 ≤ TV(𝑃, 𝑄) ≤ 1,
0 ≤ 𝐷JS (𝑃, 𝑄) ≤ log 2.
Почему генератор не единственен
Если заменить 𝑓 на
𝑓(𝑡) = 𝑓(𝑡) + 𝑎(𝑡 − 1),
то
𝔼𝑄 [𝑎(𝑟 − 1)] = 𝑎(𝔼𝑄 𝑟 − 1) = 0.
Следовательно,
𝐷𝑓 (𝑃‖𝑄) = 𝐷𝑓 (𝑃‖𝑄).
Поэтому в разных таблицах можно встретить внешне разные формулы для одного и того же
расхождения. Они отличаются линейным членом, который исчезает после усреднения.
208
Влад Куликов · Открытая редакция 2026.1
Соседнее семейство: степенные дивергенции и дивергенции Реньи
Для 𝛼 ≠ 0, 1 функция
𝑓𝛼 (𝑡) =
𝑡 𝛼 − 𝛼𝑡 + 𝛼 − 1
𝛼(𝛼 − 1)
выпукла и задаёт семейство степенных f-дивергенций. В пределах 𝛼 → 1 и 𝛼 → 0 возникают
генераторы, аффинно эквивалентные прямой и обратной KL.
Для 𝛼 > 0, 𝛼 ≠ 1, дивергенция Реньи
𝐷𝛼R (𝑃‖𝑄) =
1
log
𝛼−1
𝑝𝛼 𝑞1−𝛼
использует ту же степенную сумму, но затем применяет к ней логарифм. Поэтому она является
монотонным преобразованием соответствующей степенной дивергенции и при фиксированном
𝛼 задаёт тот же порядок пар распределений, однако сама в общем случае не имеет формы
𝔼𝑄 [𝑓(𝑝/𝑞)]. Свойства f-дивергенций нельзя переносить на неё только по сходству обозначений.
11.3. Какие различия видят f-дивергенции
f-дивергенция смотрит на то, как одна мера перераспределяет вероятность относительно другой. Из
этой конструкции следуют и её сильные стороны, и естественная граница.
Обработка не увеличивает различимость
Пусть к 𝑃 и 𝑄 применяется один и тот же стохастический канал 𝐾(𝑑𝑦 ∣ 𝑥). Обозначим выходные
распределения через 𝑃𝑌 и 𝑄𝑌 . Тогда
𝐷𝑓 (𝑃𝑌 ‖𝑄𝑌 ) ≤ 𝐷𝑓 (𝑃‖𝑄) .
Это неравенство обработки данных (data processing inequality, DPI).
Короткое доказательство показывает механизм. Пусть
𝑟(𝑋) =
𝑑𝑃
(𝑋).
𝑑𝑄
Отношение плотностей после канала равно условному среднему исходного отношения:
𝑑𝑃𝑌
(𝑌) = 𝔼𝑄 [𝑟(𝑋) ∣ 𝑌].
𝑑𝑄𝑌
По условному Йенсену
𝐷𝑓 (𝑃𝑌 ‖𝑄𝑌 ) = 𝔼𝑄𝑌 𝑓 𝔼𝑄 [𝑟(𝑋) ∣ 𝑌]
≤ 𝔼𝑄 [𝑓(𝑟(𝑋))]
= 𝐷𝑓 (𝑃‖𝑄).
Вот и вся механика: канал заменяет точное отношение 𝑟(𝑋) его условным средним. Усреднение
сглаживает различия, а выпуклость не позволяет среднему штрафу вырасти.
Для представления 𝑍 = 𝑇(𝑋) вывод читается так: после фиксированного энкодера две группы данных
нельзя сделать более различимыми на уровне распределений, чем они были во входе. При
209
Теория информации для машинного обучения
этом ограниченный линейный классификатор вполне может работать по 𝑍 лучше, чем по 𝑋: энкодер
способен сделать уже существующее различие доступнее выбранному классу считывающих моделей.
Инвариантность к обратимой перепараметризации
Если 𝑇 — измеримая биекция с измеримым обратным отображением, то
𝐷𝑓 (𝑇# 𝑃‖𝑇# 𝑄) = 𝐷𝑓 (𝑃‖𝑄).
При гладкой замене координат якобианы в отношении плотностей сокращаются. Поэтому fдивергенция не зависит от того, описали ли мы один и тот же объект в исходных координатах, после
нормализации или через обратимое преобразование признаков.
Это сильная инвариантность. Но она же подсказывает границу: f-дивергенция не использует
внешнюю геометрию пространства. Она знает, как соотносятся вероятности, но не знает,
близки ли две разные точки по евклидовой, косинусной или перцептивной метрике.
Что выбирает функция 𝑓
При фиксированном направлении 𝐷𝑓 (𝑃‖𝑄) большие значения
𝑟=
𝑝
𝑞
соответствуют областям, где модель 𝑄 недооценивает данные 𝑃. Малые значения 𝑟 — областям, где
𝑄 выделяет больше массы, чем 𝑃.
Разные 𝑓 по-разному взвешивают эти два типа ошибки. Поэтому при ограниченном модельном
семействе они могут выбирать разные проекции одного и того же распределения:
• прямая KL дорого штрафует области с заметной массой 𝑃, которым 𝑄 назначила слишком малую
вероятность;
• обратная KL дорого штрафует массу 𝑄 в областях, где 𝑃 почти отсутствует;
• ограниченные JS, расстояние Хеллингера и TV постепенно насыщаются при сильном
расхождении.
Отсюда возникает знакомая эвристика: прямая KL часто ведёт к покрытию мод, обратная — к выбору
одной из них. В M3 мы видели это на аппроксимации смеси одной гауссианой. Формулировать
210
Влад Куликов · Открытая редакция 2026.1
результат следует именно так: это типичное поведение проекции в ограниченное семейство,
а не универсальный закон любого алгоритма с данной аббревиатурой в функции потерь.
Когда носители не пересекаются
Пусть 𝑃 и 𝑄 взаимно сингулярны.
граничных значений:
Тогда распространённые f-дивергенции достигают своих
𝐷JS (𝑃, 𝑄) = log 2,
TV(𝑃, 𝑄) = 1,
𝐻 2 (𝑃, 𝑄) = 1,
а прямая KL и 𝜒 2 Пирсона в соответствующих направлениях становятся бесконечными.
Числа здесь разные. Общим является другое: они больше не сообщают, насколько далеко друг от
друга находятся носители. Точки на расстоянии 10−3 и 103 могут получить один и тот же JS-счёт.
В §11.8 именно эта потерянная геометрия приведёт нас к расстоянию Вассерштейна.
11.4. Классификатор оценивает отношение плотностей
Теперь вернёмся к игре из начала модуля и выведем её точно.
Сформируем бинарную выборку:
• с вероятностью 𝜋 берём 𝑋 ∼ 𝑃 и ставим метку 𝐶 = 1;
• с вероятностью 1 − 𝜋 берём 𝑋 ∼ 𝑄 и ставим метку 𝐶 = 0.
По формуле Байеса оптимальный вероятностный классификатор равен
𝐷∗ (𝑥) = Pr(𝐶 = 1 ∣ 𝑋 = 𝑥) =
𝜋𝑝(𝑥)
.
𝜋𝑝(𝑥) + (1 − 𝜋)𝑞(𝑥)
Разделим вероятность первого класса на вероятность второго:
𝐷∗ (𝑥)
𝜋𝑝(𝑥)
=
.
1 − 𝐷∗ (𝑥)
(1 − 𝜋)𝑞(𝑥)
После логарифмирования получаем
logit 𝐷 ∗ (𝑥) = log
𝜋
𝑝(𝑥)
+ log
.
𝑞(𝑥)
1−𝜋
При равных априорных вероятностях классов второй член исчезает:
logit 𝐷 ∗ (𝑥) = log
211
𝑝(𝑥)
.
𝑞(𝑥)
Теория информации для машинного обучения
В двухточечном примере из §11.1:
𝐷∗ (𝑎) = 0.8,
𝐷 ∗ (𝑏) = 0.2,
и поэтому
logit 𝐷 ∗ (𝑎) = log 4,
logit 𝐷 ∗ (𝑏) = − log 4.
Идеальный классификатор восстанавливает именно тот логарифм отношения, который нужен KL и
многим другим дивергенциям.
Это один из центральных приёмов вывода без явного правдоподобия (likelihood‐free inference):
вместо двух плотностей оценивается одна функция, различающая их выборки.
На этом месте важно различить две задачи:
• классификация источника требует правильного решения или ранжирования;
• оценивание отношения плотностей требует ещё и хорошо откалиброванных вероятностей.
При почти разделимых классах точность классификации может быть идеальной, а логиты
— произвольно завышенными.
Поэтому высокий результат классификации подтверждает
различимость выборок, но сам по себе ещё не даёт точной численной оценки отношения 𝑝/𝑞 .
11.5. Вариационная форма: как сделать расхождение обучаемым
Классификация дала один способ получить отношение плотностей.
механизм, который работает сразу для всего семейства f-дивергенций.
От неравенства Фенхеля к нижней границе
Для выпуклой 𝑓 определим сопряжённую функцию
𝑓 ∗ (𝑠) = sup{𝑠𝑡 − 𝑓(𝑡)} .
𝑡>0
Из определения следует неравенство Фенхеля:
212
Теперь выведем общий
Влад Куликов · Открытая редакция 2026.1
𝑓(𝑡) ≥ 𝑠𝑡 − 𝑓 ∗ (𝑠)
для любого допустимого 𝑠. Выберем в каждой точке 𝑠 = 𝑇(𝑥) и подставим 𝑡 = 𝑝(𝑥)/𝑞(𝑥):
𝑝
𝑝
≥ 𝑇 − 𝑓 ∗ (𝑇).
𝑞
𝑞
𝑓
Умножим на 𝑞 и проинтегрируем:
𝑝
𝑞
𝑝
≥ 𝔼𝑄 𝑇 − 𝑓 ∗ (𝑇)
𝑞
𝐷𝑓 (𝑃‖𝑄) = 𝔼𝑄 𝑓
= 𝔼𝑃 [𝑇] − 𝔼𝑄 [𝑓 ∗ (𝑇)].
Следовательно, каждая допустимая функция 𝑇 даёт нижнюю границу:
𝔼𝑃 [𝑇] − 𝔼𝑄 [𝑓 ∗ (𝑇)] ≤ 𝐷𝑓 (𝑃‖𝑄) .
Если класс функций достаточно богат и условия двойственности выполнены, можно взять супремум:
𝐷𝑓 (𝑃‖𝑄) = sup 𝔼𝑃 [𝑇(𝑋)] − 𝔼𝑄 [𝑓 ∗ (𝑇(𝑋))] .
𝑇
Для дифференцируемой строго выпуклой 𝑓 поточечный оптимум удовлетворяет
𝑇 ∗ (𝑥) = 𝑓 ′
𝑝(𝑥)
𝑞(𝑥)
.
Если 𝑓 ′ обратима, идеальный критик позволяет восстановить отношение плотностей:
𝑝(𝑥)
= (𝑓 ′ )−1 (𝑇 ∗ (𝑥)).
𝑞(𝑥)
213
Теория информации для машинного обучения
Теперь роль критика видна точно. Он не обязан выдавать вероятность класса; в общем случае он
учится преобразованному отношению плотностей, выбранному функцией 𝑓.
От теоремы к обучению нейросети
Пусть 𝒯 — класс критиков, например нейросети фиксированной архитектуры. Тогда
sup 𝔼𝑃 𝑇 − 𝔼𝑄 𝑓 ∗ (𝑇) ≤ 𝐷𝑓 (𝑃‖𝑄).
𝑇∈𝒯
В практическом запуске к этому добавляются ещё три слоя приближения:
1. ожидания заменяются средними по конечной выборке;
2. оптимизатор находит не лучший критик даже внутри 𝒯 ;
3. один и тот же набор данных часто используется для настройки критика и для отчёта его
значения.
Последний пункт особенно важен. Для фиксированного 𝑇 популяционная цель является нижней
границей. Но максимум эмпирической цели по гибкому классу может переобучиться и оказаться
выше истинной дивергенции. Надёжный протокол отделяет обучение критика от оценки на
отложенных парах и проверяет перестановочную базовую линию.
KL: формы NWJ и Donsker–Varadhan
Для прямой KL возьмём
𝑓(𝑡) = 𝑡 log 𝑡.
Её сопряжённая функция равна
214
Влад Куликов · Открытая редакция 2026.1
𝑓 ∗ (𝑠) = 𝑒 𝑠−1 .
Общая формула даёт
𝐷KL (𝑃‖𝑄) = sup 𝔼𝑃 [𝑇] − 𝔼𝑄 [𝑒 𝑇−1 ] .
𝑇
В литературе по оцениванию MI эту запись часто называют формой Nguyen–Wainwright–Jordan, или
NWJ. Её оптимальный критик:
𝑇 ∗ (𝑥) = 1 + log
𝑝(𝑥)
.
𝑞(𝑥)
Другая точная форма KL — Donsker–Varadhan:
𝐷KL (𝑃‖𝑄) = sup 𝔼𝑃 [𝐺] − log 𝔼𝑄 [𝑒 𝐺 ] .
𝐺
Связь между ними удобно увидеть, а не запоминать. Положим 𝑇 = 𝐺 + 𝑐 в NWJ-цели:
𝔼𝑃 [𝐺] + 𝑐 − 𝑒 𝑐−1 𝔼𝑄 [𝑒 𝐺 ].
Максимум по свободному сдвигу 𝑐 достигается при
𝑐 ∗ = 1 − log 𝔼𝑄 [𝑒 𝐺 ].
После подстановки остаётся DV-цель. Поэтому оптимальный DV-критик определён с точностью до
константы:
𝐺 ∗ (𝑥) = log
𝑝(𝑥)
+ const.
𝑞(𝑥)
Обе формулы точны на уровне распределений, но их конечновыборочные оценки ведут себя поразному. Экспонента и логарифм нормировочного среднего делают DV особенно чувствительной к
редким большим значениям критика.
11.6. GAN и f-GAN
Теперь состязательная игра перестаёт выглядеть отдельным трюком: это один из способов обучать
вариационный критик вместе с распределением, которое он сравнивает с данными.
Исходная минимаксная игра GAN
Целевая функция Goodfellow et al. имеет вид
max 𝔼𝑃data [log 𝐷(𝑋)] + 𝔼𝑄𝜃 [log(1 − 𝐷(𝑋))] .
𝐷
Для фиксированного генератора поточечный оптимум равен
𝐷∗ (𝑥) =
𝑝data (𝑥)
.
𝑝data (𝑥) + 𝑞𝜃 (𝑥)
Подставим его обратно. Если
215
Теория информации для машинного обучения
𝑀=
1
(𝑃
+ 𝑄𝜃 ),
2 data
то
max 𝑉(𝐷, 𝑄𝜃 ) = − log 4 + 2𝐷JS (𝑃data , 𝑄𝜃 ) .
𝐷
Это сильный и точный результат: идеализированная минимаксная игра с оптимальным
дискриминатором сравнивает данные и генератор по JS-дивергенции.
Реальное обучение делает следующий шаг приближённо. Дискриминатор не оптимизируется до
конца на каждом обновлении, генератор ограничен параметрическим семейством, а вместо исходной
насыщаемой цели часто используется несатурирующаяся функция потерь
−𝔼𝑄𝜃 log 𝐷(𝑋),
которая даёт более сильный градиент на ранних этапах. Желаемая точка 𝑃data = 𝑄𝜃 сохраняется, но
отдельный шаг генератора уже не является буквальным шагом градиентного спуска по точной JS.
f-GAN
Общая вариационная форма предлагает заменить JS другой f-дивергенцией:
min max 𝔼𝑃data [𝑇𝜙 (𝑋)] − 𝔼𝑄𝜃 [𝑓 ∗ (𝑇𝜙 (𝑋))] .
𝜃
𝜙
Если класс критиков достаточно богат, а внутренний максимум найден, значение внутренней задачи
равно
𝐷𝑓 (𝑃data ‖𝑄𝜃 ).
Для некоторых 𝑓 ∗ допустим не весь числовой диапазон. Поэтому выход неограниченной сети 𝑉𝜙
пропускают через специальное преобразование
216
Влад Куликов · Открытая редакция 2026.1
𝑇𝜙 (𝑥) = 𝑔𝑓 (𝑉𝜙 (𝑥)),
гарантирующее
𝑇𝜙 (𝑥) ∈ dom 𝑓 ∗ .
Выбор 𝑓 меняет сразу несколько вещей:
•
•
•
•
•
какую проекцию данных выбирает ограниченное семейство генераторов;
форму и кривизну функции потерь критика;
допустимый диапазон его выхода;
чувствительность к разным значениям отношения плотностей;
статистический компромисс между смещением и дисперсией оценки.
Удобно разделить два уровня. В идеализированной задаче дивергенция задаёт цель. В
реальном GAN динамика седловой оптимизации определяет, удастся ли к этой цели
приблизиться. Коллапс мод, осцилляции и нестабильность зависят не только от 𝑓, но и от
архитектуры, регуляризации, относительных скоростей обучения и суррогатной цели генератора.
11.7. MINE и InfoNCE
Взаимная информация уже имеет вид задачи сравнения распределений:
𝐼(𝑋; 𝑌) = 𝐷KL (𝑃𝑋𝑌 ‖𝑃𝑋 ⊗ 𝑃𝑌 ).
Совместное распределение даёт настоящие пары (𝑋, 𝑌). Произведение маргиналов даёт пары,
собранные независимо. Поэтому оценивание MI можно превратить в различение связанных и
перемешанных пар.
MINE: DV-критик для совместного распределения
MINE подставляет эту пару распределений в формулу Donsker–Varadhan:
217
Теория информации для машинного обучения
𝐼(𝑋; 𝑌) ≥ 𝔼𝑃𝑋𝑌 [𝑇𝜙 (𝑋, 𝑌)] − log 𝔼𝑃𝑋 ⊗𝑃𝑌 [𝑒 𝑇𝜙 (𝑋,𝑌) ] .
Положительные пары берутся из совместного распределения. Для произведения маргиналов можно
независимо пересэмплировать 𝑋 и 𝑌; на практике часто перемешивают 𝑌 внутри мини-батча.
Популяционная формула проста, а конечновыборочное оценивание трудно именно из-за экспоненты.
Редкие большие значения 𝑇𝜙 способны доминировать в знаменателе и создавать высокую
дисперсию. Исходная работа MINE использовала скользящее среднее для стабилизации градиента
нормировочного члена.
Хороший протокол разделяет три шага:
1. критик обучается на тренировочных парах;
2. значение оценивается на отложенных парах;
3. перестановочный эксперимент проверяет, что оцениватель возвращается к нулевой базовой
линии при разрушенной зависимости.
InfoNCE: выбор положительного кандидата
InfoNCE использует другую игру. Для каждого 𝑋 один кандидат 𝑌1 берётся из 𝑃(𝑌 ∣ 𝑋), а
iid
𝑌2 , … , 𝑌𝐾 ∼ 𝑃𝑌
служат отрицательными кандидатами. Критик должен найти положительную пару:
ℒNCE = −𝔼 log
𝑒 𝑠(𝑋,𝑌1 )
𝐾
∑𝑗=1 𝑒 𝑠(𝑋,𝑌𝑗 )
.
При этой схеме выборки
𝐼(𝑋; 𝑌) ≥ log 𝐾 − ℒNCE .
Оптимальная оценочная функция имеет вид
𝑠 ∗ (𝑥, 𝑦) = log
𝑝(𝑦 ∣ 𝑥)
+ 𝑐(𝑥),
𝑝(𝑦)
то есть снова кодирует отношение плотностей.
218
Влад Куликов · Открытая редакция 2026.1
Например, при 𝐾 = 32 и функции потерь 1.2 ната получаем
log 32 − 1.2 ≈ 2.266 ната ≈ 3.27 бита.
Это нижняя граница на MI при заданной схеме, а не самостоятельное измерение всей информации в
представлении.
Одно отношение плотностей, разные выборочные цели
MINE и InfoNCE сходятся к родственной оптимальной оценочной функции, но строят разные
вариационные задачи:
• MINE использует DV-функционал с экспоненциальным ожиданием;
• InfoNCE решает 𝐾 -классовую задачу выбора положительного кандидата.
Поэтому InfoNCE некорректно описывать как «MINE с небольшим смещением».
У InfoNCE есть явный потолок:
log 𝐾 − ℒNCE ≤ log 𝐾.
Увеличение 𝐾 поднимает этот потолок и при идеальном критике может сделать границу плотнее. Но
для обучения представлений важно не только численное значение границы: ложные отрицательные
пары, схема аугментаций, вычислительный бюджет и сложность оптимизации могут изменить
качество в последующей задаче.
Здесь возникает важное различие:
219
Теория информации для машинного обучения
Вариационная граница может быть полезной функцией обучения даже тогда,
когда её численное значение плохо оценивает само значение MI.
При большой истинной MI известные нейросетевые границы сталкиваются с компромиссом
смещения и дисперсии. Более того, без дополнительных предположений распределительносвободная нижняя граница с высокой вероятностью по 𝑁 наблюдениям не может надёжно расти
существенно быстрее порядка log 𝑁. Это ограничение относится к статистической гарантии, а не
запрещает использовать контрастивную цель как обучающий сигнал.
11.8. Интегральные вероятностные метрики: расстояние
Вассерштейна и MMD
f-дивергенции отвечают на вопрос о перераспределении вероятностной массы. Но иногда задача
должна различать близкие и далёкие несовпадения.
Две движущиеся точки
Пусть
𝑃 = 𝛿0 ,
𝑄𝜃 = 𝛿𝜃 .
При любом 𝜃 ≠ 0 носители не пересекаются, поэтому
𝐷JS (𝑃, 𝑄𝜃 ) = log 2,
TV(𝑃, 𝑄𝜃 ) = 1,
а KL бесконечна в обоих направлениях. Эти величины не меняются, когда 𝜃 движется от 10−3 к 103 .
Расстояние Вассерштейна первого порядка, напротив, видит величину сдвига:
𝑊1 (𝑃, 𝑄𝜃 ) = |𝜃| .
Этот пример объясняет, зачем нужен другой язык: не отношение плотностей, а класс тестовых
функций, чувствительных к геометрии.
220
Влад Куликов · Открытая редакция 2026.1
Интегральная вероятностная метрика
Для симметричного класса функций ℱ определим
IPMℱ (𝑃, 𝑄) = sup 𝔼𝑃 [ℎ(𝑋)] − 𝔼𝑄 [ℎ(𝑋)] .
ℎ∈ℱ
Класс ℱ задаёт, какие различия способен увидеть критик. Если функции слишком просты, разные
распределения могут иметь одинаковые ожидания для всех ℎ ∈ ℱ . Если класс богат, оценивание
становится статистически и вычислительно сложнее.
Расстояние Вассерштейна первого порядка
Пусть (𝒳, 𝑑) — полное сепарабельное метрическое пространство, например ℝ𝑑 , а 𝑃 и 𝑄 имеют
конечный первый момент. Для класса всех 1-липшицевых функций двойственность Канторовича–
Рубинштейна даёт
𝑊1 (𝑃, 𝑄) =
sup
‖ℎ‖Lip ≤1
𝔼𝑃 ℎ − 𝔼 𝑄 ℎ .
Та же величина имеет транспортную форму:
𝑊1 (𝑃, 𝑄) =
inf
𝛾∈Π(𝑃,𝑄)
𝔼(𝑋,𝑌)∼𝛾 [𝑑(𝑋, 𝑌)] .
Здесь Π(𝑃, 𝑄) — все совместные распределения с маргиналами 𝑃 и 𝑄 . Первая формула говорит о
лучшем 1-липшицевом критике; вторая — о минимальной средней стоимости переноса массы.
Расстояние Вассерштейна зависит от базовой метрики. Если умножить все координаты на сто,
транспортная цена также изменится. Это не дефект: именно метрика сообщает, какие перемещения
следует считать малыми.
WGAN: расстояние Вассерштейна как цель критика
Wasserstein GAN (WGAN) обучает критик по цели
max
‖ℎ𝜙 ‖Lip ≤1
𝔼𝑃data [ℎ𝜙 (𝑋)] − 𝔼𝑄𝜃 [ℎ𝜙 (𝑋)] .
В идеале внутренний максимум равен 𝑊1 . Главная инженерная трудность — обеспечить условие
Липшица.
Оригинальный WGAN использовал обрезку весов. WGAN-GP заменил её штрафом
𝜆𝔼𝑋 ‖∇𝑥 ℎ𝜙 (𝑋)‖2 − 1
2
на интерполированных точках. Такой штраф часто даёт более удобное обучение, но не является
глобальным сертификатом того, что нейросеть 1-липшицева на всём пространстве.
Содержательный результат WGAN состоит не в обещании, что любой запуск сойдётся, а в более
подходящей геометрии популяционной цели при близких раздельных носителях. Практическое
качество всё равно зависит от класса критиков, способа ограничения Липшица и динамики
оптимизации.
MMD: критик задаётся ядром
Если ℱ — единичный шар в пространстве с воспроизводящим ядром ℋ𝑘 , получаем максимальное
расхождение средних (maximum mean discrepancy, MMD):
221
Теория информации для машинного обучения
MMD𝑘 (𝑃, 𝑄) =
sup
‖ℎ‖ℋ𝑘 ≤1
𝔼𝑃 ℎ − 𝔼𝑄 ℎ .
Его квадрат вычисляется без внутреннего обучения нейросети:
2
MMD𝑘 (𝑃, 𝑄) = 𝔼𝑋,𝑋 ′ ∼𝑃 𝑘(𝑋, 𝑋 ′ )
− 2𝔼𝑋∼𝑃,𝑌∼𝑄 𝑘(𝑋, 𝑌)
+ 𝔼𝑌,𝑌 ′ ∼𝑄 𝑘(𝑌, 𝑌 ′ ).
Для характеристического ядра равенство MMD= 0 эквивалентно 𝑃 = 𝑄 . Например, гауссовское ядро
𝑘𝜎 (𝑥, 𝑦) = exp −
‖𝑥 − 𝑦‖2
2𝜎 2
является характеристическим на евклидовом пространстве. Но ширина 𝜎 определяет масштаб
различий: слишком малая ширина видит только локальные совпадения, слишком большая
сглаживает структуру.
MMD удобна для двухвыборочных тестов и контроля сдвига распределения: эмпирическая оценка
строится из попарных значений ядра и не требует седловой оптимизации. Цена этого удобства —
необходимость выбрать содержательное ядро; наивный расчёт также имеет квадратичную сложность
по размеру выборки.
Семейства частично пересекаются
f-дивергенции и IPM — не две непроницаемые коробки. Полная вариация допускает обе формы:
TV(𝑃, 𝑄) =
1
2
|𝑝 − 𝑞|
и
TV(𝑃, 𝑄) = sup 𝔼𝑃 ℎ − 𝔼𝑄 ℎ .
0≤ℎ≤1
Полезнее помнить механизм:
• f-дивергенция задаёт геометрию через отношение плотностей и функцию 𝑓 ;
• IPM задаёт геометрию через класс тестовых функций ℱ .
11.9. Выбор расхождения в практической задаче
Универсально лучшего расхождения нет. Выбор начинается не с названия функции потерь, а с того,
какие данные доступны и что система должна считать ошибкой.
Постановка
Естественный первый кандидат
Что проверить
Доступно нормированное
правдоподобие
KL / NLL / MLE
Есть только выборки из 𝑃 и 𝑄
классификационная оценка
отношения или вариационная
f-граница
GAN/f-GAN или IPM
направление KL, носители и
несоответствие модельного
семейства
мощность критика, калибровка,
отложенная оценка
Обучается неявный генератор
222
суррогат генератора и динамика
седловой оптимизации
Влад Куликов · Открытая редакция 2026.1
Постановка
Естественный первый кандидат
Что проверить
Важна геометрическая близость
носителей
Нужен двухвыборочный тест
расстояние Вассерштейна
базовая метрика и способ контроля
Липшица
ядро/критик выбираются без
утечки тестовой выборки
схема негативов,
смещение–дисперсия и отличие
границы от MI
MMD или классификационный
тест
InfoNCE, NWJ, DV и другие
границы
MI используется как функция
обучения
Перед выбором полезно ответить на четыре вопроса.
1. Что можно вычислить?
Есть ли доступ к 𝑝(𝑥) и 𝑞(𝑥), или только к выборкам? Можно ли дифференцировать через генератор?
Есть ли естественные положительные и отрицательные пары?
2. Какая ошибка важна?
Нужно ли дорого штрафовать пропущенную массу, лишнюю массу, геометрический сдвиг, изменение
отдельных моментов или любую различимость выбранным классом функций?
3. Что действительно оптимизируется?
Точное расхождение, нижняя граница, конечновыборочный оцениватель и суррогатная функция
потерь генератора — разные объекты. Их оптимумы могут совпадать в идеале, но траектории
обучения и статистические свойства различаются.
4. Как будет проверяться результат?
Число критика следует дополнять независимыми проверками: значением цели на отложенных
данных, метрикой последующей задачи, визуальным или предметным контролем, перестановочной
базовой линией, несколькими ядрами или несколькими классами критиков.
Итоговый принцип можно сформулировать без лозунга о «лучшем расстоянии»:
Хорошее расхождение согласует три вещи: смысл ошибки, доступный способ
оценивания и геометрию пространства, в котором работает модель.
11.10. Математическое углубление: общая мера и точная
двойственность
Можно пропустить при первом чтении. Здесь мы делаем строгими места, которые в
основном маршруте были сформулированы для плотностей с 𝑃 ≪ 𝑄 .
Общая f-дивергенция и сингулярная часть
Пусть 𝑃 и 𝑄 доминируются мерой 𝜇:
𝑝=
𝑑𝑃
,
𝑑𝜇
𝑞=
𝑑𝑄
.
𝑑𝜇
Определим граничные значения
𝑓(𝑡)
.
𝑡→∞ 𝑡
𝑓∞′ = lim
𝑓(0) = lim 𝑓(𝑡),
𝑡↓0
223
Теория информации для машинного обучения
Тогда расширенная f-дивергенция равна
𝐷𝑓 (𝑃‖𝑄) =
𝑞𝑓
{𝑞>0}
𝑝
𝑑𝜇 + 𝑓∞′ 𝑃{𝑞 = 0} .
𝑞
Формула не зависит от выбора общей доминирующей меры. Если 𝑃 ⟂ 𝑄 , то
𝐷𝑓 (𝑃‖𝑄) = 𝑓(0) + 𝑓∞′ .
Отсюда сразу получаются граничные значения:
•
•
•
•
TV: 1;
квадрат расстояния Хеллингера в нашей нормировке: 1;
JS: log 2;
прямая KL и 𝜒 2 Пирсона: +∞.
Совместная выпуклость
Функция двух неотрицательных аргументов
𝜓(𝑝, 𝑞) = 𝑞𝑓(𝑝/𝑞)
является перспективой выпуклой функции 𝑓 и потому совместно выпукла по (𝑝, 𝑞).
интегрирования получаем для 0 ≤ 𝜆 ≤ 1:
После
𝐷𝑓 𝜆𝑃1 + (1 − 𝜆)𝑃2 ‖ 𝜆𝑄1 + (1 − 𝜆)𝑄2
≤ 𝜆𝐷𝑓 (𝑃1 ‖𝑄1 ) + (1 − 𝜆)𝐷𝑓 (𝑃2 ‖𝑄2 ).
Это формальное выражение простой идеи: смешивание двух задач сравнения не создаёт больше
расхождения, чем средний счёт до смешивания.
Когда вариационный супремум точен
Тождество
𝐷𝑓 (𝑃‖𝑄) = sup 𝔼𝑃 𝑇 − 𝔼𝑄 𝑓 ∗ (𝑇)
𝑇
требует выпуклости и нижней полунепрерывности 𝑓, корректной области 𝑓 ∗ , достаточно богатого
класса измеримых функций и условий, позволяющих выбрать поточечный оптимум и обменять
интегрирование с супремумом.
Если 𝑓 дифференцируема, оптимум имеет вид
𝑇 ∗ (𝑥) = 𝑓 ′
𝑝(𝑥)
.
𝑞(𝑥)
Если 𝑓 недифференцируема, например для TV, вместо производной используется субградиент:
𝑇 ∗ (𝑥) ∈ 𝜕𝑓
𝑝(𝑥)
.
𝑞(𝑥)
Нейросетевой класс почти всегда уже полного класса измеримых функций. Поэтому выражение,
оптимизированное в коде, корректнее называть вариационной нижней границей, пока точность
для выбранной архитектуры и процедуры не доказана отдельно.
224
Влад Куликов · Открытая редакция 2026.1
11.12. Заключение
KL привела нас к этому модулю, но итог оказался шире одной дивергенции.
f-дивергенции собирают большой класс расхождений в одну формулу:
𝐷𝑓 (𝑃‖𝑄) = 𝔼𝑄 𝑓
𝑝
.
𝑞
Функция 𝑓 задаёт, как оцениваются разные ошибки в отношении плотностей. Неравенство обработки
данных объясняет, почему фиксированная обработка не усиливает популяционную различимость, а
насыщение на раздельных носителях показывает, где отношению плотностей не хватает внешней
геометрии.
Двойственность Фенхеля превращает недоступное расхождение в обучаемую задачу:
𝐷𝑓 (𝑃‖𝑄) = sup 𝔼𝑃 𝑇 − 𝔼𝑄 𝑓 ∗ (𝑇) .
𝑇
В идеале критик восстанавливает преобразование 𝑝/𝑞 . В реальном запуске он работает внутри
ограниченного класса, по конечной выборке и с конечным числом шагов оптимизации. Поэтому
значение критика полезно ровно настолько, насколько ясно описан этот протокол.
Та же механика связывает несколько, на первый взгляд, разных методов:
•
•
•
•
•
вероятностный классификатор оценивает логарифм отношения плотностей;
исходная минимаксная игра GAN при оптимальном дискриминаторе связана с JS;
f-GAN меняет функцию 𝑓 и сопряжённую функцию потерь критика;
MINE сравнивает совместные и перемешанные пары через DV;
InfoNCE решает многовыборочную классификационную задачу с тем же отношением
плотностей в оптимальной оценочной функции.
Когда расстояние между точками имеет смысл само по себе, язык меняется. Расстояние Вассерштейна
задаёт стоимость переноса в базовой метрике, а MMD — различимость классом функций,
определённым ядром.
Главный инженерный вывод модуля:
Расхождение выбирают не по репутации его названия, а по тому, какую
ошибку оно считает дорогой, как его можно оценить и какая геометрия нужна
задаче.
В Модуле 12 вариационный аппарат появится в другой роли. KL будет измерять, насколько зависящее
от данных апостериорное распределение отклонилось от априорного, а PAC-Bayes превратит эту
стоимость в границу обобщения.
Основные источники
1. X. Nguyen, M. Wainwright, M. Jordan, Estimating Divergence Functionals and the Likelihood Ratio
by Convex Risk Minimization, 2010.
2. S. Nowozin, B. Cseke, R. Tomioka, f-GAN: Training Generative Neural Samplers using Variational
Divergence Minimization, 2016.
3. I. Goodfellow et al., Generative Adversarial Nets, 2014.
4. M. Belghazi et al., MINE: Mutual Information Neural Estimation, 2018.
5. A. van den Oord, Y. Li, O. Vinyals, Representation Learning with Contrastive Predictive Coding, 2018.
6. B. Poole et al., On Variational Bounds of Mutual Information, 2019.
7. D. McAllester, K. Stratos, Formal Limitations on the Measurement of Mutual Information, 2020.
8. M. Arjovsky, S. Chintala, L. Bottou, Wasserstein GAN, 2017.
9. I. Gulrajani et al., Improved Training of Wasserstein GANs, 2017.
10. A. Gretton et al., A Kernel Two-Sample Test, 2012.
225
Модуль 12. Информационные
границы обобщения: PAC-Bayes и
взаимная информация
Как читать этот модуль. Основной маршрут — §§12.1–12.9. Сначала мы увидим,
почему выбор лучшей модели по той же выборке делает её оценку оптимистичной. Затем
построим два способа оплатить эту адаптивность: PAC-Bayes-сертификат через 𝐷KL (𝑄‖𝑃)
и границу в среднем через 𝐼(𝑊; 𝑆). В §12.7 эти две записи встретятся в точном тождестве.
§12.10 — математическое углубление про априорные распределения, зависящие от данных,
MI по отдельным примерам и условную MI; его удобно оставить на второй проход.
12.1. Почему лучшая обучающая ошибка почти неизбежно
слишком хороша
Представим 32 классификатора. У каждого одна и та же истинная вероятность ошибки:
𝐿(𝑤𝑗 ) = 0.2,
𝑗 = 1, … , 32.
Ни один из них не лучше остальных. Но мы проверяем все 32 на одной выборке из 80 примеров
и оставляем классификатор с минимальной эмпирической ошибкой.
В воспроизводимом
эксперименте этого модуля ошибка победителя в среднем получается около
0.113,
хотя его истинная ошибка по-прежнему равна 0.2.
Алгоритм не обнаружил скрыто более сильную модель.
Он обнаружил благоприятную
случайную флуктуацию. Чем больше вариантов мы просмотрели, тем выше шанс, что один
из них случайно окажется особенно удачным именно на этой выборке.
Та же механика работает в большом ML-пайплайне:
•
•
•
•
•
•
мы подбираем архитектуру;
запускаем несколько инициализаций;
выбираем эпоху по метрике;
настраиваем гиперпараметры;
сравниваем варианты предобработки;
иногда много раз смотрим на один и тот же валидационный набор.
Каждый отдельный результат может быть честной оценкой фиксированной модели. Но победитель
выбирается после просмотра этих оценок. Поэтому его число уже содержит смещение выбора.
Запишем обучение как случайное отображение
226
Влад Куликов · Открытая редакция 2026.1
𝑆 ⟶ 𝑊 = 𝐴(𝑆),
где
𝑆 = (𝑍1 , … , 𝑍𝑛 ) ∼ 𝒟 𝑛
— обучающая выборка, а 𝑊 — индекс гипотезы, параметры сети или случайная модель, возвращённая
алгоритмом.
Для функции потерь
0 ≤ 𝓁(𝑤, 𝑧) ≤ 1
определим истинный и эмпирический риски:
𝐿(𝑤) = 𝔼𝑍∼𝒟 [𝓁(𝑤, 𝑍)],
1
𝐿𝑆 (𝑤) =
𝑛
𝑛
𝓁(𝑤, 𝑍𝑖 ).
𝑖=1
Разность
gen(𝑤, 𝑆) = 𝐿(𝑤) − 𝐿𝑆 (𝑤)
называется разрывом обобщения (generalization gap). Положительный разрыв означает, что
обучающая оценка была оптимистичнее популяционной.
Если не сказано обратное, логарифмы в модуле натуральные, а KL и взаимная информация
измеряются в натах.
Главная проблема здесь не в том, что алгоритму запрещено смотреть на данные. Обучение без данных
было бы бессмысленным. Проблема в другом:
Адаптивность нужно оплатить: чем сильнее результат зависит от случайных
деталей выборки, тем большую статистическую цену мы должны добавить к
обучающей ошибке.
В этом модуле появятся две книги учёта.
1. PAC-Bayes сравнивает зависящее от данных распределение моделей 𝑄𝑆 с заранее выбранным
распределением 𝑃 и выставляет счёт
𝐷KL (𝑄𝑆 ‖𝑃).
2. Информационная граница рассматривает обучение как канал 𝑆 → 𝑊 и измеряет
𝐼(𝑊; 𝑆).
227
Теория информации для машинного обучения
Обе конструкции локальнее грубого подсчёта всего класса гипотез. Но они отвечают на разные
вопросы и дают разные типы гарантий. PAC-Bayes обычно сертифицирует конкретную выборку
с высокой вероятностью. Базовая MI-граница контролирует ожидаемый разрыв по случайной
выборке и случайности алгоритма.
Это различие будет важно на протяжении всего модуля.
12.2. От фиксированной модели к адаптивному выбору
Фиксированная модель
Пусть 𝑤 выбрано до того, как появилась выборка 𝑆. Тогда неравенство Хёфдинга даёт
2
Pr |𝐿(𝑤) − 𝐿𝑆 (𝑤)| ≥ 𝜀 ≤ 2𝑒 −2𝑛𝜀 .
Здесь всё устроено просто: мы сравниваем среднее независимых ограниченных величин с их
математическим ожиданием.
Но обученная модель
𝑊 = 𝐴(𝑆)
не является заранее фиксированной. Она выбиралась именно потому, что хорошо выглядела на 𝑆.
Подставить 𝑊 в границу для фиксированного 𝑤 нельзя: зависимость результата от выборки — и есть
то, что требуется учесть.
Равномерная сходимость
Классический выход состоит в том, чтобы потребовать хорошую оценку одновременно для всех
моделей класса ℋ . Если класс конечен, объединяющая оценка даёт
2
Pr sup |𝐿(𝑤) − 𝐿𝑆 (𝑤)| ≥ 𝜀 ≤ 2|ℋ|𝑒 −2𝑛𝜀 .
𝑤∈ℋ
Следовательно, с вероятностью не меньше 1 − 𝛿 :
228
Влад Куликов · Открытая редакция 2026.1
sup |𝐿(𝑤) − 𝐿𝑆 (𝑤)| ≤
𝑤∈ℋ
ln(2|ℋ|/𝛿)
.
2𝑛
Цена выбора среди |ℋ| вариантов входит как ln |ℋ|. Это уже информационная подсказка: чтобы
назвать одного победителя среди 𝑀 кандидатов, требуется порядка log 𝑀 бит.
Для бесконечных классов роль размера играют VC-размерность, сложность Радемахера, нормы,
отступы и другие меры сложности.
Здесь легко сделать слишком сильный вывод. Равномерные границы не «ошибаются на нейросетях».
Они дают корректную гарантию наихудшего случая для всего класса. Проблема в том, что грубая
глобальная сложность огромной сети часто делает численную границу вакуумной — больше единицы
для риска в [0, 1].
Но реальный алгоритм не исследует весь класс одинаково. SGD, архитектура, предобучение,
регуляризация и данные направляют его в малую часть пространства параметров. Поэтому
естественно спросить не только
насколько велик весь класс?
но и
насколько сложен именно результат, который вернул этот алгоритм на этой выборке?
Адаптивный выбор в миниатюре
Вернёмся к 32 одинаково хорошим гипотезам. Жёсткий выбор
𝑊 = arg min 𝐿𝑆 (𝑤𝑗 )
𝑗
почти полностью определяется случайными различиями между эмпирическими ошибками.
эксперименте:
В
𝐼(𝑊; 𝑆) ≈ 3.24 ната,
𝔼[gen] ≈ 0.087,
а информационная граница, которую мы выведем в §12.6, даёт около
0.142.
Если заменить argmin мягким Gibbs-выбором
Pr(𝑊 = 𝑗 ∣ 𝑆) ∝ exp −
𝐿𝑆 (𝑤𝑗 )
,
𝜏
то с ростом температуры 𝜏 выбор становится менее чувствительным к конкретным флуктуациям.
Одновременно уменьшаются и 𝐼(𝑊; 𝑆), и смещение выбора.
229
Теория информации для машинного обучения
Этот пример не доказывает, что шум всегда улучшает обучение. Он показывает более точный
механизм: рандомизация может ограничить объём выборочно-специфической информации,
использованной при выборе результата.
12.3. PAC-Bayes: распределение до данных и распределение
после обучения
PAC-Bayes меняет объект анализа. Вместо одной обученной гипотезы рассматривается распределение
над гипотезами или параметрами.
• 𝑃 — априорное распределение (prior), фиксированное независимо от сертифицирующей
выборки 𝑆;
• 𝑄𝑆 — апостериорное распределение (posterior), которое может зависеть от всей выборки;
• при предсказании модель 𝑊 случайно выбирается из 𝑄𝑆 .
Названия prior и posterior пришли из байесовской статистики, но PAC-Bayes не требует, чтобы
𝑄𝑆 был обычным байесовским апостериорным распределением. Это могут быть любые две
вероятностные меры, удовлетворяющие условиям теоремы.
Определим риск Gibbs-предиктора:
𝐿(𝑄) = 𝔼𝑊∼𝑄 [𝐿(𝑊)],
𝐿𝑆 (𝑄) = 𝔼𝑊∼𝑄 [𝐿𝑆 (𝑊)].
230
Влад Куликов · Открытая редакция 2026.1
Здесь нужно не потерять сертифицируемый объект.
Базовая граница относится к Gibbsпредиктору: модель выбирается из 𝑄 случайно, и риск усредняется по этому выбору.
Это не то же самое, что:
1.
2.
3.
4.
сеть со средними весами 𝔼𝑄 [𝑊];
усреднение логитов или вероятностей ансамбля;
голосование большинства;
лучшая отдельная модель на носителе 𝑄 .
Иногда для этих объектов можно вывести дополнительные границы. Но заменить Gibbs-риск риском
среднего предиктора одним словом «ансамбль» нельзя.
Что оплачивает KL
Член
𝐷KL (𝑄𝑆 ‖𝑃)
измеряет, насколько сильно распределение после обучения отклонилось от заранее выбранной точки
отсчёта.
Если 𝑃 уже отдаёт большую массу областям, где находится хорошее решение, апостериорному
распределению не требуется далеко уходить. Если же 𝑄𝑆 концентрируется там, где 𝑃 почти не имеет
массы, цена велика.
Это не просто расстояние между начальными и конечными весами.
распределений, их дисперсий, носителей и параметризации.
231
KL зависит от полных
Теория информации для машинного обучения
Почему априорное распределение нельзя бесплатно обучить на той же
выборке
PAC-Bayes-теорема будет одновременно верна для всех 𝑄 , поэтому апостериорное распределение
разрешено выбирать после просмотра данных. Но 𝑃 используется внутри концентрационного
аргумента как распределение, не зависящее от 𝑆.
Если сначала обучить 𝑃 на всей сертифицирующей выборке, затем выбрать 𝑄𝑆 рядом с ним и просто
подставить маленькую KL в стандартную формулу, данные будут использованы дважды:
• для выбора точки отсчёта;
• для выбора апостериорного распределения.
Второе использование оплачено KL, первое — нет.
Корректные варианты существуют: разделение данных, иерархические априорные распределения,
дифференциально-приватный выбор или специальные теоремы для априорных распределений,
зависящих от данных. Но зависимость должна быть видна в гарантии.
12.4. PAC-Bayes-kl: сертификат для конкретной выборки
Для 𝑎, 𝑏 ∈ [0, 1] обозначим бинарную KL-дивергенцию
kl(𝑎‖𝑏) = 𝑎 ln
1−𝑎
𝑎
+ (1 − 𝑎) ln
.
𝑏
1−𝑏
Малые буквы kl здесь важны: это KL между двумя распределениями Бернулли с параметрами 𝑎 и 𝑏.
Теорема
Пусть
•
•
•
•
𝑆 ∼ 𝒟 𝑛 i.i.d.;
0 ≤ 𝓁 ≤ 1;
𝑃 не зависит от 𝑆;
𝑛 ≥ 2.
Тогда с вероятностью не меньше 1 − 𝛿 по выбору 𝑆 одновременно для всех апостериорных
распределений 𝑄 выполняется
kl 𝐿𝑆 (𝑄)‖𝐿(𝑄) ≤
𝐷KL (𝑄‖𝑃) + ln
𝑛
2√𝑛
𝛿 .
Эту форму обычно называют PAC-Bayes-kl-границей; коэффициент 2√𝑛 соответствует уточнённой
оценке экспоненциального момента Маурера.
232
Влад Куликов · Открытая редакция 2026.1
На этом месте полезно прочитать формулу словами.
•
•
•
•
Левая часть сравнивает наблюдаемый Gibbs-риск и неизвестный истинный Gibbs-риск.
Первый член справа оплачивает отклонение апостериорного распределения от априорного.
Второй задаёт уровень доверия.
Деление на 𝑛 распределяет эту цену по размеру выборки.
Обозначим правую часть через
𝑐(𝑄, 𝑆) =
𝐷KL (𝑄‖𝑃) + ln(2√𝑛/𝛿)
.
𝑛
Тогда верхний сертификат получается численной инверсией бинарной KL:
−1
𝐿(𝑄) ≤ kl+ 𝐿𝑆 (𝑄), 𝑐(𝑄, 𝑆) .
Это не декоративная форма. Точная инверсия особенно полезна, когда эмпирический риск мал.
Почему квадратное следствие теряет точность
Неравенство Пинскера даёт
kl(𝑎‖𝑏) ≥ 2(𝑎 − 𝑏)2 .
Поэтому из PAC-Bayes-kl следует более простая граница
𝐿(𝑄) ≤ 𝐿𝑆 (𝑄) +
𝐷KL (𝑄‖𝑃) + ln(2√𝑛/𝛿)
.
2𝑛
Она удобна для чтения, но заменяет точную геометрию бинарной KL параболой.
Если
𝐿𝑆 (𝑄) = 0,
233
Теория информации для машинного обучения
то
kl(0‖𝐿) = − ln(1 − 𝐿),
и потому
𝐿(𝑄) ≤ 1 − 𝑒 −𝑐 ≈ 𝑐
при малом 𝑐 . Точная граница имеет масштаб 1/𝑛, тогда как квадратное следствие даёт только 1/√𝑛.
Например, если 𝑐 = 0.01, то
1 − 𝑒 −𝑐 ≈ 0.00995,
а Пинскер даёт
𝑐/2 ≈ 0.0707.
Разница уже не косметическая.
Почему теорема верна: четыре шага
Полное доказательство остаётся в основном маршруте, потому что оно показывает центральный
механизм PAC-Bayes — перенос концентрации с независимого априорного распределения на
зависящее от данных апостериорное.
Шаг 1.
Экспоненциальный момент для фиксированной гипотезы.
фиксированного 𝑤:
𝔼𝑆 exp 𝑛 kl 𝐿𝑆 (𝑤)‖𝐿(𝑤)
Для каждого
≤ 2√𝑛.
Это усиленная концентрационная оценка для средних ограниченных случайных величин.
Шаг 2. Усреднение по априорному распределению. Поскольку 𝑃 не зависит от 𝑆, можно
поменять порядок ожиданий:
𝔼𝑆 𝔼𝑊∼𝑃 exp 𝑛 kl 𝐿𝑆 (𝑊)‖𝐿(𝑊)
≤ 2√𝑛.
Шаг 3. Переход от среднего утверждения к событию высокой вероятности.
неравенству Маркова с вероятностью не меньше 1 − 𝛿 :
𝔼𝑊∼𝑃 exp 𝑛 kl 𝐿𝑆 (𝑊)‖𝐿(𝑊)
≤
По
2√𝑛
.
𝛿
Шаг 4. Замена меры. Для любого 𝑄 и измеримой функции 𝐹 неравенство Донскера—Варадана
даёт
𝔼𝑄 [𝐹(𝑊)] ≤ 𝐷KL (𝑄‖𝑃) + ln 𝔼𝑃 𝑒 𝐹(𝑊) .
Подставим
𝐹(𝑤) = 𝑛 kl 𝐿𝑆 (𝑤)‖𝐿(𝑤) .
Тогда на событии из шага 3:
234
Влад Куликов · Открытая редакция 2026.1
𝔼𝑄 kl 𝐿𝑆 (𝑊)‖𝐿(𝑊) ≤
𝐷KL (𝑄‖𝑃) + ln(2√𝑛/𝛿)
.
𝑛
Наконец, совместная выпуклость бинарной KL даёт
kl 𝐿𝑆 (𝑄)‖𝐿(𝑄) ≤ 𝔼𝑄 kl 𝐿𝑆 (𝑊)‖𝐿(𝑊) .
Граница доказана.
Вот и вся механика: концентрация для фиксированной модели переносится на выбранное
после данных распределение ценой KL.
Обратите внимание, где использована независимость 𝑃: во втором шаге. Если 𝑃 = 𝑃𝑆 , обмен
ожиданий уже не имеет прежнего смысла, и доказательство требует дополнительного члена.
12.5. От сертификата к обучаемому распределению
PAC-Bayes можно использовать после обучения, но его естественная форма также подсказывает
целевую функцию.
Рассмотрим для 𝜆 > 0 регуляризованный функционал
ℱ𝜆 (𝑄) = 𝐿𝑆 (𝑄) +
1
𝐷 (𝑄‖𝑃).
𝜆𝑛 KL
Вариационный принцип Гиббса даёт точный оптимум:
𝑄𝜆 (𝑑𝑤) =
𝑃(𝑑𝑤)𝑒 −𝜆𝑛𝐿𝑆 (𝑤)
𝔼𝑊∼𝑃 [𝑒 −𝜆𝑛𝐿𝑆 (𝑊) ]
.
Эквивалентно,
𝑄𝜆 = arg min ℱ𝜆 (𝑄).
𝑄
Это та же экспоненциальная перенормировка, которую мы уже встречали в MaxEnt и KLрегуляризованных политиках:
• эмпирический риск наклоняет массу в сторону хороших моделей;
• априорное распределение задаёт исходную геометрию;
235
Теория информации для машинного обучения
• KL назначает цену сильному отклонению;
• 𝜆 задаёт обменный курс между подгонкой и сложностью.
Это не обязательно обычный байесовский апостериорный закон
Если
𝜆𝑛𝐿𝑆 (𝑤) = − log 𝑝(𝑆 ∣ 𝑤)
с точностью до не зависящей от 𝑤 константы, то 𝑄𝜆 совпадает с байесовским апостериорным
распределением.
Для произвольной функции потерь это обобщённый Gibbs-апостериорный закон, а не
результат обычного обновления по правдоподобию.
Кроме того, 𝑄𝜆 является точным оптимумом функционала ℱ𝜆 , но не автоматически точным
минимизатором любой выбранной PAC-Bayes-границы. Практические методы могут напрямую
минимизировать дифференцируемую форму сертификата, его инверсию или удобный суррогат.
Общий мотив остаётся тем же: эмпирический риск плюс информационная цена.
Гауссовские распределения над весами
Пусть
𝑃 = 𝒩 𝜇𝑃 , diag(𝜎𝑃2 ) ,
𝑄 = 𝒩 𝜇𝑄 , diag(𝜎𝑄2 ) .
Тогда
𝐷KL (𝑄‖𝑃) =
1
2
2
𝜎𝑄,𝑗
𝑗
2
𝜎𝑃,𝑗
+ ln
+
(𝜇𝑄,𝑗 − 𝜇𝑃,𝑗 )2
2
𝜎𝑃,𝑗
2
𝜎𝑄,𝑗
2
𝜎𝑃,𝑗
−1
.
Квадратичный член по средним действительно напоминает 𝐿2 -регуляризацию. Но это только
часть KL. Полная PAC-Bayes-постановка также учитывает дисперсии и относится к распределению
предикторов.
Поэтому корректная формулировка такова:
У гауссовского PAC-Bayes-члена есть 𝐿2 -подобная составляющая, но обычное
детерминированное затухание весов не равно полному PAC-Bayes-обучению.
То же относится к dropout. Он вводит стохастичность, но конкретная PAC-Bayes-гарантия требует
явно задать 𝑃, 𝑄 , риск и способ сертификации.
Почему точечная модель часто имеет бесконечную KL
Если 𝑃 имеет непрерывную плотность, а
𝑄 = 𝛿𝑤∗ ,
то
236
Влад Куликов · Открытая редакция 2026.1
𝐷KL (𝛿𝑤∗ ‖𝑃) = ∞.
Точечная мера не абсолютно непрерывна относительно непрерывного априорного распределения.
Поэтому для практического сертификата обычно используют:
•
•
•
•
стохастическое распределение вокруг весов;
дискретизацию или квантизацию;
априорное распределение с подходящими атомами;
отдельную теорию для голосования большинства или детерминированного предиктора.
Рандомизация здесь не магический источник обобщения. Она делает сертифицируемый объект
корректно определённым и позволяет торговать устойчивостью предсказаний против KL-цены.
12.6. MI-границы: обучение как канал от выборки к модели
Теперь откажемся от выбранного вручную априорного распределения и посмотрим на весь алгоритм
обучения как на канал
𝑆 ⟶ 𝑊.
Алгоритм может быть случайным из-за инициализации, порядка мини-батчей, dropout, добавленного
шума или явной выборки из апостериорного распределения.
Взаимная информация
𝐼(𝑊; 𝑆) = 𝐷KL 𝑃𝑊,𝑆 ‖𝑃𝑊 ⊗ 𝑃𝑆
измеряет, насколько распределение результата меняется при знании конкретной обучающей
выборки.
Это близко к интуиции «сколько данных модель запомнила», но точнее говорить:
𝐼(𝑊; 𝑆) измеряет статистическую зависимость результата алгоритма от всей
выборки.
Она не сообщает напрямую, какие примеры можно восстановить, нарушена ли приватность и
сохранены ли семантически важные факты. Для этих вопросов нужны отдельные операционные
критерии.
Теорема Xu–Raginsky
Предположим, что для каждого фиксированного 𝑤 центрированная потеря
𝓁(𝑤, 𝑍) − 𝐿(𝑤)
𝜎-субгауссовская:
ln 𝔼𝑍 exp [𝜆(𝓁(𝑤, 𝑍) − 𝐿(𝑤))] ≤
𝜆2 𝜎 2
2
для всех 𝜆 ∈ ℝ.
Тогда
𝔼 𝐿(𝑊) − 𝐿𝑆 (𝑊) ≤
237
2𝜎 2 𝐼(𝑊; 𝑆)
.
𝑛
Теория информации для машинного обучения
Если 0 ≤ 𝓁 ≤ 1, лемма Хёфдинга позволяет взять
𝜎2 =
1
,
4
и получить
|𝔼 gen| ≤
𝐼(𝑊; 𝑆)
.
2𝑛
Откуда берётся формула
Под распределением произведения 𝑃𝑆 ⊗ 𝑃𝑊 модель 𝑊 независима от выборки. Для фиксированного
𝑊 средний эмпирический риск концентрируется вокруг популяционного с субгауссовским
параметром 𝜎/√𝑛.
Но в реальном обучении используется совместное распределение 𝑃𝑆,𝑊 . Неравенство замены
меры из Модуля 11 сравнивает ожидания одной функции под совместным распределением и под
произведением маргиналов. Цена замены равна
𝐷KL 𝑃𝑆,𝑊 ‖𝑃𝑆 ⊗ 𝑃𝑊 = 𝐼(𝑊; 𝑆).
Оптимизация по параметру экспоненциального момента даёт квадратный корень. Так же, как в
PAC-Bayes, концентрация переносится с независимой постановки на зависимую. Но теперь роль
стоимости играет не KL к выбранному априорному распределению, а сама взаимная информация
алгоритма.
Численный пример адаптивного выбора
Для жёсткого выбора среди 32 одинаковых гипотез эксперимент даёт
𝐼(𝑊; 𝑆) ≈ 3.235 ната,
𝐼(𝑊; 𝑆)
≈ 0.142
2𝑛
238
Влад Куликов · Открытая редакция 2026.1
при 𝑛 = 80, тогда как наблюдаемый ожидаемый разрыв равен примерно 0.087.
Граница не точна, но она правильно отслеживает механизм: когда температура Gibbs-выбора
увеличивается, зависимость от случайных деталей выборки уменьшается, и вместе с ней уменьшается
смещение выбора.
Какой именно тип гарантии мы получили
Базовая MI-граница контролирует
𝔼𝑆,𝑊 𝐿(𝑊) − 𝐿𝑆 (𝑊) .
Это утверждение в среднем. Оно не является автоматически высоковероятностным сертификатом
для конкретной обученной модели и конкретной выборки.
Кроме того, оно относится к выбранной функции потерь.
Малый ожидаемый разрыв для
кросс-энтропии не гарантирует малый разрыв по фактической корректности, безопасности или
человеческим предпочтениям.
Почему детерминированная вещественная модель может иметь бесконечную
MI
Если 𝑊 принимает конечное число значений и является детерминированной функцией 𝑆, то
𝐼(𝑊; 𝑆) = 𝐻(𝑊) < ∞.
Но если 𝑊 — точный вещественный вектор, детерминированно вычисленный из непрерывной
выборки, совместное распределение (𝑆, 𝑊) часто сингулярно относительно 𝑃𝑆 ⊗ 𝑃𝑊 . Тогда
𝐼(𝑊; 𝑆) = ∞.
Алгоритм может хорошо обобщать, а базовая граница всё равно будет вакуумной. Это ограничение
выбранной информационной меры, а не доказательство плохого обобщения.
Добавление шума способно сделать MI конечной, но при этом меняется сам алгоритм и его
риск. Нельзя добавить шум только в доказательство и продолжать сертифицировать исходный
детерминированный предиктор без отдельного аргумента.
MI по отдельным примерам
Более локальная оценка использует зависимости 𝐼(𝑊; 𝑍𝑖 ):
1
|𝔼 gen| ≤
𝑛
𝑛
2𝜎 2 𝐼(𝑊; 𝑍𝑖 ).
𝑖=1
Она может быть существенно сильнее глобальной границы: каждый пример может влиять на
результат слабо, даже если суммарная зависимость 𝐼(𝑊; 𝑆) велика или бесконечна.
12.7. Точное разложение, связывающее PAC-Bayes и MI
Пусть алгоритм задаёт условное распределение
𝑄𝑆 = 𝑃𝑊∣𝑆 ,
а 𝑃𝑊 — маргинальное распределение результата алгоритма при случайной выборке 𝑆.
239
Теория информации для машинного обучения
Для любого фиксированного априорного распределения 𝑃, относительно которого соответствующие
KL конечны, выполняется
𝔼𝑆 𝐷KL (𝑄𝑆 ‖𝑃) = 𝐼(𝑊; 𝑆) + 𝐷KL (𝑃𝑊 ‖𝑃) .
Это точная бухгалтерия, а не аналогия.
• 𝐼(𝑊; 𝑆) — неизбежная средняя цена зависимости результата от выборки;
• 𝐷KL (𝑃𝑊 ‖𝑃) — дополнительная цена несовпадения выбранной точки отсчёта с типичным
распределением результатов алгоритма.
Доказательство
Добавим и вычтем логарифм плотности 𝑃𝑊 :
𝔼𝑆,𝑊 ln
𝑑𝑄𝑆
𝑑𝑄𝑆
𝑑𝑃𝑊
(𝑊) = 𝔼𝑆,𝑊 ln
(𝑊) + 𝔼𝑆,𝑊 ln
(𝑊)
𝑑𝑃
𝑑𝑃𝑊
𝑑𝑃
= 𝐼(𝑊; 𝑆) + 𝐷KL (𝑃𝑊 ‖𝑃).
Оракульное априорное распределение
Среднюю величину
𝔼𝑆 𝐷KL (𝑄𝑆 ‖𝑃)
минимизирует
𝑃 = 𝑃𝑊 .
Тогда второй член исчезает, и средняя PAC-Bayes-сложность равна MI.
Почему же просто не использовать 𝑃𝑊 ? Теоретически, если распределение данных 𝒟 и алгоритм
полностью известны, 𝑃𝑊 фиксировано до текущей выборки и является валидной точкой отсчёта.
Практическая проблема в том, что оно зависит от неизвестного распределения всех возможных
обучающих выборок и обычно недоступно.
240
Влад Куликов · Открытая редакция 2026.1
Если оценивать 𝑃𝑊 по той же сертифицирующей выборке, априорное распределение становится
зависящим от данных, и стандартная теорема требует поправки.
Что объединено, а что осталось разным
Тождество объясняет, почему PAC-Bayes и MI часто дают похожие регуляризаторы. Но типы гарантий
не совпадают.
PAC-Bayes
MI-граница
Обычно высоковероятностное утверждение по 𝑆
Сертифицирует все 𝑄 на хорошем событии
Требует выбранное априорное распределение 𝑃
Может быть вычислима для конкретного 𝑄
Обычно утверждение об ожидаемом разрыве
Анализирует канал 𝑃𝑊∣𝑆
Использует маргинал 𝑃𝑊 неявно
𝐼(𝑊; 𝑆) часто трудно оценить
Поэтому фраза «MI — это усреднённый PAC-Bayes» полезна как первая карта, но не заменяет
теоремы.
12.8. Связи с MDL, Information Bottleneck и KL-регуляризованными
политиками
Информационные конструкции предыдущих модулей действительно родственны.
Самый
безопасный способ увидеть родство — выписать случайные переменные и операционный смысл
каждого KL.
241
Теория информации для машинного обучения
PAC-Bayes и MDL
Пусть класс дискретен и
𝑄 = 𝛿𝑤 ,
𝑃(𝑤) > 0.
Тогда
𝐷KL (𝛿𝑤 ‖𝑃) = − ln 𝑃(𝑤).
В битах:
− log2 𝑃(𝑤),
то есть идеальная длина кода гипотезы под априорным распределением.
Это точный мост: PAC-Bayes оплачивает описание выбранной модели относительно заранее
объявленного кода.
Но MDL шире одной формулы. В нём есть двухчастные, смесевые и предиктивно-последовательные
коды; непрерывные параметры требуют точности или стохастического кода; стоимость данных под
моделью может учитываться иначе.
MI-границы и Information Bottleneck
В Information Bottleneck измеряется
𝐼(𝑋; 𝑇),
где 𝑋 — отдельный вход, а 𝑇 — его представление.
В теории обобщения измеряется
𝐼(𝑊; 𝑆),
где 𝑆 — весь обучающий набор, а 𝑊 — результат алгоритма.
Обе величины штрафуют зависимость от деталей исходного объекта. Но это разные объекты и разные
задачи:
• IB спрашивает, сколько информации представление хранит о входе;
• MI-граница спрашивает, насколько обученный результат зависит от конкретной выборки.
Малое 𝐼(𝑋; 𝑇) само по себе не является доказательством малого 𝐼(𝑊; 𝑆) и не даёт автоматически
границу обобщения.
Старый лозунг «MI-границы строго доказывают IB» слишком силён.
Корректнее сказать: обе теории используют общий принцип информационного ограничения, а
прямой вывод требует дополнительной модели обучения.
PAC-Bayes KL и KL-якорь в RLHF
В PAC-Bayes:
𝐷KL (𝑄models ‖𝑃models )
сравнивает распределения над моделями или весами.
В KL-регуляризованном RLHF:
242
Влад Куликов · Открытая редакция 2026.1
𝐷KL 𝜋(⋅ ∣ 𝑥)‖𝜋ref (⋅ ∣ 𝑥)
сравнивает распределения ответов при фиксированном контексте.
Алгебра похожа, потому что обе задачи используют экспоненциальный наклон относительно базовой
меры. Но случайные объекты различны.
И ещё одна граница особенно важна после Модуля 8: PAC-Bayes контролирует переход от
эмпирического риска к популяционному для заданной функции потерь. Если прокси-награда
систематически расходится с истинной целью, маленький разрыв обобщения по прокси не исправит
это смещение.
12.9. Как построить практический PAC-Bayes-сертификат
Теорема становится инженерным инструментом только после того, как все случайные объекты
определены без двусмысленности.
Шаг 1. Зафиксировать сертифицируемый предиктор и функцию потерь
Нужно решить, что будет работать при эксплуатации:
•
•
•
•
Gibbs-предиктор;
апостериорный ансамбль;
голосование большинства;
детерминированная сеть.
Базовая граница относится к Gibbs-риску. Для другого объекта требуется отдельный переход.
243
Теория информации для машинного обучения
Также нужно выбрать ограниченную функцию потерь. Нельзя обучать по кросс-энтропии, оценивать
0–1 риск и незаметно подставлять одно вместо другого.
Шаг 2. Зафиксировать валидное априорное распределение
Простейший вариант — выбрать 𝑃 до сертифицирующих данных.
Практически более сильный вариант — разделить выборку:
1. по 𝑆0 построить информативное априорное распределение;
2. по независимой части 𝑆1 обучить 𝑄 и провести сертификацию условно на 𝑆0 .
Цена очевидна: априорное распределение становится лучше, но эффективная сертифицирующая
выборка уменьшается.
Шаг 3. Обучить распределение, а не только точку
Для диагонального гауссовского 𝑄 оптимизируются средние и дисперсии.
Слишком малая
дисперсия сохраняет хорошую подгонку, но создаёт большую KL. Слишком большая уменьшает
часть сложности, но разрушает предсказания.
Поэтому сертификат ищет не просто «плоский минимум», а конкретный компромисс между
робастностью стохастического предиктора и ценой относительно 𝑃.
Шаг 4. Сертифицировать эмпирический Gibbs-риск
Ожидание по 𝑄 часто оценивается методом Монте-Карло. Тогда конечное число выборок из 𝑄
добавляет ещё одну статистическую ошибку.
Просто усреднить десять сетей и подставить результат в формулу недостаточно для строгого
сертификата.
Нужна отдельная доверительная граница на эмпирический Gibbs-риск или
аналитическое вычисление ожидания.
Шаг 5. Вычислить KL и инвертировать бинарную KL
Для диагональных гауссов 𝐷KL (𝑄‖𝑃) вычисляется аналитически.
инвертируется численно.
После этого PAC-Bayes-kl
В эксперименте модуля для стохастического линейного классификатора:
𝐿𝑆 (𝑄) ≈ 0.227,
𝐷KL (𝑄‖𝑃) ≈ 12.67 ната,
𝐿(𝑄) ≤ 0.272
при 𝛿 = 0.05. Диагностическая оценка тестового Gibbs-риска равна примерно
0.225.
Тестовый набор не участвует в сертификате; он нужен только для проверки эксперимента.
Что уже удавалось получить для глубоких сетей
Dziugaite и Roy показали, что прямой оптимизацией PAC-Bayes-границы можно получить
невакуумные сертификаты для стохастических глубоких сетей с миллионами параметров. Более
244
Влад Куликов · Открытая редакция 2026.1
поздний метод PAC-Bayes with Backprop в своём протоколе на MNIST сообщал тестовую ошибку
около 1.4% и сертификат около 2.3%.
Это важный контрпример тезису «все теоретические границы для глубоких сетей обязательно больше
единицы». Но он не является универсальным объяснением обобщения:
•
•
•
•
результат зависит от архитектуры, параметризации и априорного распределения;
сертифицируется стохастический предиктор;
такая теснота границы на MNIST не переносится автоматически на LLM;
вычислимый сертификат может оставаться значительно слабее отложенной оценки.
Правильный вывод скромнее и сильнее одновременно: PAC-Bayes способен давать реальную
численную гарантию для большой модели, если вся система обучения и сертификации спроектирована
под эту задачу.
12.10. Математическое углубление: более локальные информационн
цены
Этот раздел не требуется для основного маршрута. Он показывает, как теория смягчает две
слабости базовых формул: априорное распределение трудно выбрать до данных, а 𝐼(𝑊; 𝑆)
для детерминированной непрерывной модели может быть бесконечной.
Априорные распределения, зависящие от данных
Есть несколько корректных стратегий.
Разделение выборки. 𝑃 строится по 𝑆0 , а теорема условно применяется к независимой части 𝑆1 .
Иерархическое априорное распределение. Выбор одного из семейства априорных распределений
кодируется верхним уровнем и оплачивается дополнительным KL или объединяющей оценкой.
Дифференциально-приватный выбор. Если механизм построения 𝑃𝑆 контролируемо зависит
от данных, эта зависимость может быть включена в PAC-Bayes-гарантию.
Специализированные PAC-Bayes-теоремы для априорных распределений, зависящих
от данных. Они напрямую добавляют член, измеряющий использование данных при выборе точки
отсчёта.
Общий принцип не меняется:
Данные, использованные для уменьшения члена сложности, не исчезают из
счёта бесплатно.
MI по отдельным примерам
Глобальная величина 𝐼(𝑊; 𝑆) может скрывать локальную структуру. По цепному правилу
𝑛
𝐼(𝑊; 𝑆) =
𝐼(𝑊; 𝑍𝑖 ∣ 𝑍<𝑖 ),
𝑖=1
но граница
𝐼(𝑊; 𝑆)
сначала суммирует все вклады, а затем берёт один корень.
Граница по отдельным примерам использует
245
Теория информации для машинного обучения
1
𝑛
𝑛
𝐼(𝑊; 𝑍𝑖 ).
𝑖=1
Если каждый пример влияет слабо, такая локальная агрегация может быть существенно меньше.
Условная взаимная информация
Построим сверхвыборку (supersample)
𝑛
𝑆 = 𝑍𝑖,0 , 𝑍𝑖,1
𝑖=1
,
содержащую по два независимых кандидата на каждую позицию. Пусть
𝑈 = (𝑈1 , … , 𝑈𝑛 ),
𝑈𝑖 ∼ Bernoulli(1/2),
и реальная обучающая выборка строится как
𝑆𝑈 = 𝑍𝑖,𝑈𝑖
𝑛
𝑖=1
.
Алгоритм возвращает
𝑊 = 𝐴(𝑆𝑈 ).
Тогда условная информационная сложность измеряет
𝐼(𝑊; 𝑈 ∣ 𝑆).
Её операционный смысл: если известны обе возможные выборки в каждой позиции, насколько по
результату обучения можно восстановить биты 𝑈𝑖 , сообщающие, какой пример действительно попал
в обучение?
Для детерминированного алгоритма эта величина всё равно конечна:
𝐼(𝑊; 𝑈 ∣ 𝑆) ≤ 𝐻(𝑈) = 𝑛 ln 2.
Именно поэтому CMI может оставаться содержательной там, где обычная 𝐼(𝑊; 𝑆) для точных
вещественных весов бесконечна.
CMI связывает информационный взгляд с VC-размерностью, схемами сжатия и дифференциальной
приватностью. Но она не становится автоматически простой вычислимой метрикой для большой
нейросети. Это более точный объект теории, а не готовая строка в панели мониторинга.
12.12. Ключевые выводы модуля
Обучающая выборка выполняет две роли: по ней выбирают модель и по ней оценивают её качество.
Именно повторное использование делает оценку победителя оптимистичной.
PAC-Bayes оплачивает адаптацию относительно заранее объявленной точки отсчёта:
kl 𝐿𝑆 (𝑄)‖𝐿(𝑄) ≲
𝐷KL (𝑄‖𝑃) + ln(1/𝛿)
.
𝑛
MI-граница оплачивает среднюю зависимость результата алгоритма от выборки:
246
Влад Куликов · Открытая редакция 2026.1
|𝔼 gen | ≲
𝐼(𝑊; 𝑆)
.
𝑛
Их связывает точное тождество
𝔼𝑆 𝐷KL (𝑄𝑆 ‖𝑃) = 𝐼(𝑊; 𝑆) + 𝐷KL (𝑃𝑊 ‖𝑃).
Но итоговая карта важнее одного лозунга.
•
•
•
•
•
•
•
PAC-Bayes обычно даёт высоковероятностный сертификат для Gibbs-предиктора.
Базовая MI-граница обычно контролирует ожидаемый разрыв алгоритма.
Априорное распределение, обученное на сертифицирующих данных, требует отдельной оплаты.
𝐼(𝑊; 𝑆) не равно 𝐼(𝑋; 𝑇) из Information Bottleneck.
KL над весами не равна KL между политиками в RLHF.
Малый разрыв обобщения по прокси-функции потерь не устраняет смещение самой прокси.
Невакуумная граница доказывает нетривиальное утверждение, но не обязана быть достаточно
тесной для выбора модели.
Это не набор защитных оговорок, а рабочая дисциплина. Информационная теория обобщения
становится полезной, когда мы точно называем:
1.
2.
3.
4.
5.
6.
случайную выборку;
результат алгоритма;
сертифицируемый предиктор;
функцию потерь;
тип вероятностной гарантии;
цену адаптивности, которую действительно удалось вычислить.
В Модуле 13 эта дисциплина понадобится особенно сильно. Там слова «канал», «сжатие», «поиск» и
«информация» будут применяться к рассуждению LLM, и каждый такой мост придётся отделять от
прямой теоремы.
Основные источники
1. D. McAllester, «Some PAC-Bayesian Theorems», COLT 1998; «PAC-Bayesian Stochastic Model Selection», 2003.
2. A. Maurer, «A Note on the PAC Bayesian Theorem», 2004.
3. O. Catoni, «PAC-Bayesian Supervised Classification», 2007.
4. D. Russo, J. Zou, «Controlling Bias in Adaptive Data Analysis Using Information Theory», 2016.
5. A. Xu, M. Raginsky, «Information-Theoretic Analysis of Generalization Capability of Learning Algorithms», 2017.
6. G. K. Dziugaite, D. M. Roy, «Computing Nonvacuous Generalization Bounds for Deep (Stochastic) Neural Networks», 2017.
7. G. K. Dziugaite, D. M. Roy, «Data-Dependent PAC-Bayes Priors via Differential Privacy», 2018.
8. O. Rivasplata, V. M. Tankasali, C. Szepesvári, «PAC-Bayes with Backprop», 2019.
9. Y. Bu, S. Zou, V. V. Veeravalli, «Tightening Mutual Information Based Bounds on Generalization Error», 2019.
10. T. Steinke, L. Zakynthinou, «Reasoning About Generalization via Conditional Mutual Information»,
2020.
247
Модуль 13. Рассуждение в LLM:
вычисление, поиск и информация
Как читать этот модуль. Это итоговый модуль курса. Основной маршрут — §§13.1–13.10:
что именно меняется, когда модель получает больше вычислений во время ответа; почему
промежуточные шаги могут помогать без появления новых данных; как распределить
бюджет между одной длинной траекторией, несколькими кандидатами и проверкой; где
контекст и инструменты действительно приносят новую информацию; и как оценивать
такую систему без смешения качества и стоимости. §13.11 — математическое углубление о
пошаговом информационном приросте и последовательной выразительности. Его можно
оставить на второй проход.
13.1. Что меняется, когда модель «думает дольше»
Представим одну и ту же модель и один и тот же запрос. В первом режиме модель сразу выдаёт
короткий ответ. Во втором — сначала пишет несколько десятков промежуточных шагов. В третьем —
строит несколько решений, запускает код, получает результаты тестов и выбирает лучший вариант.
Веса модели не изменились. Исходный запрос тоже. Но качество вполне может оказаться разным.
Что именно было куплено дополнительными вычислениями?
Слово reasoning часто используют как общее название всего сразу: многошаговой задачи, видимой
цепочки мыслей, поиска, работы с инструментами и просто хорошего ответа. Для инженерного
разговора этого недостаточно. В этом модуле будем различать пять объектов.
1. Последовательное вычисление.
Ответ требует нескольких зависимых операций:
арифметики, построения доказательства, отладки программы или планирования.
2. Промежуточное состояние. Модель хранит частичные результаты в видимой цепочке
рассуждения (chain of thought, CoT), скрытом рабочем черновике (scratchpad) или
внутреннем состоянии.
3. Поиск. Система рассматривает несколько кандидатов, ветвится, возвращается назад или
перераспределяет вычислительный бюджет.
4. Внешнее наблюдение. Система получает результат поиска, исполнения кода, теста,
измерения или действия в среде.
5. Качество результата. Улучшается заранее выбранная метрика: доля правильных ответов,
pass@k, логарифмическая потеря, устойчивость или стоимость решения.
Эти объекты связаны, но не тождественны. Длинная цепочка может быть ошибочной. Правильный
ответ не доказывает, что видимый текст был причинным механизмом решения. Поиск может
улучшить результат без единой красивой траектории. Калькулятор способен резко повысить
точность, хотя не приносит нового факта о мире. А поисковая система, напротив, действительно
может дать сведения, которых в запросе не было.
248
Влад Куликов · Открытая редакция 2026.1
Исследования цепочек рассуждения показали, что пошаговые демонстрации могут заметно улучшать
результаты больших языковых моделей на арифметических, символьных и некоторых задачах
здравого смысла. Позднее вычислительный бюджет на конкретный запрос стал отдельным
объектом оптимизации: модель может тратить больше токенов, строить несколько траекторий,
обращаться к верификатору или к среде.
Главный вопрос модуля поэтому звучит так:
Что покупают дополнительные вычисления: новые сведения, более богатое
вычисление над уже доступными сведениями или более широкий поиск среди
возможных решений?
Ответ зависит от того, как устроена система. Начнём с трёх базовых режимов.
13.2. Амортизация, рабочий черновик и поиск
Предобучение можно понимать как амортизацию вычислений. Огромная стоимость обучения
заранее упаковывает в параметры статистические закономерности, факты, эвристики и фрагменты
алгоритмов. Во время ответа модель быстро применяет эту накопленную структуру к новому запросу.
Амортизированный ответ
В простейшем режиме модель получает запрос и сразу генерирует ответ:
𝑞𝜃 (𝑎 ∣ 𝑥).
Большая часть работы уже «оплачена» при обучении. Это быстро, но вычислительный бюджет
конкретной задачи мал. Если нужная процедура не стала надёжной амортизированной эвристикой,
модель может поспешить с локально правдоподобным, но неверным продолжением.
Последовательный рабочий черновик
Теперь модель сначала генерирует промежуточные токены
𝐶1 , 𝐶2 , … , 𝐶𝑘 ,
а затем ответ 𝐴:
249
Теория информации для машинного обучения
𝑘
𝑞𝜃 (𝑐1∶𝑘 , 𝑎 ∣ 𝑥) =
𝑞𝜃 (𝑐𝑡 ∣ 𝑥, 𝑐<𝑡 ) 𝑞𝜃 (𝑎 ∣ 𝑥, 𝑐1∶𝑘 ).
𝑡=1
Каждый новый токен даёт ещё один последовательный шаг применения модели и место для
записи промежуточного результата. Рабочий черновик поэтому может увеличивать эффективную
вычислительную глубину системы, хотя параметры остаются прежними.
Здесь важно слово «может». Токен сам по себе не является полезной операцией. Модель способна
записать верный частичный результат, повторить уже сказанное или увести вычисление в неверную
ветвь. Дополнительный бюджет создаёт возможность для работы, но не гарантирует, что она будет
использована хорошо.
Явный поиск и взаимодействие
В третьем режиме система рассматривает альтернативы и получает обратную связь. Например:
•
•
•
•
•
•
self‐consistency: несколько траекторий и голосование по ответу;
best‐of‐N: несколько кандидатов и выбор верификатором;
лучевой или древовидный поиск;
Tree of Thoughts: ветвление, оценка частичных состояний и возврат назад;
запуск интерпретатора, калькулятора или тестов;
агентный цикл «действие → наблюдение → следующее действие».
Одна длинная цепочка ещё не является поиском. Поиск начинается там, где система действительно
сохраняет альтернативы, сравнивает их, может отказаться от раннего выбора или получить сигнал из
среды.
Полезная граница между амортизацией и поиском
На одном конце находится модель, которая почти мгновенно выдаёт выученный ответ. На другом —
система, которая заново исследует пространство решений для каждого запроса. Между ними много
промежуточных режимов: короткий черновик, несколько выборок, локальная проверка, адаптивный
бюджет.
Эта шкала полезнее буквальной аналогии с индукцией Соломонова. Универсальный предсказатель
из Модуля 10 суммирует все вычислимые объяснения и обладает специальными теоретическими
гарантиями. Обычная LLM не реализует такую сумму и этих гарантий не наследует. Но различие
250
Влад Куликов · Открытая редакция 2026.1
между заранее амортизированной эвристикой и вычислением для конкретной задачи
остаётся содержательным.
13.3. Почему промежуточные токены могут помогать
Самое прямое объяснение — вычислительное. Авторегрессивная генерация позволяет многократно
применять один и тот же блок модели, каждый раз передавая вперёд расширенное состояние.
Рассмотрим чётность 𝑛 битов:
𝑌 = 𝑋1 ⊕ 𝑋2 ⊕ ⋯ ⊕ 𝑋𝑛 .
Линейный классификатор по исходному вектору не решает эту задачу. Но достаточно одного бита
рабочей памяти:
𝑆0 = 0,
𝑆𝑡 = 𝑆𝑡−1 ⊕ 𝑋𝑡 .
После 𝑛 шагов:
𝑆𝑛 = 𝑌.
Никаких новых данных к 𝑋 не добавилось. Изменилась процедура: вместо одного ограниченного
считывания появился последовательный алгоритм.
Дополнительные токены здесь работают как такты вычисления и рабочая
память, а не как новые наблюдения.
Это не только метафора. Для специально заданных моделей вычислений существуют результаты,
показывающие, что цепочка промежуточных шагов расширяет класс последовательно реализуемых
функций decoder-only Transformer. Например, при конкретных предпосылках о глубине, точности
251
Теория информации для машинного обучения
и размере представления 𝑇 шагов CoT позволяют моделировать последовательную схему размера
порядка 𝑇. Такой результат не является универсальной теоремой о любой современной LLM, но
подтверждает сам механизм: последовательное декодирование может добавлять вычислительную
выразительность.
Когда длинный черновик особенно полезен
Выигрыш наиболее естественен, когда задача:
•
•
•
•
•
раскладывается на зависимые подзадачи;
требует хранения промежуточных значений;
допускает локальную проверку шагов;
чувствительна к раннему выбору ветви;
содержит процедуру, которую трудно свернуть в один локальный переход.
На простом вопросе из памяти длинная цепочка может лишь увеличить стоимость и число
возможностей ошибиться. Поэтому зависимость качества от числа токенов не обязана быть
монотонной. Важен не сам объём текста, а полезное вычисление, которое система успела выполнить.
13.4. Новая информация или новое вычисление?
Теперь сформулируем центральное точное утверждение модуля.
Пусть (𝑋, 𝑌 ∗ ) ∼ 𝑃, где 𝑋 — полная задача, доступная модели, а 𝑌 ∗ — правильный ответ. Фиксированная
модель строит внутреннюю цепочку 𝐶 из 𝑋 и собственной случайности 𝑈:
𝐶 = 𝐺𝜃 (𝑋, 𝑈),
𝑈 ⟂ 𝑌 ∗ ∣ 𝑋.
Тогда
𝑌∗ ⟶ 𝑋 ⟶ 𝐶
образует марковскую цепь. Следовательно,
𝐼(𝑌 ∗ ; 𝐶 ∣ 𝑋) = 0
и
𝐻(𝑌 ∗ ∣ 𝑋, 𝐶) = 𝐻(𝑌 ∗ ∣ 𝑋),
𝐼(𝑌 ∗ ; 𝑋, 𝐶) = 𝐼(𝑌 ∗ ; 𝑋) .
### Короткое доказательство
По построению распределение цепочки при известном входе не зависит от правильного ответа:
𝑝(𝑐 ∣ 𝑥, 𝑦 ∗ ) = 𝑝(𝑐 ∣ 𝑥).
Значит, 𝐶 и 𝑌 ∗ условно независимы при заданном 𝑋, откуда 𝐼(𝑌 ∗ ; 𝐶 ∣ 𝑋) = 0. Остальные равенства
следуют из определения условной взаимной информации и цепного правила. ■
Формулу удобно прочитать словами:
Внутренне сгенерированная цепочка не сообщает идеальному наблюдателю
нового факта о правильном ответе сверх полного входа. Она перерабатывает
уже доступные данные.
Почему же точность реальной модели способна вырасти? Потому что реальная модель — не
идеальный байесовский наблюдатель, который мгновенно вычисляет 𝑃(𝑌 ∗ ∣ 𝑋). Её выход
ограничен архитектурой, глубиной и обученной процедурой. Рабочий черновик меняет доступный
вычислительный путь и может сделать нужную функцию проще для последующего считывающего
слоя.
252
Влад Куликов · Открытая редакция 2026.1
Определим логарифмическую потерю модели после 𝑗 шагов:
ℒ𝑗 = 𝔼 − log 𝑞𝜃,𝑗 (𝑌 ∗ ∣ 𝑋, 𝐶≤𝑗 ) .
Она может уменьшаться: модель лучше использует промежуточные результаты. Но это уменьшение
модельной потери, а не истинной условной энтропии 𝐻(𝑌 ∗ ∣ 𝑋). Для отдельной модели и
отдельного шага даже монотонность не гарантирована: ошибочная запись способна увеличить
потерю.
Когда новая информация действительно появляется
Пусть после внутреннего шага система получает наблюдение 𝑂: результат поиска, ответ базы данных,
показание датчика, скрытый тест или реакцию среды. Тогда
𝐼(𝑌 ∗ ; 𝑋, 𝑂) = 𝐼(𝑌 ∗ ; 𝑋) + 𝐼(𝑌 ∗ ; 𝑂 ∣ 𝑋).
Последний член может быть положительным. Здесь система уже не только вычисляет, но и получает
данные извне.
Есть полезный пограничный случай. Калькулятор, которому передали числа из запроса, обычно не
добавляет шенноновской информации о детерминированном ответе: результат уже задан входом. Но
он предоставляет надёжный вычислительный модуль. Поиск по внешней базе или измерение среды,
напротив, может действительно добавить сведения, отсутствовавшие в запросе.
Получается простая карта:
Компонент системы
Что он в первую очередь добавляет
параметры модели
промежуточные токены
несколько кандидатов
верификатор
инструмент вычисления
амортизированные знания и процедуры
последовательную глубину и рабочую память
ширину поиска
способность выбирать среди найденного
более надёжную операцию над имеющимися
данными
потенциально новую информацию
поиск, датчик, среда
253
Теория информации для машинного обучения
13.5. Что можно измерять по шагам
Интуитивная фраза «этот шаг добавил информацию» может обозначать несколько разных вещей.
Если их не развести, одна и та же кривая начинает одновременно изображать прогресс вычисления,
уверенность модели и истинную неопределённость задачи.
Истинный информационный прирост
Если 𝑆𝑗 — случайное промежуточное состояние, то
𝐼(𝑌 ∗ ; 𝑆𝑗 ∣ 𝑆𝑗−1 )
измеряет дополнительную информацию о правильном ответе, содержащуюся в новом состоянии
после знания старого. Но величина зависит от того, как именно определены состояния и по какому
распределению порождаются задачи и траектории.
Для полного внутреннего контекста
𝑆𝑗 = (𝑋, 𝐶≤𝑗 )
при отсутствии внешних наблюдений получаем
𝐼(𝑌 ∗ ; 𝐶𝑗 ∣ 𝑋, 𝐶<𝑗 ) = 0.
Поэтому буквальное утверждение «каждый внутренний токен приносит новые биты о правильном
ответе» неверно в этой постановке.
Улучшение вспомогательного предиктора
Практически можно обучить отдельный предиктор 𝑔𝑗 (𝑦 ∣ 𝑠𝑗 ), который пытается восстановить ответ
по состоянию после 𝑗-го шага, и измерять на отложенных данных
CE𝑗 = 𝔼[− log 𝑔𝑗 (𝑌 ∗ ∣ 𝑆𝑗 )].
Если кросс-энтропия уменьшается, состояние стало полезнее для выбранного класса
предикторов.
Это содержательная диагностическая величина: она показывает, что ответ
становится легче извлечь. Но она зависит от мощности, обучения и калибровки предиктора. В
§13.11 мы точно разложим её на истинную условную энтропию и вариационный разрыв.
Предиктивная энтропия модели
Можно также измерять
𝐻 𝑞𝜃 (⋅ ∣ 𝑆𝑗 ) .
Она отвечает на другой вопрос: насколько распределён следующий прогноз самой модели. Низкая
предиктивная энтропия означает концентрацию, но не правильность. Уверенная ошибка может
иметь очень низкую энтропию.
Верность и наблюдаемость цепочки
Наконец, видимая цепочка может быть полезна для анализа поведения системы. Здесь важно
различать два свойства.
• Верность причинному механизму (faithfulness). Насколько написанные шаги отражают
вычисление, которое действительно повлияло на ответ?
• Наблюдаемость (monitorability). Может ли внешний наблюдатель по цепочке обнаружить
ошибку, обман, использование подсказки или нарушение правила?
254
Влад Куликов · Открытая редакция 2026.1
Эти свойства связаны, но не совпадают. Цепочка может быть неполным описанием внутреннего
механизма и всё же давать полезный сигнал для мониторинга. И наоборот, гладкое правдоподобное
объяснение может плохо отражать причины ответа.
Один из способов проверки — интервенции:
•
•
•
•
•
удалить шаг;
заменить промежуточное число;
вставить ложный вывод;
перефразировать объяснение без изменения содержания;
скрыть часть контекста, на которую цепочка ссылается.
Если ответ не реагирует на содержательно важную подмену, цепочка могла быть постфактумобъяснением или система могла восстановить решение другим путём. Поэтому одна интервенция
редко даёт окончательный вердикт: нужны контролируемые задачи, несколько типов вмешательств
и сравнение с внешними проверками.
Современные исследования также показывают, что непосредственное оптимизационное давление на
наблюдаемую цепочку может ухудшить её диагностическую ценность: система способна научиться
скрывать нежелательный мотив, сохраняя поведение. Это не означает, что мониторинг цепочек
бесполезен. Правильный вывод скромнее: наблюдаемость — отдельная характеристика
системы, которую нужно измерять и не следует принимать как автоматическое
следствие высокой точности.
13.6. Одна длинная траектория или много кандидатов?
Дополнительный бюджет можно потратить по-разному. Можно углублять одну траекторию,
порождать много независимых решений или строить дерево с промежуточной оценкой. Выбор
зависит от структуры ошибок.
255
Теория информации для машинного обучения
Голосование по нескольким траекториям
Пусть каждая независимая попытка даёт правильный ответ с вероятностью 𝑝. Для нечётного 𝑁
вероятность правильного большинства равна
𝑁
𝑃maj (𝑁, 𝑝) =
𝑟=(𝑁+1)/2
𝑁 𝑟
𝑝 (1 − 𝑝)𝑁−𝑟 .
𝑟
Если 𝑝 > 1/2 и ошибки действительно независимы, большинство становится надёжнее с ростом 𝑁.
Если 𝑝 < 1/2, голосование лишь всё увереннее закрепляет систематическую ошибку.
Метод self‐consistency использует близкую идею: модель порождает разнообразные цепочки, а
затем выбирается наиболее частый итоговый ответ. Эмпирически это может заметно улучшать
многошаговые задачи. Но независимость — сильное предположение. Если все траектории
воспроизводят один и тот же неверный шаблон, эффективное число независимых попыток остаётся
близким к единице.
Best‐of‐N и идеальный верификатор
Пусть каждый кандидат правильный с вероятностью 𝑝, а идеальный верификатор узнаёт правильный
ответ. Тогда успех происходит, если хотя бы один из 𝑁 кандидатов верен:
𝑃oracle (𝑁) = 1 − (1 − 𝑝)𝑁 .
Эта формула описывает покрытие генератора: удалось ли вообще найти решение.
Несовершенный верификатор
Реальный верификатор присваивает кандидату оценку 𝑣(𝑥, 𝑐) и выбирает максимум. Теперь итог
зависит от двух компонентов:
1. генератор должен включить правильный ответ в набор;
2. верификатор должен поставить его выше ложных кандидатов.
При увеличении 𝑁 первый компонент улучшается, а второй может ухудшаться. Большая выборка
содержит не только больше правильных решений, но и больше редких ложных кандидатов, которые
эксплуатируют ошибку оценивателя.
Поэтому полезно публиковать две величины:
• oracle pass@N — был ли правильный кандидат среди 𝑁;
• selected pass@N — выбрал ли его реальный верификатор.
Их разность показывает цену несовершенного выбора.
256
Влад Куликов · Открытая редакция 2026.1
Проверка может быть проще построения — но не всегда
Для некоторых задач правильность результата легко проверить: выполнить программу на тестах,
подставить корни уравнения, проверить доказательство формальным ядром. Тогда широкий поиск
особенно полезен.
Но универсальной теоремы «проверять всегда легче, чем решать» здесь нет. Тесты могут быть
неполными, спецификация — неоднозначной, а оценка открытого текста — почти такой же трудной,
как генерация. Поэтому связь с классами сложности может быть вдохновляющей аналогией, но не
заменяет анализа конкретного верификатора.
13.7.
In-context learning:
приносит данные
когда контекст действительно
Промежуточная цепочка и примеры в запросе выглядят одинаково — и то и другое является текстом
в контексте. Информационно их роли различаются.
Пусть 𝑍 — скрытая задача, стиль разметки или правило, а демонстрации
𝐷 = {(𝑥𝑖 , 𝑦𝑖 )}𝑚
𝑖=1
порождаются условно по 𝑍. Тогда
𝑚
𝑝(𝑥𝑖 , 𝑦𝑖 ∣ 𝑧),
𝑝(𝑧 ∣ 𝐷) ∝ 𝑝(𝑧)
𝑖=1
а прогноз для нового объекта равен
257
Теория информации для машинного обучения
𝑝(𝑦𝑚+1 ∣ 𝑥𝑚+1 , 𝐷) =
𝑝(𝑦𝑚+1 ∣ 𝑥𝑚+1 , 𝑧) 𝑝(𝑧 ∣ 𝐷) 𝑑𝑧.
Если демонстрации зависят от скрытой задачи, то
𝐼(𝑍; 𝐷) > 0.
Они действительно сообщают системе, какое правило сейчас действует. Внутренний черновик,
построенный после получения полного запроса, выполняет другую функцию: организует
вычисление над уже доступным контекстом.
В специальных генеративных постановках in-context learning можно строго получить как неявный
байесовский вывод по скрытому понятию. Например, такой результат доказан для смеси скрытых
марковских моделей при заданной структуре предобучающих данных. Исследования induction heads
дают ещё одну механистическую картину копирования и продолжения паттернов.
Граница точного утверждения здесь важна. Из специальных моделей не следует, что произвольная
LLM явно хранит точное апостериорное распределение, что любой запрос порождён смесью задач
или что всякое ICL-поведение является байесовски оптимальным. Но модель скрытой задачи даёт
полезный вопрос: какая переменная стала лучше определена после демонстраций и какие
данные действительно изменили наше состояние знания?
13.8. Как модели учатся рассуждать
Во многих современных системах способности к многошаговому решению формируются несколькими
связанными циклами. Удобно разделить их на имитацию, генерацию с отбором и оптимизацию по
обратной связи.
258
Влад Куликов · Открытая редакция 2026.1
1. Имитация хороших траекторий
При обучении с учителем модель получает пары «задача → решение с промежуточными шагами»
и максимизирует их правдоподобие. Это учит формату, типичным декомпозициям и локальным
переходам.
Сильная сторона подхода — плотный обучающий сигнал. Слабая — зависимость от качества
демонстраций: модель может перенять лишние ритуалы, неудачные сокращения или убедительно
оформленные ошибки.
2. Генерация, проверка и повторное обучение
Следующий цикл:
1.
2.
3.
4.
5.
породить несколько траекторий;
проверить финальный ответ или шаги;
сохранить удачные примеры;
дообучить модель на отобранных данных;
повторить.
STaR является ранним примером такого самобутстрэппинга: модель генерирует объяснения,
отбирает те, которые приводят к правильному ответу, и учится на них. Rejection sampling,
дистилляция и синтетические наборы рассуждений используют родственную механику.
Здесь возникает систематический риск: отбор видит только то, что умеет проверить. Если
проверяется один финальный ответ, в данные могут попасть цепочки с неверными промежуточными
причинами и случайно правильным результатом.
3. Оптимизация по результату или по шагам
Награда за результат оценивает итог: прошли ли тесты, совпал ли численный ответ, выполнилось
ли формальное условие. Такой сигнал масштабируется в задачах с дешёвой автоматической
проверкой и лежит в основе обучения с проверяемыми наградами (reinforcement learning with
verifiable rewards, RLVR).
Обучение по шагам (process supervision) оценивает промежуточные переходы. Оно может
лучше локализовать ошибку и обучить отдельный процессный верификатор, но требует более
дорогой разметки или надёжного автоматического проверяющего.
Работы по верификаторам математических решений и по пошаговой проверке показывают, что
выбор среди нескольких кандидатов и обратная связь на промежуточных шагах могут существенно
улучшать результаты в своих постановках. DeepSeek-R1, в свою очередь, продемонстрировал, что
крупномасштабное обучение с подкреплением по проверяемым результатам способно вызывать
длинные стратегии самопроверки; последующая многоэтапная процедура понадобилась, среди
прочего, для читаемости и устойчивого поведения.
259
Теория информации для машинного обучения
Где возникает Goodhart
Как только оценка становится целью оптимизации, система начинает искать способы повысить
именно эту оценку. Возможны:
•
•
•
•
•
подгонка под слабый верификатор;
эксплуатация неполных тестов;
производство длинных, но пустых цепочек;
копирование шаблона «правильного рассуждения» без надёжного результата;
сокрытие нежелательного поведения от монитора.
KL-регуляризация к базовой политике может ограничить отклонение распределения ответов, как
обсуждалось в Модуле 8. Но это не PAC-Bayes-сертификат и не гарантия истинности траектории:
объекты, усреднения и условия теорем различны.
Полезный инженерный принцип здесь прост:
Генератор, верификатор и источник награды образуют одну систему.
Улучшение одного компонента нельзя оценивать в отрыве от ошибок двух
других.
13.9. Как оценивать систему рассуждения
Одна итоговая accuracy скрывает слишком много. Система может получить тот же результат,
потратив в десять раз больше токенов; генератор может почти всегда находить ответ, а верификатор
— часто выбирать не тот; видимая цепочка может быть полезна для мониторинга, но плохо отражать
причинный механизм.
260
Влад Куликов · Открытая редакция 2026.1
Нужен фронтир качества и стоимости.
Качество ответа
•
•
•
•
pass@1 и pass@k;
точность после выбора верификатором;
логарифмическая потеря и калибровка, если доступны вероятности;
устойчивость к перефразированию, изменению чисел и контрфактическим вариантам.
Вычислительная цена
•
•
•
•
•
число промежуточных токенов;
число траекторий;
FLOPs, задержка и денежная стоимость;
число обращений к инструментам;
пиковая память и допустимый параллелизм.
Покрытие поиска и качество выбора
•
•
•
•
•
oracle pass@N;
selected pass@N;
корреляция ошибок между траекториями;
калибровка и устойчивость верификатора;
первый бюджет, при котором дальнейшее расширение выборки перестаёт окупаться.
Верность и наблюдаемость
•
•
•
•
•
чувствительность ответа к вмешательствам в цепочку;
способность локализовать первый неверный шаг;
совпадение с формальными проверками;
способность независимого монитора обнаруживать известные нарушения;
устойчивость этой способности после оптимизации модели против монитора.
Обобщение
•
•
•
•
•
новые шаблоны задач, а не только новые числа;
защита от загрязнения тестов;
перенос на другую сложность и длину;
домены, где автоматическая проверка слабее;
агентные задачи с распределительным сдвигом среды.
Адаптивный бюджет
Пусть 𝑄(𝐵) — качество при бюджете 𝐵. Нас интересует не только максимальная точка, но и форма
кривой:
𝐵 ⟼ 𝑄(𝐵).
Для простых запросов лучший ответ может появляться почти сразу. Для задач средней трудности
полезны несколько выборок или более длинная траектория. Для слишком трудных задач текущая
модель может порождать лишь множество вариаций одной ошибки.
Исследование оптимального масштабирования вычислений во время ответа показало, что лучший
способ тратить бюджет зависит от сложности запроса. В его постановке адаптивное распределение
вычислений было более чем в четыре раза эффективнее базового best‐of‐N; на части задач меньшая
модель с дополнительными вычислениями превосходила модель с в 14 раз большим числом
параметров при сопоставимом числе операций.
261
Теория информации для машинного обучения
Это не закон «вычисления на инференсе всегда выгоднее увеличения модели». Результат требует
ненулевого покрытия генератора, пригодного верификатора и правильного распределения бюджета.
Поэтому честное сравнение систем фиксирует не только модель, но и полный протокол поиска,
проверки и остановки.
13.10. Что доказано, что наблюдается и что пока служит
гипотезой
В теме рассуждения особенно легко превратить удачный образ в закон. Соберём утверждения по их
статусу.
Точные результаты в заданной модели
• Если внутренняя цепочка строится только из полного входа и независимой случайности, то
𝐼(𝑌 ∗ ; 𝐶 ∣ 𝑋) = 0.
• При независимых попытках вероятность правильного большинства имеет биномиальную
форму.
• Для идеального верификатора
𝑃oracle (𝑁) = 1 − (1 − 𝑝)𝑁 .
• Демонстрации могут нести информацию о скрытой задаче.
• При специальных предпосылках последовательные CoT-шаги расширяют вычислительную
выразительность Transformer.
Эмпирические результаты
• Пошаговые подсказки улучшают ряд многошаговых задач.
262
Влад Куликов · Открытая редакция 2026.1
• Дополнительные вычисления во время ответа иногда дают значительный выигрыш, но он
зависит от задачи и стратегии.
• Верификаторы и пошаговое обучение полезны в некоторых доменах с проверяемыми ответами.
• Видимая цепочка не всегда является верным отчётом о причинном механизме.
• Цепочка может быть полезна для мониторинга, но эта полезность чувствительна к оптимизационному
давлению.
Исследовательские линзы
•
•
•
•
рассуждение как компромисс между амортизацией и поиском;
длина траектории как приближение вычислительной трудности;
пошаговый информационный прирост как универсальная мера качества рассуждения;
LLM как конечное приближение универсального предсказателя.
Последняя группа полезна, если приводит к проверяемой постановке. Она становится опасной, когда
область аналогии исчезает из формулировки.
13.11. Математическое углубление: пошаговый информационный
прирост
Можно пропустить при первом чтении. Здесь мы уточним, когда уменьшение
кросс-энтропии действительно можно связать с условной взаимной информацией и
почему выбор состояния меняет интерпретацию.
Произвольные и вложенные состояния
Для двух произвольных состояний 𝑆𝑗−1 и 𝑆𝑗 :
𝐼(𝑌; 𝑆𝑗 ∣ 𝑆𝑗−1 ) = 𝐻(𝑌 ∣ 𝑆𝑗−1 ) − 𝐻(𝑌 ∣ 𝑆𝑗−1 , 𝑆𝑗 ),
𝐼(𝑌; 𝑆𝑗−1 ∣ 𝑆𝑗 ) = 𝐻(𝑌 ∣ 𝑆𝑗 ) − 𝐻(𝑌 ∣ 𝑆𝑗−1 , 𝑆𝑗 ).
Вычитая, получаем точное тождество:
𝐻(𝑌 ∣ 𝑆𝑗−1 ) − 𝐻(𝑌 ∣ 𝑆𝑗 ) = 𝐼(𝑌; 𝑆𝑗 ∣ 𝑆𝑗−1 ) − 𝐼(𝑌; 𝑆𝑗−1 ∣ 𝑆𝑗 ) .
Поэтому снижение условной энтропии между двумя произвольными состояниями — это чистый
баланс: новая релевантная информация минус релевантная информация, потерянная при замене
старого состояния новым.
Если старое состояние восстанавливается из нового, то
𝐼(𝑌; 𝑆𝑗−1 ∣ 𝑆𝑗 ) = 0,
и остаётся привычная формула:
𝐼(𝑌; 𝑆𝑗 ∣ 𝑆𝑗−1 ) = 𝐻(𝑌 ∣ 𝑆𝑗−1 ) − 𝐻(𝑌 ∣ 𝑆𝑗 ) .
Именно условие вложенности нельзя silently опускать.
Внутренний шаг и внешнее наблюдение
Пусть на шаге 𝑗 система сначала строит внутреннее состояние 𝐶𝑗 , а затем получает внешнее
наблюдение 𝑂𝑗 . Полная история:
𝐻𝑗 = (𝐻𝑗−1 , 𝐶𝑗 , 𝑂𝑗 ).
263
Теория информации для машинного обучения
Если 𝐶𝑗 генерируется из 𝐻𝑗−1 и независимой случайности, то
𝐼(𝑌; 𝐶𝑗 ∣ 𝐻𝑗−1 ) = 0.
По цепному правилу:
𝐼(𝑌; 𝐶𝑗 , 𝑂𝑗 ∣ 𝐻𝑗−1 ) = 𝐼(𝑌; 𝑂𝑗 ∣ 𝐻𝑗−1 , 𝐶𝑗 ).
В полном информационном счёте новый сигнал пришёл через 𝑂𝑗 . Внутренний шаг мог решить,
какое наблюдение запросить, и тем самым повысить его ценность, но сам не создал внешний
факт.
Кросс-энтропия вспомогательного предиктора
Пусть 𝑔𝑗 (𝑦 ∣ 𝑠𝑗 ) — предиктор ответа по состоянию 𝑆𝑗 . Его ожидаемая кросс-энтропия:
CE𝑗 = 𝔼[− log 𝑔𝑗 (𝑌 ∣ 𝑆𝑗 )].
Она раскладывается как
CE𝑗 = 𝐻(𝑌 ∣ 𝑆𝑗 ) + Δ𝑗 ,
где
Δ𝑗 = 𝔼𝑆𝑗 𝐷KL 𝑃(⋅ ∣ 𝑆𝑗 )‖𝑔𝑗 (⋅ ∣ 𝑆𝑗 ) ≥ 0
— вариационный разрыв.
Для произвольных состояний:
CE𝑗−1 − CE𝑗 = 𝐼(𝑌; 𝑆𝑗 ∣ 𝑆𝑗−1 ) − 𝐼(𝑌; 𝑆𝑗−1 ∣ 𝑆𝑗 ) + Δ𝑗−1 − Δ𝑗 .
Разность кросс-энтропий совпадает с условной взаимной информацией только при двух дополнительных
условиях:
1. старое состояние восстанавливается из нового;
2. разрывы предикторов равны, пренебрежимо малы или отдельно оценены.
Одна предиктивная энтропия модели этих условий не обеспечивает.
Почему рабочее состояние может стать «информативнее»
Здесь легко запутаться. Если обновление имеет вид
𝑆𝑗 = 𝐹(𝑆𝑗−1 , 𝑈𝑗 ),
𝑈𝑗 ⟂ 𝑌 ∣ 𝑆𝑗−1
и не получает доступа ни к 𝑋, ни к внешним данным, то по неравенству обработки данных
𝐼(𝑌; 𝑆𝑗 ) ≤ 𝐼(𝑌; 𝑆𝑗−1 ).
Информация не увеличивается.
Но модель на каждом шаге обычно снова видит исходный запрос. Тогда
𝑆𝑗 = 𝐹(𝑆𝑗−1 , 𝑋, 𝑈𝑗 ).
Сжатое рабочее состояние 𝑆𝑗 может иметь большую взаимную информацию с 𝑌, чем 𝑆𝑗−1 , потому что
заново извлекло из 𝑋 релевантный аспект. При этом полный набор (𝑋, 𝐶≤𝑗 ) всё равно не содержит о
𝑌 больше информации, чем 𝑋 сам по себе.
264
Влад Куликов · Открытая редакция 2026.1
Это и есть правильная развилка:
• доступность для ограниченного состояния или считывающего слоя может расти;
• общее количество информации в полном входе и внутренней цепочке не растёт без
внешнего наблюдения.
Последовательная выразительность
Информационный анализ отвечает, откуда пришли данные. Теория вычислений отвечает, какие
функции доступны при данном бюджете.
При специальных предпосылках о точности и размере представлений Transformer фиксированной
глубины без CoT ограничен классом параллельных вычислений, тогда как 𝑇 последовательных шагов
позволяют реализовать схемы размера порядка 𝑇. Поэтому два языка дополняют друг друга:
• взаимная информация учитывает доступные сведения;
• вычислительная выразительность учитывает возможность преобразовать их в ответ.
13.13. Заключение: информация не заменяет вычисление
Курс начался с разведения информации и смысла. Заканчивается он похожим, но новым различием:
информация и вычисление — не одно и то же.
Система может получить все необходимые данные и всё же не суметь вычислить ответ. Она может
правильно преобразовать известные данные, не узнав ни одного нового факта. Она может получить
новую информацию из поиска, но плохо встроить её в решение. И она может породить убедительное
объяснение, которое лишь частично отражает причинный механизм ответа.
Поэтому итоговый анализ модели рассуждения ведётся не по одной оси:
•
•
•
•
•
•
параметры дают амортизированную компетенцию;
промежуточные токены дают последовательную глубину и рабочую память;
выборка кандидатов даёт ширину поиска;
верификатор даёт правило выбора;
инструменты и среда могут дать как вычисление, так и новые наблюдения;
метрика определяет, что именно система учится считать успехом.
Информационная теория здесь выполняет свою лучшую роль: не обещает магического объяснения
интеллекта, а заставляет аккуратно назвать случайные переменные, источники данных, условные
зависимости и цену ошибки. Теория вычислений добавляет вопрос о доступных процедурах.
Экспериментальная методология проверяет, действительно ли найденный механизм работает за
пределами одного теста.
Дополнительные токены — не автоматически дополнительные знания. Чаще
это дополнительное время, рабочая память, ширина поиска и возможность
проверить себя.
Именно такое разделение позволяет говорить о современных системах рассуждения без двух
крайностей: не сводить их к «просто следующему токену», но и не превращать длинную цепочку в
доказательство понимания.
Основные источники
1.
2.
3.
4.
5.
6.
J. Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, 2022.
X. Wang et al., Self-Consistency Improves Chain of Thought Reasoning in Language Models, 2022.
K. Cobbe et al., Training Verifiers to Solve Math Word Problems, 2021.
S. Yao et al., Tree of Thoughts: Deliberate Problem Solving with Large Language Models, 2023.
H. Lightman et al., Let’s Verify Step by Step, 2023.
C. Snell et al., Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model
Parameters, 2024.
265
Теория информации для машинного обучения
7. J.-F. Ton, M. F. Taufiq, Y. Liu, Understanding Chain-of-Thought in LLMs through Information Theory, 2024.
8. T. Lanham et al., Measuring Faithfulness in Chain-of-Thought Reasoning, 2023.
9. Y. Chen et al., Reasoning Models Don’t Always Say What They Think, 2025.
10. B. Baker et al., Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation, 2025.
11. Z. Li et al., Chain of Thought Empowers Transformers to Solve Inherently Serial Problems, 2024.
12. S. M. Xie et al., An Explanation of In-context Learning as Implicit Bayesian Inference, 2021.
13. C. Olsson et al., In-context Learning and Induction Heads, 2022.
14. E. Zelikman et al., STaR: Bootstrapping Reasoning With Reasoning, 2022.
15. DeepSeek-AI, DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025.
266
Модуль 14. Компьютерное зрение
через теорию информации
Как читать этот модуль. Это бонусный модуль для тех, кто работает с изображениями,
мультимодальными моделями и развёртыванием CV-систем. Основной маршрут —
§§14.1–14.8. Он начинается с наиболее буквальной связи с теорией информации — сжатия
изображения в настоящий поток битов, — затем переходит к перцептивному качеству,
диффузионным моделям, CLIP, самообучению визуальных представлений и сжатию
самой модели. §14.9 — математическое углубление: точный счёт битов в hyperprior-кодеке
и гауссовские тождества удаления шума. Его можно оставить на второй проход.
14.1. Почему компьютерное зрение — хороший полигон для
теории информации
Возьмём обычное RGB-изображение размером 1024 × 1024 с восемью битами на канал. В несжатом
виде это
1024 ⋅ 1024 ⋅ 3 ⋅ 8 = 25 165 824
бита, то есть ровно 3 МиБ. Но для системы машинного зрения это изображение может играть
несколько совершенно разных ролей.
• Его можно сохранить или передать, заплатив некоторым числом битов и допустив
контролируемое искажение.
• Его можно наблюдать через шум и восстановить наиболее вероятный или наиболее точный
чистый сигнал.
• Его можно превратить в компактное представление для классификации, поиска, сегментации
или управления.
• Наконец, саму модель, которая всё это делает, приходится размещать в памяти, передавать на
устройство и исполнять с ограниченной задержкой.
Во всех четырёх случаях появляются слова «сжатие», «информация», «шум» и «узкое место». Но
математический смысл этих слов различается.
В нейронном кодеке всё почти по Шеннону: есть источник, квантованный символ, вероятностная
модель, энтропийный кодер и файл, длину которого можно измерить. В диффузионной модели
есть точные гауссовские тождества между условным средним, score и взаимной информацией, но
они не определяют всю архитектуру и весь алгоритм генерации. В CLIP и self-supervised learning
информационные величины помогают читать целевую функцию, однако не превращают каждый
энкодер в оптимальный Information Bottleneck. В квантизации весов аналогия с rate–distortion
полезна только после того, как мы честно определили, что считаем rate и какую ошибку называем
distortion.
Эта шкала точности важнее списка методов:
267
Теория информации для машинного обучения
Постановка
Что задано точно
Что приходится выбирать
инженеру
Сжатие изображения
поток битов, декодер, мера
искажения
гауссовский канал, MSE-оптимум,
score-тождества
обучающая игра и суррогатная
функция потерь
формат чисел и вычислительный
бюджет
архитектуру, вероятностную
модель, задержку
расписание шума,
параметризацию, sampler
аугментации, отрицательные пары,
downstream-задачу
реальную меру функционального
искажения
Удаление шума и diffusion
CLIP и SSL
Сжатие модели
Главная привычка этого модуля будет очень простой:
Перед тем как говорить об информации, назовите случайные переменные, код
или наблюдение и критерий ошибки.
С этой привычкой многие громкие аналогии становятся точнее — и, что важнее, полезнее.
14.2. Нейронное сжатие изображений: энтропийная модель
и реальный поток битов
Начнём с места, где связь с теорией информации можно проверить буквально:
изображение, затем восстановить его из полученного файла.
Нейронный кодек строит латентное представление
𝑌 = 𝑔𝑎 (𝑋),
квантует его
268
сохранить
Влад Куликов · Открытая редакция 2026.1
𝑌 = 𝑄(𝑌),
и восстанавливает изображение
𝑋 = 𝑔𝑠 (𝑌).
Здесь 𝑔𝑎 — анализирующее преобразование, 𝑔𝑠 — синтезирующее. По роли они напоминают
преобразование и обратное преобразование в классическом кодеке, но теперь оба обучаются на
данных.
Сам по себе латент ещё не является сжатым файлом. Чтобы получить поток битов, кодеру
нужна вероятность каждого дискретного символа. Пусть энтропийная модель назначает латенту
вероятность
𝑝𝜓 (𝑦).
Тогда арифметический или range coder способен передать этот латент примерно за
− log2 𝑝𝜓 (𝑦)
бит, плюс небольшой конечный расход на завершение потока, заголовки и арифметику конечной
точности.
На этом месте удобно прочитать формулу совсем буквально. Если средний счёт модели равен 0.25
бит/пиксель, то для изображения 1024 × 1024 идеальная часть потока составляет
0.25 ⋅ 10242 = 262 144
бита, то есть 32 КиБ. Это уже не метафора о «компактном представлении»: это число, которое можно
сравнить с реальным размером файла.
Целевая функция rate–distortion
Стандартная обучающая цель имеет вид
ℒ=
𝔼[− log2 𝑝𝜓 (𝑌)]
𝑅∶ ожидаемый битовый расход
+𝜆 𝔼[𝑑(𝑋, 𝑋)] .
𝐷∶ искажение
Параметр 𝜆 задаёт обменный курс между битами и качеством реконструкции. При разных 𝜆 одна и
та же архитектура может дать разные рабочие точки на эмпирической кривой rate–distortion.
Именно здесь старый лозунг «нейросеть учится сжимать изображение» становится строгим.
Вероятностная модель не просто регуляризует латент: её логарифмический счёт управляет
энтропийным кодером. Первые сквозные нейронные кодеки обучали анализирующее преобразование,
вероятностную модель и синтезирующее преобразование именно в такой совместной постановке.
(Ballé, Laparra & Simoncelli, 2017)
269
Теория информации для машинного обучения
Как обучать систему с недифференцируемой квантизацией
Округление удобно для файла, но неудобно для градиента. Распространённая релаксация заменяет
его во время обучения аддитивным равномерным шумом:
𝑌 = 𝑌 + 𝑈,
𝑈𝑖 ∼ Unif(−1/2, 1/2).
Плотность непрерывного 𝑌 обучается так, чтобы её масса на единичном интервале соответствовала
вероятности будущего дискретного символа. Это даёт гладкий суррогат для оптимизации.
Но суррогат остаётся суррогатом. Финальная проверка кодека должна выполняться с настоящим
округлением, настоящей таблицей вероятностей и настоящим энтропийным кодером. Непрерывная
функция потерь может хорошо предсказывать расход, но не обязана совпадать с каждым физическим
файлом до последнего бита.
Hyperprior: иногда выгодно сначала описать контекст
Представьте два фрагмента изображения: ровное небо и густую листву.
В обоих случаях
основной латент имеет одинаковый формат, но ожидаемый масштаб и локальная вариативность
коэффициентов различаются. Одна факторизованная модель вероятностей вынуждена описывать
оба режима одним и тем же правилом.
Hyperprior передаёт дополнительный латент
𝑍 = 𝑄(ℎ𝑎 (𝑌)),
который помогает декодеру предсказать параметры распределения основного латента:
270
Влад Куликов · Открытая редакция 2026.1
𝑝𝜃 (𝑦 ∣ 𝑧).
Полный модельный счёт становится
𝑅 = 𝔼[− log2 𝑝𝜓 (𝑍)] + 𝔼[− log2 𝑝𝜃 (𝑌 ∣ 𝑍)] .
Смысл прост: мы тратим несколько бит на описание режима, чтобы затем точнее кодировать
большой массив основных символов. Scale hyperprior был введён именно как обучаемая служебная
информация о пространственно меняющейся статистике латентов. (Ballé et al., 2018)
Здесь легко сделать слишком сильный вывод. Из цепного правила не следует, что добавление 𝑍
магически уменьшает фундаментальную энтропию 𝑌:
𝐻(𝑌, 𝑍) = 𝐻(𝑌) + 𝐻(𝑍 ∣ 𝑌) ≥ 𝐻(𝑌).
Практический выигрыш возникает в сравнении ограниченных моделей. Простая факторизация
плохо описывает зависимости в 𝑌, а условная модель с hyperprior может сократить несоответствие
настолько, что экономия на основном потоке превысит цену 𝑍. В §14.9 мы запишем этот баланс как
точное KL-разложение.
Контекстная модель: меньше битов, больше последовательности
Ещё один способ улучшить вероятностную модель — использовать уже декодированные символы:
𝑝(𝑦𝑖 ∣ 𝑦<𝑖 , 𝑧).
271
Теория информации для машинного обучения
Такой контекст способен снизить кросс-энтропию, поскольку учитывает локальные зависимости.
Иерархический prior и авторегрессионный контекст дополняют друг друга; именно это показали
модели с совместным авторегрессионным и иерархическим prior. (Minnen, Ballé & Toderici, 2018)
Но декодирование становится последовательным: для символа 𝑖 нужны предыдущие символы.
Поэтому лучшая вероятностная модель не обязана быть лучшим продуктовым кодеком. Современные
системы специально ищут компромисс между точностью контекста и параллелизмом декодирования.
Для честного сравнения кодеков нужны как минимум:
•
•
•
•
•
•
фактический битовый расход, обычно бит/пиксель;
мера искажения;
задержка кодирования и декодирования;
пиковая память;
стоимость модели и служебной информации;
совместимость и воспроизводимость потока битов.
В нейронном сжатии теория информации даёт ядро задачи. Инженерия решает, какой ценой это
ядро будет реализовано.
14.3. Искажение и перцептивное качество
Функция rate–distortion требует выбрать
𝑑(𝑥, 𝑥).
В компьютерном зрении этот выбор особенно заметен: он определяет, что кодек или восстановительная
модель считают ошибкой.
Представьте, что по шумному наблюдению возможны две одинаково правдоподобные тонкие
текстуры. Квадратичная ошибка предпочитает их среднее. Математически это правильно: условное
среднее минимизирует MSE. Визуально среднее двух текстур может оказаться размытым и не
похожим ни на одну из них.
Отсюда возникают три разных вопроса.
1. Насколько реконструкция близка к конкретному оригиналу?
2. Насколько она похожа на оригинал в выбранном пространстве признаков?
3. Насколько распределение реконструкций похоже на распределение естественных
изображений?
Одна метрика редко отвечает сразу на все три.
MSE и PSNR: точность пикселей
Среднеквадратичная ошибка:
MSE(𝑥, 𝑥) =
1
‖𝑥 − 𝑥‖22 .
𝑁
При фиксированном диапазоне значений PSNR является монотонным преобразованием MSE. Эти
метрики стабильны, легко интерпретируются и естественны, когда важно восстановить численные
значения пикселей.
Их ограничение не в том, что они «плохие», а в том, что они отвечают на узкий вопрос. Для
медицинского изображения, астрономического наблюдения или удалённого зондирования
пиксельная верность может быть принципиальнее зрительной правдоподобности. Для миниатюры
в социальной сети продуктовый приоритет может быть противоположным.
272
Влад Куликов · Открытая редакция 2026.1
LPIPS: расстояние между признаками пары изображений
LPIPS сравнивает нормированные признаки нескольких слоёв глубокой сети. Схематически:
2
𝑤𝑙 ⊙ 𝐹𝑙 (𝑥) − 𝐹𝑙 (𝑥)
𝑑LPIPS (𝑥, 𝑥) =
2
.
𝑙
Веса были калиброваны на человеческих суждениях о перцептивном сходстве, и на соответствующих
тестах эта мера лучше согласовывалась с такими суждениями, чем ряд традиционных пиксельных
метрик. (Zhang et al., 2018)
Важно правильно назвать объект: LPIPS — расстояние между конкретной парой изображений
в выбранном пространстве признаков. Это не MMD, не f-дивергенция и не сравнение двух
распределений изображений.
FID: сравнение распределений в пространстве признаков
Для генератора или генеративного кодека нужен другой вопрос: похож ли набор реконструкций на
набор реальных изображений как распределение?
FID аппроксимирует оба распределения признаков Inception гауссовскими законами и вычисляет
квадрат 𝑊2 -расстояния между ними:
1/2
1/2 1/2
FID = ‖𝜇𝑟 − 𝜇𝑔 ‖22 + Tr Σ𝑟 + Σ𝑔 − 2 Σ𝑟 Σ𝑔 Σ𝑟
.
Это статистика уровня набора. Хороший FID не гарантирует, что конкретная реконструкция
сохранила конкретную деталь исходного изображения. И наоборот, низкий MSE отдельной пары не
гарантирует реалистичность распределения результатов. FID был введён в работе Heusel et al. (2017).
Rate–distortion–perception
Blau и Michaeli предложили добавить к ограничению на искажение отдельное ограничение на
расхождение распределений:
𝑅(𝐷, 𝑃) = inf 𝐼(𝑋; 𝑋)
𝑃𝑋∣𝑋
при
𝔼[𝑑(𝑋, 𝑋)] ≤ 𝐷,
𝒟(𝑃𝑋 , 𝑃𝑋 ) ≤ 𝑃.
При свободном 𝑃 возвращается обычная функция rate–distortion. Если же реконструкции должны
одновременно хорошо соответствовать исходникам и выглядеть как выборки из правильного
распределения, достижимая область обычно сужается. За улучшение восприятия приходится
платить rate, distortion или обоими ресурсами. (Blau & Michaeli, 2019)
273
Теория информации для машинного обучения
Универсальной аддитивной формулы, одинаковой для всех источников и всех мер, здесь нет. Форма
границы зависит от источника, функции искажения, расхождения распределений, доступной
случайности и протокола кодирования.
Что покупает генеративный декодер
Обычный MSE-декодер в неоднозначной ситуации тяготеет к условному среднему. Генеративный
декодер может выбирать одну правдоподобную реализацию из условного распределения. Текстура
становится убедительнее, но конкретные детали могут отличаться от оригинала.
HiFiC показал практический вариант такого компромисса: битовый расход сочетается с distortion-,
perceptual- и adversarial-членами, а реконструкции оценивались и численно, и в пользовательском
исследовании. (Mentzer et al., 2020)
274
Влад Куликов · Открытая редакция 2026.1
Правильный вывод не состоит в том, что генеративный кодек «лучше». Он оптимизирует другой
продуктовый контракт. Если вымышленные детали опасны, реалистичность не заменяет верность.
Если важен внешний вид при крайне малом битовом расходе, жёсткая пиксельная точность может
быть не лучшим расходованием бюджета.
14.4.
Диффузионные модели:
денойзинг и I–MMSE
гауссовское зашумление,
На первый взгляд diffusion далека от кодирования. Но её прямой процесс — это последовательность
гауссовских каналов с разным отношением сигнала к шуму.
Пусть
𝑋𝑡 = 𝛼𝑡 𝑋0 + 𝜎𝑡 𝜀,
𝜀 ∼ 𝒩(0, 𝐼).
После деления на 𝜎𝑡 получаем
𝑌𝛾 =
𝑋𝑡
= √𝛾𝑋0 + 𝑁,
𝜎𝑡
𝛾=
𝛼𝑡2
.
𝜎𝑡2
Каждый уровень шума можно читать как наблюдение одного и того же сигнала при своём SNR.
Что именно учит MSE
Если сеть предсказывает чистое изображение и минимизирует
𝔼‖𝑋0 − 𝑓𝜃 (𝑋𝑡 , 𝑡)‖2 ,
275
Теория информации для машинного обучения
то популяционный оптимум равен условному среднему:
𝑓 ∗ (𝑥𝑡 , 𝑡) = 𝔼[𝑋0 ∣ 𝑋𝑡 = 𝑥𝑡 ] .
Если сеть предсказывает шум,
𝔼‖𝜀 − 𝜀𝜃 (𝑋𝑡 , 𝑡)‖2 ,
оптимум имеет вид
𝜀 ∗ (𝑥𝑡 , 𝑡) = 𝔼[𝜀 ∣ 𝑋𝑡 = 𝑥𝑡 ].
Это не специальная магия diffusion. Условное среднее — обычный оптимальный предиктор для
квадратичной функции потерь. Сила конструкции в том, что такие задачи решаются на множестве
уровней шума.
От денойзера к score
Для гауссовского зашумления выполняется точное тождество:
∇𝑥𝑡 log 𝑝𝑡 (𝑥𝑡 ) =
𝛼𝑡 𝔼[𝑋0 ∣ 𝑥𝑡 ] − 𝑥𝑡
1
= − 𝔼[𝜀 ∣ 𝑥𝑡 ] .
𝜎𝑡
𝜎𝑡2
При известных 𝛼𝑡 и 𝜎𝑡 апостериорное среднее, оптимальный предиктор шума и score содержат одну
и ту же информацию в разных параметризациях.
Но один MMSE-денойзер ещё не является генератором. Обратная SDE или соответствующая ODE
использует поле score на всех уровнях шума, чтобы провести случайную точку от простого базового
распределения к распределению данных. Именно score определяет обратную динамику в score-based
генеративном моделировании. (Song et al., 2021)
I–MMSE: сколько информации добавляет SNR
Для канала
𝑌𝛾 = √𝛾𝑋 + 𝑁
и взаимной информации в натах выполняется
𝑑
1
𝐼(𝑋; 𝑌𝛾 ) = mmse(𝛾) .
𝑑𝛾
2
Здесь
mmse(𝛾) = 𝔼 ‖𝑋 − 𝔼[𝑋 ∣ 𝑌𝛾 ]‖2 .
Тождество справедливо для широкого класса входных распределений с конечным вторым моментом.
(Guo, Shamai & Verdú, 2005)
Интегральная форма особенно наглядна:
𝐼(𝑋; 𝑌𝛾2 ) − 𝐼(𝑋; 𝑌𝛾1 ) =
276
1
2
𝛾2
mmse(𝛾) 𝑑𝛾.
𝛾1
Влад Куликов · Открытая редакция 2026.1
Пока сигнал трудно восстановить, небольшой прирост SNR покупает заметный прирост информации.
Когда апостериорная ошибка уже мала, следующие единицы SNR дают меньше нового.
Где заканчивается это объяснение
Тождества выше действительно связывают гауссовский шум, удаление шума, score и взаимную
информацию. Но они не выбирают за нас:
•
•
•
•
•
•
форму расписания шума;
веса разных уровней в функции потерь;
число шагов сэмплирования;
численный solver;
архитектуру U-Net или Transformer;
способ conditioning и guidance.
Variational Diffusion Models показали, что непрерывная вариационная граница выражается через SNR
и при фиксированных конечных SNR не зависит от формы расписания в среднем, хотя расписание
влияет на дисперсию оценивателя, дискретизацию и удобство оптимизации. (Kingma et al., 2021)
Это хороший пример роли теории информации в современном ML. Она даёт точный скелет
механизма, но не подменяет весь проект модели.
14.5. CLIP и контрастивное выравнивание изображений с
текстом
CLIP ставит простую, но масштабируемую задачу: среди текстов в батче найти подпись, соответствующую
изображению, и симметрично среди изображений найти соответствие для текста.
Пусть
277
Теория информации для машинного обучения
𝑧𝑖𝐼 = 𝑓𝐼 (𝑥𝑖 ),
𝑧𝑗𝑇 = 𝑓𝑇 (𝑦𝑗 ),
а 𝑠(𝑧𝑖𝐼 , 𝑧𝑗𝑇 ) — косинусное сходство или скалярное произведение нормированных представлений. Один
из двух симметричных членов имеет вид
(𝑖)
𝓁𝐼→𝑇 = − log
exp(𝑠(𝑧𝑖𝐼 , 𝑧𝑖𝑇 )/𝜏)
𝐾
∑𝑗=1 exp(𝑠(𝑧𝑖𝐼 , 𝑧𝑗𝑇 )/𝜏)
.
То есть визуальный энкодер обучается различать правильное текстовое соответствие среди
кандидатов. Это контрастивная классификационная игра, а не реконструкция пикселей. (Radford et al., 2021)
Связь с InfoNCE
При стандартной вероятностной схеме — одна положительная пара из совместного распределения и
𝐾 − 1 независимых отрицательных примеров из маргинального — выполняется
𝐼(𝑍𝐼 ; 𝑍𝑇 ) ≥ log 𝐾 − ℒNCE .
Это важная связь. Контрастивная классификация заставляет оценочную функцию приближать
отношение совместной плотности к произведению маргиналов, а её качество даёт нижнюю границу
на MI.
Но численное значение эмпирической функции потерь CLIP не является точным измерением
истинной взаимной информации. Граница зависит от схемы отрицательной выборки, класса
278
Влад Куликов · Открытая редакция 2026.1
критиков и популяционного ожидания. Число log 𝐾 ограничивает именно эту нижнюю границу, а не
само содержание представлений.
Большой батч даёт больше кандидатов и повышает возможный потолок границы. Он также меняет
оптимизацию, число ложных отрицательных пар и вычислительную стоимость. Поэтому «больше
negatives» — инженерный рычаг, а не монотонный закон качества.
Какой сигнал получает визуальный энкодер
Точный положительный вывод можно сформулировать без IB-лозунга:
CLIP усиливает в представлении те различия между изображениями, которые
помогают сопоставлять их с текстами среди рассматриваемых кандидатов.
Это естественно создаёт сильную семантическую структуру: объекты, действия, стили и категории,
которые регулярно выражаются в подписях, получают прямой обучающий сигнал. Именно поэтому
представления CLIP хорошо переносятся на zero-shot classification и retrieval.
Information Bottleneck оптимизировал бы явный компромисс
𝐼(𝑋; 𝑍) − 𝛽𝐼(𝑍; 𝑌).
В обычной функции потерь CLIP нет отдельной цены за 𝐼(𝑋𝐼 ; 𝑍𝐼 ). Поэтому из неё не следует,
что энкодер нашёл минимальное достаточное представление или гарантированно выбросил всю
нетекстовую информацию. Корректнее говорить о давлении задачи на релевантность, а не о
решённом IB.
SigLIP хорошо показывает, что даже внутри одной общей идеи возможны разные обучающие игры:
он заменяет общую softmax-нормировку попарной sigmoid-функцией потерь. Цель — согласовать
изображения и тексты — остаётся, но статистика отрицательных пар и вычислительная организация
меняются. (Zhai et al., 2023)
Почему одной информационной линзы недостаточно
Если модель ошибается в OCR, подсчёте объектов или пространственном grounding, причиной может
быть не только обучающий сигнал. Важны также:
•
•
•
•
•
•
разрешение изображения и размер патча;
состав image–text данных;
качество подписей;
архитектура визуального энкодера;
связующий модуль между визуальным энкодером и LLM;
post-training и протокол оценки.
Достаточность представления всегда относится к конкретной целевой переменной. Условие
𝑌task ⟂ 𝑋 ∣ 𝑍
нужно проверять отдельно для поиска, OCR, сегментации и локализации. «Семантический
эмбеддинг» не является универсальным достаточным статистиком для всех визуальных задач.
14.6. Самообучение визуальных представлений: инвариантности
и защита от коллапса
В self-supervised learning разметку заменяет специально сконструированная задача. Часто берутся две
аугментированные версии одного изображения:
𝑉1 = 𝑇1 (𝑋),
𝑉2 = 𝑇2 (𝑋).
279
Теория информации для машинного обучения
Аугментации здесь не декоративное увеличение набора данных. Они являются частью спецификации
задачи:
Если две версии объявлены эквивалентными, модель получает сигнал не
использовать различия между ними.
Цветовое искажение, crop, blur и геометрические преобразования тем самым задают предполагаемые
инвариантности представления.
Есть и строгая граница. Если преобразование уничтожило информацию о будущей метке 𝑌, энкодер
не сможет восстановить её из ничего:
𝑌 ⟶ 𝑋 ⟶ 𝑉 ⟶ 𝑍,
поэтому по DPI
𝐼(𝑌; 𝑍) ≤ 𝐼(𝑌; 𝑉) ≤ 𝐼(𝑌; 𝑋).
Сильная аугментация может улучшить одну целевую задачу и ухудшить другую. Инвариантность
всегда относительна к тому, что мы собираемся делать дальше.
Контрастивные методы: SimCLR и MoCo
SimCLR сближает две версии одного изображения и раздвигает представления разных изображений
с помощью InfoNCE-подобной функции потерь. В исходной работе критическими оказались
композиция аугментаций, проекционная голова и достаточный объём отрицательных примеров.
(Chen et al., 2020)
MoCo решает ту же общую задачу через динамический словарь: очередь отрицательных ключей и
momentum-обновляемый энкодер позволяют поддерживать большой и относительно согласованный
набор кандидатов без огромного текущего батча. (He et al., 2020)
Информационная граница объясняет одну часть механизма. Геометрическая картина alignment и uniformity объясняет другую: положительные пары должны сближаться, а представления всего набора
не должны собраться в одной точке.
Self-distillation: BYOL и DINO
Если просто потребовать равенства представлений двух версий, постоянный вектор даст нулевую
ошибку. Это и есть коллапс: цель согласования выполнена, но полезной структуры нет.
BYOL избегает обычных отрицательных пар. Online-сеть предсказывает представление медленно
обновляемой target-сети, а stop-gradient и асимметрия ветвей меняют динамику задачи. (Grill et al.,
2020)
DINO использует student–teacher self-distillation, centering, sharpening и multi-crop. В исходной работе
представления self-supervised ViT демонстрировали выраженную пространственную структуру и
хорошо работали в k-NN и линейных протоколах. (Caron et al., 2021)
Эти методы можно анализировать информационно, но их обучающие цели не являются стандартными
оценивателями MI.
Ограничения на дисперсию и избыточность
VICReg сочетает три члена:
• согласование двух версий;
• нижнюю границу дисперсии каждой координаты;
• штраф за ковариации между координатами.
280
Влад Куликов · Открытая редакция 2026.1
Дисперсионный член не даёт всем примерам стать одной точкой, а ковариационный уменьшает
линейную избыточность. (Bardes, Ponce & LeCun, 2021)
Barlow Twins приближает матрицу взаимной корреляции двух представлений к единичной. (Zbontar
et al., 2021)
Положительная дисперсия ещё не гарантирует семантическую полезность, а нулевая ковариация
в общем случае не означает независимость. Эти члены решают конкретную проблему геометрии
представлений, а не всю задачу достаточности.
Masked modeling: MAE
MAE скрывает большую долю патчей, кодирует только видимые и обучает декодер восстанавливать
отсутствующие пиксели. (He et al., 2022)
Здесь защита от тривиального решения возникает через необходимость предсказывать скрытое
содержание. Это реконструктивная цель, а не контрастивная классификация и не обычная InfoNCEграница.
Получается полезная карта:
Семейство
Что связывает две версии
SimCLR, MoCo
BYOL, DINO
контрастивное
различение
student–teacher prediction
VICReg, Barlow Twins
согласование статистик
Как избегает
тривиального решения
Что особенно задаёт
качество
отрицательные
кандидаты
асимметрия,
stop-gradient, teacher
dynamics
дисперсия и
декорреляция
аугментации и словарь
negatives
архитектура и динамика
обновления
281
выбранные
batch-статистики
Теория информации для машинного обучения
Семейство
Что связывает две версии
MAE
реконструкция скрытых
патчей
Как избегает
тривиального решения
Что особенно задаёт
качество
скрытая часть входа
mask ratio и декодер
Общая идея не в том, что все методы «максимизируют MI». Они конструируют разные способы
сохранить предсказуемую структуру, ввести полезные инвариантности и не позволить представлению
схлопнуться. Именно различия между этими способами и определяют перенос на downstreamзадачи.
14.7. Сжатие CV-модели: квантизация, pruning и distillation
До сих пор мы сжимали изображение или представление. Теперь ограниченным ресурсом становится
сама система: размер файла модели, пропускная способность памяти, задержка и энергия.
Квантизация
Для равномерного аффинного квантизатора:
𝑞 = clip (round(𝑤/𝑠) + 𝑧, 𝑞min , 𝑞max ) ,
𝑤 = 𝑠(𝑞 − 𝑧).
Номинальный INT4 говорит, что код одного значения занимает четыре бита. Но сериализованная
модель дополнительно хранит масштабы, нулевые точки, границы групп, выравнивание и иногда
кодовые книги.
Например, group-wise INT4 с группой из 128 весов и одним 16-битным scale на группу требует без
учёта выравнивания
4+
16
= 4.125
128
бита на исходный вес.
Чтобы превратить квантизацию в настоящую rate–distortion-постановку, нужно выбрать distortion.
Простая ошибка весов
‖𝑊 − 𝑊‖22
может быть удобным локальным суррогатом, но одинаковое изменение разных весов по-разному
влияет на активации, логиты и итоговую метрику. Поэтому практические методы используют
калибровочные данные, ошибку выходов слоя, чувствительность по Гессиану или сквозную функцию
потерь.
PTQ, QAT и особенности Vision Transformer
Post-training quantization (PTQ) калибрует уже обученную сеть. Quantization-aware training (QAT)
включает имитацию квантизации в обучение и позволяет параметрам адаптироваться.
Vision Transformer создаёт специфические режимы: входы LayerNorm, выходы GELU и attention
probabilities имеют разные масштабы и формы распределений. FQ-ViT и PTQ4ViT разрабатывали
специальные квантизаторы и критерии калибровки именно для этих компонентов. (Lin et al., 2021;
Yuan et al., 2021)
282
Влад Куликов · Открытая редакция 2026.1
Смешанная точность как распределение бюджета
Если слой 𝑙 получает 𝑏𝑙 бит, естественная инженерная задача имеет вид
min 𝐷(𝑏1 , … , 𝑏𝐿 )
𝑏1 ,…,𝑏𝐿
при
𝑛𝑙 𝑏𝑙 ≤ 𝐵.
𝑙
Это действительно напоминает распределение битов в классической rate–distortion-теории. Но
функция 𝐷 задаётся конкретной моделью, данными и метрикой. Универсальной формулы для
произвольной нейросети нет.
Pruning: нули тоже требуют формата
Неструктурированный pruning уменьшает число ненулевых параметров, но добавляет стоимость
индексов и нерегулярного хранения.
При умеренной разреженности sparse-представление
может занимать не меньше плотного низкоразрядного тензора и плохо ускоряться на обычном
оборудовании.
Структурный pruning удаляет каналы, головы или блоки.
ускорение, потому что сохраняет регулярные операции.
Он чаще превращается в реальное
MDL даёт здесь полезную дисциплину: оплачивать нужно и значения, и структуру маски. Но само
слово «разреженность» ещё не сообщает фактический размер файла и задержку.
Distillation: сжатие функции
Knowledge distillation обучает student приближать распределение teacher, например через
𝐷KL (𝑞𝑇 (⋅ ∣ 𝑥)‖𝑞𝑆 (⋅ ∣ 𝑥)) .
Это удобно читать как функциональное сжатие: меньшая модель получает ограниченный
вычислительный бюджет и должна воспроизвести поведение большей.
Здесь rate может означать число параметров, размер файла, FLOPs или latency. Distortion — KL по
выходам, ошибка логитов или ухудшение downstream-метрики. Пока эти величины не названы,
фраза «distillation — rate–distortion» остаётся только общей аналогией.
На синтетической кривой ниже используются группы по 128 весов, clipping по p99.9 внутри каждой
группы и один хранимый FP16-scale на группу. Поэтому rate и нормированная MSE весов относятся
к одной и той же схеме квантизации.
283
Теория информации для машинного обучения
Хороший отчёт о развёртывании должен содержать:
•
•
•
•
•
•
размер сериализованной модели;
пиковую память;
задержку на целевом устройстве;
пропускную способность или энергию, если они измеряются;
итоговую метрику задачи;
калибровку и устойчивость после сжатия.
Номинальная разрядность — начало измерения, а не его итог.
14.8. Один CV-пайплайн, четыре разных информационных
бюджета
Рассмотрим систему текстового поиска по изображениям на периферийном устройстве.
1.
2.
3.
4.
5.
6.
Камера получает изображение 𝑋.
При необходимости кодек хранит или передаёт его.
Визуальный энкодер строит embedding 𝑍 = 𝑓(𝑋).
Текстовый энкодер строит embedding запроса 𝑈 = 𝑔(𝑇).
Индекс ищет близкие 𝑍.
Квантованная модель должна уложиться в память и задержку устройства.
284
Влад Куликов · Открытая редакция 2026.1
В одной системе присутствуют несколько независимых счетов.
Компонент
Rate или ресурс
Distortion или критерий
кодек изображения
визуальное представление
бит/пиксель, размер файла
размерность и статистика 𝑍
поисковый индекс
байт на объект
модель
байты, память, FLOPs, latency
MSE, LPIPS, задача downstream
сохранение информации о
выбранной задаче
recall@K, изменение
ранжирования
NLL, accuracy, retrieval quality
Кодек данных
Для нейронного кодека
𝑅image ≈ 𝔼[− log2 𝑝(𝑌, 𝑍)].
Здесь rate имеет прямой операционный смысл.
Представление
Эмбеддинг 𝑍 должен сохранять то, что важно для поиска по тексту. Для пиксельной сегментации,
точной локализации или оценки качества изображения достаточное представление может быть
другим.
Нельзя одновременно требовать, чтобы один вектор был минимальным и достаточным для всех
возможных задач. Минимальность всегда определяется относительно выбранной релевантной
переменной.
285
Теория информации для машинного обучения
Индекс
Product quantization или binary hashing сжимают эмбеддинги. Здесь rate — число байт на объект.
Возможные distortions:
• ошибка восстановления вектора;
• потеря recall@K;
• изменение порядка соседей.
Это три разные задачи, и улучшение одной не обязано улучшать остальные.
Модель
INT8 или INT4 уменьшают размер модели и нагрузку на память. Искажение нужно измерять
сквозным образом: по качеству поиска, задержке и устойчивости на целевом устройстве.
Диагностические вопросы
В таком пайплайне особенно легко смешать разные геометрии и разные случайные величины.
•
•
•
•
•
Косинусное расстояние между эмбеддингами не является f-дивергенцией распределений.
Низкая энтропия координат не гарантирует хороший поиск.
Большая 𝐼(𝑋; 𝑍) не гарантирует релевантность для текста.
Хороший FID не гарантирует сохранность детали конкретного изображения.
INT4 не сообщает фактический размер файла без формата упаковки.
Поэтому финальная карта модуля укладывается в три вопроса:
rate чего?
distortion относительно чего?
информация о какой задаче?
14.9. Математическое углубление: два точных расчёта
Можно пропустить при первом чтении. Здесь мы разбираем два места, где короткая
инженерная интуиция полезна, но точный счёт ещё полезнее.
14.9.1. Когда hyperprior действительно экономит биты
Пусть 𝑃𝑌 — истинное распределение основного квантованного латента, а факторизованная модель
кодера равна 𝑄𝑓 . Её ожидаемая идеальная длина:
𝑅fact = 𝔼𝑃𝑌 [− log2 𝑄𝑓 (𝑌)] = 𝐻2 (𝑃𝑌 ) + 𝐷KL,2 (𝑃𝑌 ‖𝑄𝑓 ).
Теперь введём служебную переменную 𝑍 и иерархическую модель
𝑄ℎ (𝑦, 𝑧) = 𝑄𝑍 (𝑧)𝑄𝑌∣𝑍 (𝑦 ∣ 𝑧).
Её ожидаемый счёт:
𝑅hier = 𝔼𝑃𝑌,𝑍 [− log2 𝑄𝑍 (𝑍) − log2 𝑄𝑌∣𝑍 (𝑌 ∣ 𝑍)]
= 𝐻2 (𝑃𝑌,𝑍 ) + 𝐷KL,2 (𝑃𝑌,𝑍 ‖𝑄ℎ )
= 𝐻2 (𝑃𝑌 ) + 𝐻2 (𝑍 ∣ 𝑌) + 𝐷KL,2 (𝑃𝑌,𝑍 ‖𝑄ℎ ).
Следовательно,
𝑅fact − 𝑅hier = 𝐷KL,2 (𝑃𝑌 ‖𝑄𝑓 ) − 𝐻2 (𝑍 ∣ 𝑌) − 𝐷KL,2 (𝑃𝑌,𝑍 ‖𝑄ℎ ) .
286
Влад Куликов · Открытая редакция 2026.1
Hyperprior выигрывает, когда уменьшение модельного несоответствия превосходит цену служебной
переменной и остаточное несоответствие иерархической модели.
Если 𝑍 является детерминированной функцией уже кодируемого 𝑌, то 𝐻(𝑍 ∣ 𝑌) = 0: идеальная
совместная энтропия не выросла. В реальном кодеке всё равно остаются кросс-энтропийный
зазор, конечная точность и накладные расходы. Если же 𝑍 содержит дополнительную случайность
относительно 𝑌, условная энтропия является настоящей ценой.
Вот и вся механика: hyperprior не нарушает предел Шеннона. Он позволяет ограниченному семейству
вероятностных моделей приблизиться к нему.
14.9.2. Гауссовские тождества удаления шума
Пусть
𝑋 ∼ 𝒩(0, 𝜎𝑋2 ),
𝑌𝛾 = √𝛾𝑋 + 𝑁,
𝑁 ∼ 𝒩(0, 1).
Тогда
𝐼(𝑋; 𝑌𝛾 ) =
1
ln(1 + 𝛾𝜎𝑋2 ),
2
а апостериорная дисперсия равна
mmse(𝛾) =
𝜎𝑋2
.
1 + 𝛾𝜎𝑋2
Поэтому
𝑑𝐼
1
1 𝜎𝑋2
= mmse(𝛾).
=
2
𝑑𝛾
2 1 + 𝛾𝜎𝑋
2
Теперь рассмотрим
𝑋𝑡 = 𝛼𝑋 + 𝜎𝜀,
𝜀 ∼ 𝒩(0, 1).
Маргинальное распределение:
𝑋𝑡 ∼ 𝒩 0, 𝛼 2 𝜎𝑋2 + 𝜎 2 ,
поэтому
∇𝑥𝑡 log 𝑝𝑡 (𝑥𝑡 ) = −
𝑥𝑡
.
+ 𝜎2
𝛼 2 𝜎𝑋2
Апостериорное среднее:
𝔼[𝑋 ∣ 𝑋𝑡 = 𝑥𝑡 ] =
𝛼𝜎𝑋2
𝑥𝑡 .
𝛼 2 𝜎𝑋2 + 𝜎 2
Подстановка даёт
𝛼𝔼[𝑋 ∣ 𝑥𝑡 ] − 𝑥𝑡
= ∇𝑥𝑡 log 𝑝𝑡 (𝑥𝑡 ).
𝜎2
287
Теория информации для машинного обучения
В гауссовском случае весь мост между denoising, score и I–MMSE виден без скрытой техники. В
негауссовском случае те же структурные тождества сохраняются, но апостериорное среднее и score
уже нелинейны — именно их и приходится аппроксимировать нейросетью.
14.11. Заключение
Компьютерное зрение удобно тем, что здесь несколько смыслов слова «информация» встречаются в
одной системе и быстро обнаруживают различия между собой.
В нейронном кодеке вероятность латента превращается в настоящий поток битов.
операциональная связь.
Это точная
В diffusion гауссовский канал связывает условное среднее, score и взаимную информацию. Это
точный математический механизм, но не готовый рецепт всей генеративной системы.
В CLIP и self-supervised learning целевая функция определяет, какие различия между изображениями
должны стать доступными представлению. Информационная теория помогает читать эту задачу, но
качество также задают аугментации, данные, геометрия эмбеддингов и downstream-протокол.
При квантизации и pruning сжимается уже не изображение, а модель. Тогда rate нужно считать по
реальному формату и оборудованию, а distortion — по функции системы, а не только по локальной
ошибке весов.
Главный результат модуля можно сформулировать без метафоры:
Теория информации особенно полезна в CV не тогда, когда каждый метод
называют каналом или bottleneck, а тогда, когда она заставляет точно назвать,
что передаётся, что восстанавливается и как оплачивается ошибка.
Основные источники
1. J. Ballé, V. Laparra, E. P. Simoncelli, End-to-end Optimized Image Compression, 2017.
2. J. Ballé et al., Variational Image Compression with a Scale Hyperprior, 2018.
3. D. Minnen, J. Ballé, G. Toderici, Joint Autoregressive and Hierarchical Priors for Learned Image
Compression, 2018.
4. Y. Blau, T. Michaeli, The Perception-Distortion Tradeoff , 2018.
5. Y. Blau, T. Michaeli, Rethinking Lossy Compression: The Rate-Distortion-Perception Tradeoff , 2019.
6. R. Zhang et al., The Unreasonable Effectiveness of Deep Features as a Perceptual Metric, 2018.
7. F. Mentzer et al., High-Fidelity Generative Image Compression, 2020.
8. D. Guo, S. Shamai, S. Verdú, Mutual Information and Minimum Mean-Square Error in Gaussian
Channels, 2005.
9. Y. Song et al., Score-Based Generative Modeling through Stochastic Differential Equations, 2021.
10. D. P. Kingma et al., Variational Diffusion Models, 2021.
11. A. Radford et al., Learning Transferable Visual Models From Natural Language Supervision, 2021.
12. X. Zhai et al., Sigmoid Loss for Language Image Pre-Training, 2023.
13. T. Chen et al., A Simple Framework for Contrastive Learning of Visual Representations, 2020.
14. K. He et al., Momentum Contrast for Unsupervised Visual Representation Learning, 2020.
15. J.-B. Grill et al., Bootstrap Your Own Latent, 2020.
16. M. Caron et al., Emerging Properties in Self-Supervised Vision Transformers, 2021.
17. A. Bardes, J. Ponce, Y. LeCun, VICReg, 2021.
18. J. Zbontar et al., Barlow Twins, 2021.
19. K. He et al., Masked Autoencoders Are Scalable Vision Learners, 2022.
20. Y. Lin et al., FQ-ViT, 2021.
21. Z. Yuan et al., PTQ4ViT, 2021.
22. M. Heusel et al., GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium, 2017.
288
Модуль 15. Информационная
геометрия: Fisher, естественный
градиент и потоки распределений
Как читать этот модуль. Это заключительный бонусный модуль курса. Основной
маршрут — §§15.1–15.8: почему обычный градиент зависит от координат, как информация
Фишера задаёт локальную геометрию распределений, откуда возникает естественный
градиент, какие приближения кривизны реально используются в глубоких сетях, как эта
геометрия проявляется в TRPO, PPO и RLHF и почему для переноса вероятностной массы
нужна уже Wasserstein-геометрия. §15.9 — математическое углубление об α-геометрии,
точных геодезических и теореме Ченцова. Его можно оставить на второй проход.
15.1. Что значит «маленький шаг» для вероятностной модели
Оптимизатор двигает параметры.
Но интересует нас обычно не сам вектор параметров, а
распределение, функция или политика, которые он задаёт.
Начнём с самой маленькой вероятностной модели — распределения Бернулли. Вероятность события
можно записать непосредственно как
𝑝 ∈ (0, 1)
или через логит
𝑧 = log
𝑝
,
1−𝑝
𝑝 = 𝜎(𝑧).
Это две системы координат для одного и того же статистического объекта. Если сделать обычный
градиентный шаг по 𝑝, а затем решить ту же задачу по 𝑧, траектории вероятности в общем случае не
совпадут. Алгоритм изменился только потому, что мы переименовали координату.
Есть и более физическая проблема.
Одинаковое изменение вероятности не везде означает
одинаковое изменение распределения. Переход
0.50 ⟶ 0.51
даёт
𝐷KL Bern(0.50)‖ Bern(0.51) ≈ 2.00 ⋅ 10−4
ната. А переход
0.01 ⟶ 0.02
289
Теория информации для машинного обучения
при той же евклидовой длине шага 0.01 даёт уже
𝐷KL Bern(0.01)‖ Bern(0.02) ≈ 3.12 ⋅ 10−3
ната — более чем в пятнадцать раз больше. В первом случае мы слегка сдвинули почти неопределённую
монету. Во втором — удвоили вероятность редкого события.
В глубокой сети та же проблема скрыта миллионами координат:
•
•
•
•
перестановка нейронов может не менять реализуемую функцию;
масштабы соседних слоёв способны взаимно компенсироваться;
softmax не меняется при добавлении общей константы ко всем логитам;
один и тот же евклидов шаг в весах может почти не изменить выход модели или, наоборот,
радикально перестроить распределение.
Поэтому центральный вопрос информационной геометрии звучит так:
Как измерять изменение модели в терминах самого вероятностного объекта,
а не случайно выбранных координат?
Ответа «одна правильная геометрия для всего ML» не существует. В этом модуле встретятся три
разных конструкции.
1. Fisher–Rao и локальная KL измеряют различимость соседних вероятностных моделей.
2. Дивергенции Брэгмана и зеркальный спуск задают удобную геометрию обновлений на
симплексе и в экспоненциальных семействах.
3. Wasserstein-геометрия учитывает стоимость переноса массы в пространстве наблюдений.
Полезная короткая формулировка:
Геометрия — это договор о том, какие изменения считать малыми.
290
Влад Куликов · Открытая редакция 2026.1
Если объектом является политика, малость можно измерять средним KL между распределениями
действий. Если мы переносим изображение из шума в данные, важна стоимость движения
в пространстве пикселей или признаков. Если оптимизируем обычную детерминированную
регрессию, Fisher может вообще оказаться не тем объектом, который нужен.
Сначала разберём геометрию соседних распределений.
15.2. Информация Фишера и локальная форма KL
Пусть модель задаёт гладкое семейство распределений
ℳ = 𝑝𝜃 (𝑥) ∶ 𝜃 ∈ Θ ⊆ ℝ𝑑 .
Вектор
𝑠𝜃 (𝑥) = ∇𝜃 log 𝑝𝜃 (𝑥)
называется скор-функцией (score
function) по параметрам.
регулярности его среднее равно нулю:
𝔼𝑝𝜃 [𝑠𝜃 (𝑋)] =
При стандартных условиях
∇𝜃 𝑝𝜃 (𝑥) 𝑑𝑥 = ∇𝜃 1 = 0.
Матрица информации Фишера:
𝐺(𝜃) = 𝔼𝑋∼𝑝𝜃 𝑠𝜃 (𝑋)𝑠𝜃 (𝑋)⊤ .
Для направления 𝑣 квадратичная форма имеет особенно прозрачный смысл:
𝑣 ⊤ 𝐺(𝜃)𝑣 = Var𝑝𝜃 𝑣 ⊤ 𝑠𝜃 (𝑋) .
Если это число велико, движение вдоль 𝑣 заметно меняет логарифмические вероятности типичных
наблюдений. Соседние модели в этом направлении легче различить статистически. Если число
равно нулю, малый сдвиг вдоль 𝑣 в первом порядке вообще не меняет распределение.
Почему Fisher появляется из KL
Рассмотрим соседнюю модель 𝑝𝜃+𝑑𝜃 . Разложим её логарифм около 𝜃:
log 𝑝𝜃+𝑑𝜃 (𝑥) = log 𝑝𝜃 (𝑥) + 𝑠𝜃 (𝑥)⊤ 𝑑𝜃 +
1 ⊤ 2
𝑑𝜃 ∇𝜃 log 𝑝𝜃 (𝑥)𝑑𝜃 + 𝑜(‖𝑑𝜃‖2 ).
2
Подставим в KL:
𝐷KL 𝑝𝜃 ‖𝑝𝜃+𝑑𝜃 = 𝔼𝑝𝜃 [log 𝑝𝜃 (𝑋) − log 𝑝𝜃+𝑑𝜃 (𝑋)] .
Линейный член исчезает, потому что среднее скор-функции равно нулю.
перенести производные под знак интеграла
−𝔼𝑝𝜃 ∇2𝜃 log 𝑝𝜃 (𝑋) = 𝐺(𝜃).
Получаем центральное локальное тождество:
291
При возможности
Теория информации для машинного обучения
𝐷KL 𝑝𝜃 ‖𝑝𝜃+𝑑𝜃 =
1 ⊤
𝑑𝜃 𝐺(𝜃)𝑑𝜃 + 𝑜(‖𝑑𝜃‖2 ) .
2
На этом месте удобно остановиться и прочитать формулу словами:
Fisher — это второй порядок цены малого изменения распределения,
измеренной через KL.
Прямая и обратная KL имеют один и тот же квадратичный член. Их асимметрия проявляется
начиная с более высоких порядков. Поэтому Fisher даёт локальную риманову геометрию, но не
превращает саму KL в глобальное расстояние: KL остаётся асимметричной и не удовлетворяет
неравенству треугольника.
Почему длина не зависит от координат
Пусть та же модель записана в новых координатах 𝜙, причём 𝜃 = 𝜃(𝜙) и
𝐽=
𝜕𝜃
.
𝜕𝜙
Тогда
𝐺𝜙 = 𝐽⊤ 𝐺𝜃 𝐽.
Одновременно
292
Влад Куликов · Открытая редакция 2026.1
𝑑𝜃 = 𝐽 𝑑𝜙.
Поэтому
𝑑𝜃 ⊤ 𝐺𝜃 𝑑𝜃 = 𝑑𝜙 ⊤ 𝐺𝜙 𝑑𝜙.
Числа в матрице меняются, но локальная статистическая длина остаётся той же. Именно это
означает, что Fisher ведёт себя как метрический тензор, а не как произвольный предобусловливатель.
Точный пример: Bernoulli
Для 𝑋 ∼ Bernoulli(𝑝) в координате 𝑝:
𝐺𝑝 (𝑝) =
1
.
𝑝(1 − 𝑝)
В логит-координате 𝑧:
𝐺𝑧 (𝑧) = 𝑝(1 − 𝑝).
Матрицы выглядят противоположно: одна растёт у края симплекса, другая там стремится к нулю. Но
элемент длины совпадает:
𝑑𝑝2
= 𝑝(1 − 𝑝) 𝑑𝑧 2 .
𝑝(1 − 𝑝)
Координата
𝑢(𝑝) = 2 arcsin √𝑝
выпрямляет эту одномерную геометрию:
𝑑𝑠 2 = 𝑑𝑢2 .
Поэтому точное расстояние Fisher–Rao между двумя монетами равно
𝑑FR (𝑝1 , 𝑝2 ) = 2 arcsin √𝑝2 − arcsin √𝑝1 .
Для 𝑝1 = 0.1 и 𝑝2 = 0.9:
𝑑FR ≈ 1.85459.
293
Теория информации для машинного обучения
Та же матрица ограничивает точность оценивания
Для 𝑛 независимых наблюдений и несмещённого оценивателя при условиях регулярности граница
Крамера—Рао даёт
Cov(𝜃) ⪰
1
𝐺(𝜃)−1 .
𝑛
Это другая сторона той же идеи. Если соседние распределения легко различимы, параметр можно
оценить точнее. Если разные значения параметра почти не меняют наблюдаемое распределение,
никакой несмещённый оцениватель не сможет извлечь высокую точность из тех же данных.
Где заканчивается локальная картина
У результата есть три важные границы.
• Квадратичная аппроксимация надёжна только для достаточно малого шага.
• Положительная определённость Fisher требует локальной идентифицируемости. В глубоких
сетях симметрии и избыточные параметры часто делают её сингулярной.
• Fisher зависит от того, какое распределение наблюдений и условную модель мы объявили
статистическим объектом. «Матрица Fisher сети» без уточнения ожиданий — ещё не полное
определение.
Последний пункт станет центральным в §15.4. Сначала посмотрим, какой шаг возникает, если
именно Fisher использовать для измерения малости обновления.
294
Влад Куликов · Открытая редакция 2026.1
15.3. Естественный градиент:
малом изменении модели
наискорейший спуск при
Пусть нужно минимизировать функцию 𝐿(𝜃), а
𝑔 = ∇𝜃 𝐿.
Обычный градиент является направлением наискорейшего спуска при евклидовом ограничении на
шаг. Но если малость измеряется локальной KL, естественная задача другая:
min 𝑔⊤ 𝛿
1 ⊤
𝛿 𝐺𝛿 ≤ 𝜀.
2
при
𝛿
Лагранжиан даёт направление
∇𝜃 𝐿 = 𝐺(𝜃)† 𝑔 ,
где 𝐺 † — обратная или псевдообратная матрица. При невырожденной 𝐺 шаг, использующий весь
допустимый бюджет, равен
𝛿∗ = −
2𝜀
𝑔⊤ 𝐺 −1 𝑔
𝐺 −1 𝑔 .
Представьте
𝐺=
100 0
,
0
1
𝑔=
1
.
1
Обычный градиент предлагает одинаково двигаться по обеим координатам. Естественный градиент
даёт направление
𝐺 −1 𝑔 =
0.01
.
1
Первая координата в сто раз чувствительнее с точки зрения изменения распределения, поэтому тот
же статистический бюджет разрешает значительно меньший сдвиг.
295
Теория информации для машинного обучения
Инвариантность на примере Bernoulli
Пусть целевая функция зависит от вероятности: 𝐿 = 𝐿(𝑝). В координате 𝑝 естественный градиентный
поток имеет вид
𝑑𝐿
𝑑𝑝
= −𝑝(1 − 𝑝) .
𝑑𝑡
𝑑𝑝
В логит-координате
𝑑𝐿
𝑑𝐿
=
𝑝(1 − 𝑝),
𝑑𝑧
𝑑𝑝
𝐺𝑧 = 𝑝(1 − 𝑝),
поэтому
𝑑𝑧
𝑑𝐿
𝑑𝐿
= −𝐺𝑧−1
=− .
𝑑𝑡
𝑑𝑧
𝑑𝑝
После обратного преобразования:
𝑑𝑝
𝑑𝑧
𝑑𝐿
= 𝑝(1 − 𝑝)
= −𝑝(1 − 𝑝) .
𝑑𝑡
𝑑𝑡
𝑑𝑝
Обе системы координат описывают один и тот же непрерывный поток распределений. Обычный
градиентный поток такого свойства не имеет.
Это и есть сильный положительный результат естественного градиента: векторное поле не
зависит от гладкой взаимно однозначной перепараметризации статистической модели.
296
Влад Куликов · Открытая редакция 2026.1
Почему конечный шаг всё же зависит от реализации
Практический алгоритм делает не бесконечно малое движение, а шаг Эйлера:
𝜃𝑡+1 = 𝜃𝑡 − 𝜌𝐺(𝜃𝑡 )−1 𝑔𝑡 .
После нелинейной замены координат конечные точки такого шага совпадают только с точностью
первого порядка по 𝜌. Для точной конечной инвариантности потребовалась бы геодезическая
интеграция или согласованная ретракция на многообразии.
Поэтому на практике важны:
•
•
•
•
•
малый или адаптивно выбранный шаг;
проверка фактического KL после обновления;
линейный поиск;
демпфирование;
качество приближения матрицы кривизны.
Демпфированный шаг
(𝐺 + 𝜆𝐼)−1 𝑔
часто необходим численно. Но добавка 𝜆𝐼 вводит в задачу евклидову часть и тем самым меняет
исходную геометрию. Это полезная инженерная уступка, а не нейтральная деталь.
Естественный градиент и метод Ньютона
Метод Ньютона использует гессиан самой целевой функции:
𝛿N = −𝐻𝐿−1 𝑔.
Естественный градиент использует Fisher статистической модели:
𝛿NG = −𝐺 −1 𝑔.
Они могут совпадать в специальных постановках правдоподобия — например, на уровне ожидаемой
отрицательной логарифмической функции правдоподобия при подходящей спецификации модели.
В нейросетях Fisher также тесно связана с обобщённой матрицей Гаусса—Ньютона для ряда выходных
распределений экспоненциального семейства. Но эмпирический гессиан, модельная Fisher и GGN в
общем случае различны. Подробный разбор этой связи и её практических последствий дан у Martens,
2020.
Полезно запомнить:
Обратная Fisher не является магическим ускорителем. Она меняет единицы
измерения шага так, чтобы одинаковый бюджет означал примерно одинаковое
изменение распределения.
15.4. Что именно называют «кривизной» в глубокой сети
Полную матрицу Fisher модели с миллиардами параметров нельзя хранить и обращать напрямую.
Но прежде чем обсуждать приближения, нужно понять, к какой матрице они вообще относятся.
Модельная Fisher
Для условной модели 𝑝𝜃 (𝑦 ∣ 𝑥) и выбранного распределения входов 𝜌(𝑥):
297
Теория информации для машинного обучения
𝐺model (𝜃) = 𝔼𝑥∼𝜌 𝔼𝑦∼𝑝𝜃 (⋅∣𝑥) 𝑔𝜃 (𝑥, 𝑦)𝑔𝜃 (𝑥, 𝑦)⊤ ,
где
𝑔𝜃 (𝑥, 𝑦) = ∇𝜃 log 𝑝𝜃 (𝑦 ∣ 𝑥).
Ключевая деталь: внутреннее ожидание по метке берётся из текущей модели.
Эмпирическая Fisher
На наборе данных часто вычисляют
𝐺emp =
1
𝑛
𝑛
𝑔𝜃 (𝑥𝑖 , 𝑦𝑖 )𝑔𝜃 (𝑥𝑖 , 𝑦𝑖 )⊤ .
𝑖=1
Здесь метки 𝑦𝑖 пришли из данных, а не из 𝑝𝜃 (⋅ ∣ 𝑥𝑖 ). Поэтому эта матрица является вторым моментом
пообъектных градиентов, вычисленных по данным, но в общем случае не является несмещённой
оценкой модельной Fisher и не обязана приближать гессиан. Это различие подробно анализируют
Kunstner, Balles и Hennig, 2019.
Небольшой пример показывает масштаб расхождения. Для Bernoulli-модели в логит-координате:
𝐺model = 𝑝(1 − 𝑝).
Если истинная доля единиц в данных равна 𝑞 , то популяционный второй момент наблюдаемого
градиента равен
𝐺data = 𝑞(1 − 𝑝)2 + (1 − 𝑞)𝑝2 .
При
𝑞 = 0.8,
𝑝 = 0.2
получаем
𝐺model = 0.16,
𝐺data = 0.52.
Обе величины построены из квадратов градиентов, но отвечают на разные вопросы.
Обобщённая матрица Гаусса—Ньютона
Пусть сеть выдаёт 𝑓𝜃 (𝑥), а функция потерь по выходу равна 𝓁(𝑓, 𝑦). GGN использует
𝐺GGN = 𝔼 𝐽𝑓⊤ 𝐻𝓁,𝑓 𝐽𝑓 ,
где 𝐽𝑓 — якобиан выходов по параметрам, а 𝐻𝓁,𝑓 — гессиан функции потерь по выходам. Если
𝓁 выпукла по 𝑓, GGN положительно полуопределена. Для некоторых вероятностных моделей
она совпадает с соответствующей Fisher, но это требует конкретной параметризации выходного
распределения и функции потерь.
298
Влад Куликов · Открытая редакция 2026.1
K-FAC, Adam и Shampoo
K-FAC приближает крупные блоки Fisher или GGN произведениями Кронекера:
𝐺layer ≈ 𝐴 ⊗ 𝐵.
Матрица 𝐴 описывает статистику входных активаций слоя, а 𝐵 — статистику сигналов обратного
распространения. Такое разложение позволяет сравнительно дёшево применять приближённую
обратную матрицу. Но оно сохраняет только часть корреляционной структуры и требует демпфирования.
Именно как приближение естественного градиента K-FAC вводится у Martens и Grosse, 2015.
Adam накапливает покоординатные первые и вторые моменты стохастических градиентов и
использует масштабирование вида
1
.
√𝑣𝑡 + 𝜖
Это адаптивный диагональный предобусловливатель. Квадраты градиентов могут напоминать
диагональ эмпирической Fisher, но Adam не обращает модельную Fisher и не обладает полной
инвариантностью естественного градиента.
Shampoo строит структурированные матрицы вторых моментов по осям тензора. Он родственен fullmatrix AdaGrad и использует больше структуры, чем покоординатные методы, но по умолчанию не
является Fisher-аппроксимацией.
299
Теория информации для машинного обучения
Метод
Какой объект
используется
Newton
гессиан целевой функции
Естественный градиент
модельная Fisher
GGN
кривизна функции
потерь по выходам
Эмпирическая Fisher
второй момент
наблюдаемых градиентов
Adam
диагональные моменты
градиентов
Кронекеровы блоки
Fisher/GGN
тензорные вторые
моменты
K-FAC
Shampoo
Что сохраняется
локальная кривизна
самой цели
локальная KL-геометрия
положительная
полуопределённость при
выпуклой выходной
потере
доступность по данным
дешёвое адаптивное
масштабирование
межкоординатную
структуру внутри слоя
структуру по осям
параметра
Что не следует обещать
автоматически
статистическая
инвариантность модели
точную глобальную
область доверия
равенство Fisher для
любой задачи
корректная
Fisher-геометрия вдали
от специальных режимов
инвариантность
естественного градиента
точное обращение
полной матрицы
интерпретацию через
Fisher без
дополнительных условий
Вот и вся практическая мораль раздела: слово «кривизна» не называет одну универсальную матрицу.
Каждый метод решает, какие зависимости сохранить, какие отбросить и сколько вычислений на это
потратить.
15.5. Геометрия политик: NPG, TRPO, PPO и KL в RLHF
Политика уже сама является условным распределением:
𝜋𝜃 (𝑎 ∣ 𝑠).
Поэтому идея малого изменения распределения здесь особенно естественна.
распределения состояний 𝑑(𝑠) матрица Fisher политики равна
Для выбранного
𝐺𝜋 (𝜃) = 𝔼𝑠∼𝑑,𝑎∼𝜋𝜃 ∇𝜃 log 𝜋𝜃 (𝑎 ∣ 𝑠)∇𝜃 log 𝜋𝜃 (𝑎 ∣ 𝑠)⊤ .
Естественный градиент политики:
∇𝐽 = 𝐺𝜋† ∇𝐽.
Он масштабирует шаг так, чтобы чувствительные направления в распределении действий менялись
осторожнее.
TRPO: доверительная область в пространстве политик
TRPO начинает с локальной суррогатной целевой функции и ограничивает среднее изменение
политики:
𝔼𝑠∼𝑑𝜋old 𝐷KL (𝜋old (⋅ ∣ 𝑠)‖𝜋𝜃 (⋅ ∣ 𝑠)) ≤ 𝛿 .
После линеаризации цели и квадратичной аппроксимации KL возникает та же задача, что в §15.3,
а значит — направление естественного градиента. Практический TRPO применяет сопряжённые
градиенты и линейный поиск, а не строит точную геодезическую. Исходная работа прямо выводит
300
Влад Куликов · Открытая редакция 2026.1
практический алгоритм как последовательность приближений к теоретически мотивированному
обновлению в области доверия. (Schulman et al., 2015)
Важно различать два уровня:
• теоретические гарантии улучшения используют более сильный контроль распределительного
сдвига;
• практический алгоритм контролирует эмпирический средний KL и проверяет шаг численно.
PPO: полезная прокси, но не строгая область доверия
PPO использует отношение вероятностей
𝑟𝑡 =
𝜋𝜃 (𝑎𝑡 ∣ 𝑠𝑡 )
𝜋old (𝑎𝑡 ∣ 𝑠𝑡 )
и клиппированную суррогатную цель
𝐿clip = 𝔼 [min (𝑟𝑡 𝐴𝑡 , clip(𝑟𝑡 , 1 − 𝜀, 1 + 𝜀)𝐴𝑡 )] .
Это позволяет делать несколько эпох обновлений на одном пакете данных и часто стабилизирует
обучение. Но clipping контролирует отношения для действий, попавших в выборку, а не всю
политику.
Контрпример можно записать в трёх числах. Пусть
𝜋old = (0.50, 0.49, 0.01),
а в пакете встретилось только первое действие. Рассмотрим семейство
𝜋𝑞 = (0.50, 𝑞, 0.50 − 𝑞).
Отношение вероятностей фактически выбранного действия всегда равно единице, поэтому
соответствующий sampled surrogate не меняется. Но
𝐷KL (𝜋old ‖𝜋𝑞 ) ⊃ 0.49 log
0.49
⟶∞
𝑞
при 𝑞 → 0. Следовательно, clipping не является глобальным ограничением на KL. Именно
поэтому реализации часто дополнительно мониторят KL, используют раннюю остановку или явный
штраф. PPO был предложен как более простой first-order метод с некоторыми практическими
преимуществами TRPO, а не как точное решение той же constrained-задачи. (Schulman et al., 2017)
301
Теория информации для машинного обучения
Два разных KL в RLHF
В RLHF и похожих процедурах легко смешать два ограничения.
1. Пошаговый KL сравнивает текущую политику со снимком, который породил данные этого
обновления. Его задача — не дать одному шагу стать слишком большим.
2. KL к фиксированной базовой политике сравнивает текущую модель с SFT- или базовой
моделью. Его задача — ограничивать накопленный дрейф на всём протяжении обучения.
Удобно сформулировать различие так:
TRPO спрашивает: «насколько далеко мы ушли за этот шаг?» Reference KL
спрашивает: «насколько далеко мы ушли от исходной модели вообще?»
Для фиксированного контекста идеальная задача
max {𝔼𝜋 [𝑟] − 𝛽𝐷KL (𝜋‖𝜋ref )}
𝜋
имеет точный Gibbs-оптимум
𝜋 ∗ (𝑦) ∝ 𝜋ref (𝑦)𝑒 𝑟(𝑦)/𝛽 .
Полный вывод уже был в Модуле 8. Здесь важно увидеть геометрию: KL задаёт цену ухода от
базового распределения, а экспоненциальный наклон является точным проксимальным решением
идеализированной задачи.
DPO использует эту аналитическую связь, чтобы выразить предпочтения через логарифмическое
отношение вероятностей политики и базовой модели.
Но DPO не выполняет обновление
302
Влад Куликов · Открытая редакция 2026.1
естественного градиента или шаг TRPO на каждом мини-пакете. Одинаковая KL-структура ещё
не делает алгоритмы тождественными.
И ещё одна граница: KL между политиками в RLHF сравнивает распределения ответов, тогда как PACBayes KL из Модуля 12 сравнивает распределения над гипотезами. Совпадение формулы не переносит
сертификат обобщения из одной постановки в другую.
15.6. Wasserstein-геометрия и потоки распределений
Fisher хорошо отвечает на вопрос о различимости соседних моделей. Но иногда главная структура
находится не в параметрах, а в самом пространстве наблюдений.
Рассмотрим две точечные массы:
𝑃 = 𝛿0 ,
𝑄𝜀 = 𝛿𝜀 .
Для любого 𝜀 ≠ 0 их носители не пересекаются. Поэтому обе направленные KL бесконечны, полная
вариация равна единице, а Jensen–Shannon равна log 2 — независимо от того, находится ли вторая
точка на расстоянии 10−6 или 106 .
Wasserstein видит именно то, что здесь важно:
𝑊2 (𝑃, 𝑄𝜀 ) = |𝜀|.
Он использует геометрию пространства данных.
Определение через транспортный план
При квадратичной стоимости
𝑊22 (𝑃, 𝑄) =
inf
𝛾∈Π(𝑃,𝑄)
𝔼(𝑋,𝑌)∼𝛾 ‖𝑋 − 𝑌‖2 .
Связка 𝛾 (coupling) определяет, какую массу из 𝑃 сопоставить какой массе из 𝑄 . Базовая метрика —
часть постановки. Если одну координату измерять в метрах, а другую в миллиметрах, транспортная
стоимость изменится.
303
Теория информации для машинного обучения
Динамическая форма
Формула Бенаму—Бренье записывает ту же стоимость как минимальное кинетическое действие:
1
𝑊22 (𝑃0 , 𝑃1 ) = inf
𝑝𝑡 ,𝑣𝑡 0
‖𝑣𝑡 (𝑥)‖2 𝑝𝑡 (𝑥) 𝑑𝑥 𝑑𝑡
при уравнении непрерывности
𝜕𝑡 𝑝𝑡 + ∇ ⋅ (𝑝𝑡 𝑣𝑡 ) = 0.
Теперь точка пространства — целое распределение 𝑝𝑡 , а векторное поле 𝑣𝑡 переносит его массу. Не
всякий путь между 𝑃0 и 𝑃1 является геодезической: геодезика должна минимизировать действие.
Непрерывный нормализующий поток
Пусть отдельная частица движется по ODE:
𝑑𝑥𝑡
= 𝑣𝑡 (𝑥𝑡 ).
𝑑𝑡
Тогда плотность вдоль траектории изменяется по формуле
𝑑
log 𝑝𝑡 (𝑥𝑡 ) = −∇ ⋅ 𝑣𝑡 (𝑥𝑡 ) .
𝑑𝑡
304
Влад Куликов · Открытая редакция 2026.1
Это непрерывный аналог формулы замены переменных и основа непрерывных нормализующих
потоков (continuous normalizing flows). Neural ODE показали, как обучать такие модели и
вычислять логарифм правдоподобия через интеграл дивергенции. (Chen et al., 2018)
Flow Matching: сначала выбирается путь
Flow Matching не начинает с неизвестного логарифма плотности. Сначала выбирается семейство
промежуточных распределений или условных путей, затем нейросеть обучается регрессией к
векторному полю, которое реализует выбранную эволюцию.
Главная свобода здесь двойная:
• какую связку между начальными и конечными точками выбрать;
• какой путь между связанными точками использовать.
Одна и та же пара маргинальных распределений допускает множество связок, а значит — множество
скоростей и траекторий. В частности, Flow Matching совместим и с diffusion-путями, и с путями,
построенными через оптимальный транспорт. Это часть исходной постановки метода, а не
последующее переименование. (Lipman et al., 2022)
В одномерном гауссовском случае разницу видно особенно чисто. Пусть
𝑋0 = 𝜇0 + 𝜎0 𝑍,
𝑋1 = 𝜇1 + 𝜎1 𝑍
с общим 𝑍 ∼ 𝒩(0, 1). Линейная интерполяция
𝑋𝑡 = (1 − 𝑡)𝑋0 + 𝑡𝑋1
305
Теория информации для машинного обучения
даёт Wasserstein-геодезическую между гауссовскими маргиналами. Если же 𝑋0 и 𝑋1 выбрать
независимо, конечные маргиналы останутся теми же, но кинетическое действие станет больше.
Связка — не служебная деталь; она определяет геометрию траекторий.
Rectified Flow
Rectified Flow обучает ODE следовать прямым линиям между парами из выбранной связки и может
повторно «выпрямлять» полученный транспорт. Исходная работа показывает, что rectification не
увеличивает выпуклые транспортные стоимости выбранной связки и способна давать траектории,
удобные для грубой дискретизации. (Liu, Gong и Liu, 2022)
Но отсюда не следует, что любой обученный rectified flow автоматически является точным
отображением оптимального транспорта или глобальной Wasserstein-геодезической. Прямизна
отдельных траекторий, качество выбранной связки, ошибка регрессии и ошибка численного
интегратора — разные вопросы.
Probability-flow ODE и diffusion
Для SDE
𝑑𝑋𝑡 = 𝑓(𝑋𝑡 , 𝑡)𝑑𝑡 + 𝑔(𝑡)𝑑𝑊𝑡
со скалярным коэффициентом диффузии соответствующая probability-flow ODE имеет дрейф
1
𝑑𝑋𝑡
= 𝑓(𝑋𝑡 , 𝑡) − 𝑔(𝑡)2 ∇𝑥 log 𝑝𝑡 (𝑋𝑡 ) .
𝑑𝑡
2
При точной скор-функции SDE и ODE имеют одинаковые одномоментные маргинальные
распределения 𝑝𝑡 . Но их траектории и связки различаются: одна динамика стохастическая, другая
детерминированная. Именно такую эквивалентную Neural ODE выводит формализм score-based
SDE. (Song et al., 2021)
Наконец, не смешивайте две скор-функции:
∇𝑥 log 𝑝𝑡 (𝑥)
— градиент лог-плотности по наблюдению, используемый в diffusion;
𝐺(𝜃)−1 ∇𝜃 𝐿
— естественный градиент по параметрам модели. Оба выражения содержат слово «градиент» и
работают с распределениями, но живут в разных пространствах.
15.7. Экспоненциальные семейства, двойственные координаты
и зеркальный спуск
В Модуле 8 мы подробно вывели экспоненциальное семейство:
𝑝𝜃 (𝑥) = ℎ(𝑥) exp 𝜃 ⊤ 𝑇(𝑥) − 𝐴(𝜃) .
Теперь та же конструкция получает геометрическое чтение.
Параметры ожиданий равны
𝜂 = ∇𝐴(𝜃) = 𝔼𝜃 [𝑇(𝑋)],
306
Влад Куликов · Открытая редакция 2026.1
а Fisher:
𝐺(𝜃) = ∇2 𝐴(𝜃) = Cov𝜃 (𝑇(𝑋)) .
KL между двумя членами семейства является дивергенцией Брэгмана лог-нормировки:
𝐷KL (𝑝𝜃1 ‖𝑝𝜃2 ) = 𝐵𝐴 (𝜃2 , 𝜃1 ) .
Обратите внимание на порядок: касательная к 𝐴 берётся в точке 𝜃1 , а значение сравнивается в 𝜃2 . В
двойственных координатах:
𝐷KL (𝑝𝜃1 ‖𝑝𝜃2 ) = 𝐵𝐴∗ (𝜂1 , 𝜂2 ).
Натуральные координаты 𝜃 и координаты ожиданий 𝜂 образуют две аффинные системы, связанные
преобразованием Лежандра. Это и есть смысл двойственно плоской (dually flat) структуры. Слово
«плоская» относится к паре e/m-связностей, а не обещает нулевую риманову кривизну метрики
Fisher–Rao. В §15.9 гауссовское семейство даст явный контрпример.
Зеркальный спуск
Зеркальный шаг имеет вид
𝑤𝑡+1 = arg min 𝜌𝑔𝑡⊤ 𝑤 + 𝐷𝜓 (𝑤, 𝑤𝑡 ) ,
𝑤
где 𝐷𝜓 — дивергенция Брэгмана выпуклой функции 𝜓.
307
Теория информации для машинного обучения
На вероятностном симплексе естественный выбор
𝜓(𝑝) =
𝑝𝑖 log 𝑝𝑖
𝑖
даёт
𝐷𝜓 (𝑝, 𝑞) = 𝐷KL (𝑝‖𝑞).
Решение шага:
𝑝𝑡+1,𝑖 =
𝑝𝑡,𝑖 𝑒 −𝜌𝑔𝑡,𝑖
.
∑𝑗 𝑝𝑡,𝑗 𝑒 −𝜌𝑔𝑡,𝑗
Это знакомый по Модулю 8 экспоненциальный наклон. Там он возникал как MaxEnt- или KLрегуляризованный оптимум; здесь — как проксимальное обновление на симплексе.
Локально дивергенция Брэгмана задаётся гессианом:
𝐷𝜓 (𝑤 + 𝑑𝑤, 𝑤) =
1
𝑑𝑤 ⊤ ∇2 𝜓(𝑤)𝑑𝑤 + 𝑜(‖𝑑𝑤‖2 ).
2
Поэтому зеркальный спуск и естественный градиент тесно связаны через соответствующую
локальную метрику; для экспоненциальных семейств связь особенно точна в двойственных
координатах. Но глобально это не один алгоритм для произвольного 𝜓 и конечного шага.
Зеркальный спуск использует всю асимметричную дивергенцию Брэгмана, а естественный
градиент — локальную квадратичную метрику. Эту эквивалентность в двойственной геометрии
экспоненциальных семейств подробно разбирают Raskutti и Mukherjee, 2013.
15.8. Практическая карта: сначала выберите объект, затем
геометрию
После всех формул легко сделать последнюю чрезмерно сильную попытку: объявить Fisher
«истинной геометрией ML» или, наоборот, заменить её Wasserstein. Правильная карта скромнее и
полезнее.
Что является точкой
пространства
Что означает малое
изменение
Подходящая
конструкция
вероятностная модель
правдоподобия
обновление политики
𝑝𝜃
Fisher / локальная KL
веса на симплексе
распределение 𝑝
перенос выборок
распределение в
пространстве данных
параметры или выходы
соседние распределения
трудно различить
распределение действий
мало изменилось на
релевантных состояниях
мала Bregman-цена
относительно текущей
точки
масса перемещена на
малое расстояние
мала ошибка в
выбранной задаче
вычислимо приближена
полезная кривизна
Задача
детерминированная
регрессия
крупная сеть
𝜋𝜃 (𝑎 ∣ 𝑠)
структурированные
блоки параметров
308
усреднённая по
состояниям KL политик /
Fisher
зеркальный спуск / KL
Wasserstein / OT
гессиан, GGN или
метрика задачи
K-FAC, Shampoo,
адаптивные
предобусловливатели
Влад Куликов · Открытая редакция 2026.1
Перед применением геометрического языка полезно задать пять вопросов.
1. Какой объект мы обновляем? Параметры, распределение ответов, представление или путь
выборок?
2. Что должно считаться малым?
KL, транспортная стоимость, изменение логитов,
функциональная ошибка?
3. Локальна ли используемая аппроксимация? Если да, достаточно ли мал фактический
шаг?
4. Какую матрицу или дивергенцию код реально вычисляет?
модельную Fisher,
эмпирическую Fisher, GGN или лишь диагональный момент?
5. Что проверяется после обновления? Фактический KL, качество на задаче, стоимость
интегрирования, реальный дрейф политики?
Главный синтез модуля можно выразить одной строкой:
Геометрия не выбирает цель обучения. Она определяет, какие движения
считаются близкими во время её оптимизации.
Естественный градиент не исправляет неверную награду. Wasserstein не гарантирует удобный путь
для конечной нейросети. K-FAC не делает невыпуклую задачу выпуклой. Но правильная геометрия
может убрать искусственную зависимость от координат, сделать область доверия содержательной и
подсказать, какую структуру кривизны стоит сохранять.
309
Теория информации для машинного обучения
15.9. Математическое углубление: α-геометрия и точные
примеры
Можно пропустить при первом чтении. Основной ML-маршрут завершён. Здесь
мы уточним, как одна и та же Fisher-метрика сосуществует с разными асимметричными
связностями, и посмотрим на две геодезии, которые можно записать в закрытой форме.
α-дивергенции в соглашении Амари
Для 𝛼 ≠ ±1:
𝐷(𝛼) (𝑃‖𝑄) =
4
1−
1 − 𝛼2
𝑝(1−𝛼)/2 𝑞(1+𝛼)/2 .
Пределы:
𝛼 → −1 ∶
𝐷(𝛼) (𝑃‖𝑄) ⟶ 𝐷KL (𝑃‖𝑄),
𝛼 → +1 ∶
𝐷(𝛼) (𝑃‖𝑄) ⟶ 𝐷KL (𝑄‖𝑃).
При 𝛼 = 0 получается постоянный множитель квадрата расстояния Хеллингера.
Это параметр α-геометрии Амари, а не порядок дивергенции Реньи. У разных авторов встречаются
другие знаки и масштабы, поэтому пределы нужно проверять рядом с определением.
Все гладкие α-дивергенции этого семейства порождают одну и ту же Fisher-метрику во втором
порядке. Различие появляется в третьем порядке и задаёт разные аффинные связности:
• 𝛼 = +1 — e-связность;
• 𝛼 = −1 — m-связность;
• 𝛼 = 0 — связность Леви—Чивиты Fisher-метрики.
310
Влад Куликов · Открытая редакция 2026.1
Это важная концептуальная точка: метрика описывает локальную длину, но одной метрики
недостаточно, чтобы восстановить асимметрию дивергенции и понятие прямой линии.
Категориальное распределение как часть сферы
Для распределения 𝑝 = (𝑝1 , … , 𝑝𝐾 ) внутри симплекса Fisher-элемент длины равен
𝐾
2
𝑑𝑠 =
𝑖=1
𝑑𝑝𝑖2
,
𝑝𝑖
𝑑𝑝𝑖 = 0.
𝑖
Сделаем замену
𝜓𝑖 = 2√𝑝𝑖 .
Тогда
𝜓𝑖2 = 4
𝑖
и
𝑑𝜓𝑖2 .
𝑑𝑠 2 =
𝑖
То есть внутренность вероятностного симплекса отображается в положительный ортант сферы
радиуса 2. Отсюда точное расстояние:
311
Теория информации для машинного обучения
𝑑FR (𝑃, 𝑄) = 2 arccos
√𝑝𝑖 𝑞𝑖
.
𝑖
Для 𝐾 = 2 эта формула сводится к Bernoulli-расстоянию из §15.2. Коэффициент
√𝑝𝑖 𝑞𝑖
𝑖
уже встречался в Модуле 11 как коэффициент Бхаттачарьи и в расстоянии Хеллингера. Здесь он
становится косинусом сферического угла.
Геодезическая Bernoulli
В координате
𝑢 = 2 arcsin √𝑝
геодезика является обычной прямой:
𝑢(𝑡) = (1 − 𝑡)𝑢(𝑝0 ) + 𝑡𝑢(𝑝1 ).
Возвращаясь к вероятности:
𝑢(𝑡)
2
2
𝑝(𝑡) = sin
.
Она не совпадает с линейной интерполяцией вероятностей (1 − 𝑡)𝑝0 + 𝑡𝑝1 .
Нормальное семейство и гиперболическая плоскость
Для
𝑋 ∼ 𝒩(𝜇, 𝜎 2 )
Fisher в координатах (𝜇, 𝜎):
1/𝜎 2
0
𝐺(𝜇, 𝜎) =
0
.
2/𝜎 2
Положим
𝑥=
𝜇
√2
,
𝑦 = 𝜎.
Тогда
𝑑𝑠 2 = 2
𝑑𝑥 2 + 𝑑𝑦 2
.
𝑦2
Это масштабированная метрика верхней полуплоскости Пуанкаре с постоянной гауссовой кривизной
312
Влад Куликов · Открытая редакция 2026.1
1
𝐾=− .
2
Таким образом, нормальное семейство является экспоненциальным и двойственно плоским, но не
плоским в римановом смысле Леви—Чивиты. Два слова «плоский» относятся к разным связностям.
Теорема Ченцова
В классической конечномерной статистике теорема Ченцова, грубо говоря, утверждает: с точностью
до общего множителя Fisher–Rao является единственной римановой метрикой на вероятностных
симплексах, согласованной с достаточными статистиками и подходящими стохастическими
отображениями.
Это сильное обоснование Fisher как статистической геометрии. Но оно не говорит, что Fisher обязана
быть правильной стоимостью переноса изображений, физических координат или скрытых состояний.
Базовая метрика пространства данных в теорему не входит. Wasserstein отвечает на другой вопрос —
поэтому конкуренции между двумя конструкциями нет.
15.11. Заключение
К концу курса знакомые информационные величины получили ещё одну роль. Энтропия и KL
начинались как счета за неопределённость и несовпадение моделей. Теперь их второй порядок задаёт
локальную форму пространства распределений, а эта форма меняет само понятие градиентного шага.
Три вопроса помогают не потеряться:
• Fisher–Rao: насколько различимы соседние вероятностные модели?
313
Теория информации для машинного обучения
• Дивергенции Брэгмана и зеркальный спуск: как обновить распределение, уважая
геометрию его ограничений?
• Wasserstein: сколько стоит физически перенести вероятностную массу в пространстве
данных?
Их нельзя бездумно заменять друг другом. Но вместе они дают зрелую карту современных MLметодов:
локальная различимость ⟶ естественный градиент и область доверия
асимметричная проксимальная цена ⟶ зеркальные и экспоненциальные обновления .
стоимость переноса массы ⟶ CNF, Flow Matching и diffusion paths
Главный урок не в том, что каждый популярный алгоритм «на самом деле» является одной
геометрической теоремой. Он в другом:
Сначала определите объект, затем смысл близости, и только после этого
выбирайте геометрию и её вычислимое приближение.
Так информационная геометрия завершает курс не новым универсальным лозунгом, а дисциплиной
постановки задачи. Формула становится сильнее, когда мы точно знаем, что она измеряет — и где её
обещание заканчивается.
Основные источники
1.
2.
3.
4.
5.
6.
7.
8.
9.
10.
11.
12.
13.
14.
S.-I. Amari, «Information Geometry and Its Applications», Springer, 2016.
S.-I. Amari, «Natural Gradient Works Efficiently in Learning», 1998.
J. Martens, «New Insights and Perspectives on the Natural Gradient Method», 2020.
J. Martens, R. Grosse, «Optimizing Neural Networks with Kronecker-factored Approximate Curvature», 2015.
F. Kunstner, L. Balles, P. Hennig, «Limitations of the Empirical Fisher Approximation», 2019.
S. Kakade, «A Natural Policy Gradient», NeurIPS 2001.
J. Schulman et al., «Trust Region Policy Optimization», 2015.
J. Schulman et al., «Proximal Policy Optimization Algorithms», 2017.
R. Rafailov et al., «Direct Preference Optimization», 2023.
R. T. Q. Chen et al., «Neural Ordinary Differential Equations», 2018.
Y. Lipman et al., «Flow Matching for Generative Modeling», 2022.
X. Liu, C. Gong, Q. Liu, «Flow Straight and Fast», 2022.
Y. Song et al., «Score-Based Generative Modeling through Stochastic Differential Equations», 2021.
G. Raskutti, S. Mukherjee, «The Information Geometry of Mirror Descent», 2013.
314
Модуль 16. Памятка по курсу
16.1. Памятка по курсу: ключевые идеи и формулы
Эта памятка — не ещё один теоретический модуль. Она нужна для трёх ситуаций: быстро
восстановить определение, выбрать подходящую информационную величину и заметить слишком
сильный вывод до того, как он превратится в ошибку модели или эксперимента.
Читать её подряд необязательно. Лучше возвращаться к нужному блоку по вопросу: что именно
я сейчас измеряю, относительно какого распределения и в каких единицах? За доказательствами,
примерами, кодом и первоисточниками следует обращаться к соответствующим модулям 1–15.
Сначала четыре диагностических вопроса
Перед любой информационно-теоретической формулой полезно спросить:
1. Чьё распределение стоит внутри логарифма? Источника данных 𝑃, модели 𝑄𝜃 ,
апостериорного распределения, политики или критика?
2. По какому распределению берётся среднее? По данным, по модели, по смеси, по
траекториям политики или по случайности алгоритма обучения?
3. Что является единицей? Бит, нат, бит/токен, бит/байт, бит/пиксель, бит/использование
канала или полная длина описания?
4. Каков статус величины? Это теоретическая величина на уровне распределения, оценка
по конечной выборке, обучающая целевая функция, вариационная граница или реальный
физический поток битов?
Большая часть путаницы в машинном обучении возникает не из сложной математики, а из
незаметной смены ответа хотя бы на один из этих вопросов.
Обозначения и единицы
В памятке 𝑃 обычно обозначает распределение источника или данных, а 𝑄 — модель. Если основание
логарифма равно двум, информационные величины измеряются в битах; если используется
натуральный логарифм — в натах:
log2 𝑥 =
ln 𝑥
.
ln 2
При 𝑝(𝑥) > 0 и 𝑞(𝑥) = 0 модель объявила возможное событие невозможным, поэтому соответствующие
кросс-энтропия и дивергенция Кульбака—Лейблера (KL) бесконечны.
1. Неожиданность, энтропия и счёт модели — M1–M3
Неожиданность отдельного исхода
𝑠𝑃 (𝑥) = − log𝑏 𝑝(𝑥).
315
Теория информации для машинного обучения
Логарифм превращает произведение вероятностей независимых этапов в сумму информационных
цен:
𝑠(𝑝𝑞) = 𝑠(𝑝) + 𝑠(𝑞).
Редкое событие получает большой счёт, вероятное — малый. Этот счёт ничего не говорит о
семантической важности события: невероятная опечатка может быть информационно дорогой и
при этом бессмысленной.
Энтропия
𝐻𝑏 (𝑋) = 𝔼𝑋∼𝑃 [− log𝑏 𝑝(𝑋)] = −
𝑝(𝑥) log𝑏 𝑝(𝑥).
𝑥
Энтропия — средний счёт за неопределённость источника. Для конечного алфавита размера 𝐾 :
0 ≤ 𝐻𝑏 (𝑋) ≤ log𝑏 𝐾,
а максимум достигается на равномерном распределении.
Для пары переменных действует цепное правило:
𝐻(𝑋, 𝑌) = 𝐻(𝑋) + 𝐻(𝑌 ∣ 𝑋).
Для последовательности:
𝑇
𝐻(𝑋1∶𝑇 ) =
𝐻(𝑋𝑡 ∣ 𝑋<𝑡 ).
𝑡=1
Это бухгалтерия авторегрессии: общий счёт раскладывается на последовательные условные счета.
Кросс-энтропия и KL
𝐻𝑏 (𝑃, 𝑄) = 𝔼𝑋∼𝑃 [− log𝑏 𝑞(𝑋)],
𝐷KL,𝑏 (𝑃‖𝑄) = 𝔼𝑋∼𝑃 log𝑏
𝑝(𝑋)
.
𝑞(𝑋)
Главное разложение:
𝐻𝑏 (𝑃, 𝑄) = 𝐻𝑏 (𝑃) + 𝐷KL,𝑏 (𝑃‖𝑄) .
Энтропия 𝐻(𝑃) — неизбежная неопределённость источника. KL — средняя доплата за использование
чужой вероятностной модели.
Для условного предсказания:
ℒ(𝜃) = 𝔼𝑃 [− log 𝑞𝜃 (𝑌 ∣ 𝑋)] = 𝐻𝑃 (𝑌 ∣ 𝑋) + 𝔼𝑋 𝐷KL 𝑃(⋅ ∣ 𝑋)‖𝑄𝜃 (⋅ ∣ 𝑋) .
Максимальное правдоподобие уменьшает вторую часть, но не может убрать внутреннюю неопределённость
данных.
316
Влад Куликов · Открытая редакция 2026.1
Авторегрессионное отрицательное логарифмическое правдоподобие (NLL) и перплексия
𝑇
− log 𝑞𝜃 (𝑥1∶𝑇 ) =
− log 𝑞𝜃 (𝑥𝑡 ∣ 𝑥<𝑡 ).
𝑡=1
Средняя логарифмическая потеря 𝐿̄ 𝑏 превращается в перплексию:
PPL𝑏 = 𝑏𝐿̄ 𝑏 .
Перплексия является монотонным преобразованием среднего отрицательного логарифмического
правдоподобия (NLL), а не отдельной мерой истины, рассуждения или фактической корректности.
Градиент кросс-энтропии после softmax
Если 𝑞 = softmax(𝑧), а 𝑟 — целевое распределение, то
∇𝑧 𝓁 = 𝑞 − 𝑟 .
Модель увеличивает логиты там, где целевая масса больше модельной, и уменьшает там, где модель
выделила слишком много вероятности.
Не смешивать
• Предиктивная энтропия 𝐻(𝑄𝜃 (⋅ ∣ 𝑥)) спрашивает, насколько распределена сама модель до
наблюдения ответа.
• Отрицательное логарифмическое правдоподобие (NLL) − log 𝑞𝜃 (𝑦 ∣ 𝑥) спрашивает,
какую вероятность модель дала реально произошедшему ответу.
• Энтропия источника 𝐻𝑃 (𝑌 ∣ 𝑋) относится к истинному распределению данных.
Уверенная ошибка может иметь низкую предиктивную энтропию и огромный NLL.
2. Среднее и нелинейность: Йенсен и вариационные границы — M4
Для выпуклой функции 𝜙:
𝜙(𝔼[𝑋]) ≤ 𝔼[𝜙(𝑋)].
Для вогнутой функции направление меняется. Это простой компас: сначала определите кривизну,
затем порядок «усреднить» и «применить функцию».
Ансамбль вероятностей
Поскольку − log выпукла,
− log
𝜆𝑗 𝑞𝑗 (𝑦) ≤
𝑗
𝜆𝑗 [− log 𝑞𝑗 (𝑦)].
𝑗
Арифметическая смесь вероятностей не хуже среднего участника по логарифмической потере для
каждого примера. Это не означает, что она обязана улучшить точность классификации, калибровку
или устойчивость к сдвигу распределения.
317
Теория информации для машинного обучения
Вариационная нижняя граница (ELBO)
Для латентной модели:
log 𝑝𝜃 (𝑥) = ELBO(𝑥) + 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝𝜃 (𝑧 ∣ 𝑥) ,
где
ELBO(𝑥) = 𝔼𝑞𝜙 (𝑧∣𝑥) log 𝑝𝜃 (𝑥, 𝑧) − log 𝑞𝜙 (𝑧 ∣ 𝑥) .
ELBO — нижняя граница на логарифм правдоподобия, а её разрыв известен точно: это KL к
истинному апостериорному распределению.
Укрупнение состояний
Если детерминированное или случайное преобразование скрывает детали, то различимость по KL не
возрастает:
𝐷KL (𝑃𝑌 ‖𝑄𝑌 ) ≤ 𝐷KL (𝑃𝑋 ‖𝑄𝑋 ).
Это один из первых видов общего принципа: обработка может перепаковать информацию, но не
создать различимость из ничего.
3. Взаимная информация: ценность наблюдения — M5
𝐼(𝑋; 𝑌) = 𝐷KL (𝑃𝑋𝑌 ‖𝑃𝑋 𝑃𝑌 ) = 𝐻(𝑌) − 𝐻(𝑌 ∣ 𝑋) .
У взаимной информации три эквивалентных чтения:
• сокращение оптимальной логарифмической потери при наблюдении 𝑋;
• расстояние реального совместного распределения до мира независимости;
• средняя величина статистической связи между 𝑋 и 𝑌.
Условная взаимная информация:
𝐼(𝑋; 𝑌 ∣ 𝑍) = 𝐻(𝑌 ∣ 𝑍) − 𝐻(𝑌 ∣ 𝑋, 𝑍).
Она отвечает на вопрос: что 𝑋 добавляет о 𝑌, когда 𝑍 уже известно? Именно поэтому условная
взаимная информация (CMI) обнаруживает избыточность и синергию, которую одномерный отбор
признаков может пропустить.
Неравенство обработки данных
Если
𝑌 ⟶ 𝑋 ⟶ 𝑇,
то
𝐼(𝑌; 𝑇) ≤ 𝐼(𝑌; 𝑋).
Энкодер может сделать информацию более доступной ограниченному классификатору, не создавая
новых битов о целевой переменной.
318
Влад Куликов · Открытая редакция 2026.1
InfoNCE
При схеме с одним положительным кандидатом и 𝑁 − 1 независимыми отрицательными
кандидатами:
𝐼(𝑋; 𝑌) ≥ log 𝑁 − ℒNCE .
Потолок log 𝑁 относится к этой конкретной нижней границе, а не к истинной взаимной информации
и не к качеству представления вообще.
Оценивание взаимной информации
Нужно различать:
истинная MI ≠ оценка по выборке ≠ обучающая прокси-цель.
Подстановочные, соседские и нейросетевые оцениватели имеют разные смещения, дисперсии и
режимы отказа. Число без протокола оценки мало что означает.
4. От вероятностей к битам и от сообщений к каналам — M6–M7
Неравенство Крафта
Для длин двоичного префиксного кода:
2−𝓁𝑖 ≤ 1.
𝑖
Это бюджет бинарного дерева:
пространства.
короткое кодовое слово занимает большую часть доступного
Теорема кодирования источника
Для оптимального односимвольного префиксного кода:
𝐻2 (𝑋) ≤ 𝐿∗ < 𝐻2 (𝑋) + 1.
Для кода, настроенного на модель 𝑄 , идеальная средняя длина равна:
𝔼𝑃 [− log2 𝑞(𝑋)] = 𝐻2 (𝑃) + 𝐷KL,2 (𝑃‖𝑄).
Арифметический или интервальный кодер (range coder) превращает последовательные условные
вероятности в реальный обратимый поток, но конечная точность, завершение, заголовки и
служебные данные добавляют накладные расходы.
Поэтому важно различать:
𝐿ideal ,
𝐿stream ,
𝐿total .
Последняя величина может включать стоимость модели, токенизатора и протокола декодирования.
Свойство асимптотической равномерности (AEP) и энтропийная скорость
Для источника из независимых одинаково распределённых символов (i.i.d.):
319
Теория информации для машинного обучения
1
− log2 𝑃(𝑋 𝑛 ) ⟶ 𝐻2 (𝑋).
𝑛
Для стационарного источника с памятью центральным объектом становится энтропийная скорость:
ℎ = lim
𝑛→∞
1
𝐻(𝑋1∶𝑛 ).
𝑛
Пропускная способность канала
Для дискретного канала без памяти:
𝐶 = max 𝐼(𝑋; 𝑌) .
𝑃𝑋
𝐼(𝑋; 𝑌) при фиксированном входе — одна рабочая точка. Пропускная способность дополнительно
оптимизирует допустимое распределение входов.
Канонические примеры:
𝐶BSC = 1 − ℎ2 (𝜀),
𝐶BEC = 1 − 𝜀,
𝐶AWGN =
𝑃
1
log2 1 + 2 .
2
𝜎
Надёжная передача асимптотически возможна при скорости 𝑅 < 𝐶 и невозможна с исчезающей
ошибкой при 𝑅 > 𝐶 .
Для совместной задачи сжатия и передачи при 𝜅 использованиях канала на символ источника
условие разделения имеет вид:
𝑅(𝐷) < 𝜅𝐶.
Контекстное окно, механизм внимания (attention) или скрытое состояние сами по себе не являются
пропускной способностью: сначала нужно определить сообщения, входные ограничения, шум,
единицу использования и критерий ошибки.
5.
Максимум энтропии (MaxEnt), экспоненциальные семейства и
экспоненциальный наклон — M8
Относительный максимум энтропии
При базовом распределении 𝑚 и линейных ограничениях на средние ищется информационная
проекция:
𝑞∗ = arg min 𝐷KL (𝑞‖𝑚).
𝑞∈𝒞
Решение имеет форму:
320
Влад Куликов · Открытая редакция 2026.1
⊤
𝑚(𝑥)𝑒 𝜆 𝑓(𝑥)
𝑞𝜆 (𝑥) =
.
𝑍(𝜆)
Экспоненциальный наклон — общий механизм: базовая масса перераспределяется в пользу
состояний с высокой оценкой, а нормировочная константа оплачивает превращение весов в
распределение.
Экспоненциальное семейство
𝑝𝜂 (𝑥) = ℎ(𝑥) exp 𝜂⊤ 𝑇(𝑥) − 𝐴(𝜂) .
Для регулярного семейства:
∇𝐴(𝜂) = 𝔼𝜂 [𝑇(𝑋)],
∇2 𝐴(𝜂) = Cov𝜂 (𝑇(𝑋)).
Градиент лог-нормировки даёт средние достаточных статистик, а гессиан — их ковариацию и
информацию Фишера в натуральных координатах.
Softmax как точное решение вариационной задачи
softmax(𝑧/𝜏) = arg max 𝑞 ⊤ 𝑧 + 𝜏𝐻(𝑞) .
𝑞∈Δ
При энтропии в натах точный разрыв равен:
max{𝑢⊤ 𝑧 + 𝜏𝐻(𝑢)} − {𝑞 ⊤ 𝑧 + 𝜏𝐻(𝑞)} = 𝜏𝐷KL (𝑞‖𝑞 ∗ ).
𝑢∈Δ
Энергетическая модель
𝑞𝜃 (𝑥) =
𝑒 −𝐸𝜃 (𝑥)
.
𝑍𝜃
Градиент отрицательного логарифмического правдоподобия:
∇𝜃 [− log 𝑞𝜃 (𝑥)] = ∇𝜃 𝐸𝜃 (𝑥) − 𝔼𝑞𝜃 [∇𝜃 𝐸𝜃 (𝑋)].
Положительная фаза понижает энергию данных, отрицательная поднимает энергию типичных
выборок модели.
KL-регуляризованная политика
max {𝔼𝜋 [𝑟] − 𝛽𝐷KL (𝜋‖𝜋ref )}
𝜋
имеет оптимум Гиббса:
𝜋 ∗ (𝑦 ∣ 𝑥) =
𝜋ref (𝑦 ∣ 𝑥)𝑒 𝑟(𝑥,𝑦)/𝛽
.
𝑍(𝑥)
KL задаёт цену отклонения от базовой политики, но не подтверждает корректность самой награды.
Для экспоненциальной траектории 𝜋𝛼 ∝ 𝜋0 𝑒 𝛼𝑟proxy :
321
Теория информации для машинного обучения
𝑑
𝔼 [𝑔] = Cov𝜋𝛼 (𝑔, 𝑟proxy ).
𝑑𝛼 𝜋𝛼
Прокси-награда растёт, потому что её производная равна дисперсии. Истинное качество растёт
только пока его ковариация с прокси положительна.
6.
Полезное забывание:
скорость–искажение, информационное
бутылочное горлышко и VAE — M9
Скорость–искажение
𝑅(𝐷) =
min
𝑃𝑋∣𝑋 ∶𝔼[𝑑(𝑋,𝑋)]≤𝐷
𝐼(𝑋; 𝑋) .
Функция 𝑅(𝐷) отвечает: сколько информации необходимо сохранить, чтобы среднее искажение
не превысило 𝐷 ? Ответ зависит от выбранной функции искажения; «лишняя информация» не
существует без задачи и цены ошибки.
Информационное бутылочное горлышко (Information Bottleneck, IB)
ℒIB = 𝐼(𝑋; 𝑇) − 𝛽𝐼(𝑇; 𝑌).
При марковской структуре 𝑌 − 𝑋 − 𝑇:
𝐼(𝑋; 𝑌) − 𝐼(𝑇; 𝑌) = 𝔼𝑋,𝑇 𝐷KL (𝑃(𝑌 ∣ 𝑋)‖𝑃(𝑌 ∣ 𝑇)) .
Представление хорошо сжато относительно задачи, если оно объединяет входы, почти не меняя
предсказание релевантной переменной 𝑌.
Вариационный IB (VIB) и VAE
В вариационном информационном бутылочном горлышке (VIB) KL к выбранному априорному
распределению даёт верхнюю границу на скорость:
𝔼𝑋 𝐷KL 𝑞𝜙 (𝑇 ∣ 𝑋)‖𝑟(𝑇) = 𝐼(𝑋; 𝑇) + 𝐷KL 𝑞𝜙 (𝑇)‖𝑟(𝑇) .
Для VAE:
− ELBO(𝑥) = 𝔼𝑞𝜙 (𝑧∣𝑥) [− log 𝑝𝜃 (𝑥 ∣ 𝑧)] + 𝐷KL 𝑞𝜙 (𝑧 ∣ 𝑥)‖𝑝(𝑧) .
искажение
вариационная скорость
Стандартный VAE является системой скорость–искажение для моделирования 𝑋, но не тождествен
IB с внешней целевой переменной 𝑌.
I–MMSE
Для гауссовского канала
𝑌𝛾 = √𝛾𝑋 + 𝑁,
взаимная информация в натах удовлетворяет:
322
𝑁 ∼ 𝒩(0, 1),
Влад Куликов · Открытая редакция 2026.1
𝑑
1
𝐼(𝑋; 𝑌𝛾 ) = mmse(𝛾) .
𝑑𝛾
2
Скорость накопления информации при росте отношения сигнал/шум (SNR) равна половине ошибки
оптимального оценивания. Это важный мост к удалению шума и диффузионным моделям, но не
готовый выбор архитектуры или расписания шума.
7. Индивидуальные описания и MDL — M10
Колмогоровская сложность отдельной строки:
𝐾𝑈 (𝑥) =
min
𝑝∶ 𝑈(𝑝)=𝑥
|𝑝|.
Она зависит от универсальной машины лишь на аддитивную константу, но в общем случае
невычислима.
Большинство строк длины 𝑛 несжимаемы:
Pr{𝐾(𝑋) < 𝑛 − 𝑐} < 2−𝑐
для равномерной строки 𝑋 ∈ {0, 1}𝑛 .
Для вычислимого распределения 𝑃 шенноновская и алгоритмическая картины встречаются в
среднем:
𝐻2 (𝑃) ≤ 𝔼𝑃 [𝐾(𝑋)] ≤ 𝐻2 (𝑃) + 𝐾(𝑃) + 𝑂(1).
Принцип минимальной длины описания:
𝐿(ℎ, 𝐷) = 𝐿(ℎ) + 𝐿(𝐷 ∣ ℎ).
Модель должна оплатить и собственную сложность, и остаток данных, который она не объяснила. Это
не разрешение измерять смысл файла числом бит: краткость описания, вычислительная стоимость
и семантическая ценность остаются разными объектами.
8. Сравнение неявных распределений — M11
Общая 𝑓-дивергенция:
𝐷𝑓 (𝑃‖𝑄) = 𝔼𝑄 𝑓
𝑝(𝑋)
𝑞(𝑋)
.
Она включает KL, полную вариацию, 𝜒 2 Пирсона, квадрат расстояния Хеллингера и дивергенцию
Йенсена—Шеннона при соответствующем выборе выпуклой 𝑓.
Классификатор как оцениватель отношения плотностей
Если примеры из 𝑃 имеют априорную вероятность 𝜋, то оптимальный дискриминатор удовлетворяет:
logit 𝐷 ∗ (𝑥) = log
𝑝(𝑥)
𝜋
+ log
.
𝑞(𝑥)
1−𝜋
323
Теория информации для машинного обучения
Хорошая классификация источника ещё не гарантирует хорошо откалиброванную численную оценку
отношения 𝑝/𝑞 .
Вариационная форма
𝐷𝑓 (𝑃‖𝑄) = sup 𝔼𝑃 [𝑇] − 𝔼𝑄 [𝑓 ∗ (𝑇)]
𝑇
при подходящих условиях и достаточно богатом классе функций. На практике нужно различать
точный супремум, лучший критик в ограниченном классе и результат конечновыборочного
обучения.
Для исходной минимаксной игры GAN при оптимальном дискриминаторе:
max 𝑉(𝐷, 𝑄) = − log 4 + 2𝐷JS (𝑃data , 𝑄).
𝐷
Это тождество на уровне распределений, а не описание каждого отдельного шага реального обучения
GAN.
Когда носители распределений разнесены, KL и дивергенция Йенсена—Шеннона могут давать
слабую геометрию оптимизации. Тогда полезны интегральные вероятностные метрики: расстояние
Вассерштейна использует стоимость переноса массы, а максимальное среднее расхождение (MMD) —
различимость средних вложений в воспроизводящем ядровом гильбертовом пространстве (RKHS).
9. Адаптивность и обобщение — M12
PAC-Bayes с бинарной KL
Для ограниченной функции потерь и валидного априорного распределения 𝑃, независимого от
сертифицирующей выборки, с вероятностью не меньше 1 − 𝛿 одновременно для допустимых 𝑄 :
kl 𝐿𝑆 (𝑄)‖𝐿(𝑄) ≤
𝐷KL (𝑄‖𝑃) + ln
𝑛
2√𝑛
𝛿 .
Граница относится к предиктору Гиббса 𝑊 ∼ 𝑄 , а не автоматически к сети со средними весами.
Обобщённое распределение Гиббса минимизирует эмпирический риск с KL-ценой:
𝑄𝜆 (𝑑𝑤) ∝ 𝑃(𝑑𝑤)𝑒 −𝜆𝑛𝐿𝑆 (𝑤) .
Граница через взаимную информацию
Если потери субгауссовские с параметром 𝜎 2 , то
𝔼[𝐿(𝑊) − 𝐿𝑆 (𝑊)] ≤
2𝜎 2 𝐼(𝑊; 𝑆)
.
𝑛
Это граница на ожидаемый разрыв по случайной выборке и случайности алгоритма, а не
высоковероятностный сертификат конкретного запуска.
PAC-Bayes и взаимная информация связаны точным средним разложением:
𝔼𝑆 𝐷KL (𝑄𝑆 ‖𝑃) = 𝐼(𝑊; 𝑆) + 𝐷KL (𝑃𝑊 ‖𝑃) .
324
Влад Куликов · Открытая редакция 2026.1
Взаимная информация измеряет зависимость результата обучения от выборки. Дополнительный
член измеряет несовпадение выбранного априорного распределения с маргинальным распределением
результатов алгоритма.
10. Рассуждение и вычисления во время ответа — M13
Пусть внутренний рабочий черновик строится как
𝐶 = 𝐺𝜃 (𝑋, 𝑈),
𝑈 ⟂ 𝑌 ∗ ∣ 𝑋.
Тогда
𝐼(𝑌 ∗ ; 𝐶 ∣ 𝑋) = 0 .
Внутренне сгенерированная цепочка не приносит идеальному наблюдателю нового факта о
правильном ответе сверх полного входа. Она может быть полезна как последовательное вычисление,
рабочая память или поиск.
Если появляется внешнее наблюдение 𝑂, то
𝐼(𝑌 ∗ ; 𝑋, 𝑂) = 𝐼(𝑌 ∗ ; 𝑋) + 𝐼(𝑌 ∗ ; 𝑂 ∣ 𝑋),
и последний член может быть положительным.
Для 𝑁 независимых кандидатов с вероятностью успеха 𝑝 идеальный верификатор получает:
𝑃oracle (𝑁) = 1 − (1 − 𝑝)𝑁 .
Реальный результат зависит и от покрытия генератора, и от качества выбора. Более широкий поиск
способен одновременно находить больше правильных решений и давать больше возможностей
эксплуатировать ошибки верификатора.
Для произвольных невложенных состояний:
𝐻(𝑌 ∣ 𝑆𝑗−1 ) − 𝐻(𝑌 ∣ 𝑆𝑗 ) = 𝐼(𝑌; 𝑆𝑗 ∣ 𝑆𝑗−1 ) − 𝐼(𝑌; 𝑆𝑗−1 ∣ 𝑆𝑗 ).
Улучшение состояния — баланс новой релевантной информации и информации, потерянной при
замене предыдущего состояния.
11. Компьютерное зрение: четыре разных бюджета — M14
Обучаемое сжатие изображений
Типичная цель обучаемого кодека:
ℒ = 𝑅 + 𝜆𝐷,
где 𝑅 — ожидаемая длина потока для квантованных латентов и служебной информации, а 𝐷 — явно
выбранное искажение.
Для гипераприорного распределения полный счёт имеет вид:
𝑅 = 𝔼[− log2 𝑝𝜙 (𝑍)] + 𝔼[− log2 𝑝𝜓 (𝑌 ∣ 𝑍)].
325
Теория информации для машинного обучения
Служебный латент полезен только тогда, когда экономия на основном коде превышает цену его
собственной передачи.
Удаление шума и градиент лог-плотности
Для
𝑋𝑡 = 𝛼𝑡 𝑋0 + 𝜎𝑡 𝜀
Оптимальный по среднеквадратичной ошибке восстановитель равен условному среднему:
𝑓 ∗ (𝑥𝑡 ) = 𝔼[𝑋0 ∣ 𝑋𝑡 = 𝑥𝑡 ].
Скор-функция, то есть градиент лог-плотности зашумлённого распределения:
∇𝑥𝑡 log 𝑝𝑡 (𝑥𝑡 ) =
𝛼𝑡 𝔼[𝑋0 ∣ 𝑥𝑡 ] − 𝑥𝑡
.
𝜎𝑡2
Это точный мост между удалением шума и градиентом лог-плотности, но не полный вывод
архитектуры диффузионной модели.
Не смешивать четыре бюджета
•
•
•
•
кодек данных измеряется реальными битами или бит/пиксель;
представление оценивается по информации, полезной выбранной задаче;
зашумлённое наблюдение ограничивает точность оценивания;
модель имеет собственные расходы памяти, разрядности, пропускной способности и задержки.
12. Информационная геометрия — M15
Информация Фишера как локальная форма KL
Для гладкого семейства 𝑝𝜃 :
𝐷KL 𝑝𝜃 ‖𝑝𝜃+𝑑𝜃 =
1 ⊤
𝑑𝜃 𝐺(𝜃)𝑑𝜃 + 𝑜(‖𝑑𝜃‖2 ),
2
где
𝐺(𝜃) = 𝔼𝑝𝜃 ∇𝜃 log 𝑝𝜃 (𝑋)∇𝜃 log 𝑝𝜃 (𝑋)⊤ .
Информация Фишера измеряет локальную статистическую различимость, а не глобальное
симметричное расстояние KL.
Естественный градиент
Локальная задача наилучшего уменьшения функции при KL-бюджете приводит к направлению:
∇𝜃 𝐿 = 𝐺(𝜃)† ∇𝜃 𝐿.
Это координатно-инвариантное направление в первом порядке. Конечный шаг, демпфирование и
приближённая матрица Фишера снова зависят от реализации.
326
Влад Куликов · Открытая редакция 2026.1
Две геометрии
Геометрия Фишера—Рао спрашивает, насколько различимы соседние распределения. Геометрия
Вассерштейна спрашивает, сколько стоит перенести массу в пространстве наблюдений:
𝑊22 (𝑃, 𝑄) =
inf
𝛾∈Π(𝑃,𝑄)
𝔼(𝑋,𝑌)∼𝛾 ‖𝑋 − 𝑌‖2 .
Ни одна геометрия не является универсально правильной. Сначала нужно выбрать объект:
распределение предсказаний, политика, плотность на изображениях или физический поток
массы.
Для экспоненциального семейства:
𝐺(𝜂) = ∇2 𝐴(𝜂),
а KL становится дивергенцией Брэгмана лог-нормировки:
𝐷KL (𝑝𝜂 ‖𝑝𝜉 ) = 𝐴(𝜉) − 𝐴(𝜂) − ∇𝐴(𝜂)⊤ (𝜉 − 𝜂).
13. Как быстро выбрать нужный объект
Вопрос
Основная величина
Что она не обещает
Насколько распределена сама
модель?
Какой счёт модель получила на
данных?
предиктивная энтропия
истинность и калибровку
отрицательное логарифмическое
правдоподобие (NLL) /
кросс-энтропия
дивергенция KL
энтропию источника без
дополнительных предпосылок
Какова цена несовпадения двух
моделей?
Что один объект сообщает о
другом?
Сколько бит нужно для источника?
С какой скоростью можно
передавать через шум?
Как выбрать распределение при
ограничениях?
Сколько информации нужно
сохранить при допустимой
ошибке?
Как сравнить неявные
распределения по выборкам?
Как оплатить адаптивный выбор
модели?
Что покупают дополнительные
токены рассуждения?
Что считать малым изменением
модели?
взаимная / условная взаимная
информация
энтропия, энтропийная скорость,
реальный код
пропускная способность канала
максимум энтропии (MaxEnt) /
информационная проекция
скорость–искажение /
информационное бутылочное
горлышко (IB)
вариационная 𝑓-дивергенция,
максимальное среднее
расхождение (MMD), расстояние
Вассерштейна
KL в PAC-Bayes или 𝐼(𝑊; 𝑆)
вычислительная глубина, поиск,
внешние наблюдения
метрика Фишера, локальная KL,
дивергенция Брэгмана или
расстояние Вассерштейна
327
симметрию и метрическую
геометрию
причинное направление
стоимость модели и протокола,
если они не посчитаны
результат без входных
ограничений и модели канала
правильность самих ограничений
универсальную функцию
искажения
точность при слабом критике или
малой выборке
один и тот же тип гарантии
автоматическое появление новой
информации
одну геометрию для всех объектов
Теория информации для машинного обучения
14. Самые частые слишком сильные выводы
Неверное сокращение мысли
Точная версия
Низкая энтропия означает правильный ответ
Низкая энтропия означает концентрацию
распределения модели
NLL оценивает кросс-энтропию данных и модели при
конкретном протоколе
KL несимметрична; локально её квадратичная форма
задаёт информацию Фишера
Без внешних данных он может только сохранить,
потерять или перепаковать её
Она даёт конкретную нижнюю границу при
конкретной схеме выборки
У них родственная структура скорость–искажение, но
разные релевантные переменные
KL ограничивает сдвиг распределения, но не
исправляет неверную награду
Внутренняя цепочка даёт вычисление; новые факты
требуют внешнего наблюдения
Для отношения плотностей нужны ещё и
калиброванные вероятности
Сжатие точно измеряет предиктивную
логарифмическую потерю и может коррелировать с
отдельными способностями
Оно контролирует локальную суррогатную цель на
наблюдавшихся действиях
Сначала нужно определить случайные величины,
протокол, ограничения и тип гарантии
NLL равна энтропии языка
KL — расстояние
Энкодер создаёт информацию о метке
InfoNCE измеряет всю взаимную информацию
VAE тождественен IB с внешней целевой переменной
KL защищает от эффекта Гудхарта
Более длинная цепочка рассуждений приносит новые
факты
Сильный классификатор точно оценивает 𝑝/𝑞
Хорошее сжатие равно интеллекту
Отсечение в PPO гарантирует малый KL
Одна информационная величина объясняет всё
машинное обучение
15. Семь механизмов, которые связывают весь курс
1. Логарифм превращает произведение вероятностей в сумму цен. Отсюда неожиданность,
отрицательное логарифмическое правдоподобие (NLL), длина кода и последовательная
факторизация.
2. KL выделяет цену несовпадения. Она появляется в кросс-энтропии, вариационном выводе,
максимуме энтропии (MaxEnt), обучении по человеческой обратной связи (RLHF), PAC-Bayes и
информационной геометрии — но каждый раз между разными объектами.
3. Йенсен контролирует порядок усреднения и нелинейности. Из него вырастают
ансамблевые гарантии, ELBO, неравенство логарифмической суммы (log‐sum) и многие
вариационные границы.
4. Взаимная информация измеряет ценность наблюдения для предсказания. Условная
взаимная информация показывает добавочную ценность, неравенство обработки данных —
предел обработки, а InfoNCE — одну обучаемую нижнюю границу.
5. Кодирование придаёт вероятностям операционный смысл. Хорошая вероятностная
модель становится компрессором только вместе с энтропийным кодером и согласованным
протоколом.
6. Экспоненциальный наклон — универсальная форма ограниченного обновления.
Он объединяет максимум энтропии (MaxEnt), экспоненциальные семейства, softmax и
политики с KL-регуляризацией.
7. Информация не заменяет задачу, вычисление и семантику. Формула становится
полезной только после определения переменных, критерия качества, доступных данных и
ресурсов системы.
Если сохранить эту карту, отдельные формулы перестают выглядеть коллекцией трюков.
становятся разными ответами на один общий вопрос:
328
Они
Влад Куликов · Открытая редакция 2026.1
Как измерить, передать, сохранить, сравнить или перераспределить неопределённость
при явно заданных ограничениях?
Эта памятка не вводит новых результатов. Первоисточники и подробные условия находятся в списках
литературы модулей 1–15 рядом с соответствующими темами.
329