/
Текст
МОСКОВСКИЙ ГОСУДАРСТВЕННЫЙ УНИВЕРСИТЕТ
имени М.В. ЛОМОНОСОВА
В.В. Александров, С.С. Лемак, Н.А. Парусников
Лекции по механике
управляемых систем
Допущено Учебно-методическим советом по математике и механике
УМО по классическому университетскому образованию в качестве учебного пособия
для студентов высших учебных заведений, обучающихся по специальности
« 010701 Фундаментальная математика и механика»
МОСКВА-2012
УДК 531.3:681.5.01(075.8)
ББК22.2:32.965я73
А46
Рецензенты:
Заведующий кафедрой МАИ, профессор А.В. Шаронов
Заведующий лабораторией ИЛУ РАН, профессор Л.Б. Рапопорт
Александров В.В., Лемак С.С. Парусников Н.А.
А46 Лекции по механике управляющих систем: Учебное
пособие.. - М.: МАКС Пресс, 2012. - 240 с.
ISBN 978-5-317-03976-9
Учебное пособие содержит курс лекций, читаемых на механико-
математическом факультете Московского государственного
университета им. М.В. Ломоносова.
Для студентов и аспирантов, специализирующихся в области
управления механическими системами.
УДК 531.3:681.5.01(075.8)
ББК22.2:32.965я73
ISBN 978-5-317-03976-9 ® Александров В.В., Лемак С.С, Парусников НА, 2012
Оглавление
Предисловие 7
Часть I Первый семестр. Линейный анализ и синтез
управляемых систем 9
Лекция 1. Основные понятия механики управляемых
систем. Физическая и математическая модели
системы. Программное управление и управление
при помощи обратной связи 9
Лекция 2. Основные понятия: устойчивость,
управляемость, наблюдаемость 16
Лекция 3. Понятия управляемости и наблюдаемости.
Критерии управляемости и наблюдаемости 23
1. Понятие управляемости и критерий управляемости . . 23
2. Понятие наблюдаемости и критерий наблюдаемости . 26
Лекция 4. Контравариантные и ковариантные координаты,
алгоритмы управления с заданными свойствами
переходных процессов 31
Лекция 5. Асимптотические алгоритмы оценивания.
Управление по оценке 37
1. Асимптотически устойчивый алгоритм оценивания ... 37
2. Стабилизация вполне управляемой и вполне
наблюдаемой стационарной линейной системы 40
Лекция 6. Структура стационарных динамических систем с
позиций управляемости 43
1. Декомпозиция линейных стационарных систем с точки
зрения управляемости 43
Лекция 7. Структура стационарных динамических систем с
позиций наблюдаемости и стабилизируемости .. 51
1. Декомпозиция линейных стационарных систем с точки
зрения наблюдаемости 51
2. Стабилизируемость линейных стационарных систем 55
Лекция 8. Характеристики многомерных случайных
векторов. Свойства многомерного нормального
распределения 58
1. Характеристики многомерных случайных векторов . . 58
2. Основные законы распределения 62
3
Лекция 9. Случайные процессы и их характеристики 66
1. Анализ случайных процессов 67
2. Процессы с ортогональными приращениями. Белый шум 70
Лекция 10. Стохастические модели линейных динамических
систем 74
1. Дискретный случай 74
2. Непрерывный случай 75
3. Дискретизация непрерывных случайных процессов . . 77
Лекция 11. Алгоритмизация задачи оценивания 80
1. Решение переопределенных систем линейных
алгебраических уравнений 81
2. Критерий максимального правдоподобия 82
3. Задача сглаживания экспериментальных данных
методом наименьших квадратов при помощи кубических
сплайнов 84
Лекция 12. Критерий ортогональности и критерий
условного среднего 87
Лекция 13. Дискретный фильтр Калмана 91
1. Алгоритмы дискретного фильтра Калмана 91
2. Некоторые свойства дискретного фильтра Калмана . . 93
3. Реализация дискретного фильтра Калмана методом
квадратного корня 95
Лекция 14. Непрерывный фильтр Калмана > 98
1. Представление уравнения Риккати в виде линейных
уравнений большей размерности 100
2. Некоторые условия устойчивости фильтра Калмана . . 102
Лекция 15. Применение теории наблюдаемости и
оценивания в инерциальной навигации 104
Часть II Второй семестр. Нелинейное управление
возмущаемыми системами 117
Лекция 16. Стратегии многоуровневого управления
движением 117
1. Линейная комбинация программного и
дополнительного управления при помощи обратной связи 118
2. Оптимизация программного движения. Принцип
максимума Понтрягина 120
3. Два уровня управления для сингулярно возмущенных
систем 121
4
Лекция 17. Двухуровневое управление планированием ЛА . 125
1. Нормализация и обезразмеривание уравнений движения 127
2. Анализ присоединенной системы и синтез алгоритма
стабилизации 128
3. Редукция к вырожденной (упрощенной) системе с
помощью теоремы Тихонова 129
Лекция 18. Классическая вариация и необходимое условие
слабого локального минимума 132
Лекция 19. Лагранжева форма необходимых условий
оптимальности 137
1. Задача Больца в вариационном исчислении 137
2. О связи вариационных принципов механики с
принципом максимума 138
3. Лагранжева форма условий оптимальности 139
Лекция 20. Оптимальная стабилизация при неограниченных
ресурсах 143
1. Управление линейной системой с квадратичным
функционалом качества на конечном интервале времени . . 143
2. Стационарные системы при бесконечном времени
управления 144
Лекция 21. Квадратичная стабилизация и линейные
матричные неравенства ~ 147
Лекция 22. Стабилизация линейной системы при наличии
возмущений 153
1. Робастная квадратичная стабилизация линейной
системы 153
2. Стабилизация при наличии аддитивных возмущений . 154
3. Стабилизация линейной стохастической системы ... 157
Лекция 23. Игольчатая вариация и необходимое условие
сильного локального минимума 161
1. Доказательство принципа максимума Понтрягина . . . 161
2. Задача быстродействия 166
Лекция 24. Достаточные условия оптимальности
управляемой системы 168
1. Достаточность принципа максимума для линейных
систем 168
2. Метод динамического программирования Беллмана
как достаточное условие оптимальности 172
5
3. Связь метода динамического программирования с
принципом максимума 176
Лекция 25. Особые оптимальные управления 178
1. Вариация Келли и необходимые условия
оптимальности второго порядка 178
2. Скобки Пуассона 180
3. Структура оптимального управления 181
Лекция 26. Задача Годдарда 184
Лекция 27. Численные методы решения экстремальных
задач 190
1. Классификация методов численного решения задач
оптимального управления 190
2. Сведение к двухточечной краевой задаче 191
Лекция 28. Задача Булгакова о накоплении возмущений и
максиминное тестирование качества
стабилизации 198
1. Задача Булгакова о накоплении возмущений 198
2. Алгоритм проектирования точки на множество
достижимости 202
3. Максиминное тестирование качества робастной
стабилизации 203
Дополнения к лекциям 208
Дополнение к лекциям 5—7. Декомпозиция алгоритмов
управления и оценивания по компонентам
соответственно вектора управления и вектора наблюдения . . . 208
Дополнение к лекции 13.Субоптимальное сглаживание . . . 214
Дополнение к лекции 14. Меры оцениваемости 219
Дополнение 1 к лекции 24. Регулярный синтез по Болтянскому223
Дополнение 2 к лекции 24. О достаточности принципа
максимума в общем случае 228
Дополнение к лекции 28. О смешанных стратегиях
реализации динамической игры 229
Предметный указатель 236
Основная литература 237
Дополнительная литература 237
6
Предисловие
Пятидесятые и шестидесятые годы прошлого века — время
получения в механике управляемых систем основополагающих
теоретических результатов, связанных с именами Л.С. Понтрягина, Р. Беллма-
на (методы оптимального управления), А.Н. Тихонова
(асимптотические методы), Р. Калмана (теория управляемости и наблюдаемости).
К 1967 году профессор Московского университета Я.Н. Ройтен-
берг создает и начинает читать на Отделении механики механико-
математического факультета МГУ обязательный годовой курс
«Механика управляемых систем». В 1987 году этот курс был дополнен
проведением семинаров (один раз в две недели) и, наконец, в 2011
году при увеличении срока обучения на механико-математическом
факультете до шести лет, Ученый Совет факультета ввел еженедельное
сопровождение курса практическими занятиями. Лекторами в эти
годы, кроме Я.Н. Ройтенберга, были В.ВАлександров, Н.А.
Парусников и С.С. Лемак. За прошедшее время было опубликовано четыре
учебных пособия:
а) «Нелинейные колебания и автоматическое регулирование».
Я.Н. Ройтенберг( 1967г.)
б) «Автоматическое управление». Я.Н. Ройтенберг (1971,1974,
1992гг. — на русском языке; 1974г. — на французском языке;
1978г. на польском языке).
в) «Ведение в динамику управляемых систем». В.В. Александров,
СИ. Злочевский, С.С. Лемак, Н.А. Парусников (1993г. — на
русском языке, 2010г. — на английском языке).
г) «Оптимальное управление движением». В.В. Александров,
В.Г. Болтянский, С.С. Лемак, Н.А. Парусников, В.М.
Тихомиров ( 2005г. — на русском языке).
В настоящее время выходят в свет «Лекции по механике управляемых
систем».
К сожалению, вместить в 28 лекций, составляющих годовой курс,
весь теоретический материал не представляется возможным. Поэтому
авторы данного учебного пособия вынуждены были давать на лекциях
только самые необходимые теоретические методы анализа и синтеза
управляемых динамических систем(УДС), оставляя объяснения
процессов их реализации для конструирования конкретных алгоритмов
навигации и управления на практические занятия по курсу.
Знакомство с конкретными УДС происходит при проведении занятий по спе-
7
циальному практикуму. Следует отметить, что многие важные
разделы, например такие, как управление распределенными системами или
управляемые биомеханические системы, не рассматриваются в этом
курсе.
Все замечания и предложения просьба направлять по
электронному адресу vladimiralexandrov366@ hotmail.com.
8
Часть I
ПЕРВЫЙ СЕМЕСТР. ЛИНЕЙНЫЙ АНАЛИЗ
И СИНТЕЗ УПРАВЛЯЕМЫХ СИСТЕМ
Лекция 1
Основные понятия механики
управляемых систем. Физическая и
математическая модели системы.
Программное управление и управление
при помощи обратной связи
В предлагаемом курсе излагается математическая теория
управления, ограниченная системами некоторого класса, который будет
определён ниже.
Современная математическая теория управления — это огромная
область знаний, с одной стороны опирающаяся на ряд математических
дисциплин, таких, например, как линейная алгебра, теория
дифференциальных уравнений, теория случайных процессов, функциональный
анализ и т.д.; с другой стороны имеющая свой собственный
математический язык, свою собственную систему взглядов, понятий, теорем
и т.п.. Число прикладных задач, решаемых с помощью этой теории,
необъятно.
Такие задачи относятся к различным сферам человеческой
деятельности: авиационная и космическая техника, биология, медицина,
экономика. По-видимому, теория управления — одна из самых
динамичных, бурно развивающихся областей человеческого знания.
История развития теории управления увлекательна, поучительна
и требует изложения в виде специальных курсов. Здесь она будет
затронута более чем кратко при изложении конкретных разделов.
Выделим из огромного моря проблем, связанных с управлением,
некоторый класс, который является предметом изучения в курсе
«Механика управляемых систем» и будет здесь описан.
Первично для нас понятие управляемой динамической системы.
Будем различать физическую модель такой системы и математиче-
9
А Объект
Управляющие
исполнительные
устройства
I I Вычислительные!^
устройства Г
Рис. 1.1. Блок-схема управляемой системы
скую. Физическая модель включает в себя пять элементов:
1. Управляемый объект.
Примеры таких объектов: самолет, биосреда, человеческий
организм, экономическая система.
2. Цель управления.
Примеры таких целей: приведение самолета к заданному
аэродрому; защита биосреды от вредных воздействий человеческой
деятельности; излечение человека от какой-то болезни и.т.д.
3. Измерительные устройства.
Прежде чем управлять, надо знать состояние объекта.
Примеры измерительных устройств: датчики, позволяющие
определить текущие координаты самолета; измерители,
определяющие состояние среды, в частности, степень
загрязненности вредными примесями; сенсоры состояния человеческого
организма и.т.д.
4. Управляющие (исполнительные) устройства.
Примеры: рули крена, курса, тангажа на самолете; препараты,
очищающие среду; лекарства.
5. Вычислитель.
Этот элемент управляемой динамической системы занимает
особое положение. В нем собирается вся информация об
объекте, о работе измерительных и исполнительных устройств,
реализуются алгоритмы, доставляющие выходную информацию,
и алгоритмы, формирующие законы управления.
Вычислитель — это устройство, с которым в наибольшей степени
связана работа прикладного математика.
Физическая блок-схема управляемой динамической системы
имеет вид (рис. 1.1):
Измерительные
устройства
10
Хотя физическая модель управляемой системы и дает базовое
представление о предмете нашего изучения, она недостаточно
конструктивна из-за её неконкретности. Конструктивность вносит
математическая модель управляемой системы.
Приведем в качестве примера одну из содержательных
математических моделей, отражающую достаточно широкий класс
прикладных задач управления движением: космический корабль должен
прилуниться в заданном районе Луны. Траектория его полета состоит из
нескольких участков: участок разгона и торможения, когда работают
двигатели корабля, участок, когда корабль движется по
баллистической траектории, участки, на которых эта траектория корректируется
при помощи специальных устройств.
Траектория полета рассчитывается заранее исходя из
необходимости попасть в цель и, по возможности, максимально сэкономить
горючее. Организуется управление кораблем так, чтобы в идеальном
случае без учета возмущений он двигался по вычисленной
траектории. Такое движение будем называть программным, соответствующее
управление — программным управлением.
Но из-за всякого рода возмущений и погрешностей в работе
двигателя реальная траектория будет отличаться от программной. Имея
в своем распоряжении измерительные устройства, определяющие
местоположение корабля, и специальные корректирующие двигатели,
можно организовать дополнительное управление как функцию
рассогласования реального движения корабля с программным. Такое
управление мы будем называть управлением с обратной связью.
Математическая модель, описывающая задачу управления
подобного типа, такова: пусть управляемая динамическая система
описывается дифференциальным уравнением:
y(t) = /(v>*M)+ *(*)>
где у — вектор состояния системы, w — управление, подлежащее
выбору, q — возмущения, в том числе элемент незнания точной модели
динамической системы. Для простоты здесь оно предполагается
аддитивным, что не слишком ограничивает общность постановки задачи,
поскольку во многих случаях аддитивности удается добиться за счет
линеаризации.
Функция / предполагается дифференцируемой по своим
аргументам, управление w(t) — кусочно-непрерывной функцией времени (или
даже кусочно-гладкой). Значения функции w(t) выбираются из
некоторого ограниченного множества Uy отражающего ограниченность ре-
11
сурсов управления.
Программное управление, обозначаемое далее через w*f
выбирается из внутренней области множества U в пространстве управлений
(w* € intW) и минимизирует некоторый функционал, отражающий
ряд целей: минимизацию энергии, точность, заданность значений у в
конечный момент времени, нежелательность, чтобы вектор y(i) в
процессе движения выходил за рамки некоторой трубки и т.д. Здесь
математически этот функционал пока не описывается. Тот факт, что
управление w* должно выбираться из внутренней области множества U в
пространстве управлений, отражает необходимость сохранения части
резервов для организации управления с обратной связью. Функция w*
удовлетворяет уравнению
** = /(»*, «Л О,
где у* — программное (желаемое) состояние динамической системы.
Введем вектор x(t) = y(t) — y*(t). Пусть в нашем распоряжении
имеются измерители, доставляющие информацию Z* о текущем
состоянии y(t) системы:
2* = в(у,*)+г(*),
где r(t) — погрешность информации, вызванная неидеальностью
работы измерителя, в(у,£) — известная вектор-функция. Отметим, что
на практике размерность вектора Z* заметно меньше, чем
размерность вектора у.
Приведенные выше соотношения отражают переход от
физического (электромеханического) описания системы (в основе которого
лежит теоретическая механика, электромеханика, физиология и т.д.) к
информационной модели. Этот переход является чрезвычайно важной
составляющей в механике управляемых систем.
Поскольку y*(t) известная функция, можно сформировать
величину:
ζ = Ζ* - в(у·,ί) = в(у) - в(у*) + г(«) = в(у* + х) - в(у*) + г(«).
Предполагается, что χ достаточно малая величина и допустима
линеаризация — разложение функции θ (у) в ряд Тейлора в окрестности
программного движения у*, т.е. допустимо представление:
дв(у)\
в(у* + х) = в(у*) + Нх, где Я =
ду
тогда
ν=ν~
z{t) = H(t)x(t) + r(t) (1.1)
12
Введем величину и = w — w* — резерв, позволяющий формировать
управление с обратной связью. Что такое «управление с обратной
связью» с формальной точки зрения — будет ясно из дальнейшего.
Введем управление, которому подчиняется поведение вектора х.
Для этого из уравнения
Ш = f(y* + х, w* + и) + q(t)
вычтем уравнение
y* = f(y*,w*).
Предполагается, что допустима линеаризация:
f(y* + x,w* + и) = f*(y\w*) + A(t)x + B(t)u,
где
A(t)=df{v'w)
y=y* dW
v=v
dy
w—w" w—w"
Таким образом *
χ = A(t)x + B(t)u. (1.2)
Задача теперь сводится к следующей: отклонение текущего вектора
состояния от программного — вектор х, подчиняется только что
выведенному линейному уравнению. Текущую информацию, линейно
зависящую от вектора х, доставляет вектор ζ. Требуется за счет
введения управления и = L[z] выбором оператора L либо минимизировать
в том или ином смысле величину х, либо добиться того, чтобы
отклонения χ асимптотически стремились к нулю. В последнем случае
можно говорить о стабилизации программного движения y*(t). Как было
сказано выше, управление w формируется как комбинация
программного w* и дополнительного w(z, t) управлений:
w = w*+u(z,t). (1.3)
Дополнительное управление и еще называют позиционным,
поскольку оно представляет собой «управление с обратной связью», а задачу
выбора L — задачей синтеза позиционного управления.
Чаще всего поставленную выше задачу выбора оператора L
решают в виде двух последовательных процедур.
Первая — построение оценки χ = Li[z]f где оператор L\
выбирается из условия минимизации величины Δχ = χ — χ.
Вторая — построение управления и = L2[x].
Решению указанной задачи будет посвящена половина нашего
курса, соответствующая первому семестру.
13
!«(*)
W J Λ fin «Λ _1_ л 1 ^ »
1 *| 2/ — /U/> w) + g | *
1
*Л«гу* 1 л* /л,* „.«л 1 ^ »
>У* | l/ -Al/,^) | *
в(у)
-Θ(|Τ)
JLr(t)
1 /\/\
J *>cv
Vz*
Ί (\?\
J *^cV
t 1
1 u Ι Γ ΓΓ-Ί L *
1 b2[Xj ρ
♦
LiW
1
| x = A(t)x + B(t)u + q |
μ ^ ι
Рис. 1.2.
Предварительно заметим, что выбор операторов Li, L<i
определяется гипотезами о математических моделях, которыми описывается
поведение возмущений q(t) и r(t). Чаще всего они полагаются
случайными.
Блок-схема, алгоритма решения задач управления, приводится на
рис 1.2:
С прикладной точки зрения очень важно отметить, что между
физической и математической моделями нет полного соответствия.
Именно управления, которые формируют поведение управляемого
объекта, составляют только часть управлений, формирующих
поведение управляемой динамической системы. И дело здесь вот в чем:
исполнительные и измерительные устройства сами могут
описываться дифференциальными уравнениями, а переменные, входящие в эти
уравнения, должны быть включены в состав вектора состояния у
управляемой системы.
Например, исполнительные и измерительные устройства, как
правило, включают в свой состав усилители сигнала. Подходящая
математическая модель усилителя такова: пусть s(t) — вход усилителя,
v(t) — его выход. Имеет место соотношение:
Τν + ν = fo,
где Τ — постоянная времени усилителя, к — коэффициент усиления, а
величина υ должна быть включена в состав вектора состояния
управляемой системы.
Кроме того, возмущения q(t), г(£), включающие в себя и
инструментальные погрешности всех входящих в систему устройств, также
могут описываться дифференциальными уравнениями.
Для примера опишем простейшую модель измерителя. Пусть I —
измеряемая величина, V — результат измерения. При этом
Ζ' = Ζ + χΖ + ε° + εθ.
14
Здесь х — погрешность масштаба (или мультипликативная
погрешность), ε° — дрейф (смещение) нуля — аддитивная погрешность, ε3
— случайная высокочастотная погрешность. Часто величины κ и ε°
считают постоянными, и тогда их можно описать уравнениями:
х = 0, ε° = 0.
Величины ус и ε° включаются в состав вектора состояния
управляемой системы. В результате этого он оказывается достаточно высокой
размерности.
Заметим, что поставленная задача линейного синтеза
позиционного управления не является единственно возможной. Рассмотрим еще
одну задачу формирования управления w, получившую название
задачи слежения.
Предположим, что имеется нестационарное желаемое движение
yn(t), t € [iojoo). Соответствующее основное управляющее
воздействие ип не существует или не известно, зато известно, что
уп = у*(*) + Ду(*),
где y*(t) — реализуемое стационарное движение и и* —
соответствующее управление. Тогда, воспользовавшись (1.2),( 1.1) и (1.3), где
х = У — У*» получим следующую задачу: требуется найти такое
дополнительное управляющее воздействие и, чтобы текущее отклонение
отслеживало со временем разность Ay(t):
x(t) —-► Ay(t). (1.4)
t—rOO
Задача линейного синтеза (1.2),(1.1), (1.3), (1.4) называется задачей
слежения, а управляемая динамическая система, реализующая
решение этой задачи, получила название следящей системы. Следует
отметить, что данные постановки задач синтеза управляемой
динамической системы, являясь простейшими, в то же время позволяют
наиболее быстро войти в круг проблем механики управляемых систем.
Оправданием такой методики изложения является тот факт, что
линейная стратегия управления (1.3) соответствует известному в
теоретической механике представлению движения, как суммы двух
движений — переносного и относительного.
15
Лекция 2
Основные понятия: устойчивость,
управляемость, наблюдаемость
При выборе исполнительных и измерительных устройств из
некоторого доступного набора, а также при формировании законов
управления следует руководствоваться рядом условий и требований,
некоторые из которых обязательны. Первое из таких условий — при q = О,
г = 0, естественно потребовать, чтобы вектор χ по норме ||х|| =
(хтх)1/2 был, начиная с какого-то момента времени, достаточно
малой величиной. Формализация этого требования связана с понятием
устойчивости, которое мы далее и сформулируем в достаточно общем
виде.
Рассмотрим векторное уравнение у = /(у, ί), у е Rn. Пусть
уравнение таково, что при у (to) = у*(*о) существует решение y*(t) при
t € [*о>оо]. Рассмотрим какое-то другое решение y(t) с начальным
условием y(to) и образуем разность x(t) = y(t) — y*(t). Имеем:
* = Р(М), (2.1)
где φ(χ,ί) = f(y* + x,t) — f(y*,t). Функция <p(x,t) удовлетворяет
очевидному условию <р(0, t) = 0, т.е. χ = 0 является тривиальным
решением уравнения (2.1).
Определение 1. Тривиальное решение χ — 0 устойчиво по
Ляпунову, если для всякого ε > 0 найдется такое S(x(to),to,e), что
при ||я?(*о)|| < * величина x(t) удовлетворяет условию \\x(t)\\ < ε
при t > ίο-
Определение 2. Невозмущенное решение у* (t) устойчиво по
Ляпунову, если тривиальное решение x(t) = 0 устойчиво по
Ляпунову.
Определение 3. Решение у* (t) называется неустойчивым по
Ляпунову, если не выполняются требования определения 1.
Определение 4. Решение y*(t) асимптотически устойчиво, если
оно устойчиво по Ляпунову и \\x(t)\\ -> 0 при t -> оо и ж(£0) € S,
где S — замкнутая выпуклая окрестность точки χ = 0.
Определение 5. Решение y*(t) экспоненциально устойчиво, если
\\x(t)\\ < Ме"а^~"ь°\ где Μ >0,а>0 — некие константы.
16
Устойчивость по первому приближению
Рассмотрим стационарный сличай. Пусть у* = const и функция /
не зависит явно от времени, тогда
χ = φ(χ)} (2.2)
где φ(0) = 0. Разложим функцию φ(χ) в степенной ряд по χ в
окрестности тривиального решения и ограничимся первым (линейным)
слагаемым. Будем иметь вместо (2.2) уравнение
χ = Ах, (2.3)
гдеЛ=^| -const.
Характеристическое уравнение системы (2.3) имеет вид: det(XE —
А) = 0 и пусть Re Aj < 0 Vj, где λ,- — корни
характеристического уравнения. Очевидно, что в этом случае решение уравнения (2.3)
асимптотически устойчиво. Если хотя бы для одного из корней λ,-
выполнено Re Xj > 0, имеет место неустойчивость.
Теорема 1 (Об устойчивости по первому приближению. А.М.Ляпунов
1899). Если все корни характеристического уравнения
матрицы А имеют отрицательные действительные части, то
тривиальное решение уравнения (2.2), а также невозмущенное
решение у* асимптотически устойчиво. Если действительная
часть хотя бы одного из корней положительна, то
тривиальное решение уравнения (2.2), а также решение y*(t)
неустойчиво. Если корни характеристического уравнения не
удовлетворяют ни одному из указанных двух условий, имеет место
пограничный случай, требующий дополнительных исследований.
Здесь теорема об устойчивости по первому приближению
приводится без доказательства.
Пример пограничного случая. Рассмотрим уравнение χ -f ж3 = 0.
Характеристическое уравнение по первому приближению имеет
нулевой корень кратности два, и решение первого приближения таково:
x(t) = С\ 4- C<ity т.е. неустойчиво. Решение же исходного уравнения
устойчиво (не асимптотически), поскольку фазовые кривые имеют
щ^ + ¥=с>0.
Критерий Гурвица
При анализе устойчивости возникает задача определения корней
характеристического уравнения матрицы А. Непосредственное
вычисление корней при больших η весьма трудоемкая процедура. Кроме
17
того, в практических задачах полезно установить зависимость корней
от параметров системы. Здесь на помощь приходит критерий Гурвица.
Для характеристического уравнения общего вида
α0λη + αιλ"-1 + ... + ап = О
составляется определитель Гурвица (не нарушая общности, для
простоты записи ограничимся случаем η = 4):
αϊ
аз
0
0
ао
Q>2
а±
0
0
αχ
аз
0
0
α,ο
Cb2
a±
Способ составления определителя очевиден. Считаем, что ао >
Образуем угловые миноры:
Δι = аь Δ2 =
аз
Cb2
Δ,=
аг
«з
0
ао
CL2
0,4
ϋ
αχ
аз
, Δ4—сам определитель.
Критерий Гурвица: для того, чтобы корни
характеристического уравнения имели отрицательные действительные части,
необходимо и достаточно, чтобы все угловые миноры были
положительны: Αχ > 0; Δ2 > 0; Δ3 > 0; Δ4 > 0.
Следствие: Для того, чтобы все корни имели отрицательные
действительные части, необходимо, чтобы все коэффициенты а* были
положительными.
При η = 2 условие положительности коэффициентов (αϊ > 0,
а2 > 0) оказывается необходимым и достаточным для
асимптотической устойчивости.
При выполнении условия Гурвица анализ динамики не
заканчивается. Например, требуется, чтобы затухание переходных процессов в
системе χ = Ах происходило достаточно быстро, т.е требуется,
чтобы модули действительных частей корней характеристического
уравнения были достаточно велики. Для выяснения условий, при которых
это происходит, вводится понятие запаса устойчивости (или
степени устойчивости).
В уравнении χ — Ах введем замену переменных: положим у =
xeatf где а > 0 — некоторое заданное число. Получим у = (А+аЕ)у.
Характеристическое уравнение будет иметь вид \\Е — (А 4- аЕ)\ = 0.
Если для этого уравнения выполняются условия Гурвица, то говорят,
что уравнение χ = Ах имеет запас устойчивости а. Это означает, что
18
затухание переходных процессов в исходном уравнении относительно
χ происходит не медленнее, чем е~а*.
Таким образом, для определения условий, при которых система
имеет запас устойчивости а, необходимо в исходном
характеристическом уравнении величину λ заменить на величину λ = μ — α.
Выполнение условий Гурвица для полинома относительно μ обеспечивает в
системе запас устойчивости а.
В качестве примера, иллюстрирующего конструктивность понятия
«запас устойчивости», рассмотрим задачу стабилизации
летательного аппарата (самолета, крылатой ракеты) относительно программной
траектории при условии, что информация о текущем боковом
отклонении аппарата известна ( она доставляется навигационной
системой). Пусть κ — известная величина бокового отклонения. В первом
приближении уравнение, определяющее поведение величины κ, имеет
вид:
x + Rx = S + q. (2.4)
Здесь δ — управление, подлежащее выбору; q — внешнее возмущение
(ветер); R — постоянный параметр, зависящий от аэродинамики
аппарата.
Обычно управление δ определяется соотношением
t
δ = —kox — к\ Ι κ(τ)άτ.
о
Здесь fco, &i — коэффициенты обратной связи. Добавление
интеграла в закон обратной связи позволяет избежать установившегося
остаточного отклонения при q = const ^ о.
Вывод уравнения, а также более подробная мотивировка
управляющего сигнала здесь не приводятся. Дифференцируя (2.4) (при
постоянном q), получаем
κ + Rk 4- к$к + к\х = 0.
При сохранении запаса устойчивости λ0 = f потребуем, чтобы корни
характеристического уравнения были следующими:
λι = —-, \2£ = --±3ω.
Характеристическое уравнение в этом случае примет вид
19
Отсюда ко = ^- 4- ω2, к\ = § (^- 4- ω2). Исключая ω2, получим
При этом ко > з".
При практическом построении алгоритма управления учитывается
ряд дополнительных обстоятельств, которые здесь не
рассматриваются.
Наблюдаемость и управляемость.
Предварительные замечания
Будем считать, что программное движение y*(t) и
соответствующее этому движению управление w* заданы. Вопрос об определении
этих величин будет рассмотрен во второй части нашего курса, а сейчас
мы сосредоточим свое внимание на решении задачи управления
относительно программного движения при помощи обратных связей.
Считая, что приведенная выше линеаризация допустима (а это верно в
подавляющем большинстве случаев), мы приходим к следующей задаче.
Пусть вектор χ = y(t) — y*(t) определяет рассогласование истинного
движения с программным, а его поведение подчиняется уравнению:
x(t) = A(t)x(t) + B(t)u(t) + g(t), (2.5)
где А и В известные матрицы, вообще говоря, зависящие от времени,
величина и — управление, подлежащее выбору, aq — немоделируе-
мое возмущение, т.е. возмущение, не имеющее адекватных
математических моделей, описываемых с помощью дополнительных
переменных, включенных в вектор состояния управляемого объекта.
Исходной информацией для формирования управления служит
величина
z(t) = H(t)x(t) + r(t),
где Я — известная матрица, г — немоделируемое возмущение (немо-
делируемая инструментальная погрешность измерителей).
Задача состоит в определение алгоритма и = L(z), где оператор L
предполагается линейным.
Систему (2.5) будем называть стабилизируемой, если существует
такой оператор L[z] (L[0] = 0), что при и = L[z] и равных нулю q и г
тривиальное (нулевое) решение уравнения
x(t) = A(t)x(t) + B(t)L[H(t)x(t)] (2.6)
асимптотически устойчиво.
20
Как уже говорилось, одна из интерпретаций задачи стабилизации
состоит в декомпозиции на две подзадачи. Первая из них —
построение при помощи измерения ζ оценки x(t) = Li[z], вторая —
построение управления u(t) = L2[x], зависящего от оценки.
Возможность решения каждой из этих подзадач тесно связана с
двумя характеристиками внутренних свойств системы —
управляемостью и наблюдаемостью. К изучению результатов, связанных с
указанными характеристиками, мы сейчас и приступаем. Заметим
только, что соответствующая теория оказывается шире, чем просто ответ
на вопрос о стабилизируемости.
Особое внимание будет уделено частному стационарному случаю
(А В и Я — константы), для которого получены наиболее глубокие и
конструктивные результаты.
Прежде чем излагать теорию, опирающуюся на понятия
управляемости и наблюдаемости, рассмотрим два примера, поясняющих суть
обсуждаемых далее вопросов.
Пример 2.1. Рассмотрим систему с управлением и
ii(t) = λι*ι (*) + «(*),
χ2 (t) = \2Х2 (t) + u(t).
Пусть величины х\ и х2 доступны измерению. Тогда управление и
можно организовать в виде линейной обратной связи u(t) = c\X\{t) 4-
c2x2(i). Характеристическое уравнение системы будет иметь вид
λ2 - (λι + λ2 + ci + c2)X 4- λιλ2 + сг\2 + c2\x = 0.
Пусть целью управления является построение системы с заданным
переходным процессом, что эквивалентно заданию
характеристического уравнения
λ2 4- αλ 4- b = 0.
Эта цель достигается при с\ и сг, удовлетворяющих системе
уравнений
с\ 4- С2 = —а — λι — λ2,
\2с\ 4- \\с2 = b — λιλ2.
Решение однозначно при λι Φ λ2. Если а > 0,6 > 0, то система
асимптотически устойчива и, значит, стабилизируема.
При λι = λ2 = λο сделаем замену переменных у\ = \{х\ 4- ж2),
2/2 = §(#ι — #г)· Имеем
2/1W = Aoyi(t)+u(t),
21
y2(t) = λο2/2(*)·
Из полученного результата следует, что в рассматриваемом случае
можно управлять переходным процессом только частично.
Заметим, что при λο < 0 система стабилизируема.
Пример 2.2. Рассматривается система с измерением ζ
xi(t) = λιχι(ί), z(t) = X!(t) + x2(t),
±2{t) = λ2#2(*)·
Имеем z(t) = жюе*1* 4- жгое*2*, где хю = χι(0), Ж20 = #2(0).
Измерение ζ дает возможность при λι ^ Аг однозначно определить
вектор x(t). Для этого достаточно использовать измерения в два
момента времени, например при t = 0 и t = 1. Но если λι = λ2 = λο,
определяется только комбинация x\(t) -f а?2 (*)·
22
Лекция 3
Понятия управляемости и наблюдаемости.
Критерии управляемости и
наблюдаемости
1. Понятие управляемости и критерий
управляемости
Итак, рассматривается система
x(t) = A(t)x(t) + B(t)u(t), (3.1)
где А и В известные матричные функции времени, и — управление,
подлежащее выбору. Как правило, dim и < dim ж.
Определение 6. Система (3.1) называется вполне управляемой
в момент времени to, если существуют такое t > to и
ограниченное управление и(т), где t0 ^ τ ^ t, которые переводят
систему из состояния x(to) =ζβ любое наперед заданное
состояние x(t) = ζ.
Напомним, что решение уравнения (3.1) имеет вид:
t
x(t) = Φ(ί,ίοΜ*ο) 4- I Φ(*,τ)Β(τ>(τ)<ίτ,
to
где Ф(£, to) — известная переходная матрица, удовлетворяющая
уравнению
Ф(Мо) = Λ(ί)Φ(ί,*ο), Φ(ίο,ίο) = Ε. (3.2)
Введем вектор η = ζ — Φ(ί, £o)f >тогда перевод системы из состояния
ξ в состояние ζ эквивалентен существованию конечного управления
и(т), удовлетворяющего соотношению:
t
J Ф(^т)В(т)и(т)ат = η.
to
Отсюда следует эквивалентное определение управляемости:
система (3.1) вполне управляема в момент to, если существуют
23
такой момент t и конечное управление u(r), t0 ^ τ ^ t,
которое переводит систему из нулевого состояния x(to) = 0влюбое
наперед заданное состояние x(t) = η.
В определении присутствует слово «вполне». Оно введено для
того, чтобы отличить качество системы от организации системы, т.е.
того, что в систему введено управление, и система управляема.
При общении специалистов такие тонкости не учитываются и
слово «вполне» опускается, что никогда не приводит к недоразумению.
Поскольку свойство управляемости целиком определяется
свойством пары (А, В), то вместо того, чтобы сказать, что система (3.1)
вполне управляема, говорят, что управляема пара (А, В).
Критерий управляемости в общем случае
Введем матрицу:
t
W(i,td) = J Φ^τ)Β(τ)Βτ(τ)Φτ(ί,τ)άτί
to
которую будем называть грамианом управляемости. Очевидно,
W(£,to) — симметрическая матрица, которая задает неотрицательно
определенную квадратичную форму ATWA ^ 0 для VA.
Теорема 2 (Р.Калман, 1962). Для управляемости пары (А, В) в
момент to необходимо и достаточно, чтобы нашелся момент
t>to такой, что det W(t,£o) φ О, т.е. W(Mo) > 0·
Доказательство.
Достаточность. Пусть det W(t, to) φ 0. Сформируем управление
и(т) = Βτ(τ)Φτ(ί,τ)νν-ν
Легко видеть, что это управление переводит систему из нулевого
состояния x(to) = 0 в состояние x(t) = η.
Необходимость. Пусть система управляема, но det W(£, to) = 0.
Тогда найдется такой вектор η φ 0, что ητ\νη = 0. Раскрывая
последнее равенство, получим
t
[ ητΦ(ί,τ)Β(τ)Βτ(τ)Φτ(ί,τ)ηάτ = 0,
или vT(t) = ηΤΦ(ί, τ)Β(τ) = 0 при любом г € [t0, t].
С другой стороны, в силу управляемости существует управление
w, переводящее систему из нулевого состояния в состояние η в момент
24
времени ί. Но тогда
t
ητη = ητ J Φ(ί, т)В(т)и(т) dr = О,
что противоречит первоначальному условию η Φ 0.
Теорема 3. Для управляемости пары (А, В) в момент ίο
необходимо и достаточно, чтобы нашелся момент t такой, для
которого уравнение относительно η
77ΤΦ(ί, r)B(r) = 0, ίο < τ < ί
имело бы при всех г единственное тривиальное решение.
Рассмотрим стационарный случай, когда матрицы А и В не
зависят от времени. Напомним, что в этом случае переходная матрица
Φ(ί, ίο) может быть записана в виде разложения
Φ(ί,ίο) = βΑ(^)=Ε + Α(ί-ίο) + Α2^^ + ...
Перейдем к доказательству теоремы 3. Уравнение
ητΦ(ί,τ)Β = 0
будет иметь вид:
E + A(t-r) + A-
(ί-*ο)2
+а^-^::\
(п-1)!
п!
В = 0.
(3.3)
В силу того, что функции 1, (ί — τ), (< — т)2,... линейно
независимы, уравнение (3.3) эквивалентно следующей бесконечной системе
уравнений:
ητΒ = 0,
ητΑΒ = 0,
η ■ АгВ = 0,
ητΑη-1Β = 0,
ητΑηΒ = 0,
(3.4)
25
Напомним хорошо известную теорему Гамильтона-Кэли,
согласно которой матрица А удовлетворяет своему собственному
характеристическому уравнению. Пусть характеристическое уравнение
матрицы А таково:
\\Е - А\ = λη + αιλη-χ + ... + on = 0.
Тогда
Ап + ахАп-1 + ...+ αηΕ = 0,
т.е. матрица Ап является линейной комбинацией младших степеней
матрицы А. Но легко видеть, что матрицы Ап+г, Αη+2 и т.д. также
являются линейными комбинациями тех же степеней матрицы А.
Отсюда следует, что бесконечная система алгебраических
уравнений (3.4) равносильна конечной системе уравнений:
г?тВ = 0,
ητΑΒ = 0,
ητΑ2Β = 0,
ητΑη-χΒ = 0.
Для того, чтобы эта система имела единственное тривиальное
решение относительно составляющих вектора η, необходимо и
достаточно, чтобы ранг матрицы системы равнялся размерности вектора η,
т.е. п.
Теорема 4. Для того, чтобы стационарная пара (А, В) была
управляема, необходимо и достаточно, чтобы rankW = n, где
\У = (В,АВ,А2В,...,Ап-гВ).
Матрица W называется матрицей управляемости.
2. Понятие наблюдаемости и критерий
наблюдаемости
Рассматривается система
x(t)=A(t)x(t) + B(t)u(t),
ζ(τ)=Η(τ)χ(τ), r€[td,*]. l ' '
Определение 7. Система (3.5) называется вполне
наблюдаемой в момент t, если существует момент to такой, что
можно определить состояние системы x(t) из наблюдений выходной
функции z(r) на отрезке ί0 ^ τ ^ t (to < t).
26
Поскольку управление г* в (3.5) — известная функция,
возможность определения x(t) при помощи -г(т) та же, что и для системы
i(t) = A(t)x(t),
ζ(τ) = Η(τ)χ(τ), τ€[ί0,ί]. {'
Размерность вектора ζ как правило меньше размерности х> и
знание ζ в некоторый фиксированный момент г не дает достаточной
информации для восстановления вектора состояния х(т). Поэтому для
решения задачи определения x(t) требуется учитывать имеющуюся в
нашем распоряжении информацию о векторе ζ(τ) на всем интервале
ίο ^ τ ^ L
Замечание 1. По поводу слова «вполне» в определении
наблюдаемости можно сказать то же, что говорилось по поводу
определения управляемости. Далее это слово мы будем опускать.
Поскольку наблюдаемость есть внутреннее свойство системы
(3.6), полностью определяемой матрицами АиН, то далее
будем также говорить о наблюдаемости пары (А, Н).
Сформулируем критерий наблюдаемости. Образуем
симметрическую матрицу
t
j\f(Mo) = f Φτ(τ,ί)Ητ(τ)Η(τ)Φ(τ,ήάτ.
to
Здесь Φ(ί, to) — переходная матрица системы. МатрицуЛ/\£, to) будем
называть грамианом наблюдаемости.
Теорема 5 (Р.Калман, 1962). Для наблюдаемости пары (А,Н) в
момент времени t необходимо и достаточно, чтобы нашелся
момент to < t такой, что detAf(t, to) φ 0, т.е. Af(t, to) > 0.
Доказательство. Выведем критерий наблюдаемости в общем
(нестационарном) случае А Φ const, Η φ const. Доказательство
теоремы можно провести аналогично доказательству теоремы 2
(смотрите лекцию 3). Но здесь мы пойдем по другому пути, используя
возможность продемонстрировать метод наименьших квадратов, к которому
мы будем обращаться в последующих лекциях.
Рассмотрим уравнения (3.6). Зафиксируем некоторый момент £0
как начальный. Для определения x(t) имеем уравнение
z(r) = Я(т)Ф(т, «)*(«), (3.7)
которое должно удовлетворяться для всякого τ из интервала [to, ί].
27
Достаточность. Попробуем построить конкретный алгоритм
определения x(t) из уравнения на интервале [to,t]. Выберем в качестве
пробной некоторую величину x(t). Для произвольного момента τ €
[to, t] это пробное x(t) не обязательно удовлетворяет уравнению (3.7),
тогда имеется рассогласование (невязка)
Δζ(τ) = ζ(τ) - #(т)Ф(т,*)*(*).
Естественно потребовать, чтобы пробное решение x(t)
минимизировало в некотором смысле совокупность всех невязок на интервале
[to ^]. Мерой невязки может служить следующий функционал
t t
J[x] = / ||Δ*(τ)||2 dr = /Δζτ(τ)Δζ(τ) dr. (3.8)
to to
Так как ограничения на χ отсутствуют, и функционал (3.8) является
квадратичным, то оптимальное решение x(t) выбирается из условия
к-0· <">
которое приводит при det λί Φ 0 к решению
t
x(t) =Л/'-1(*,*о) ίφτ(τ,ήΗτ(τ)ζ(τ)άτ. (3.10)
to
Полученное нами решение является точным. Это следует из прямой
подстановки выражения (3.7) в выражение (3.10). Отсюда также
следует, что наш функционал на решении (3.10) обращается в ноль:
7 = 0.
Необходимость. Предположим, что система наблюдаема, т.е.
существует единственное решение уравнения (3.7)
*(т) = Я(т)Ф(т,*)а?(*), re[to,t].
Пусть матрица Af(t, to) не является положительно определенной, т.е.
для некоторого χ = x(t)
xTAi(t,t0)x = 0, (3.11)
и этому χ отвечает свое измерение ζ(τ) в соответствии с
соотношением (3.7). Из (3.11) следует
Г * 1 *
ί Φτ(τ^)Ητ(τ)Η(τ)Φ(τ^)άτ\ х= [ ζτ(τ)ζ(τ)άτ = 0,
X
Uo J to
28
или ζ(τ) = 0 для всех г € [to, t]. Следовательно, для рассматриваемой
системы существует решение x(t), которое невозможно отличить от
нулевого, что противоречит условию о наблюдаемости.
Замечание 2. Вместо уравнения (37), определяющего x(t),
можно рассматривать уравнение для определения x(to) = xq
z{r) = Я(т)Ф(т, to)x(to), t0<T<t.
Эквивалентный грамиан наблюдаемости выглядит так
t
Af(t,to) = f Φτ(τ,ίο)Ητ(τ)Η(τ)Φ(τ,ίο)(Ιτ. (3.12)
Рассмотрим теперь стационарный случай А = const, В = const.
Критерий наблюдаемости для стационарной системы формулируется
следующим образом.
Теорема 6. Для наблюдаемости стационарной пары (А,Н)
необходимо и достаточно выполнения условия
( НА ^
rankJV = n, JV =
\ НА"-1 )
Матрицу N назовем матрицей наблюдаемости.
Последний критерий поясним рассуждениями, которые, по-
существу, представляют вариант его вывода.
Аналитическая функция z(t) однозначно определяется значениями
этой функции и всех ее производных в некоторый момент t. В силу
уравнения (3.6) получим в этот момент
z(t) = #x(*), z(t) = HAx{t),... z^l\t) = НАп-гх(г). (3.13)
Но все последующие производные ζ в силу теоремы Гамильтона - Кэ-
ли являются линейными комбинациями величины ζ и ее первых η — 1
производных, и поэтому не несут в себе новой информации о векторе
х. Таким образом, возможность определения вектора χ по измерениям
ζ(τ), τ € [ίο, οο] эквивалентна возможностям, содержащимся в
системе (3.13).
Но для того, чтобы система (3.13) имела однозначное решение x(t)
необходимо и достаточно, чтобы rankJV = п.
Приведем некоторые полезные на практике факты, связанные с
понятием управляемости и наблюдаемости. В уравнениях (3.5)
перейдем к новой переменной
£ = Сх,
29
где С — постоянная квадратная невырожденная матрица. Уравнения
относительно ξ имеют вид:
ξ = САС~г£ + СВщ
ζ = НС-1^
Обозначим
Ас = С АС-1, Вс = СВ, Нс = НС"1.
Имеет место следующее свойство: из управляемости пары (А, В) и
наблюдаемости пары (А, Я) следует управляемость пары (Ас, Вс) и
наблюдаемость пары (Ас, Яс), и наоборот, то есть свойства
управляемости и наблюдаемости инвариантны к невырожденному
преобразованию вектора состояния. Доказательство здесь не приводится.
Сформулируем еще одну методически важную теорему о
сопряженности задач управления и наблюдения.
Рассмотрим две линейные динамические системы, сопряженные
друг другу.
Система I:
χ = Ах 4- Ви,
ζ = Нх.
Система II:
ξ = -Ατξ + Ητν,
ς = Βτξ.
Теорема 7 (О сопряженности понятий управляемости и
наблюдаемости). Система II вполне управляема, если и только если вполне
наблюдаема система I. Система II вполне наблюдаема, если и
только если вполне управляема система I.
Справедливость утверждения следует из сравнения
соответствующих грамианов управляемости и наблюдаемости.
Но понятие сопряженности существенно шире, чем содержание
только что сформулированной теоремы. А именно, все результаты,
связанные с одной из характеристик, переносятся сопряженным
образом на другую характеристику. Последующее изложение
подтверждает сказанное.
30
Лекция 4
Контравариантные и ковариантные
координаты, алгоритмы управления с
заданными свойствами переходных
процессов
Обсудим теперь две задачи.
Первая из них — пусть стационарная система
χ = Ах + Вщ
ζ = Ях,
вполне управляема, т.е. вполне управляема пара (А, В). Как
строить алгоритм управления (или более узко — алгоритм стабилизации)?
Один из таких алгоритмов, равно пригодный как для нестационарных,
так и для стационарных систем, был рассмотрен при доказательстве
теоремы (2.5). Будет показано, что по крайней мере в стационарном
случае более приемлем алгоритм в виде линейной обратной связи.
Вторая задача — построение алгоритмов, доставляющих оценку
вектора состояния, если пара (Д Я) вполне наблюдаема. Один из
таких алгоритмов был рассмотрен при доказательстве теоремы (3.5). Но
более удобным и выгодным со многих точек зрения оказывается
динамический алгоритм оценивания. Он находит в настоящее время самое
широкое применение в разнообразных конкретных системах
управления.
Одно из эффективных средств решения поставленной задачи —
выбор подходящего вектора состояния (вектора фазовых координат),
связанного с первоначальным вектором невырожденным линейным
преобразованием, т.е. выбор подходящего базиса, в котором решение
задачи было бы очевидным.
Пусть ж, у, ζ — инвариантные обозначения векторов, не
привязанные к какому-либо базису.
Как известно, задаваясь базисом {ё1,...,^} в пространстве
состояния, произвольный вектор χ можно определить двояким образом:
во-первых, представить его в форме разложения по базисным векто-
31
рам
* = £>+«*, (4.1)
i=i
и, во-вторых, задать η скалярных произведений
xJ=xTej, j = l,...,n. (4.2)
Величины ж+ называются контравариантными координатами,
величины xj — ковариантными координатами. Соответственно, вводятся
два вектора-столбца
х+ = (*+. ..χ+)τ, χ- = (χ^...χ-)τ. (4.3)
Если базис ортонормированный, то ж+ = ж~. Столбец χ в
уравнении (4.2) интерпретируется как столбец, составленный из координат
вектора χ в ортонормированном базисе {ё7}, при этом сами
векторы ё7 представляются в этом базисе как единичные столбцы ej =
(0...1...0)1".
Введем новый базис {д1,..., дп} и будем использовать
представление векторов gi в виде столбцов gj, составленных из координат
векторов gj в базисе {ёР}. Столбцы gj образуют матрицу G
G = &...?). (4.4)
Обозначим через ξ+ и £~ столбцы, составленные из контравариант-
ных и ковариантных координат вектора χ в базисе {g1,..., дп}
($)
Χ = ξΪ91+ξΪ92 + ···&9η = (91,92,.··,9η)\ 2 \=Gt+.
\& )
<?1Т*,
ξϊ = хТ92 = 92Тх,
Или
ξ-=χτ9η = 9ηΤχ.
/91Т\
,2Т
Г =
χ = GTx.
\9ηΊ
32
Отсюда, кстати, следует ξ~ = <7Т(?£+.
Как будет показано далее, в стационарной задаче управления при
переходе к новому базису координаты целесообразно понимать как
контравариантные, что позволяет решить ее наиболее экономным и
наглядным образом. Стационарной задаче наблюдения в той или иной
постановке соответствуют ковариантные координаты. Такая
двойственность в выборе координат вытекает из взаимной сопряженности
задач управления и наблюдения.
Далее напомним некоторые факты из линейной алгебры, которые
будут использованы в дальнейшем.
Рассмотрим произвольный вектор-столбец f(n x 1) и
произвольную квадратную матрицу А(пхп). Образуем последовательность
векторов
д1 = f,g2=Ag1,...,g*+1 = V,···· (4.5)
Пусть первый вектор последовательности {д^}, линейно зависимый от
предыдущих, есть дк+г
9к+г = то1 + ... + акдк, к<п. (4.6)
Тогда все последующие векторы последовательности {gi} также
являются однозначными линейными комбинациями первых к векторов.
Доказательство — по индукции.
Отсюда следует, что подпространство, натянутое на векторы д*,
fc-мерно и набор векторов {д1, ...,<?*} служит базисом этого
подпространства.
ЕслиА; = п, то набор векторов {р1,...,^} служит базисом полного
пространства
ffn+1=aiff1 + ... + a»ffn. (4.7)
Запишем характеристическое уравнение матрицы А
\\Е - А\ = λη + αϊ A*1"""1 + ... 4- αη_ιλ + αη = 0.
Как уже говорилось, по теореме Гамильтона-Кэли любая матрица
удовлетворяет собственному характеристическому уравнению
Ап + сцА"·-1 + ... 4- αη-χΑ + апЕ = 0.
Последнее соотношение умножим справа на вектор д1 = /, тогда
получим
дп+1+а1дп + ... + апд1=0. (4.8)
Из сравнения (4.7) и (4.8), а также из единственности разложения
любого вектора по базисным следует
αϊ = -αη,...,αη = -аь
33
т.е. характеристическое уравнение матрицы А можно записать также
в виде
λη = αχ 4- α2λ 4-... 4- αηλη_1.
Далее будут сформулированы теоремы, которые служат основой
построения алгоритмов управления и оценивания в случаях вполне
управляемых и вполне наблюдаемых систем.
Теорема 8. Пусть стационарная пара (А(пхп),В(пхт))
управляема и доступны измерению все составляющие вектора
состояния ж. Тогда существует такая постоянная матрица С(тхп),
что управление в виде обратной связи и = Сх обеспечивает
экспоненциальную устойчивость системы χ = Ах 4- Ви.
Более полная формулировка: если пара (А, В) управляема, то
выбором матрицы С можно обеспечить любые наперед
заданные коэффициенты характеристического полинома \\Е — (А 4-
ВС)\.
В системе с одним входом
х = Ах + Ьи, Ь(пх 1),ιι(1 χ 1) (4.9)
задание характеристического полинома однозначно определяет
вектор с(п χ 1) такой, что и = сТх. В системах со многими входами такой
однозначности, вообще говоря, нет.
Докажем теорему 8 применительно к системе с одним входом.
Полное доказательство для случая, когда и — вектор,
содержится в дополнении к лекциям 5—7. Введем векторы д1 = Ь,д2 =
А91) —ί5^+1 = -Afl^'» — Матрица управляемости W представляется в
видеТУ= (дг...дп).
Пусть пара (А, В) управляема. Тогда набор {д1,..., дп} может
служить базисом. Имеет место единственное представление
<7η+1=αι<714-... + αη<Λ (4.10)
где «j - коэффициенты характеристического уравнения
\\Е - А\ = Хп - ах - α2λ - ...«ηλ"""1 = 0.
Покажем, что существует базис {/х,..., /п}, в котором контрава-
риантное представление вектора χ
χ = ξι/1 + ... + ξη/η (4.11)
34
описывается уравнениями
(4.12)
Sn-1 — Snj
ξη = «ιξι + ... + αηξη + w.
Согласно (4.9) имеем
U1 + ..· + Lfn = ξϋ*/1 + ..· + ξηΑΓ + ff1!*.
Или, с учетом (4.12),
6/1+...+ξη/η-4(αιξι+...+αηίη+«)/η = €ιΑ/1+...+ίη^Γ+ί1«-
Приравнивая векторные коэффициенты последовательно при
«,ξη,ξη-ι,..., получим
αι/η = А/1.
Соотношение αι/η = Af1 выполняется в силу (4.10). Из линейной
независимости набора {д1, ...,<?п} следует также линейная
независимость набора {/*,..., /п}, т.е. det F φ 0, где F = (/1.../п).
Соотношения (4.12) влекут за собой возможность описания скалярной
величины ξι одним дифференциальным уравнением η-го порядка
ίίη)+α1ξίη-1) + ... + αηξ1=«, (4.13)
где αϊ = -αη,...,αη = -αι.
Представление (4.12) называют иногда канонической формой по
управлению системы с одним входом.
Замечание 3. Найденное преобразование χ = F£ можно
представить в форме F = WP, где
/αη_ι αη_2
αη-2 ап_з
Ρ =
αχ
V 1
αϊ
1
0
0
1\
0
ο
ο/
35
Если измеряются все компоненты вектора состояния ж, то может
быть определен вектор ξ = F~xx. Сформируем управление и в виде
линейной обратной связи и = βιξι + ... 4- θηξη = ст£.
Характеристическое уравнение системы (4.12) при таком управлении будет иметь
вид
λη = (αϊ + ci) + (α2 + c2)X + ... 4- (αη + Сп)Хп'г. (4.14)
Поскольку выбор вектора с в нашей власти, коэффициенты этого
уравнения могут быть любыми наперед заданными. Но
характеристические уравнения — инвариант по отношению к невырожденному
преобразованию координат, поэтому такими же будут и коэффициенты
исходного характеристического уравнения.
Экспоненциальная устойчивость достигается выбором с,
обеспечивающим отрицательность действительных частей корней
характеристического полинома. Теорема доказана.
Замечание 4. Для того, чтобы выбрать во вполне управляемой
системе коэффициенты обратной связи, обеспечивающие
желаемое характеристическое уравнение, приводить уравнения
системы к виду (4.12) нет необходимости. Такой выбор легко
осуществим в первоначальной форме.
Замечание 5. В «рафинированной» постановке задачи
стабилизации (при отсутствии постоянно действующих на систему
возмущений), которая только что рассмотрена, выбор
степени затухания переходных процессов в системе ничем не
ограничен, и приведение вектора состояния в нулевое положение
может быть осуществлено за любое сколь угодно малое время. Но
решение реальных задач стабилизации существенно
осложняется, по крайней мере, по двум причинам:
• из-за ограничений мощности исполнительных
механизмов,
• из-за неизвестных возмущений, действующих на
динамическую систему, и инструментальных погрешностей
измерителей, доставляющих информацию о векторах.
К тому же эта информация, как правило, не является полной, т.е.
доступны измерению только некоторые составляющие вектора
состояния. В этих условиях управление при помощи обратной связи имеет
неоспоримые преимущества по сравнению с программным
управлением.
36
Лекция 5
Асимптотические алгоритмы оценивания.
Управление по оценке
1. Асимптотически устойчивый алгоритм
оценивания
Обсудим теперь вопрос об алгоритмах, доставляющих оценку χ
вектора ж. Ранее при выводе критерия наблюдаемости один из
возможных алгоритмов оценивания был получен, но на практике
используется иной алгоритм, аналогичный алгоритму управления при
помощи линейной обратной связи. К построению такого алгоритма мы и
перейдем.
Рассмотрим следующий алгоритм оценивания
έ(ί) = M(t) + K(z(t) - Hx(t)) + Bu(t), x(t0) = x0. (5.1)
Здесь матрица усиления К подлежит определению.
Уравнение относительно рассогласования Ах = χ — χ назовем
уравнением ошибок. В нашем случае оно имеет вид
Ax(t) = (A- KH)Ax(t), Ax{t0) = хо - $ο· (5.2)
Обратим внимание на важное свойство алгоритма (5.1),
называемое свойством несмещенности. Оно означает, что ошибка оценки
Ах = 0, если вся используемая для оценки информация точна (в
нашем случае, если Ax(to) = 0).
Теорема 9. Пусть стационарная пара (А, Н) наблюдаема.
Тогда существует такая постоянная матрица усиления К, что
уравнение ошибок (5.2), соответствующее алгоритму
оценивания (5.1), оказывается асимптотически устойчивым.
Более полная формулировка: если стационарная пара (А, Н)
наблюдаема, то выбором матрицы К можно обеспечить любые
наперед заданные коэффициенты характеристического
полинома \\Е - (А-К Н)\.
В системах с одним выходом
x(t) = Ax(t) + Bu(t), z(t) = hTx(t), h(n χ 1), z(l χ 1) (5.3)
задание характеристического полинома однозначно определяет
вектор К(п χ 1).
37
В системах с несколькими выходами такой однозначности, вообще
говоря, нет.
Докажем теорему применительно к системам с одним выходом.
Общий случай рассмотрен в дополнении к лекциям 5—7. При
доказательстве, без потери общности, будем полагать В = 0.
Матрица наблюдаемости N в нашем случае имеет вид
iV=(£lT...<7nT), detJV^O,
где д1 = h,g2 = Атд11..., gj+г = ATgj,..., причем
^η+1 = αι^ι + ··· + αη^η. (5.4)
Покажем, что существует такой базис {/*,..., /п}, в котором кова-
риантные координаты вектора χ ξι = Xх/1,& = #τ/2,...,ξη =
xTfn подчиняются уравнениям
ξ2 = <*n-l£l+6,
: (5.5)
ξη = <*l6,
ζ = ξι.
Из предыдущих уравнений последовательно получаем:
ξι = χτ91=χτΐ\
6 = ξι - <*ηξι = хТ(92 - otngl) = хт/2,
ξη = xT(9n - с*п9п-г сад1) = хТГ.
Уравнение ξη = αιξι удовлетворяется в силу соотношения (5.4).
Отсюда следует, что набор {/\..., /п} составляет базис.
Динамический алгоритм оценивания имеет вид
Ιι = otnli + 6 + *ι(* - Ιι),
|2 = On-lll + L· + **(* - fl),
(5.6)
|n = <*i£i + M*--£i).
38
Уравнения ошибок
Δξι = (αη-λι)Δξι + Δί2,
Δξ2 = (αη_1-Α:2)Δξ1 + Δξ3, (5.7)
Δξη = (αι-*η)Δξι.
Характеристическое уравнение для (5.7) таково
λη = (αϊ - К) + (α2 - *η-ι)λ + ... + (*η - ^)\η~\
Поскольку выбор kj в наших руках, мы можем сделать коэффициенты
этого уравнения любыми наперед заданными.
Представление (5.5) называют иногда канонической формой по
наблюдению системы с одним выходом.
Заметим, что при построении алгоритма оценивания нет
необходимости приводить систему (5.3) к каноническому виду.
Пример 5.1.
где г — постоянная ошибка измерения.
Запишем уравнения в форме Коши. Положим
т? = х1)т) = х2,г = х3,
тогда
χι = х2,
х2 = -хь
х3 = 0,
Ζ — Х2 + Хз
Легко убедиться в наблюдаемости системы. Алгоритм оценивания
χι = х2 4- k±(z — х2 — хз),
х2 = —χι + k2(z — х2 — хз),
#3 = k3(z-X2 -Хз)·
Уравнение ошибок
Δχχ = (1 — &ι)Δχ2 — ΛιΔχ3,
Δχ2 = —Δχχ — Λ2Δχ2 — &2Δχ3,
Δ±3 = — &3Δχ2 — ^3Δχ3,
39
Характеристическое уравнение
λ3 4- (к2 + к3)Х2 + (1 - кх)Х + к3 = 0.
Пусть желаемое характеристическое уравнение имеет вид (λ+l)3 = 0.
Из сравнения находим
кг = -2, к2 = 2, к3 = 1.
Такой выбор kj обеспечивает асимптотическую устойчивость (Axj ->>
0 при* -> оо).
Пример показывает, что решение задачи оценивания в некоторых
случаях может быть точно при неточных измерениях, если известна
структура инструментальных погрешностей.
Замечание 6. Высказанные в замечании 4 соображения,
касающиеся выбора коэффициентов обратной связи в задаче
стабилизации, в равной степени относятся и к выбору матрицы
усиления К в алгоритме оценивания.
2. Стабилизация вполне управляемой и вполне
наблюдаемой стационарной линейной системы
Предшествующие результаты позволяют решить задачу
стабилизации стационарной системы
x(t) = Ax(t) + Bu(t), z(r) = Яж(т), т € [to,*] (5.8)
в идеальном случае, когда пара (Д В) управляема, а пара (А, Н) —
наблюдаема.
Состояние вектора χ в начальный момент неизвестно, а
измеряется только величина ζ, размерность которой меньше размерности
вектора ж. Такая задача иногда называется задачей стабилизации с
неполной информацией о векторе состояния.
Первый напрашивающийся вариант решения - введение обратной
связи по измерению и = С ζ. Но в уравнении χ = (А + ВСН)х
обеспечить асимптотическую устойчивость за счет выбора матрицы С в
общем случае нельзя.
Следующий шаг — введение обратной связи вида
t t t
u = c\z + C2 zdr-\ \rca / ... zdr,
to to to
или более сложного по структуре сигнала с введением внутренних
обратных связей в контур формирования управляющего сигнала с целью
40
подбора параметров управления (в данном случае ci,..., сД
обеспечивающих асимптотическую устойчивость.
Но в нашем случае существует универсальная возможность
сформировать линейную обратную связь по оценке, доставляемой
динамическим алгоритмом
£(t) = Ax(t) + K(z(t) - Hx(t)) + Bu(t).
Уравнение ошибок имеет вид
Ax(t) = (А - KB)Ax(t), (5.9)
где матричный параметр К можно выбрать так, чтобы имела место
экспоненциальная устойчивость с любой наперед заданной степенью.
Введем обратную связь u(t) = Cx(t). Тогда исходное уравнение
можно записать
x(t) = Ax(t) + BCx(t),
или, с заменой χ = χ — Δχ,
x(t) = (A + BC)x(t) - BCAx(t). (5.10)
Характеристическое уравнение совокупной системы уравнений (5.9),
(5.10) таково
\Еп-(А + ВС) ВС
0 ХЕп - (А - КН)
Оно распадается на два
\\Еп - (А + ВС)\ = 0, |λ#η - (А - ХЛ)| = 0.
В силу управляемости пары (А, В) матричный параметр С можно
выбрать так, чтобы корни соответствующего уравнения имели
отрицательные действительные части.
Следствием вышеизложенного служит теорема о достаточных
условиях стабилизируемости.
Теорема 10. Пусть β стационарной линейной системе (5.8) пара
(А, В) управляема, а пара (А, Н) — наблюдаема. Тогда система
(5.8) стабилизируема.
Пример 5.2. Стабилизация математического маятника
относительно неустойчивого положения равновесия.
Уравнение движения имеет вид
ά — ω2 sin α = и,
где и — нормированный управляющий момент.
0.
41
В данном случае желаемое состояние а* = а* = 0. Пусть
измеряется угол α: ζ = а. Имеем уравнения в линейном приближении:
χι = х2,
±2 = ω2χχ 4- и,
ζ = χχ.
Алгоритм оценивания
xi —Х2 + ki(z-xi),
X2 = ω2χι 4- k2(z — Χι) 4- w.
Уравнения ошибок оценки
Δχχ = —&ιΔχχ 4- Δχ2ϊ
Δ±2 = (ω2 — Λ^Δχχ.
Характеристическое уравнение
λ + fci -1
-ω2 + k2 λ
λ2 + Μ + (^2-ω2) = 0.
Выберем fci и &2 из условия асимптотической устойчивости уравнений
ошибок оценки: ki > 0, к2 — ω2 > 0.
Алгоритм управления
U = βχΧχ 4- C2X2j
Xl = #2,
2
#2 = ω Xl 4" βχΧχ + C2#2j
где χχ = χι — Δχχ, χ2 = Χ2 — Δχ2· Характеристическое уравнение
собственно управляемой системы
λ -1
-(ω2 4- ci) λ - c2
A2-c2A-(ar4-ci) = 0.
Выберем ci,c2 из условия, чтобы корни этого уравнения имели
отрицательные действительные части
с2 < 0, ci+ω2 < 0.
Такой выбор параметров fci, fc2, ci, 02 обеспечивает стабилизацию.
42
Лекция 6
Структура стационарных динамических
систем с позиций управляемости
Достаточно полная математическая модель реальной управляемой
системы, каков бы ни был в ней набор исполнительных механизмов и
измерительных устройств, строго говоря, не вполне управляема. Это
происходит из-за включения в вектор состояния моделируемой
части инструментальных погрешностей и возмущений, а также
переменных, описывающих динамику работы исполнительных и
измерительных устройств.
Практически важно построение теории, позволяющей выделять из
системы её управляемую и наблюдаемую часть, иначе, производить
декомпозицию (расщепление) системы с точки зрения управляемости
и наблюдаемости.
Элементы этой теории следуют ниже.
1. Декомпозиция линейных стационарных систем
с точки зрения управляемости
Обсудим сначала вопрос о декомпозиции с точки зрения
управляемости.
Рассматривается стационарная система
x(t) = Ax(t) + Bu(t) (6.1)
Пусть условие управляемости для этой системы не выполняется,
т.е. rank W < η, где
W = (В, АВ, А2 В,..., А"-1 В) (6.2)
Вначале рассмотрим вопрос о декомпозиции с геометрической
точки зрения. Для простоты будем считать, что управление скалярно,
т.е. рассматривается система
x(t) = Ax(t) + bu{t) (6.3)
где b — матрица-столбец. В этом случае матрица W квадратная и
имеет вид:
W = (b,Ab,A\...,An~1b),
43
или
где
дг = ь,
Пусть первое дг, которое оказывается линейно-зависимым от
предыдущих, есть дт+г (га < п):
9m+1 = aig1 + сад2 + ...+ атдт.
Тогда все последующие д*, j > га -f 1 выражаются линейно через
первые m векторов д*.
Тогда rank W = га. Пусть Я™ — подпространство, натянутое на
векторы 01,..., дш. Набор д1,..., дт в этом подпространстве
является базисом.
Подпространство Я™, очевидно, инвариантно по отношению к
преобразованию А: если / € Я™, то А/ € Я™. Но тогда
подпространство Я£* инвариантно к преобразованию Ак (к любое) и к
преобразованию еЛ*, поскольку
eAt = E + At + A2^+A3^ + ....
Обратимся к уравнению (6.3). Пусть пока и = 0 и начальные условия
для χ выбраны из подпространства Я™, то есть
*(*>) = W + 6о<72 + · · · + Uo9m = (ff\ <72, · · ·,ffTO)&,
где ξ0 = (6ο, 6ο, · · ·, fmo)T. В этом случае
*(*) = eA»-«(ff1,ffa,-,ffm)U.
Так как подпространство Я™ инвариантно к преобразованию еЛ*,
то x(t) € Я™:
*(*) = fcWff1 + · · · + Ы*)<Г = (ffl, · · ·, <ГЖ*).
rapi(*) = (€i(*),6(*),...,€m(«))T·
Таким образом, если фазовая точка в начальный момент находится
в подпространстве R™ и и = 0, то она будет оставаться в этом
подпространстве в любой момент времени.
44
Пусть теперь, напротив, x(to) = 0, тогда решение уравнения (6.3)
имеет вид
to
Очевидно представление
еЛУ = φι{ϊ)9Χ + Mt)92 + · · · + Ч>гп{Ь)дш,
где ipj(i) — некоторые функции времени. Отсюда следует:
Г * 1 Г *
x(t) = / (pi(t - r)u(r)dr Ig1 + ...+ / y>m(£ - r)u(r)d
Uo J Uo
Это выражение означает, что никакое управление u(t) не может
вывести фазовую точку из подпространства R™. В общем случае, если
начальное состояние принадлежит R™
х(М = Ы91 + Ы92 + · · · + £тодт,
то любая фазовая траектория, порожденная некоторым управлением
u(t), лежит в подпространстве Я™, и величину x(t) можно
представить в виде контравариантного разложения
*W = 6ff1+6ff2 + ---+fmffTO.
Подставляя это разложение в уравнение (6.3) и принимая во внимание
соотношения
V=^+1, Agm = a1g1 + ... + amgm, i = l,...,m-l,
получим:
6=6 + Οί2ξπι, ,g .v
Sm = 6n+l +^mimj
или более кратко
ί = ^ξ + (1,0,...,0)τ«,
где матрица Ад имеет вид:
0 0 0 ... О αϊ
1 0 0 ... О α2
О 0 0 ... 1 <*„
45
Пара (Ад, (1,0,..., 0)т) управляема. Легко показать, что в этом
случае матрица управляемости Wg равна единичной: Wg = Ε.
Подведем итоги. Подпространство, натянутое на столбцы матрицы
управляемости, называется инвариантным управляемым
подпространством. Его размерность равна рангу матрицы управляемости.
Если эта матрица максимального ранга, то управляемое
инвариантное подпространство совпадает с полным пространством. Основное
свойство указанного подпространства — инвариантность к
преобразованию А и, стало быть, к преобразованию eAt.
Следствия:
1. Если в начальный момент фазовая точка системы находится в
управляемом подпространстве, то она в нем и остается при
любом управлении и.
2. Система может быть переведена из нулевой фазовой точки за
счет управления в любую наперед заданную фазовую точку,
принадлежащую инвариантному управляемому
подпространству.
Обратимся к общему случаю (6.1), когда управление и — вектор.
При этом применим несколько иной подход, уделив большее внимание
процедурной стороне дела.
Пусть rang W = т < п. Тогда среди столбцов (векторов)
матрицы W существует т линейно-независимых, которые образуют базис
подпространства, натянутого на эти векторы. Так же как и ранее
показывается, что это подпространство будет инвариантно к
преобразованиям А, А2,... и, стало быть, к преобразованию eAt. Для примера
рассмотрим случай, когда и — двумерный вектор. Тогда можно
написать
x(t) = Ax(t) + Ьгт(Ь) + Ь2и2(*), В = (Ь1, Ь2).
Введем векторы
9*=Ь\ д2 = Ад\ ..., ^+1=V, ···
/i=tf, f2 = Af\ ..., р+г = Ар, ...
Тогда матрица управляемости имеет вид
W = {g\f\g\f\...,gn,r),
где η = dim x.
Один из вариантов построения базиса подпространства R™j
таков. Рассмотрим два набора
46
Пусть первый вектор из набора {д^}, линейно зависимый от
предыдущих, есть д3*1:
да+г = агд1 + сад2 + ... + aaga.
Очевидно, все последующие gj линейно зависят от первых s
векторов. Дополним векторы дг,...,да следующими по порядку векторами
второго набора так, что первый, линейно-зависящий от предыдущих,
будет вектор /r+1:
где s -f г = га. Оказалось, что га < п.
Все последующие векторы /г+2, /г+3,..., очевидно также
линейно зависят от указанных s + r = m векторов, и подпространство -R™/,
натянутое на эти га векторов, инвариантно к преобразованию А и ем.
Итак, пусть rangW = га. Обозначим через р\ р2,... ,рт какой-
либо базис подпространства Дт, натянутого на столбцы матрицы
управляемости W. Введем матрицу Ρ = (ρ1,ρ2,... ,pm). Дополним
набор ρ векторами g1, q2,..., qk, причем га -f к = η, и введем матрицу
Q = (θ1) Я2* · · · j Qk)jтак что в совокупности наборы ρ и q составляют
базис всего пространства Rn. В остальном выбор векторов q
произволен. Например, векторы q можно выбрать ортогональными векторам
ρ и друг другу.
В новом базисе контрвариантное разложение вектора χ запишем в
виде
a = &P1 + ...£mPm + W + --- + Ws = Ρξ + Qv,
где
V L) \щ)
Справедливы соотношения:
АР = (Ар\...,Арт),
Ар1 = сцр1 + .·. + «W = (р1,... ,ртУ = Рс\
Ар2 = c12px + ... + СпяГ = (р\... ,ртУ = Р<?,
АРт = dmp1 + ... + Сптр™ = (р\... ,Рт)ст = Р(Г,
47
или
AP = PA1U
где Ац = (с1,..., cm), dim Ац = (т χ т).
Матрица AQ имеет вид:
^Q = (V,...)V).
Подпространство натянутое на векторы q, не инвариантно к
преобразованию А, поэтому векторы Aqj раскладываются по векторам
полного базиса пространства Rn.
Например:
Aql = dnp1 + ... 4-dmipm 4-hiq1 + ... + hiqk = Pdl + Ql1.
Продолжая преобразование дальше, окончательно получим:
AQ = РАи + QA22.
Размерности матриц А\2 = (га χ к) и А22 = (к χ к).
Столбцы матрицы В = (Ь1,... ,6е), — векторы подпространства
Ят, поскольку входят в матрицу управляемости. Поэтому
Ь>' = (р\...,Рт)Ь>'\
или
В = РРЬ Si = (ЬИ,Ь21), dimBi = (т χ 2).
Обратимся к уравнению (6.1). Заменим χ его контравариантным
разложением χ = Ρξ 4- Qr? и воспользуемся приведенными выше
преобразованиями. Получим:
Ρξ + (3ή = Α [Ρξ 4- Qv] 4- ΡΒι«,
или
^ + Qn = ^uf + ΡΑΧ2η 4- QA22r/ 4- РВщ.
Приравнивая выражения при базисах Риф, окончательно
получим:
i = Μιζ + Αλ2η 4- Piw ,65v
η = -^22^7
Из полученных выражений следует, что если в начальный момент
η(ίο) = 0, то фазовая точка при любом управлении и не может
выйти из подпространства ξ. То есть, подпространство ξ — инвариантное
управляемое пространство.
48
Замечание 7. Из (6.5) следует: если матрица А22
асимптотически устойчива, и измерению доступны все составляющие
вектора х, то система (6.5) (или то же самое, что и система
(6.1)) стабилизируема.
Пример 6.1.
у-у-2у = й + и. (6.6)
Для тех, кто знаком с понятием передаточной функции: факт
неполной управляемости системы следует из вида передаточной
функции. Введем обозначение: Ws (s — оператор дифференцирования).
Тогда имеем систему:
v(*) = Wv(*Mb),
w (s) = 8Л1 = J_
WyW (* + 1)(*-2) s-2'
в которой не отражен корень характеристического уравнения системы
λ = -1.
Исследуем вопрос об управляемости, следуя формализму теории.
Приведем уравнение (6.6) к форме Коши так, чтобы правая часть не
содержала производных от управляющего сигнала. Форму Коши
будем искать в виде (так называемая форма Фробениуса):
χι = агхг 4- х2 + ftu, _ч
_ (Ь./)
Х2 = «2#l + P2W.
Полагая х\ = у и приводя (6.7) к одному уравнению относительно
у и сравнивая его с (6.6), получим:
#1 = х1 ~Ь Х2 + W,
±2 = 2Χι + U.
Матрица управляемости принимает вид:
W= ( Ϊ ? V detW = 0.
-(ϋ)·
Введем новый базис {р, q}> где ρ = (1,1)т, q = (1, — 1)т. Вектор χ в
новом базисе зададим контравариантными координатами ξ и η:
χ = ξρ + ης.
Уравнения относительно новых переменных:
ξ = 2ξ + η + υ,
т) = -η
49
Инвариантное управляемое подпространство определяется
соотношением η = 0 (х\ = хг)·
Если измеряются все фазовые координаты, переменная ξ
стабилизируется при помощи линейной обратной связи
w = —77 — с^, где с > 2,
а неуправляемая переменная η -> О при t -> оо. Поэтому, хотя система
в целом управляема не полностью, она полностью стабилизируема.
50
Лекция 7
Структура стационарных динамических
систем с позиций наблюдаемости и
стабилизируемости
1. Декомпозиция линейных стационарных систем
с точки зрения наблюдаемости
Рассмотрим систему
x(t) = Ax(t)
*(т) = Я*(т),т€[М·
Пусть пара (А, Н) не вполне наблюдаема, т.е. rankJV < η, где N —
матрица наблюдаемости:
/ н \
(7.1)
N =
НА
\ НА"-1 )
Вначале, как и в задаче об управляемости, рассмотрим вопрос о
декомпозиции с геометрической точки зрения. Пока для простоты
будем считать, что измерение ζ скалярно, т.е. ζ = hrx и матрица
наблюдаемости N имеет вид:
N =
hTA
\ /i1"^"1 /
„2Т
\япТ J
где д1 = /ι, д2 = Атдг,..., д?+г = Атд*.
Пусть первый вектор последовательности {д1,.
зависимый от предыдущих, есть вектор д™*1:
,<?п}, линейно
<7m+1 = то1 + .
+ <W
тогда все последующие векторы последовательности также будут
линейно зависеть от первых т векторов, и набор {д1,..., дт} порождает
подпространство Я™, инвариантное к преобразованию АТ.
51
Этот набор служит одним из возможных в этом подпространстве
базисов. Введем набор {/*,..., fk}, m 4- к = п, такой, что
совокупный набор {д1,..., дт, /*,..., fk} служит базисом всего
пространства Дп. Набор {/}, очевидно, можно выбрать так, чтобы каждый
из векторов р был ортогонален каждому вектору д*9 а также
чтобы они были ортогональны между собой. Условие ортогональности:
ртдг = о, где г = 1,..., m, j = 1,..., fc.
Покажем, что подпространство, натянутое на векторы /*,..., fk>
инвариантно к преобразованию А, а стало быть и к преобразованию
eAt. Имеем в силу того, что любой из векторов АТд* ортогонален
любому из векторов р (j» = 1,2,..., к):
Рг(Атд*) = 0.
Последнее соотношение можно переписать в виде:
И/*) V = о.
Откуда следует, что вектор Ар принадлежит подпространству,
натянутому на векторы набора {/}. Из последнего вывода следует, что это
подпространство инвариантно также к преобразованию eAt. Пусть в
начальный момент вектор x(to) € Щ, т.е. ж(£0) можно представить в
виде:
х(М = ViiW1 + v2(to)f2 + ... + 7fc(to)/fc,
тогда
x(t) = е^-'°>*(*0) = e^'-^Mio)/1 + ... 4- m(t0)fk) =
= 4i(*)/1 + ...+ Ч*(*)Л
Измерение z(t) будет в этом случае таким:
z(t) = hTx(t) = g^imW1 + ■■■ + Vk(t)fk) = 0,
поскольку д1ТР = 0.
Таким образом, для всех фазовых траекторий, порожденных
любым начальным условием x(to) € Rk, измерение z(t) будет нулевым,
т.е. такие траектории неразличимы между собой, а также неразличимы
с тривиальной траекторией x(t) = 0. Иначе говоря, такие траектории
ненаблюдаемы.
Подпространство, натянутое на векторы /, назовем
инвариантным ненаблюдаемым подпространством. Его свойство
заключается в том, что все фазовые точки, принадлежащие этому
подпространству, не вносят вклада в измерение z(t).
52
Обратимся к общему случаю, когда измерение ζ — вектор. Нас
здесь будет интересовать, в первую очередь, процедурная сторона
вопроса. Пусть rankJV = т < п, тогда из строк матрицы
наблюдаемости можно выбрать т линейно-независимых. Подпространство,
натянутое на векторы, полученные обращением строк матрицы
наблюдаемости в столбцы, будет иметь размерность га. Это подпространство
инвариантно относительно преобразования АТ.
Пусть {рг9...9рт} — некоторый базис этого подпространства.
Дополним этот базис до полного набором {q1,..., qk}f га + к = п.
Векторы q* могут быть выбраны произвольно, лишь бы не нарушалась
линейная независимость совокупного набора {р1,... , pm, ql,..., qk}.
Один из вариантов такого выбора — каждый из q* ортогонален всем
векторам^, а также все q* ортогональны между собой.
Введем ковариантные координаты вектора ж:
£ = xTjP = ρ*τχ, j = 1,2,... ,га.
щ = xTq% = qtTx, z= 1,2,..., k.
Или в краткой форме
ξ = Ρτχ, где P = (p\...,pm),
V = QTx, Q = (q\--.,qkY
Воспользуемся аналогиями с фрагментом того же названия при
обсуждении вопроса о декомпозиции по управлению.
Роль матрицы А в указанном фрагменте в нашем случае будет
играть матрица АТ:
АТР = РА[Ъ
ATQ = PAlx+QAl2,
Нт = PHJ.
Получим уравнения, которым подчиняется поведение векторов ξ и
Ф
ξ = ρτχ = ртАх = (АтР)тх = (ΡΑ^)τχ = АХ1Ртх = Αηξ
ή = Q^i = QTAx = (ATQ)Tx = (PAjx + QAj2)x =
= (A2iPT + A22QT)x = Α21ξ + Α22η
z = Hx = {PHj)Tx = НгРтх = Ηχξ.
53
В итоге имеем систему:
v(t) = A21£(t) + A22V(t)y
€(*) = Ли€(*), (7.2)
z(t) = ffi€(i)
Здесь пара (Ац, Щ) наблюдаема.
Инвариантность подпространства {η} следует из факта: если
ξ(ίο) = 0, то и ξ(ί) = 0. Порождаемая этим начальным условием
траектория принадлежит подпространству {η}.
Определение 8. Система, в которой матрица А22
асимптотически устойчива, называется обнаруживаемой или
детектируемой.
Это определение можно также рассматривать как необходимое и
достаточное условие детектируемости.
Смысл определения становится ясен из следующего рассуждения:
будем искать оценки ξ и ή векторов ξ и η в виде:
ξ = Α11ξ+Κι{ζ-Η1ξ),
η = Α22ή + Α21ξ.
Тогда уравнение ошибок имеет вид
Αξ = (Α11^Κ1Η1)Αξ,
Αή = Α22Αη + Α2ΧΑξ,
и матрицу К всегда можно выбрать так, чтобы (7.3) была
асимптотически устойчива (Αξ -> 0). В силу того, что А22 асимптотически
устойчива, Αη -> 0, т.е. существует алгоритм, позволяющий оценить
η при t -> оо.
Пример 7.1.
у + 3у + 2у = 0, z = y + y. (7.4)
Положим χι = у,х2 = у. Получим
Х\—Х2ч Ζ = Х\ + Х2ч
х2 — —2х\ — Ъх2.
Система не является полностью наблюдаемой, так как N = (_\ _\),
т.е. det N — 0.
Невырожденной заменой ξ = ж ι + х2, η — х\ — х2 система
приводится к виду
ξ = -2ξ, ζ = ξ,
■ ν (7·5)
η = 3ξ-η.
54
Инвариантное ненаблюдаемое подпространство составляют точки
прямой
Х1+Ж2 = 0 (£ = 0).
Отметим, что система (7.5) (а, стало быть, и система (7.4))
детектируема.
2. Стабилизируемость линейных стационарных
систем
Рассматривается линейная стационарная система
i(t) = Az(t) + Bu{t),
ζ(τ) = Ηχ(τ), r€[id,*l,
где dim χ = η, dim ζ — m, dim и = s, a A, S, Я — постоянные
матрицы соответствующей размерности.
Напомним ранее введенное понятие стабилизируемости.
Система (7.6) стабилизируема, если существует оператор L[z],
такой что при и = L[z] тривиальное решение системы (7.6)
асимптотически устойчиво.
Пусть условие управляемости для этой системы не выполняется,
т.е. rank W < η, где
W = (В, АВ, А2 В,..., Ап-гВ). (7.7)
Замечание 8. Поскольку свойство стабилизируемости
определяется тройкой (А, В, Н), а свойство детектируемости —
парой (А, Н), эти свойства несравнимы. Однако,
стабилизируемость пары (А, В) при полной информации о векторе состояния
χ сопряжена детектируемости пары (А, Н).
Обратимся к характеристическому уравнению системы (7.6)
\\Е - А\ = 0.
Пусть для т корней характеристического уравнения λ, j = 1,2..., m
выполняется условие ReXj > 0. Для остальных s = η — т корней
выполнено
ReAi<0, i = l,2,...,a.
Тогда существует невырожденное преобразование F такое, что
©-*
55
где dimf = m, dim η = s, и система (7.6) в новых переменных имеет
вид
ξ = Αιξ + Βιίχ,
ή = Α2η 4- В2и, (7.8)
ζ = Ηχξ 4- Я277.
Заметим, что указанные выше величины Xj являются корнями
характеристического уравнения \ХЕШ — А\\ = 0, а величины λ» — корнями
характеристического уравнения \ХЕ3 — А2\ = 0. В качестве F,
например, можно выбрать преобразование, приводящее матрицу А к жор-
дановой форме.
Имеет место почти очевидная теорема:
Теорема 11. Для стабилизируемости системы (7.8) необходима
и достаточна управляемость пары (Αχ,Βι) и наблюдаемость
пары (Αχ, Hi).
Достаточность следует из того, что существует оператор L[z]f
описываемый соотношениями:
| = Αι 4- Вщ 4- Κ(ζ - Ηιξ - Я2ч), (? д)
ή — Α2ή 4- Вг^.
Здесь соотношения (7.9) описывают алгоритм оценивания, а матрицы
СиК подлежат выбору. Введем ошибки оценки Αξ = ξ — ξ, Αη = η —
ή и вектор состояния ζ = (η,ξ,Αξ,Αη)τ. Целесообразность такого
представления вектора состояния ζ прояснится далее.
Уравнения, которым подчиняются компоненты вектора ζ таковы:
ή = Α2η + Β20(ξ-Αξ),
i = (i4i-BiC№-BiC(A€),
А£ = (Αι - ΚΗι)Αξ - ΚΗ2Αη,
Αη = Α2Δτ7.
Характеристическое уравнение системы (7.10) имеет вид
(ХЕ8-А2) -В2С В2С 0
0 (XEm-Ai + BiC) ВгС 0 .
0 0 (XEm-Ai+KHi) KH2 1"и'
0 0 0 (ХЕ8-А2)
56
что эквивалентно соотношениям
|AE,-j42| = 0,
\\Ет-А1 + В1С\ = 0,
\\Em-Ai + KHi\ = 0,
\\Ea-A2\=Q.
Корни первого и четвертого уравнений имеют отрицательные
действительные части по определению (построению). Действительные
части корней второго уравнения могут быть сделаны отрицательными
выбором матрицы С вследствие управляемости пары (Αι,Βι).
Действительные части корней третьего уравнения могут быть сделаны
отрицательными выбором матрицы К вследствие наблюдаемости пары
Таким образом, оператор L[z] обеспечивает асимптотическую
устойчивость системы (7.10).
Достаточность доказана. Необходимость следует из структуры
системы, полученной в результате декомпозиции по управлению и
наблюдению.
Рассмотренная форма представления управляемой системы
позволяет непосредственно сформировать управление (при
управляемости пары (Αι, Β\) и наблюдаемости пары (Αχ, Hi))так, что
«неустойчивые» корни характеристического уравнения становятся
«устойчивыми» с любым наперед заданным запасом устойчивости.
«Устойчивые» корни остаются без изменения. Но если некоторые
из таких корней «слабо» устойчивы, то можно соответствующие
переменные включить в состав вектора ξ. Если при этом новые пары
(Αχ, Βι) и (Αι, Hi) удовлетворяют условиям управляемости и
наблюдаемости, то можно говорить о стабилизируемости с приемлемой
степенью устойчивости.
57
Лекция 8
Характеристики многомерных случайных
векторов. Свойства многомерного
нормального распределения
Анализ управляемости и наблюдаемости позволяет ответить на
вопрос о возможности построения асимптотически устойчивых
алгоритмов наблюдения и оценивания. Но на практике этого не
достаточно. При построении рабочих алгоритмов управления и оценивания
приходится учитывать стохастическую природу возмущений,
действующих на объект, и инструментальных погрешностей измерительных и
исполнительных устройств. Для этого разработана теория,
позволяющая строить соответствующие математические стохастические
модели и основанные на этих моделях алгоритмы. К изложению этой
теории мы и приступаем, но прежде напомним в подходящей форме
необходимые для дальнейшего сведения из теории вероятностей и теории
случайных процессов.
1. Характеристики многомерных случайных
векторов
При строгом изложении теории вероятностей вводится понятие
вероятностного пространства вместе с сопутствующей ему
аксиоматикой. Здесь мы следуем по упрощенному пути и первичным считаем
понятие случайной величины.
Универсальной характеристикой, описывающей случайную
величину X, служит функция распределения F(x). По определению,
F(x) = Р(Х < х),
где Ρ — обозначение вероятности.
В более подробной записи, когда X = (Χι, Х2, ...,Хп)т —
случайный вектор,
F(x) = F(xbx2,... ,xn) = Ρ(Χι < хъХ2 < хъ, · · · ,Χη < Χη)·
Случайная величина называется непрерывной, если непрерывна ее
функция распределения. В скалярном случае функция F(x) —
монотонно неубывающая функция аргумента х. Обобщение этого свойства
на векторный случай очевидно.
58
Если существует функция /(ж) = /(χι, Х2, · · ·, хп) такая, что
Xl X2 Х-п
^0*0 = / ·· f(u1,u2^..,un)du1du2 ...dun (8.1)
—оо —оо —оо
при любом х, то эта функция называется плотностью вероятности.
Из (8.1) следует связь функции распределения и плотности
вероятности
, = &Ρη(χχ,χ2,...,χη)
9χι,9χ2,... ,дхп
Переход от многомерных характеристик F(x) и /(х) к
одномерным F(xj), /(xj), где Xj — соответствующая компонента вектора
χ = (χι, Χ2,..., хп) осуществляется по следующим формулам (для
простоты положено η = 2, j = 1):
оо
F(xi) =F(x1,+00), /(Xl)= / /(Χΐ,Χ2)^2·
—оо
Пусть X и Υ — две случайные векторные величины. Функция
F(x\Y = у) = Р(Х < x\Y = у),
называется условной функцией распределения вероятности X
при условии У.
Имеет место формула Байеса
/(х|у) = 75Г
аналогичная формуле, определяющей условную вероятность событий.
Здесь f(x\y) — условная плотность вероятности.
Если /(х,у) = Дх)/(у), то случайные величины X и Υ
называются независимыми. Для независимых величин справедливы
соотношения
Д*1г/) =/(*), f(y\x) = f(y)-
Основные числовые характеристики случайной (в общем
случае векторной) величины — математическое ожидание и ковариация.
Пусть д(Х) — некоторая детерминированная функция случайного (в
общем случае векторного) аргумента X. Математическим ожиданием
Μ [д(Х)] = μ9 функции д(Х) называется следующая величина:
М[д(Х)]= J g(x)dF(x),
(Ж)
59
где (зе) — область изменения случайной величины.
Если определена плотность вероятности /(ж), то
оо оо оо
М[д(Х)]= / / ... / ^(w)/(wi,w2,...,wn)dui,dw2,...,dwn.
—оо —оо —оо
Величина Μ [Χ] носит название математического ожидания
случайной величины X (другой термин — среднее значение X).
Для того определения математического ожидания будем
использовать запись Μ [Χ]. Результат операции будем обозначать через μχ.
Оператор Μ[·] линеен, то есть имеет место соотношение
Μ [ад(Х) + bh(Y)] = аМ [д(Х)] + ЬМ [h{Y)\.
В частности,
Μ [аХ + bY] = аМ [X] + ЬМ [Y].
о о
Введем обозначение X = X — μχ. Величину X будем называть
центрированной случайной величиной.
Матрицей ковариации случайного вектора X (или просто кова-
риацией) называется матрица Rx:
RX = M[XXT].
Эта матрица по своему определению симметричная и неотрицательно
определенная. В том случае, когда Rx — положительно определенная
матрица, вектор X будем называть невырожденным (и вырожденным
в противном случае).
о2
Диагональные элементы Яц = М[Х^ матрицы Rx
называются дисперсиями соответствующих компонент и обозначаются Di =
D[Xi].
Величины ai = y/Dl называются среднеквадратичными (или
стандартными) отклонениями.
Из определения дисперсии следует, что она служит мерой
отклонения скалярной случайной величины относительно своего среднего
значения.
Чтобы выяснить смысл недиагональных элементов матрицы RXJ
которые называются моментами корреляции между компонентами
вектора, рассмотрим двумерный вектор X = (Xl,X2)t· Величина
ϋΐ2 = M[JfiJf2] есть момент корреляции между случайными
величинами Χχ и Х2.
60
σι
0
0 ..
σ2 ..
R
. 0 '
. 0
__ www
χ — &χΓχσχι
Ι " Ι
1
Γΐ2
Γΐ2 .
1
. . Γΐη
. . Г2п
Одновременно с моментом корреляции ϋι2 используется
безразмерная характеристика ri2, называемая коэффициентом
корреляции. Она получается из момента корреляции нормировкой:
D 2 2
ria = —^, где <т? = М[Х1], <^ = М[£2].
<Ti<T2
Заметим, что матрица ковариации ϋχ может быть представлена в
виде
где
<*х = I I » Гж =
О 0 ... ση J \ rln r2n
Легко видеть, что Д12 (соответственно Г12) = 0, если Χι и Х2 —
независимые случайные величины.
Замечание 9. Из некоррелированности не следует
независимость случайных величин.
Рассмотрим пример. Пусть компоненты случайного вектора У =
(Yi,y2)T являются координатами точки У на плоскости ΟΥ{Υ2.
Будем считать, что точка Υ всегда принадлежит кругу единичного
радиуса, центр которого совпадает с началом координат. Предположим,
что двумерная случайная величина Υ — (Υι,Υ2)τ распределена
равномерно в указанной области. Тогда
Mv = 0, /(yi,i&) = -
7Г
И
о о /* 1
#12 = Μ [У1У2] = / ~У1У2<1у1<1у2 = О,
поскольку подынтегральное выражение является нечетной функцией
своих аргументов, а область интегрирования центрально
симметрична. С другой стороны, величины yi,y2 очевидно зависимы, поскольку
2/1+2/2 <1.
Выясним вероятностный смысл понятия корреляции. Попытаемся
Х2 выразить через Χι линейным образом
Х2 с* αΧι + Ь,
61
подобрав коэффициенты а и Ь так, чтобы среднеквадратичная ошибка
δ линейного представления была минимальной:
δ2 = Μ \(Х2 - αΧι - Ь)21 = min.
Получим
δ2 = σ%(1 - r\2) 4- (ασχ - r12a2)2 + (μ2 - αμχ - Ъ)2.
Минимальное значение δ2 обеспечивается при
ασ\ — τ\2σ2 =0, μ2 — α/χι — 6 = 0.
И тогда
Ошибка δ2 максимальна при т\2 — 0 {R\2 = 0) и равна нулю при
|ri2| = 1. Кроме того |ri2| < 1, поскольку J2 > 0, и, соответственно,
|-Ri2| < ο\σ2,
С другой стороны, если имеет место точное равенство
Х2 = аХ χ + Ь,
то, как легко показать,
r12 = sign(a).
Таким образом, коэффициент корреляции служит мерой линейной
связи Х2 с Χι. Так как ri2 отражает степень только линейной связи,
из некоррелированности Х2 и Χ ι еще не следует их независимость.
2. Основные законы распределения
Закон равной плотности (для скалярной случайной величины).
Закон определяется двумя параметрами χχ и х2 (х2 > χι):
{О, χ<χι,
1/(χ2-χι), χι <x<x2,
0, χ > χ2.
_ Χ2+Χι __ (Χ2 - Χι)2
μχ- 2 , υ*- 12
Нормальный закон распределения (закон Гаусса).
Одномерный случай.
Закон определяется параметрами μχ = Μ [X] и σ2 = D [X] =
M[X2]:
f(x)= λ «ρΓ-^'^Ι
62
Ρ(χ1<Χ<χ2) = Φ(ί2)-Φ(ί1),
где
t
Φ(ί) = — / e 2dW) tx = , t2 = .
о
Для функции Ф(£) составлены подробные таблицы.
Полезно знать два числа, связанные с нормальным законом
распределения:
Р(|Х -/ι*| <σ*) = 0.67,
Ρ(\Χ-μχ\<3σχ) = 0.997.
Величину 3σχ в инженерной практике называют предельной, тем
самым пренебрегая вероятностью
Ρ(\Χ-μχ\>3σχ).
Многомерный случай.
X = (XuX2,...,Xn)Tj(x) = f(Xl,x2,...,xn) =
= (2π)-*(detRx)~2 · βχρ [ - i(x - μχ)ΤΚχ1{χ - μ,)],
/ι* = Μ[Χ], Д* = М[Х.ХТ]. (8.2)
Замечание 10. Важность нормального распределения в
практических задачах частично объясняется центральной
предельной теоремой, которая утверждает, что это
распределение вполне естественно появляется в результате суммарного
действия большого числа независимых случайных величин.
Точнее, пусть жь ж2, · · ·, #п есть η взаимно независимых
случайных величин с произвольными и, возможно, различными функциями
распределения. Пусть μ* и σ\ — среднее значение и дисперсия
случайной величины Xi, г = 1,..., п.
Рассмотрим сумму случайных величин
η
г=1
где αι — произвольные фиксированные постоянные. Тогда среднее
значение μχ и дисперсия σ\ случайной величины χ имеют вид
η η
μχ = ]Г) афг, σ\ = ]Г) α?σ?.
63
Последнее равенство справедливо в силу взаимной независимости Xi
и Xj при г φ j.
Центральная предельная теорема утверждает, что при
достаточно общих условиях распределение суммарной случайной величины χ
при η -> оо стремится к нормальному распределению с приведенными
выше средним μχ и дисперсией σ£.
Свойства нормального распределения
1. Если X и Υ — два случайных вектора, совместная плотность
вероятности которых имеет вид (8.2), то /(ж), /(у) и f(x/y)
также имеют вид (8.2).
2. Если Υ = L[X], где L — линейный оператор, то из
нормальности распределения вектора X следует нормальность
распределения вектора У.
3. Для случайных величин, распределенных по нормальному
закону, понятия независимости и некоррелированности
совпадают.
4. Нормально распределенный вектор X с математическим
ожиданием μχ и ковариацией Rx может быть получен с помощью
линейного преобразования
χ = Sx -и + μχ,
где и — нормально распределенный вектор с нулевым средним
значением и ковариацией, равной единичной матрице:
М[«] = 0, М[иит] =Е.
Для отыскания Sx надо решить задачу факторизации, т. е. задачу
представления Rx в виде
Rx^SxSj при Rx > 0.
Матрицу Sx принято называть квадратным корнем из матрицы R.
Задача факторизации может быть решена неоднозначным образом.
Приведем два наиболее употребимых варианта.
1. Известно, что квадратичная форма атRa ортогональным
преобразованием β = UTot приводится к диагональному виду:
aTRa = βτΑβ, где Л = diag(Ab λι,..., λη).
В нашем случае все λ* > 0. Отсюда следует R = UAUT и
S = UA%.
64
2. В качестве матрицы S можно выбрать нижне- или верхне-
треугольную матрицу вида
а =
821
О
«22
\ 8П1 8П2
о \
о
8пп /
su =
8Ц 812
О 822
О О
Sin \
82п
8пп /
Для вычисление элементов s^ матриц 51, 5U применяется
алгоритм аналитического разбиения Холецкого.
Заметим, что треугольные матрицы широко используются при
решении задач оценивания.
Их очевидные свойства:
1. сумма и произведение однотипных матриц являются
треугольными матрицами того же типа;
2. матрица, обратная к треугольной — треугольная матрица того
же типа.
65
Лекция 9
Случайные процессы и их характеристики
Случайным процессом (случайной функцией) Χ(ί,ω) будем
называть функцию двух аргументов: неслучайного параметра t и
элемента ω € Ω из пространства элементарных событий.
При фиксированном t величина X является случайным
вектором, при фиксированном ω — детерминированной векторной
функцией (реализацией случайного процесса). Параметр t далее будем
интерпретировать как время. Параметр t либо изменяется непрерывным
образом (процессы с непрерывным временем), либо принимает
дискретные значения, допускающие нумерацию (процессы с дискретным
временем).
Самый простой способ описать случайный процесс — это
задать закон распределения процесса в каждый момент времени t. При
таком способе вводится либо функция распределения F(x,t), либо
плотность вероятности /(ж,£). В соответствии с этим
определяются математическое ожидание М[ж(£)] = μχ(ί) и матрица ковариации
M[X(t)XT(t)] = Px(t,t).
Более полное описание случайного процесса получим, если будем
учитывать связь между значениями процесса в моменты t\ = t и t<i =
5, т.е. если зададим совместный закон распределения двух векторов
X(t)nX(s):
F(x(t),x(sy,t,s).
Для них можно определить матрицу
Px(t,s) = M[X(t)XT(s)],
которую будем далее называть матрицей корреляции, в отличие от
ее частного случая — матрицы ковариации Px(t,t). Очевидно, что
Px(t, s) — неотрицательно-определенная матрица.
Теория, основанная на описании процесса с помощью
характеристик его вероятностного распределения для двух моментов времени t
и s, носит название корреляционной теории. В дальнейшем все
рассуждения будут проводиться в рамках этой теории.
Для приложений важно — принадлежит или нет случайный
процесс к какому-либо из трех классов. Эти классы таковы:
66
• стационарные,
• марковские,
• нормальные (гауссовы) процессы.
Определение 9. В рамках корреляционной теории
стационарными процессами называются такие, функции распределения
которых не зависят от выбора начала отсчета времени:
F(x(t),x(s)) = F(x(t + τ), x(s + τ)).
Для стационарного процесса
μχ- const, Px(£,s) = Рх(τ), где r = t-s.
Компоненты вектора X в этом случае называются стационарно
связанными.
В частности, в скалярном случае
Kx(t,s) = M
X(t)X(s)
причем Kx{t) — четная функция, т.е. Кх(т) = Кх(—т), nDx = Kx(0).
Определение 10. Процесс называется марковским, если
вероятностные свойства процесса в будущем полностью
определяются вероятностными свойствами процесса в настоящем и не
зависят от поведения процесса в прошлом.
Пусть t\ < t<i < ... < ίη, где η — произвольное целое число. Тогда
P{X(tn) < xn\X(tn-i) = *η-ι, · - · ,*(ti) = xi} =
= P{X(tn) < χη/Χ(ίη_ι) = хп-г},
или, в терминах условной плотности:
/(χη|χη_ι,... ,χι) = /(жпкп-ι).
Определение П. Процесс называется нормальным или
гауссовым, если для любых моментов времени t±, t?,,..., tn
соответствующие случайные векторы имеют совместное нормальное
распределение.
1. Анализ случайных процессов
Цель последующего изложения — ввести понятия сходимости,
непрерывности, производной, интеграла применительно к случайным
функциям. Эти понятия, известные из области анализа, нуждаются в
существенном уточнении. Имеется три различных определения
сходимости последовательности случайных величин.
67
Определение 12. Сходимость по вероятности.
Последовательность {Χη(ω)} сходится по вероятности к Χ(ω), если для
любого ε > О
lim Ρ{\Χη-Χ\>ε} = 0.
n-teo
Определение 13. Сходимость в среднеквадратичном.
Последовательность {Хп} сходится в среднеквадратичном к X, если
lim Μ \\Χη - Х\2] = 0.
n-юо L J
Из сходимости в среднеквадратичном вытекает сходимость по
вероятности. Этот факт является непосредственным следствием
неравенства Чебышева:
Аналогично определяется непрерывность случайных функций.
Определение 14. Случайная функция x(t) непрерывна по
вероятности в точке t, если для каждого ε > 0
UmP{|X(ti)-A-(t)|>£} = 0.
Определение 15. Случайная функция X(i) непрерывна в
среднеквадратичном, если
UmM[|X(t1)-X(i)|2]=0.
Оба определения непрерывности ничего не говорят о
непрерывности каждой реализации. Об этом говорит третье определение
сходимости, называемой сходимостью с вероятностью единица или почти
наверное. Но в дальнейшем нам не понадобится это третье
определение.
Теорема 12. Операции предела и математического ожидания
переставимы, если предел понимать в среднеквадратичном:
lim М[Хп] = Μ \ lim Xn] =М[Х].
п-юо Ln-юо J
Теорема 13. Для того, чтобы случайный процесс был
непрерывен в среднеквадратичном, необходимо и достаточно, чтобы
были непрерывны его математическое ожидание μχ(ί) и
функция корреляции Px(t,s) в диагональных точках плоскости (i,s)
(nput = s).
Замечание 11. Из непрерывности функции корреляции в
диагональных точках следует ее непрерывность всюду.
68
Определение 16. Производной ^f в среднеквадратичном
называется предел в среднеквадратичном отношения
x(t + At) - x(t)
At
Определение означает, что
fx(t + At)-x(t)
при At -> 0.
lim M
Δί->0
Δ*
dxY
= 0.
Теорема 14. Для того, чтобы случайная функция была
дифференцируема в среднеквадратичном, необходимо и
достаточно, чтобы существовали производная математического
ожидания и вторая смешанная производная функции корреляции в
диагональных точках.
Замечание 12. Из существования второй смешанной
производной в диагональных точках следует существование вторых и
первых производных от этой функции всюду.
Поскольку производная является пределом в
среднеквадратичном, операции дифференцирования и математического ожидания
переставимы:
г dan _ άμχ \dx(t) dx(s)~\ _ d2Px(t,s)
Μ
г dan _ αμχ rdx(t) dx(s)i _
l~di\ " ~dT' Ydt ds~\ "
dtds '
В частном случае стационарной функции получаем
у=^, Py{t,s) = -^fl = Py(T), T = t-s.
Определение 17. Интегралом /а x(t)dt в среднеквадратичном
называется пределе среднеквадратичном интегральной суммы
η , __
lim У"x(rk)At, At = -, (k - 1) · At < rk < k · Δ*.
Теорема 15. Для того, чтобы процесс был интегрируем в
среднеквадратичном, необходимо и достаточно, чтобы
существовали интегралы
ь ь ь
[ μ*(ί)Μ, ί ίPx(t,s)dtds
a a a
Очевидна перестановочность операций интегрирования и
математического ожидания.
69
2. Процессы с ортогональными приращениями.
Белый шум
Процессы такого типа играют большую роль при спектральном
описании стационарных случайных процессов, при построении
стохастической модели динамических систем, в задачах анализа и синтеза
таких систем.
Будем считать, что М[х] = 0.
Пусть *о> *ь ···>**>···> *т — произвольные моменты времени и
целое число m произвольно, a t^+i > £*.
Величина
Ax(tk,tk-i) = Axfc = x(tk) - x(tk-i)
составляет приращение процесса на интервале Atk = tk — ί*-ι.
По определению, процесс будет процессом с независимыми
приращениями, если Ахк не зависит от Δχ^· и хо = #(*о) (к φ j).
Если имеет место только некоррелированность, процесс
называется процессом с ортогональными приращениями.
Рассмотрим приращение процесса χ(ί) на интервале от t до t 4- At:
Δχ = x(t + At) - x(t).
Выясним, как связана ковариация этого приращения Р&х =
Μ [Αχ · Δχτ] с ковариацией процесса Px(i) = Μ [x(t) · xT(t)].
Имеем
Pax = Μ [(*(* + Δ*) - x(t)) · (x(t + Δ*) - χ(ί))τ] =
= Px(t + Δ*) 4- Px(t) - Μ [(x(t + Δ*) - x(t)) · xT(t)] -
- Μ \x(t) · (x(t 4- Δ*) - x(*))T]
Но
x(t 4- At) = x(t) 4- Δχ,
и в силу определения процессов с ортогональными приращениями
Μ [(*(* 4- Δ*) - x(t)). хт(*)] = Px(t),
Μ [χ(ί) ■ (x(t 4- Δ*) - χ(ί))Τ] = Px(t).
Отсюда
Рд* = Px(t + At)-Px(t).
То есть ковариация приращения для процесса с ортогональными
приращениями равна приращению ковариации процесса.
70
В скалярном случае получим
DAx = Dx(t + Δ*) - Dx(t). (9.1)
Обозначим через R(t) производную по времени от
ковариационной матрицы процесса. Предположим, что существует производная по
времени от ковариационной матрицы процесса
R(t) = Px(t),
или, в скалярном случае,
Последнее соотношение приближенно можно записать при
достаточно малом At
DAx « R(t)At,
т. е. дисперсия приращения процесса с ортогональными
приращениями пропорциональна величине временного интервала At
На первый взгляд это может показаться странным (если не
обращать внимания на условия дифференцируемости), поскольку
дисперсия — квадратичная характеристика. В самом деле, рассмотрим
процесс x(t), дифференцируемый в среднеквадратичном:
Ах = x(t + Δί) - x(t) » xAt.
Для него
DAx = Μ [Αχ2] « At2Μ [χ2],
т. е. дисперсия приращения оказалась пропорциональной квадрату
приращения аргумента.
Но процесс с ортогональными приращениями, хотя и является
непрерывным в среднеквадратичном, не имеет производной,
поскольку
Μ [(x(t + Δ*) - x(t))2] » R(t)At -> 0 при At -> 0,
Μ
At )
R(t)
-ΓΓ -> oo при At -> 0.
Δί
Покажем, как можно интерпретировать величину dx, которую
нельзя понимать как обычный дифференциал в среднеквадратичном.
Предварительно напомним определение и свойства δ—функции.
Эта функция широко используется при описании линейных
динамических систем и случайных процессов. Она определяется следующими
тремя условиями:
71
1. δ(χ) = 0 приж^О;
2. δ(χ) = οο при χ = 0;
οο
3. / δ{χ)άχ = 1.
—οο
В нашем случае, как это будет видно из дальнейшего, добавим
дополнительное условие четности:
δ(χ) = J(-x).
Основное следствие из определения J-функции. Пусть φ(χ)
гладкая функция, тогда
+00 α+ε
\ φ(χ)δ(χ — a)dx = / φ(χ)δ(χ — a)dx = φ(α),
—οο α—ε
где ε как угодно малое положительное число.
Если δ(χ) четная функция, то имеем
+оо о α+ε
/ φ(χ)δ(χ — a)dx = / φ(χ)δ(χ — a)dx -f / φ(χ)δ(χ — a)dx =
—οο α—ε α
/ dx(u).
Приращение процесса Ах на интервале (t, t -f At) запишем в виде
t+Δ*
Ах =
t
Тогда
t+Δ* t+Δ*
РАх = Μ [Ах - Δχτ] = / / Μ [dx(«)dxT(wi)]. (9.2)
t t
С другой стороны,
t+Δ*
Pax = / i?(w)d«. (9.3)
t
Из сравнения (9.2) и (9.3) следует с учетом свойств ^-функции
Μ [dx(u)dxT(щ)] = R(u)dudu\6(u — u\)
72
или, если ввести формальную производную,
\dx(t) dxT(s)
Μ
dt
ds
= R(t)S(t - s).
(9.4)
Обратим внимание на то, что в силу определения матрицы
корреляции, J-функцию в последних выражениях следует считать четной
функцией своего аргумента.
Сконструированный таким образом процесс ^р- называется
процессом типа белого шума или просто белым шумом. Основное
его свойство — некоррелированность во времени. Строго говоря,
такой процесс (9.4) — не более чем удобная абстракция, и он не может
быть реализован физически. Для его реализации требуется
существование бесконечной скорости (абсолютной безынерционности,
бесконечной энергии и т.п.).
Обозначим вектор размерностей процесса через 7, за единицу
времени выберем секунду. Тогда размерности величин, входящих в
вышеописанные соотношения, будут таковы:
д
[Р]=77Т, [Ρδ*]=77Τ, [Щ
77
сек
dx
~dt
7
сек'
(9.5)
и = —,
сек
то есть для согласования размерностей для J-функции нужно принять
размерность l/сек, как это следует из самого определения ί-функции.
Полученный результат (9.5) согласуется с формальным правилом,
по которому матрица корреляции производной от векторного
процесса находится как вторая смешанная производная от матрицы
корреляции дифференцируемого процесса.
73
Лекция 10
Стохастические модели линейных
динамических систем
Поведение динамических систем, которые описываются
обыкновенными дифференциальными уравнениями, определяется начальным
значением всех фазовых координат (начальным значением вектора
состояния).
В стохастической ситуации задаются вероятностные
характеристики начального состояния системы. Стохастическая модель,
описывающая состояние системы, должна позволять предсказывать
вероятностные характеристики системы в будущем. Для нас такими
характеристиками будут математическое ожидание и матрица
корреляции вектора состояния. Рассматриваются только линейные системы.
1. Дискретный случай
Для простоты записи положим x(tk) = Хк-
Математической моделью системы служит вектор x(tk),
подчиняющийся дискретному уравнению
хк+1 = Ф(к + 1, к)хк + qk, (10.1)
где qk — дискретный белый шум:
M[qk] = 0, M[qkqJ] = QkSkj, и M[xkqJ] = 0, (к— номер шага).
Здесь Skj - символ Кронекера.
Из (10.1) непосредственно следует уравнение для определения
математического ожидания μ* = Μ [хк]:
/ΐΗ^Φ^ + Ι,λΟμ*. (Ю.2)
Подставив (10.1) и (10.2) в выражение, определяющее
ковариационную матрицу Рк+χ = M[xfc+i^fc+iT])noj^aeMKOBaPHaitHOHHoe(A|lc"
персионное) уравнение:
Pfc+1 = Ф(* + 1, к)РкФт(к + 1, к) + Qk. (10.3)
Легко показать, что матрица корреляции Р(п,т) = М[хпх^]
определяется соотношением
Р(п, га) = Ф(тг, га)Рт, η > га.
74
Здесь Φ(τι, πι) = Φ(η, η — 1) ·... · Ф(т 4- 1, т), а Ф(т, т) = Ε.
Свойство. В стационарном случае при Q = const, Φ = const
и при условии, что все корни характеристического уравнения \ХЕ —
Ф| = 0 по модулю меньше единицы при к -> оо можно говорить об
установившемся решении Р^ дисперсионного уравнения (10.3). Оно
определяется из уравнения
Роо=ФРооФТ+<?.
2. Непрерывный случай
Непрерывное стохастическое дифференциальное уравнение,
описывающее состояние динамической системы, будем рассматривать
как предел в среднеквадратичном следующего разностного уравнения:
Δχ = А · χ At 4- Δν,
Δχ = x(t 4- At) - x(t), Av = v(t 4- At) - v(t),
где v(t) — процесс с ортогональными приращениями.
Обозначим производную dP^ = Q, где Pv(t) = Μ [v(t)vT(t)].
Имеем
Μ [ΔνΔντ] = Q(t)At + o(At).
В пределе при Δί -> 0 получим
dx = А·xd£4- dv, ,«^ .ν
Af [Ai(t)AiT(*)] = Q(t)dtdsS(t - s). ( ' '
Формально, если ввести производные ^ и ^|, можно записать
^=Ax + q, (10.5)
где q — процесс типа белого шума:
Μ [q(t)] = 0, Μ [q(t)qT(s)] = Q(t)S(t - s), M[x(t0)qT (t)) = 0.
Уравнение для определения математического ожидания μχ = Μ [χ]
непосредственно следует из (10.4) или из (10.5):
μχ = Αμχ, μχ(ί0) = μο.
Уравнение для определения ковариационной матрицы Px(t) =
Μ |χ(£)χτ(ί) получим двумя способами.
1. Примем за основу уравнение (10.4). Выпишем цепочку
соотношений:
Px(t) = Μ [i(t)iT(t)] , Ρβ(*+Δί) = Μ [x(t + Δί)χτ(ί 4- Δ*)] ,
75
x(t + At) = x(t) + Ax(t),
Px{t + At) = M Ux(t) + Ax(t)} {x(t) + Δχ(ί)}Τ1 =
= Μ [x(t)xT(t)] + Μ [x(t)AxT(t)] + Μ [Ax(t)xT(t)] +
+M [Ax(t)AxT(tj\.
Так как Δα; = Ах At + Αν, то
Μ [x(t)AxT] = Px(t)AT(t)At, Μ [Δέ(ί)έτ] = A(t)Px(t)At,
Μ [Δέ(ί)Δέτ] = A(t)Px(t)AJAt2 + QAt + ο(Δί).
Таким образом,
Px(t + At) = Px(t) + (APX + PxAT)At+
+ QAt + APxATAt2 + o{At). (10.6)
При Δί -¥ 0 из (10.6) получим
^=APX + PXAT + Q. (10.7)
at
Это уравнение называется дисперсионным или
ковариационным.
2. Примем за основу уравнение (10.5). Выпишем цепочку
соотношений:
ft=Ax + q, Px(t) = M[x(t)xT(tj\,
= APX + PXAT + Μ [q(t)iT(t)\ + Μ [Z(t)q(t)T] ·
Поскольку
t
x(t) = Ф(*, *o)*(*o) + J *(t,T)q(r)dT,
to
TO
t
Μ [x(t)q(t)T] = J Φ(ί,τ)Μ [q(r)q(t)T] dr =
to
76
t
= Ι'φ(*,τ)φ(τ)ί(*-τ)Λ- =
to
t
= J Φ(ί, T)Q(r)S(t - r)dr = |g(t).
t-ε (ε->0)
Отсюда следует уравнение (10.7).
Матрица корреляции Px(t,s) = Μ \x(t)xT(s) , как легко показать,
находится из соотношения
Ρ«(Μ) = Φ(Μ)Ρ«(«) (*>*).
В стационарном случае, когда Q = const, А = const и корни
характеристического уравнения \\Е — А\ = 0 имеют отрицательные
действительные части, установившееся значение матрицы ковариации может
быть найдено из решения алгебраического уравнения
АР00 + РооАт+ Q = 0.
3. Дискретизация непрерывных случайных
процессов
Рассмотрим векторный случайный процесс χ(ί), описываемый
уравнением
± = A(t)x + q, (10.8)
где χ — n-мерный вектор состояния, q — n-мерный вектор — процесс
типа белого шума:
M[q(t)qT(s)]=Q(t)S(t-s).
Перейдем к значениям процесса в дискретные моменты времени
*о, h = t0 4- Δί, ..., tk = t0 + *Δ*, ...
Соответственно, рассмотрим вопрос о получении дискретной во
времени модели системы, эквивалентной исходной непрерывной модели.
Определение 18. Дискретное и непрерывное во времени
представления называются эквивалентными (в рамках
корреляционной теории), если векторы состояния имеют одни и те же
математические ожидания и ковариационные матрицы в
совпадающие дискретные моменты времени.
77
Решая уравнение (10.8) на отрезке времени [tk, ί^+ι]» получим
*fc+l
x(tk+i) = $(tk+i,tk)x(tk) + / Φ(**+ι,r)g(r)dr,
где Φ(ί*+ι, ί*) является переходной матрицей системы
Ф(*, ί0) = Α(ί)Φ(ί, ίο), Ф(*о, to) = £7.
Введя обозначения
Xfc = x(ifc), Φ* = *(tfc+i,tfc), 9fc = / Φ(**+ι, T)g(r)dT,
tk
получим дискретную во времени, эквивалентную модель
Хк+1 = $кХк + gfc,
где {(&} — последовательность типа дискретного белого шума:
tfc+l
Μ [qkqj] = QJiWj Qfc = У Φ(**+ι,τ)β(τ)Φτ(*Λ+ι,τ)£ίτ.
Замечание 13. При малом At обычно полагают
$(tk+utk) * Ε + AtA(tk),
либо
At2
Ф(**+ь fc) « Ε 4- ΔΜ(*Λ) + -2ρΛ2(**).
7огда
QJ « Q(tfc)At.
Примеры.
1. Процесс 1-го порядка.
Непрерывная модель.
χ + λχ = aV2\q(t), M [q(t)qT(s)] = 1 - S(t - β).
Корреляционная функция if* (τ) процесса χ(ί) имеет вид
Κ«(τ) = σ2βχρ-λΙτΙ.
Дискретная модель,
хм = ехр~АЛ* xfc + ay/l - exp~2XAt qk, M [qkqt] = 1 · Ski.
78
2. Процесс 2-го порядка.
Непрерывная модель.
χ + 2αχ + (λ2 + а2)х = 2ау/а(Х2 + a2)q(t),
M[q(t)qT(s)]=l.S(t-s).
Корреляционная функция Кх(т) процесса x(t) имеет вид
Кх(т) = σ2 exp-alTl (cosAr + ^ sinA|r|) .
Дискретная модель.
(Хк+1)=ф.(Хк)+дк,
V Ук+1 ) \Ук )
Xk = *(tk), ук = X{tk)
VA2 + a2'
= ( cosAAt + f sinAAt ^±EsinAAt
У - *5Ξ±ΙΞ sin ΑΔί cos ΑΔί + f sin ΑΔί
M[qkqi} = Q*Skh <2*=σ2[Ε-ΦΦτ].
79
Лекция 11
Алгоритмизация задачи оценивания
Последующее изложение посвящено задачам стохастически
оптимального оценивания некоторой скалярной или векторной
случайной величины χ с помощью скалярной или векторной информации ζ.
Оценка χ реализует критерий, минимизирующий в том или ином
смысле ошибку оценки Ах = χ — х. При этом критерий отражает
вероятностные связи между измерениями ζ и оцениваемой величиной ж.
Оценка может быть разовой (локальной) или меняющейся со
временем. Соответственно условно можно говорить о статических и
динамических задачах оценивания.
Существует много различных методов стохастически
оптимального оценивания. Источники, излагающие соответствующую теорию с
той или иной степенью детализации, весьма многочисленны. Ниже мы
остановимся на задачах, связанных с теорией калмановской
фильтрации и примыкающих к ним.
Для суждения о качестве оценки обычно используются две
характеристики: несмещенность и состоятельность.
Оценка χ называется несмещенной, если в среднем по
вероятности она равна оцениваемой величине:
М[Ах] = 0.
Пусть хп — оценка, использующая результаты η измерений.
Оценка χ называется состоятельной, если она сходится по
вероятности к оцениваемой величине:
Р{|жп — ж| > ε}-> 0 при п->оо.
В некотором смысле состоятельность является стохастическим
аналогом асимптотической устойчивости. Отметим, что практически
проще оказывается проверка более сильной сходимости — в
среднеквадратичном.
Количественной характеристикой результата оценивания служит
эффективность. Оценка эффективна (оптимальна), если она
наилучшая из всех возможных оценок с точки зрения некоторого заданного
критерия.
В связи с выбором критерия сделаем одно важное для
прикладных задач замечание. При построении алгоритма оценивания должны
80
быть, прежде всего, четко сформулированы модели всех
инструментальных погрешностей измерителей, доставляющих первичную
информацию, и модели возмущений, действующих на динамическую
систему. Инженеры обычно называют такие модели техническими
условиями. Именно выбранная модель погрешностей определяет
критерий, а не наоборот.
Далее везде предполагается, что погрешности и возмущения
имеют нормальное распределение, и его характеристики известны. Это
приводит к квадратичному критерию точности оценки, который
может использоваться в различных формах: критерий минимума
дисперсии ошибки оценки, критерий максимального правдоподобия,
критерий ортогональности.
Ниже в качестве основной формы выбран критерий
ортогональности. Смысл его в рамках корреляционной теории состоит в
следующем. Оценка х, использующая некоторое измерение ζ, должна быть
такова, чтобы ошибка оценки Ах = χ — χ была не коррелирована с
исходной для оценивания информацией ζ:
Μ [ΔχΙτ] = 0.
Эвристически это означает, что вся содержащаяся в измерении ζ
информация о величине χ вошла в оценку χ и, следовательно, в
измерении ζ не содержится никакой информации о неоцененной части
величины χ — ошибке Δχ.
Ниже, в полном соответствии с гипотезой о нормальности
стохастических процессов, будут рассматриваться только линейные
алгоритмы оценивания.
1. Решение переопределенных систем линейных
алгебраических уравнений
Рассмотрим простейшую задачу решения системы линейных
алгебраических уравнений
ζ = Ηχ, (11.1)
где χ — n-мерный вектор, подлежащий определению; ζ — известный
m-мерный вектор (вектор измерения); матрица Я имеет размерность
(т χ η) и, предполагается, максимальный ранг. На практике имеет
место чаще всего ш»пи, соответственно, система линейных уравнений
(11.1) переопределена.
81
Очевидный подход к решению задачи (11.1) таков. Поскольку
каждому вектору χ е Rn соответствует вектор невязки г е Я™:
г = ζ — Яж,
то в качестве решения задачи (11.1) естественно выбрать такой вектор
ж, который доставляет минимум длины (нормы) вектора невязки г.
Итак, приходим к классической постановке метода наименьших
квадратов (МНК):
x = argminJ(x), m o\
J(x) = (ζ- Ηχ)τ(ζ - Ηχ) = rTr= ||r||2. {iiU)
Минимизация функционала J приводит к уравнению
^ = -2zTH + 2хтНтН = О,
ох
из которого следует
χ = {HTHyxHTz = H+z. (11.3)
Матрица
Я+ = (НТН)-1НТ
называется псевдообратной. Матрица НТН не вырождена,
поскольку матрица Я максимального ранга.
2. Критерий максимального правдоподобия
Придадим задаче решения системы линейных алгебраических
уравнений (11.1) вероятностный смысл. Будем считать, что имеется
вектор измерения ζ такой, что
z = Hx + r, (11.4)
где г — случайный вектор погрешностей измерения, распределенный
по нормальному закону с нулевым математическим ожиданием и
известной ковариацией R:
M[r]=0, R = M[rrT]. (11.5)
Замечание 14. Форма представления вектора измерения ζ
(НА) имеет строгий смысл в отличие от записи (11.1), в
которой знак равенства условен.
Функция плотности вероятности /(г) вектора г имеет вид
/(г) = С.ехр[-^гтД-1г]. (11.6)
82
Естественный подход к решению задачи в рамках принятой модели
помехи г таков. Поскольку имеет место (11.1), то для любого значения
вектора χ случайный вектор ζ распределен по нормальному закону с
известной ковариацией R и неизвестным математическим ожиданием
μζ. Соответственно функция распределения /(ζ,μζ) вектора ζ имеет
вид
/(ζ,μζ)=0·β*ν[~(ζ-μζ)τϋ-1(ζ-μζ)]. (11.7)
Согласно критерию максимального правдоподобия, в качестве
оценки μζ неизвестного параметра распределения (11.7)
принимается такое значение μζ, при котором функция плотности
распределения /(ζ, μζ) для полученного в результате опыта (измерения) значения
случайного вектора ζ достигает максимума.
Условие max f(z, μζ), очевидно, эквивалентно условию min J, где
J = {ζ - Нх)т Я-1 {ζ - Нх). (11.8)
Таким образом, приходим к стандартной форме метода
наименьших квадратов, где обратная ковариационная матрица Я-1 играет
роль метрического тензора в пространстве помех измерения г.
Минимизация функционала J (11.8) приводит к следующему
решению:
х= (ΗτΒΓ1Η)~1ΗτΒΓ1ζ. (11.9)
Очевидно, что при равноточных независимых измерениях (R =
σ2Ε) из (11.9) вытекает знакомый результат:
χ=(ΗτΗ)~1Ητζ.
Предлагается показать, что оценка (11.9) удовлетворяет условиям
линейности, несмещенности и ортогональности.
Замечание 15. Пусть помимо измерений ζ привлекается точная
информация
z*=Gx, dimz* = (fc χ 1), k < η, (обычно k «n). (11.10)
Существует 3 способа ее использования:
1. выразив из (11.10) к составляющих вектора χ через
остальные, подставить их в уравнение (11.1) и тем
самым уменьшить на к размерность вектора,
определяемого по МНК;
2. можно воспользоваться известным аппаратом
множителей Лагранжа;
83
3. наиболее целесообразный способ: образовать вектор
измерений
w = eez\ (11.11)
где зе — достаточно большое число. Добавить уравнение
(11.11) к уравнению ζ = Η χ. Оценку χ искать как
решение совокупной системы размерности {m + k). Этот
прием эквивалентен тому, что компонентам вектора
ζ* приписываются малые погрешности со
среднеквадратичными отклонениями j|.
3. Задача сглаживания экспериментальных
данных методом наименьших квадратов при
помощи кубических сплайнов 7
В качестве примера задачи, приводящей к решению
переопределенной системы линейных алгебраических уравнений, рассмотрим
задачу сглаживания экспериментальных данных при помощи
кубических сплайнов.
Пусть g(t) функция времени, измеряемая в дискретные моменты
**:
*ο>*ι>·-->**>**+ΐι...,*Ν, Δί = tfc+i -tk = const.
Результат измерения есть
Zk = 9(tk)+rk)
где rk — погрешность измерения.
Общее число измерений zk функции g в моменты времени {tk}
равно N +1. Требуется построить оценку g(t) на всем отрезке [£0, £лг].
Отрезок [to,tN] разбивается η узлами Т{:
-*1»-*2>· ·· j^ij^i+lj- ·· >---Ln
так, что выполнено
Γι = t0, Tn = tN, AT = Г<+1 - Ti = const.
Узлы Ti выбираются так, чтобы им отвечали какие-то измерения.
Измерения в узловой точке Г» удобнее относить к предыдущему
отрезку ру_1,7у. Число измерений на каждом участке кроме первого
обозначим через га (поскольку ΔΓ = const). Тогда первый участок
[Γι, Тг] содержит га +1 измерений. Имеет место соотношение
га 4-1 + (п - 2)га = N 4-1 или га(п -1) = N.
84
Введем безразмерный интервал между измерениями:
ΔΤ' v At }
На каждом участке [Т»_1, Г»] введем безразмерное время т:
т = -яг> т€[0'1]·
Основной элемент сглаживания при помощи кубических сплайнов
— определение базовых функций. Вводятся четыре базовые функции:
ψι(τ) = \(1-τ)3, ¥,2(τ) = 1_3(2_τ)τ2)
φ3(τ) = 1 - ?(1 + т)(1 - τ)2, φ4(τ) = \т\
Линейная независимость функций φι(τ)9φ2(τ)9φζ(τ)9φ^(τ) следует,
например, из однозначности определения коэффициентов ci, с2, сз, с4
в соотношении
θιψχ(τ) 4- ο2ψ2{τ) 4- сз^з(т) 4- с4^4(т) =
а\ 4- агт 4- азт2 + θ4Τ3.
Оценка у функции д ищется в виде
■ с»+2У>з(т) 4- с*+3<р4(т), ί G [Γί,Γί+ι],
~ _ Г Wl(T) + С*+1<Р2(т) + Сц
fl"\ 0, ^[Γί,Γί+χ].
Непосредственной проверкой легко убедиться в том, что g(t)
непрерывна вместе со своими первой и второй производной в узловых
точках и, стало быть, всюду.
Для определения коэффициентов
Ci, С2, . . · , Cn, Cn+i, Сп+2,
имеем следующую переопределенную систему, имеющую так
называемую ленточную структуру.
Интервал [Γι,Γ2]:
*о = ci<pi(0) 4- с2у>2(0) 4- сз^з(0) 4- с4у>4(0),
ζχ = сцрг(Ат) 4- с2<р2(Дт) + с3^з(Ат) 4- с4у>4(Дт),
ζ2 = βι<^ι(2Δτ) 4- с2у>2(2Дт) + с3<р3(2Дт) 4- с4<р4(2Дт),
*m = ci<pi(l) 4- с2<р2(1) 4- с3^з(1) + с4у>4(1).
85
Интервал [Т2,Т3]:
zm+i = β2φι(Ατ) + β3^2(Δτ) + с4^з(Ат) + с5<р4(Ат),
Z2m = C2<^l(l) + C3^2(l) + С4^з(1) + С5<£4(1).
Интервал [Τη_ι,Τη]:
zjv = Cn_iy?i(l) + Cn<p2(l) + Cn+i<^3(i) + Cn+2<p4(l).
Решение этой системы обычно находят по методу наименьших
квадратов.
Заметим, что алгоритм сглаживания может успешно применяться,
если некоторые из измерений или даже целые блоки таких измерений
отсутствуют.
86
Лекция 12
Критерий ортогональности и критерий
условного среднего
Рассматривается задача оценивания, которая служит основой
многочисленных модификаций метода наименьших квадратов. Из нее,
в частности, следует и предыдущий результат.
Рассматриваются два случайных вектора х(п χ 1) и z(m x 1) с
известными характеристиками:
μχ == М[х], μζ = Λφ],
Рхх = Μ[έέτ], Ρζ, = Μ[ζ!τ], Pxz = M[i°zT].
Эти характеристики будем называть априорной информацией.
Ставится задача построения оценки скалярной величины α = стху
где с(п χ 1) — известный вектор.
В рамках априорной информации в качестве оценки α величины α
естественно принять ее математическое ожидание, т.е. положить α =
οτμχ. Ошибка оценки Δα = α — ά. Мерой ошибки оценки служит
дисперсия D[Aa] = М[(стх)2] = М[стххтс] = стРххс.
Пусть теперь измеряется вектор ζ, и результат измерения
известен. Поскольку известна мера линейной связи двух векторов χ и ζ
(задана матрица Ρχζ\ то возникает задача получения оценки
величины α с учетом измерения ζ.
Будем искать линейную, несмещенную и оптимальную оценку при
условии, что критерием оптимальности служит минимум дисперсии
ошибки оценки Δα.
/. Линейность. Оценка ά ищется в виде
ά = Ί1Τμχ + Ί2Τμζ + Ί3Τζ,
где векторы 71Л2 и 73 подлежат определению.
2. Несмещенность. Условие несмещенности означает, что в
среднем оценивание приводит к точному результату, т.е. Μ[Δα] = 0.
Имеем
М[Аа] = Μ[οτχ-(Ί1τμχ+Ί2Τμζ+Ί3Τζ)} = (С-^)Т μχ-(Ί2+Ίψ μζ,
отсюда 71 = с, 72 = — 73· Переобозначим 73 = к, тогда
ос = οτμχ + κτ(ζ - μζ),
87
Α χο то
Δα = с χ — ус ζ.
Вектор χ подлежит дальнейшему определению.
3. Оптимальность,
D[Aa] = Μ[(Δα)2] = сТРяхс + κτΡ**κ - 2cTPxzx.
Условие оптимальности имеет вид
дР[Аа]
д>с
= 0, (12.1)
откуда следует
хт = стР„Р£ = стК, (12.2)
neK = PxzP~z1.
Если в качестве оценки χ вектора χ выбрать
χ = μχ + Κ(ζ-μζ), (12.3)
то при всяком с оценка α = стх оптимальна.
Мерой ошибки оценки Δχ = χ — χ вектора χ служит ковариация
Pax = М[АхАхт] = М[(х — Κζ)(χ — Κζ)τ]. После выкладок с
учетом (12.2) получаем
л Да; = i'aja: *xz*zz *ζχ· ν*^·^/
Мерой ошибки оценки величины а служит дисперсия
D[Aa] = стРАхс.
Величины χ и ΐχχ можно интерпретировать как апостериорные
характеристики (условные, уточненные в результате учета измерения ζ).
Результаты, сведенные в формулы (12.2), (12.3), позволяют критерий
оптимальности (12.1) сформулировать в виде критерия
ортогональности: оценка χ оптимальна, если ошибка оценки ортогональна
измерениям (т.е. не коррелирована с ними):
Μ[Δχ!τ]=0. (12.5)
В самом деле, из (12.5) следует (12.1) с учетом того, что Δχ = χ — К ζ.
Как уже говорилось, критерий (12.5) служит отражением
простого эвристического рассуждения: оптимальная оценка должна вобрать
в себя всю информацию об оцениваемой величине, содержащуюся в
измерениях, поэтому ошибка оценки не должна быть связана с
измерениями.
Ввиду важности полученного результата дадим ему несколько
иную интерпретацию, напрямую используя нормальность закона
распределения случайных векторов χ и ζ. Оценка χ будет определяться
как условное математическое ожидание.
88
Пусть случайный вектор
·-©
распределен по нормальному закону с характеристиками
ри = м[«йт] = (£~ рр2 ) > <р« = р-)>
μ„ = M[u] =(£*). (12.6)
Функция плотности вероятности f(u) = /(ж, ζ) вектора и
записывается в следующем виде:
/(°)=(2ж)4-|РаЦ1°1''{~1("-^)Т^'("-'->}· 02J)
Пусть вектор ζ доступен измерению. Требуется уточнить
априорную характеристику Μ [χ] случайного вектора χ и определить
соответствующую ковариацию.
Для решения этой задачи естественно воспользоваться формулой
условной вероятности:
/<ф>=^,
где функция распределения f(x,z) определяется соотношением
(12.7), а функция f(z) имеет вид
Обозначим через μχ\ζ и Ρχ\ζ условное математическое ожидание и
условную ковариационную матрицу. Тогда
/(Ф) = (2π)1|Ρ.|.|* 6ХР Н(Х ~ ^*)ТР*\>{Х - μ^} '
Рф = Μ [(χ - /Ι,φ) (Χ - /ia;|z)T |z] .
Далее нам понадобится соотношение
ρ—1 / -*агаг -*агя \ дг / <**агаг ™χζ \
и " V ft, ft* / " " V Ν** ^« У'
где
■**агаг == ^-*агаг -*1χζ*,ζζ *ζχ) > ■**«* == ^-*\гг ■*!гаг-*;χχ *χζ) j
89
Ν — — (Ρ — Ρ Ρ~~ΧΡ \ΧΡ Ρ"1
1Ухг^— у* χχ *χζΓζζ ^ζχ) Γχζ^ζζ ·
Справедливость последних соотношений непосредственно следует из
равенства PUN = Ε.
Применяя формулу Байеса и приравнивая коэффициенты при
одинаковых степенях ж, получаем уже известный результат
μφ = μχ + ΡχζΡΓζ\ζ - Дг)> (]2 g)
*x\z = ·*ίXX *ΧΖ*ΖΖ *ΖΧ·
Рассмотрим частный случай, когда вектор ζ линейно зависит от
вектора ж, т.е.
ζ = Нх + г,
Я — известная матрица, г — случайный вектор с нулевым средним,
трактуемый как погрешность измерения.
Пусть заданы априорные характеристики
μχ = М[ж], Рхх = Μ[έέτ], R = M[rrT],
и, кроме того, предположим, что вектор г не коррелирован с
оцениваемым вектором ж:
М[хгт] = 0.
Целесообразно ввести обозначения, в которых априорность
фиксируется верхним индексом «—», апостериорность — верхним
индексом «+>:
·£ = Маг j -*яг = *хх*
После очевидных выкладок имеем
P-=PZZ=HP-HT + R, PXZ = P-HT, μζ = Ημχ = Ηχ~.
Взамен соотношений (12.8) получим
х+ = ж~ +Κ(ζ-Ηχ-),
К = Р~НТ(НР-НТ + Я)"1, (12.9)
р+ = р--лгяр-.
90
Лекция 13
Дискретный фильтр Калмана
Дальнейшее изложение посвящено динамическим задачам
оценивания, когда поведение во времени оцениваемой величины χ
описывается линейными стохастическими (непрерывными или
дискретными) уравнениями. При этом будет использоваться только одна форма
критерия оптимальности — критерий ортогональности. Обсуждение
указанного круга задач начнем с дискретного случая.
Термин «фильтрация» означает, что речь идет об алгоритме
выделения полезной информации на фоне помех.
1. Алгоритмы дискретного фильтра Калмана
Сначала опишем дискретный вариант задачи, используя при этом
результаты лекций 10 и 12.
Поведение динамической системы подчиняется уравнению
где Xj — вектор состояния в момент tj\ qj — дискретный белый шум
с известной интенсивностью — ковариационной матрицей Qj; Φj —
известная переходная матрица.
Заданы xq = М[жо], Ро = M[(xq — жо)(#о — #о)т]· В моменты
времени j = 0,1,2,... поступает информация ζ0, ζχ,...:
Zj = HjXj 4- Tj.
Погрешность информации Tj — некоррелированный во времени
вектор с нулевым средним и известной интенсивностью Rf MfcrJ] =
RjSji. Кроме того, полагаем M[xirJ] = 0.
Требуется в каждый момент j получить оценку %,
удовлетворяющую условию линейности, несмещенности, оптимальности. Введем
обозначения:
χ J — оценка вектора χ в момент времени j, использующая
измерения 2о,..., Zj-i (априорная оценка xj = M[xj\zq, zi, ...Zj_i]);
x'j — оценка вектора χ в момент времени j, использующая
измерения zo, · · ·,Zj-i,Zj (апостериорнаяоценкаж+ = M[xj\zq,zi,...zj]);
Pj~ — ковариация ошибки априорной оценки вектора χ в момент
3\
91
Pj~ — ковариация ошибки апостериорной оценки вектора χ в
момент j.
Для каждого момента времени j, j = 0,1,... задача решена на
лекции 12, откуда следует, что процедуру оценивания можно
представить в виде повторяющихся от момента к моменту циклов, каждый из
которых состоит из двух этапов — этапа коррекции и этапа прогноза.
Этап коррекции — переход от априорных оценок к
апостериорным в момент j. В соответствии с формулами (12.9)
ж+ = ж~ + Kj(zj - Hjxj),
Kj = PfHj(H3PfHj + Rj)-\ (13.1)
ΡΪ = (Ε-ΚάΗι)Ρ7.
Этап прогноза — переход от апостериорных оценок ж+ в момент
j к априорным оценкам хГ в моменту + 1. Имеем
V т (13.2)
Pf+i-bPflJ + Q,.
Кроме того, для включения начального цикла надо положить
хй=хо, Pq=P0. (13.3)
Алгоритм оценивания, описываемый соотношениями (13.1)—(13.3),
носит название дискретного фильтра Калмана.
Пояснение. Из самой процедуры получения оценок ж+ следует,
что ошибка оценки Axj = Xj — xj ортогональна текущему измерению
Ζ3·
M[AxjZjT] = 0, Zj = Zj — HjxJ.
Но она также ортогональна всем предшествующим
измерениям. Этот факт проиллюстрируем на примере первых двух измерений.
Оценка χ J в начальный момент строится из условия
Μ[Αχοζο]=0, Δχο = #ο-Χ(Μ ^о = *о - #0X(h
где xq — априорное математическое ожидание величины жо·
Имеем
XI = Ф0Ж0 + 90, Ζ\ = Η\Χχ + П.
Оценка xf в момент времени t\ строится из условия
Μ[Αχ\ζχ ] = О, х{ — Фо^о", х\ — х{ 4- Κχ(ζ\ — #ixj~).
92
Покажем, что величина Αχχ ортогональна измерению zq. Для
этого ошибка Αχχ должна иметь следующую структуру:
Δχχ = ΑχΑχο -f A2qo 4- Α$τχ.
Из написанного выше следует
Αχχ = Χι — χϊ — ΚχΖχ -f ΚχΗχχϊ;
χχ-Χχ = Φο^ο + go - Φο^ί = ΦοΔ^ο + 9ο;
Ζι — ΗχΧΪ = ΗχΧχ + Τχ - ffiXJf =
= #i(a?i - xf) + ri = Я^ФоДжо + go) + Γι.
Таким образом, мы показали, что величина Αχχ имеет требуемую
структуру. Отсюда по индукции следует
Axj ± Zj-χ J_ zj-2 -L · · · -L
Невозможно обобщение алгоритма дискретного фильтра Калмана на
случай коррелированности шумов системы и шумов измерений. Пусть
дополнительно MfyrJ] = Lj, тогда соотношения, описывающие этап
коррекции, остаются прежними, а ковариационное соотношение этапа
прогноза будет таким:
Pf+1 = Φ,Ρ/Φ/ + Qi - *,КД - Ь>К]Ф]. (13.4)
В частном случае, нередко встречающемся на практике, при
Qj = Qj + *Λ·, M[$rJ] = О,
получим
где QJ = M[e*£T].
2. Некоторые свойства дискретного фильтра
Калмана
Рассмотрим стационарный случай: Φ, = Φ = const, Qj = Q =
const ,Rj = Д = const. Поскольку Q > 0, то существует
представление (неоднозначное) Q = ВВТ, где матрица В называется
квадратным корнем из матрицы Q.
Теорема 16. Пусть пара (Ф,#) наблюдаема, пара (Ф,В)
управляема. Тогда при бесконечном времени наблюдения:
1) существуют Р^, Р<+, К^, определяемые соотношениями
Р~=ФР+Фт + д,
93
ΛΓοο = P-HT(HP-HT + Д)"1;
2) уравнения ошибок относительно величин Ах J = Xj — a^
Δχ+ = xj -
ж;
ΔχΤ+1 = ΦΔχ^+%,
Δχ+ = (E- KooH)AxJ - #ооГ,-
таковы, что при qj = 0, Vj = 0 выполнено
AxJ,Ax+ ->0, 0'->оо).
Более подробно случай стационарности будет рассмотрен в
разделе, посвященном непрерывному фильтру Калмана.
Пример 13.1. Пусть
Xj+ι = Xj + qj,
3
Zj=Xj+rj, Q = l, Я=-.
ρ—
Здесь Φ = 1, Η = 1, uTj[ = * Найдем установившееся
значение К и вид фильтра:
Р- = 3- Р+ = 1- К =Л
Xj+1 = Xj- , Xj = Xj + -(2j — Xj ).
Уравнение ошибок таково:
ZAXi+1 - ^Xj + g^ gTj,
при этом однородное уравнение
Δχ++1 = ±Δζ+
асимптотически устойчиво.
Полученные результаты, связанные с дискретным фильтром
Калмана, позволяют придать иную форму рассмотренному ранее (см.
лекцию 11) методу наименьших квадратов в задаче решения
переопределенной системы алгебраических уравнений ζ = Нх.
Рассматривая компоненты Zj как последовательные измерения,
методу наименьших квадратов можно придать рекуррентную форму,
94
интерпретируя индекс j как дискретный отсчет времени. Будем
считать, что в начальный моменту = 0. В качестве начальной ковариации
вектора χ примем величину Ро = >^> где ус — достаточно большое
число (ус » 1). Далее используем процедуру фильтра Калмана,
исключив из неё этап прогноза. Будем считать, что все измерения некор-
релированы между собой и стохастически равноточны. Положим для
определенности, что M[r?j) = 1.
Первый шаг:
xl = x° + K1(z1-hJx°),
Pi = Ро - Poh^hJPoh! + l)-1fc3"Po,
Ki = P0h1(h[P0hi + l)-1.
Второй шаг:
x2 = x1 + K2(z2-hJxW),
ft = Pi - ftft2(ftJPift2 + lJ-^Pi,
K2 = Pih2(hlP1h2 + l)-'x.
j-ый шаг:
χό = ^-ι + Kjizj - h]5P~l),
Pj = Pj-χ - Pj^hjihJPj^hj + l^hJPj.u
Kj = Pj-xhjihJPj^hj + I)"1.
Последний шаг при j = га.
Очевидно, что при достаточно большой величине у/ус,
оценка ж(т) с высокой степенью точности совпадает с оценкой χ =
(ΗτΗ)-1Ητζ.
3. Реализация дискретного фильтра Калмана
методом квадратного корня.
На практике обычно используется численная модификация
дискретного фильтра Калмана, основанная на так называемом методе
квадратного корня.
Метод квадратного корня состоит в том, что ковариационная
матрица Ρ представляется либо в виде разложения Ρ = SSTf где S —
верхне- или нижнетреугольная матрица, либо в виде Ρ = UDUT, где
U — верхне- или нижнетреугольная матрица с единицами на главной
95
диагонали, D = diag(di,d2,---dn)> причем dj > 0. При таком
представлении, каковы бы ни были невырожденные матрицы S и D,
матрица Ρ будет положительно определенной.
Метод корня в частности позволяет избежать потери
положительной определенности ковариационной матрицы Ρ на этапе коррекции
при вычитании, когда разности соизмеримы с квантом дискретизации
по уровню. Далее рассматривается только вариант, когда Ρ
представляется в виде Ρ = SS7.
В соответствии со сказанным всюду в соотношениях,
описывающих фильтр Калмана, заменим ковариацию Ρ на произведение SST>
где S = Р1/2 — треугольная матрица.
Рассмотрим сначала случай скалярного измерения:
Zj = hjxj -f г,·, M[rj] = 0, M[rjTi] = RjSji.
Этап коррекции (нижние индексы пока опускаем). Имеем
Р+ = Р~- p-h(hTp-h + R)-1hTp-,
х + = ST + K(z - /1тх"), К = p-h{hTp-h + Я)-1.
Положим Р~ = S~S-T, P+ = S+S+T. Получим
S+S+T = S~S-T - S-S-Th(hTS-S-Th + ϋ)-1/ιτ5"5-τ,
к = s-s-Th(hTs~s-Th + л)-1.
Введем обозначения / = £"-Tft, α = /τ/ + Д. Окончательно
получим
S+ = S~
Е
а
-ffT
1/2
K=-S~f. (13.6)
α
Если ζ — вектор и матрица R — диагональна (составляющие
вектора г некоррелированы между собой), этап коррекции реализуется
путем последовательной обработки каждой компоненты вектора
измерения, причем выходные (апостериорные) значения S и χ каждого
шага служат входной информацией следующего шага. Результат
обработки последней координаты вектора ζ служит исходной
информацией для перехода к этапу прогноза.
Замечание. Если матрица R не диагональна, то невырожденным
преобразованием С вводится вектор
ζ* = С ζ = СНх + Сг = Н*х + г*
такой, что координаты вектора г* некоррелированы.
96
Например, матрицу С можно выбрать так, чтобы М[г*г*т]
Имеем в этом случае M[r*r*T] = CRCT = Ε. Откуда С = R~
обратная матрица к матрице квадратного корня Я1/2.
Этап прогноза.
или
Обозначим Wj = 9jSf+1. Тогда
Sj+i = [WjWj + Qj]1l2.
Лекция 14
Непрерывный фильтр Калмана
Рассматривается непрерывная линейная динамическая система,
поведение которой описывается вектором состояния
x = A(t)x + q. (14.1)
Возмущения q(t) представляют собой нормальный случайный
процесс типа белого шума:
M[g(i)]=0, M[q(t)qT(s)]=Q(t)S(t-s), Q(t) > 0.
Заданы также начальные условия:
х(*о) = M[x(t0)], P(t0) = Μ [{χ(ί0) - x(*o)} {x(to) - x(t0)}T] > 0.
Возмущение q(t) предполагается независимым от начального
состояния системы x(to):
M[x(to)qT(t)]=0, Wt>t0.
Пусть информация
z(t) = H(t)x(t) + r(t) (14.2)
поступает непрерывно на интервале [£о, t].
Погрешность информации r(t) — случайный нормальный процесс
типа белого шума:
M[r(t)rT(s)] = R(t)S(t - *), R(t) > 0.
Кроме того
М[х(*0)гт(*)]=0, Wt>t0 и M[r(t)qT(s)]=0, Vt,s.
Требуется в любой момент времени t > to определить оценку x(t),
удовлетворяющую условиям линейности, несмещенности и
ортогональности.
/. Линейность. Оценку будем искать в виде
χ = Γχχ 4- Ггг,
где матрицы Γι и Г2 подлежат выбору.
2. Несмещенность. Запишем уравнение ошибок оценки
относительно величины Δχ = χ — χ:
Αχ = ΓιΔχ + (Α - Τχ - Γ2#)χ 4- q - Г2г.
98
Требование Μ[Δχ] = 0 приводит к условию
А-Г1-Г2Я = 0 или Γχ = А-КН, ЛГ = Г2.
Таким образом, уравнение для оценки χ имеет вид
χ = Ах + Κ(ζ — Нх).
Матрица К подлежит определению.
3. Ортогональность. Условие ортогональности имеет вид
M[Ax(t)zT(s)] = О, t0 < s < t,
где Ax служит решением уравнения ошибок
Ах = (А - КН)Ах + q-Kr (14.3)
и
z(8) = z(s) - M[z(s)] = φ) - Нх = H(s)Ax + r(s).
Отсюда
РЯ(*,5)ЯТ(5) + Μ[Δχ(ί)Γτ(5)] = 0, (14.4)
гдеРзД*) = M[Ax(t)AxT(s).
Запишем решение уравнения (14.3):
t
Ax(t) = Фк(1, t0)Ax(t0) + J Фк& г) [q(r) - K(r)r(r)] dr,
to
где Фь(Мо) — переходная матрица соответствующей линейной
системы.
Далее получим
t
M[Ax(t)rT(s)] = - ΙФ(*,т)#(т)М[г(т)гт(s)]dr =
t
= - / Φ(*, τ)ϋΓ(τ)Д(т)δ(τ - s)dr = -Φ(ί, s)AT(s)Я(5).
*о
Уравнение (14.4) теперь запишется так:
Px(t, s)HT(s) - Φ(ί, s)K(s)R(s) = 0.
Устремляя s -> ί, находим UT(t):
1^(*) = Ря(*)Ят(0й"1(0·
99
Ковариационная матрица Px(t) = M[Ax(t)AxT(t)] находится
как решение дисперсионного уравнения, соответствующего
уравнению (14.3):
Px(t) = (A(t)-K(t)H(t))Px(t)+
+ Px(t)(A(t) - K(t)H(t))T + Q(t) + K(t)R(t)KT(t). (14.5)
Подставив выражение для матричного коэффициента усиления К
в (14.5), получим
Px(t) = A(t)Px(t) + Px(t)AT(t) + Q(t)-
- РЯ(*)ЯТ(*)Я-1(*)Я(*)РЯ(*). (14.6)
Уравнение вида (14.6) в теории дифференциальных уравнений носит
название уравнения Риккати.
Алгоритм оценивания, описываемый соотношениями
έ(ί) =A{t)x{t) + K(t)(z(t) - Я(*)х(*)), x(to) = £0}
K(t)=Px(t)HT(t)R-\t),
Px(t) =A(t)px(t) + ρ*(*μτ (t) + g(t)- p«(to) = Po
-Р.(«)ЯТ(«)Я-1(«)Я(*)Р.(*)|
носит название непрерывного фильтра Калмана.
Алгоритм, доставляющий оценку вектора состояния в
соответствии с формулами (14.7), вырождается при R = 0 (т.е. если
измерение не содержит шума г). Такая ситуация возникает, например, когда
коррелированный шум в измерении представляется в виде
формирующего уравнения и включается в вектор состояния. Один из удобных
«инженерных» вариантов решения такой задачи состоит в том, что
вводится некоторая матрица R, соответствующая фиктивному шуму
г малой интенсивности:
М[ггт] = εΕ (ε > 0 — малый параметр).
Далее выясняются некоторые свойства алгоритма (14.7) и, в
частности, уравнения Риккати.
1. Представление уравнения Риккати в виде
линейных уравнений большей размерности
Для краткости обозначим HTR~lH = С > 0. Прежде всего
заметим, что уравнение
Ρ = АР + РАТ + Q - РСР (14.8)
100
при Q = 0 сводится к линейному путем перехода к обратной матрице
N = Р"1:
N = -NA-ATN + C.
Рассмотрим совокупность соотношений, определяющих матрицы Фь
Ф2:
Фх = ΛΨι + Q*2, Ф2 (ί0) = Р0, /ίΑΛ.
(14.9)
φ2 = (7Φι-ΑτΦ2, Φ2(*0) = #,
и определим матрицу Р* соотношением
ф1=Р*ф2. (14.10)
Покажем, что соотношения (14.9) эквивалентны уравнению (14.8)
в том смысле, что задают одну и ту же функцию P(t) = P*(t).
Продифференцируем соотношение (14.10):
ф1=р*ф2 + р*Ф2
и подставив выражения для производных Φχ и Ф2 из соотношений
(14.9) получим
(Р* - АР* - Р*АТ -Q + Р*СР*} Ф2 = 0.
Если Ф2 — невырожденная матрица, то из последнего соотношения
следует, что матрица Ρ удовлетворяет уравнению (14.8), т.е. Р* = Р.
Но
ф2 = (СР - Ат) Ф2, Ф2(*0) = #,
т.е. Ф2 — переходная матрица и, стало быть, det Ф2 Φ 0.
Соответственно матрица Ρ может быть найдена по формуле
Ρ = Φι*ί1.
Таким образом, нелинейное уравнение Риккати сведено к двум
линейным уравнениям (14.9).
Рассмотрим некоторые частные случаи.
1. Пусть Я = 0. Тогда в (14.8) матрица С = 0, и уравнение
Риккати трансформируется в дисперсионное уравнение. Обозначим через
Ф(£, to) переходную матрицу, удовлетворяющую уравнению
Ф(*, t0) = А(*)Ф(«, к), Ф(*о, to) = Ε.
Легко показать, что
*2(*) = ФТ(*о,*),
101
t
Φχ(ί) = Φ(ί, ίο) (ρ0 + f Φ(ί0, τ)ς(τ)Φτ(ί0, τ)άτ\,
t
P(t) = Φ(ί, ί0) (Ρο + J Φ(*ο, τ)Ο(τ)Φτ(ί0, τ)άτ\ Φτ(ί, ί0).
*0
2. Пусть Q = 0. Тогда
Φι(ί) = Φ(Μο)Ρο,
Φ2(ί) = Φτ(ίο,ί) + У Φτ(τ,ίο)0(τ)Φ(τ,ί0)άΛρ0,
*0
Ρ(ί) = Φ!Φ^.
2. Некоторые условия устойчивости фильтра Кал-
мана
Обратимся к алгоритму оценки (14.7). Уравнение ошибок оценки
относительно величины Да; = χ — χ имеет вид
Ах = АкАх + q-Kr, АК = А- КН. (14.11)
Важнейшим свидетельством работоспособности алгоритма (14.7)
является устойчивость (асимптотическая устойчивость)уравнения
ошибок (14.11). Ниже без доказательства приводятся три теоремы,
устанавливающие условия устойчивости фильтра Калмана для некоторых
важных практических случаев.
Теорема 17. Пусть P(t) — положительно определенная и
ограниченная для всех t>to матрица
р\Е < P(t) < ρ\Ε, pi = const, p2 = const,
являющаяся решением уравнения Риккати
Р = АР + РАТ + Q - РСР. (14.12)
Тогда уравнение (14.11) устойчиво.
Пусть, кроме того, пара (А, Н) наблюдаема. Тогда
уравнение
Ах = АкАх (14.13)
асимптотически устойчиво.
102
Теорема 18. Пусть Р\иР2 — два решения уравнения Риккати
Р = АР + РАТ + Q - РСР,
соответствующие двум возможным начальным значениям
Pi (to) и РгС^о)· Решения уравнений
Ах\ = ΑκιΔχι, Ακι = А — KiC,
ι, /ci (14.14)
Аж2 = АдеДяг» -Ακ-2 = А — К2С
устойчивы (соответственно асимптотически устойчивы).
Тогда разность АР = Р2 — Р\ ограничена (соответственно
стремится к 0 при t -> оо).
Вышеприведенная теорема позволяет положительно ответить на
вопрос о возможности применения фильтра Калмана (14.7) в
условиях, когда априорные стохастические характеристики динамической
системы (14.1) известны приблизительно.
Замечание 16. По условиям теорем требуется ограниченность
матрицы P(t). Установить эту ограниченность можно либо из
физических соображений, либо путем прямого моделирования
алгоритма оценки.
Рассмотрим стационарный случай: A,#,Q,jR — постоянные
матрицы. Поскольку Q > О, существует разложение Q = ВВТ.
Обычно, как уже говорилось ранее, в качестве матрицы В выбирается
либо верхне-, либо нижнетреугольная матрица.
Теорема 19. Пусть пара (А,Н) наблюдаема, пара (А, В)
управляема. Тогда:
1) Существует единственное установившееся решение Роо
уравнения
Р = АР + РАТ + Q-PCP, Роо= limP(i),
t-юо
удовлетворяющее алгебраическому уравнению
АРоо + РооАТ + Q - РооСРоо = 0.
2) Однородное уравнение
Ах = (А - АГооЯ)Дх, Коо = РооЯ1"^-1
асимптотически устойчиво.
103
Лекция 15
Применение теории наблюдаемости и
оценивания в инерциальной навигации
Теория наблюдаемости и оптимального оценивания находит самое
широкое применение при построении бортовых алгоритмов инерци-
альных навигационных систем (ИНС). Эти системы служат
основой навигации самолетов, крылатых ракет, морских надводных и
подводных судов, дефектоскопов, движущихся в газопроводах или
нефтепроводах И.Т.Д.
Ниже будет рассмотрена упрощенная двумерная модель
инерциальной навигационной системы, но такое упрощение
сохраняет основные свойства метода инерциальной навигации.
Приборной основой рассматриваемой здесь навигационной системы
служат два типа устройств: однокомпонентные ньютонометры и
гироскопическая платформа. Моделью ньютонометра является однокомпо-
нентный пружинный подвес с точечной чувствительной массой (см.
рис. 15.1).
На чувствительную массу ньютонометра, расположенную на дви-
жущемся в поле силы тяготения объекте, действуют две силы: сила /,
приложенная к массе со стороны пружины, и сила тяготения д.
Составляющая силы / вдоль оси чувствительности определяется по
деформации пружины.
Блоку из трех однокомпонентных ньютонометров с
ортогональными осями чувствительности может быть поставлен в соответствие
трехкомпонентный ньютонометр с одной чувствительной массой,
называемой приведенной. За счет нормировки ее можно считать
единичной.
Основой гироплатформы служат гироскопы в кардановых
подвесах. Гироскоп в кардановом подвесе сохраняет неизменную ориента-
™M^iu>^J^iMufiH
Рис. 15.1.
104
цию в инерциальном пространстве, если к осям кардана не приложены
никакие возмущающие или управляющие моменты. Если по одной из
осей карданова подвеса приложить момент, то корпус ротора
гироскопа начинает вращаться (прецессировать) вокруг другой оси с угловой
скоростью, пропорциональной приложенному моменту. Орт,
задающий направление действия момента, ось прецессии и направление
кинетического момента ротора составляют ортогональный трехгранник.
Связывая конструктивно два или три гироскопа, можно построить
гироскопическую платформу, которая либо неизменно ориентирована
в инерциальном пространстве (в отсутствие возмущающих моментов),
либо вращается с абсолютной угловой скоростью, пропорциональной
действующему на платформу моменту. С платформой жестко
связывается правый ортогональный трехгранник Μζ{Μζ\ζ<ιζ^), где Μ —
местоположение приведенной чувствительной массы блока ньютоно-
метров; в проекциях на оси этого трехгранника измеряется внешняя
сила /, приложенная к точке М. Оси прецессии гироплатформы с
точностью до инструментальных погрешностей совпадают с осями этого
трехгранника. Трехгранник Μ ζ называется приборным. Метод инер-
циальной навигации состоит в следующем:
1. Выбирается некоторая система координат (опорная система
отсчета) и ставится задача определения в этой системе скоростей и
координат объекта, движущегося в поле тяготения Земли под действием
внешней силы, доступной измерению. Под объектом всегда
понимается приведенная единичная масса, если используются два либо три
однокомпонентных ньютонометров.
2. Записываются уравнения Ньютона, которым подчиняется
поведение объекта. В эти уравнения входят компоненты двух сил: силы
тяготения, зависящей от текущих координат объекта, и внешней силы,
приложенной к чувствительной массе со стороны корпуса ньютоно-
метра. Координаты и скорости определяются путем интегрирования
этих уравнений при условии, что известны начальные координаты и
скорости, а также текущие измеренные значения компонент внешней
силы.
3. На борту движущегося объекта находятся платформа с жестко
связанными с ней ньютонометрами, реализующими приборный
трехгранник, и вычислитель, одна из задач которого — интегрирование
указанных уравнений. Входную информацию вычислителя
составляют:
а) данные о начальных значениях координат, скоростей и началь-
105
Рис. 15.2.
ной ориентации приборного трехгранника относительно
опорной системы;
б) показания ньютонометров;
в) информация, позволяющая определить текущую ориентацию
приборного трехгранника относительно опорного.
В рассматриваемом случае приборным трехгранником управляют так,
чтобы он в идеале совпадал с опорным.
Математическое описание поставленной задачи приводится далее
в двумерном, упрощенном варианте.
С неподвижной Землей произвольным образом свяжем систему
координат Οξ (ΟξχΟξ2), где О — геометрический центр Земли.
Положение точки Μ — приведенной чувствительной массы
двумерного ньютонометра — определяем полярными координатами:
длиной г радиус-вектора ОМ и величиной σ — углом между осью Οξ\ и
направлением ОМ. Отсчет этого угла производится так, как это
указано на чертеже 15.2.
За опорную систему отсчета выберем систему Ох (ОххОхг)·
Направление оси 0x2 совпадает с направлением ОМ. Положение и
абсолютную скорость точки Μ в системе Ох определим соответственно
векторами χ = {%\) и υχ = (Ц). Очевидно х\ = 0, хъ = г. Введем
также угловую скорость ω поворота системы Ох относительно Οξ
ω = σ.
В соответствии с правилами теоретической механики уравнения
106
движения точки Μ во вращающейся системе координат Ох имеют вид
υχ = ώχυχ 4- дх 4- /*,
где кососимметричная матрица ώχ равна
-(i о)·
и в предположении центральности силы тяготения Земли:
д = —2 ~~ у (А* — постоянная тяготения).
Внешняя сила / в системе Ох равна
*-(8·
В скалярной форме уравнения (15.1) имеют вид
vi = — ωτ
Г = V2
ύι=ωυ2 + /ι (15·2)
ν2 = -ωνχ - -г + /s
2·
К ним следует добавить соотношение
σ — ω.
Уравнения, реализуемые в бортовом вычислителе назовем
модельными. Входной информацией о силе / служат величины
fZl=fZl+AfZl
fz2 —JZ2 "+" Δ/*2 ,
где fZl, fZ2 — проекции внешней силы / на оси приборной системы
координат; AfZl, AfZ2 — инструментальные погрешности,
порожденные различными факторами: погрешностями нулей, погрешностями
коэффициентов в усилителях, высокочастотным «дребезгом» и.т.д.
Модельные уравнения структурно повторяют уравнения движения
опорной точки М:
v[ = -wV
r' = v'2
*Ί=ω'ν2 + ίΖι (15.3)
ί4 = -α/ι4-^ + 4
σ'=α/.
107
Переменные, отмеченные верхним индексом «штрих» будем
называть модельными переменными. Управление гироплатформой
(управление приборной системой координат) осуществляется в соответствии
с формулой:
ωζ=ω' + νζ, (15.4)
где ωζ — угловая скорость платформы, νζ — инструментальная
погрешность, порожденная неконтролируемыми возмущающими
моментами, связанными с трением в осях кардана, погрешностью
коэффициента усилителя и.т.д.
Модельные координаты и скорости можно интерпретировать как
координаты и скорости модельной точки М1 в модельной системе
координат Оу (ОухОу2), ориентация которой относительно системы Οξ
определяется углом σ'.
Ошибка решения навигационной задачи описывается
отклонением текущего положения и скорости модельной точки М1 относительно
опорной точки М, а также угловым положением приборной системы
координат относительно модельной. Соответствующие уравнения
называются уравнениями ошибок.
Вывод уравнений ошибок основан на следующей схеме.
Определяется вектор состояния X(t) динамической системы,
поведение которой подчиняется уравнению
X = F(X,U)9 x(to) = Xo, (15.5)
где F — известная вектор-функция, вектор U(t) — внешнее
возмущение системы, доступное измерению.
Информацией для определения X служат величины
U'(t) = U(t) + «(*), X'(to) = Xo + *o,
где u(t), xq — погрешность информации.
Указанная информация поступает в вычислитель, где решается
уравнение
X' = F{X\ U')> Х'(*о) = Х'0. (15.6)
Вектор X'(t) называется модельным, а уравнение (15.6) —
соответственно модельным уравнением.
Вводится вектор x(t) = X'(t) — X(t), называемый вектором
ошибок. Поведение x(t) подчиняется уравнению
x(t) = F(X + Χίυ + υ)- F{X, U). (15.7)
Величины u(t) и х0 полагаются малыми настолько, что уравнение
(15.7) может быть линеаризовано, т.е. правая часть этого уравнения
108
может быть разложена в ряд Тейлора относительно величин χ и ω в
окрестности X(t), U(t). Получим
χ = A(t)x(t) + B(t)w(t), (15.8)
где
A(t) = A(X(t),U(t)) = 9FfxU),
B(t) = B(X(t),U(t)) = 9Ffi;U)- (15.9)
Важно отметить, что в силу гипотезы малости величин и и xq в
выражениях (15.8) для матриц А и В аргументы X и U можно заменить
на аргументы X'fU'. Более того, вместо X или Х! можно
использовать X* = X + х*, лишь бы величина x*(t) имела порядок малости
величины x(t).
Вернемся к выводу уравнений ошибок в нашем конкретном
случае. Далее нам понадобится понятие угла малого поворота. Пусть
система координат Os (OsxOs2) повернута относительно системы
Ор (Ор%Ор2) на угол х, так, что имеют место соотношения
= С = (Sl\ — (Pl\ С = ( cosx sinx>\
Pi \«2/ ' ~ \P2/ ' ~~ y-sinx cos κ J '
Если угол χ настолько мал, что допустима замена cos χ = 1, sin x =
χ, το χ называется малым поворотом или углом малого поворота. В
этом случае
s = (# + x)p, где *=(_х Jj —
кососимметрическая матрица, соответствующая малому повороту х.
Определим ориентацию приборной системы Oz относительно
опорной Ох малым поворотом а
z = (E + a)x,
модельную систему Оу относительно опорной — малым поворотом
Δσ = σ' - σ ^
у = (Е + Ασ)χ,
приборную систему Oz относительно модельной — малым поворотом
β
ζ = (Ε + β)ν.
Очевидно /? = α — Δσ.
109
Здесь угол а представляет ошибку построения приборной
вертикали (горизонта), угол Δσ — ошибку построения модельной
вертикали (горизонта).
Очевидны соотношения
ωζ =ω -f- ά,
ωυ =ω 4- Δσ.
Из уравнения (15.4), определяющего управление платформой, следует
β = νζ. (15.10)
Это уравнение называется кинематическим уравнением ошибок.
Введем соотношения, определяющие движение модельной точки
М1 относительно опорной точки М, т.е. соотношения, которые
описывают ошибки определения местоположения при помощи ИНС.
Важно отметить, что информация, содержащаяся в бортовом вычислителе
ИНС описывает движение модельной точки М! в модельной системе
координат. Поэтому, чтобы сравнить ее движение с движением
опорной точки М, уравнения движения Μ надо записать тоже в модельной
системе координат.
Положение точки Μ в системе Оу определяется вектором у =
(yi У2)Ту а положение М' в системе Оу — вектором у' = (у[ yf2)T·
Полная ошибка вычисления местоположения определяется
величиной Ау = у1 — у. Связь между величинами Ауг, Ау2 и величинами Δσ
и Δγ находится из соотношений
(£)-(?)-<»+Ч)·
откуда следует
Ayi = — τΑσ
Ау2 =г/ — г = Δγ.
Целесообразно представить полную ошибку Ау в виде суммы двух
ошибок: динамической и кинематической. Для этого запишем Ау в
виде Ау = у! — у = {у1 — ζ) 4- {ζ — у), где ζ — вектор,
определяющий положение точки Μ в приборной системе Οζ. Введем
обозначение 5у = у! — ζ и 5у назовем вектором динамических ошибок. С
учетом
ζ = {Ε 4- $)у и ζ = (Ε 4- &)х
получим Ay = Sy + J3y> где
*■(&)-(г)
по
Таким образом, полная ошибка местоположения представлена в виде
двух ошибок: динамической и кинематической. В скалярной форме
Ayi = 8уг + βτ
Дуг = Sy2 = Δγ.
Чтобы вывести уравнения, которым подчиняется динамическая
ошибка Sy, сравним две группы уравнений.
1) Уравнения движения точки М! в системе Оу
у' = υ'υ+ωνι/
а у' (15.11)
2) Уравнения движения точки Μ в приборной системе О ζ
ζ = υζ+ ωζζ
. ~ ,_ ^ψ μ ζ (15.12)
νζ = ωζν* + gx + fz, gz = —5-.
Предварительно вычислим
Обозначим ω§ = ^ = £, где gf = ^.
Тогда получим
При решении навигационной задачи в окрестности Земли г = й + Л,
где R — приведенный радиус сферической модели Земли R « 6380км,
h < 30км, и поэтому приближенно можно считать
ωΐ = JL = £ = const = 1,56 · 10"61/сек2
Величина ωο = >/5== 1,25-10~31/сек носит название частоты
Шулера по имени немецкого ученого Макса Шулера, который ввел понятие
математического маятника с длиной, равной радиусу Земли. Из
сравнения уравнений (15.11) и (15.12) с учетом того, что ωζ = ωυ + νζ и
полагая v'y — vz = <Ц„ получим
Jy =<Ц, 4- шу5у - Ргу
.. ^ . 2/ί»ι\±Α. ~ (15.13)
111
Уровень погрешностей современных навигационных систем таков, что
величиной vzvy можно пренебречь.
Уравнения (15.13) носят название динамических уравнений
ошибок. Запишем их в скалярной форме:
Syi =δυχ 4- ωνSy2 - νζτ
δύχ =ωυδυ2 — Ц) Jyi + AfZl
и (15.14)
Sy2 =δυ2 - ωυ Syi
δν2 = - ωυδυι + 2шц6у2 4- AfZ2
Добавляя к этим уравнениям кинематическое уравнение ошибок
а также выражения для полных ошибок
Ayi =<fyi + βτ
Ау2 =Δγ,
получим замкнутую систему уравнений, определяющих точность
решения навигационной задачи.
Заметим, что при самолетных скоростях отношение
ω
— <1.
ωο
Можно показать, что динамические уравнения ошибок (15.14)
неустойчивы. Эта неустойчивость вызывается наличием в правой
части слагаемого 2и$6у2. Строгое исследование неустойчивости
выходит за рамки этой лекции.
Во всех реально функционирующих инерциальных
навигационных системах для устранения указанной неустойчивости
привлекается в той или иной форме дополнительная информация о высоте. Либо
априорно полагается, что высота в процессе движения мало меняется
и можно допустить гипотезу
г = const,
либо дополнительная информация о высоте доставляется датчиками
не инерциальной природы, например, баровысотомерами. При этом
возможны два варианта построения алгоритмов навигационной
системы. В первом варианте из состава модельных уравнений
исключаются уравнения вертикального канала. С механической точки зрения это
означает, что движение точки М' стеснено геометрической связью
JI „*
г = г ,
112
где г* = г 4- ρ — дополнительная информация о высоте, а ρ —
погрешность этой информации.
В другом случае в модельные уравнения вертикального канала
вводится обратная связь, сформированная при помощи
дополнительной информации. Модельные уравнения вертикального канала при
этом имеют вид
r'=^ + fci(r'-r*)
г
Соответствующие уравнения ошибок вертикального канала таковы:
Аг =δυ2 - ων6уг 4- кг (Аг - ρ)
δν2 = — ωνδυι 4- 2ω%Ατ 4- AfZ2 4- k2(Ar — ρ).
На практике к\ и к2 выбирают настолько большими, что уравнения
(15.15) можно заменить уравнениями
Аг =δυ2 + кг(Аг -ρ)
. , /А ч (10.10)
δυ2 =к2(Аг — ρ).
Строгая оценка возможности такого перехода здесь опускается.
Характеристическое уравнение системы (15.16) имеет вид
λ2 - кгХ - к2 = 0.
Корни этого уравнения выберем такими, чтобы характеристическое
уравнение имело вид (λ4-λο)2 = 0. Тогда к\ = — 2λο, к2 = —λ§.
Выберем λο > ωο. При таком выборе к% и к2 по истечении очень короткого
переходного процесса практически будет достигнуто равенство
г' = г*, (Ατ = ρ).
Следовательно, дополнительная информация г* может
рассматриваться также как геометрическая связь, ограничивающая движение
материальной точки М'.
В рассматриваемом случае уравнения ошибок получаются путем
подстановки в уравнения горизонтального канала вместо величины
δυ2 ее представления
δυ2 = ё + Шу6у\,
а вместо величины 6у2 = Аг — величины ρ. Тогда
5ух =δυ% +ωνρ-νζτ
δύχ =ων(ρ 4- шу5у{) - a^yi 4- AfZl.
113
5У1 2 -Да, ^ a ι,
ά = δω + ι>
£ώ = — α^α 4- ω^ε,
оси = ,
где ε = ■
ί/2 =
_Μί
На практике величинами, зависящими от ρ обычно пренебрегают.
После указанных упрощений получим
&/1 =δυχ — vzr
/ι с 17^
ίύι = - (wg - ω£) <fyi + Δ/,!.
Еще одно очевидное упрощение: для самолетных скоростей
величина ωυ того же порядка, что и величина и — угловая скорость
вращения Земли. Отношение ^ < 4 · КГ"3, поэтому величиной ω% по
сравнению с ω§ можно пренебречь. Перепишем уравнения (15.17) с
учетом указанного упрощения, заменив переменную 6у\ на
переменную α в соответствии с соотношениями
Получим
9
Внутренние свойства навигационной системы определяются
свойствами однородных уравнений ошибок, которые в нашем случае
имеют вид
α + α£α = 0, β = 0.
Отсюда следует, что приборная вертикаль совершает относительно
истинной вертикали гармонические колебания с частотой Шулера ωο,
а кинематическая ошибка β постоянна.
Предположим,что и = const, ε = ε° + εθ, где ε° = const.
Динамическая ошибка α в этом случае остается ограниченной,
кинематическая ошибка растет линейно во времени. В современных инерци-
альных навигационных системах рост ошибки обычно не превышает
одной морской мили (1,852км) за час полета.
Существует ряд задач мониторинга земной поверхности,
осуществляемого при помощи авиации. В этом случае используется
комплексная навигационная система, включающая в себя помимо инер-
циальной системы приемник спутниковой навигационной системы
GPS или ГЛОНАСС, доставляющий высокоточную информацию о
координатах самолета.
Приемник спутниковой навигационной системы обрабатывает
сигнал от видимых навигационных спутников, движущихся вокруг
Земли по орбитам с периодом приблизительно двенадцать часов. На
114
борту каждого спутника установлены атомные часы и передатчик,
излучающий цифровой сигнал на определенной частоте. Спутники
располагаются так, что из любой точки земной поверхности или ее
ближайшей окрестности в каждый момент времени видны по крайней
мере четыре спутника.
Навигационные сигналы содержат информацию, позволяющую
определить в вычислителе приемника координаты спутников. Кроме
того, приемник определяет время прохождения сигнала до спутника,
которое с учетом скорости распространения радиоволн является
измерением расстояния до спутника, называемым псевдодальностью:
* = у/(т - η\)2 + (г/з - 4)2 + (г/з - 4)2 + cAt + ρ\
где щ j = 1,2,3 — координаты приемника; ту*· — координаты г-го
навигационного спутника; At — рассогласование часов спутниковой
системы и часов приемника ( спутниковое время общее для всех
спутников); с — скорость света; ρ* — инструментальная погрешность,
включающая в себя задержки распространения сигнала в атмосфере,
тропосфере и.т.д.
Четыре псевдодальности позволяют однозначно определить (с
точностью до инструментальных погрешностей) три коорднаты
приемника и рассогласование часов Δί.
Одна из целей комплексирования — повышение точности
определения ошибки приборной вертикали а.
В этом случае постановка задачи состоит в оценивании вектора
состояния (α, δω, /?, и, ε°)τ при помощи измерения
w = σ' - σ* = Δσ - ρ8 = а - β - ρ8.
Здесь σ* — информация, доставляемая спутниковой системой, ρ3 —
погрешность этой информации, которую полагаем белым шумом с
известной интенсивностью.
Итак, математическое описание задачи сведено к соотношениям
ά =δω 4- ι/,
δώ = -ω%α + ω%(ε° + ε3),
β=ν, ν = 0, έ° = 0,
w =α —/? — ρ3.
Проведем анализ наблюдаемости, используя тот факт, что если
наблюдается какая-то переменная, то наблюдается и ее производная.
115
Наблюдаемые переменные
χι = а — β χ2 = δω
х3 = ol - ε° ус^ — v.
Уравнение, которому подчиняется вектор χ = (χχ, хг, хз, Х4)т имеет
вид
χ = Ах + <?,
А =
/0 1 0 0\ / 0 \
0 0 -wg 0 Ι <4ε>
0 1 0 1 ' Η 0 ' W =
\о о о о/ V ° /
Оценка κ строится по стандартной схеме
κ = Aie + K*(w — щ).
Уравнения ошибок оценки Ακ = κ — κ
Ακ = ΑΑκ - Κ*Ακχ + q + Κ*ρ3.
= χι-
-Q"
Вектор К* выбирается либо постоянным, обеспечивающим
компромисс между скоростью затухания переходных процессов в уравнении
ошибок и среднеквадратическими установившимися ошибками, либо
из реализации фильтра Калмана.
Примеры соответствующих числовых расчетов выходят за рамки
этой лекции. Заметим только, что дополнительная спутниковая
информация имеет очень высокую точность и можно считать, что
величины х^, г = 1,..., 4 оцениваются практически точно. Тогда ошибка
определения угла а равна ε°. Для серийных навигационных систем эта
ошибка не превышает 1 минуты в угловой мере.
В заключение заметим, что в инерциальной навигации существует
целый ряд задач (различные виды калибровки, начальной выставки,
коррекции), алгоритмы решения которых основаны на фильтрах
Калмана.
116
Часть II
ВТОРОЙ СЕМЕСТР. НЕЛИНЕЙНОЕ
УПРАВЛЕНИЕ ВОЗМУЩАЕМЫМИ
СИСТЕМАМИ
Лекция 16
Стратегии многоуровневого управления
движением
В курсах теоретической механики и механики сплошных сред
изучаются статические и динамические системы. При этом вопросы
управления такими системами не рассматриваются. В то же время и в
природе, и в технике имеются динамические системы, снабженные
исполнительными механизмами (двигателями), что позволяет изменять
позицию (состояние) этих систем, т.е. управлять ими. Будем говорить
в этом случае, что рассматривается движение управляемого объекта,
которое описывается дифференциальными уравнениями с
функциональным включением
y = /(y,w), у(*о) = У*
ιι(·) € U = {«(-) € KC\u(t) € Ω С Я5, t e [to,**)}. '
Здесь у — n-мерный вектор-столбец координат, описывающий
состояние управляемого объекта, и — s-мерный вектор-столбец
управляющих воздействий, /(у, и) — дважды непрерывно
дифференцируемая вектор-функция своих координат, U — функциональное
множество, описывающее имеющиеся ресурсы по управлению движением
объекта.
Функциональная схема управляемого объекта представлена на
рис. 16.1.
Физический смысл управляющих воздействий может быть
различным: это могут быть управляющие силы и моменты непосредственно, в
случае если исполнительные механизмы идеальны, или управляющие
сигналы, подающиеся на эти механизмы, когда необходимо учесть их
функционирование.
117
Движущийся объект
"Ί ~Т
Исполнительные
механизмы
Измерительные
устройства
1 ^
Система управления
Рис. 16.1. Функциональная схема управляемой системы
Описание функционального множества U позволяет представить
разнообразные ограничения на управления и, встречающиеся на
практике, в компактном виде: ограничения на величину или
производную, ограничения на интеграл или ограничение в среднеквадратичном
(по энергии) и т.д. Из схемы следует, что для формирования
управляющих воздействий необходимо наличие исполнительных механизмов,
осуществляющих механический процесс (движение системы), а также
сенсоров и системы управления, осуществляющих информационный
процесс — формирование управляющих сигналов на основе
информации от сенсоров (см. лекции 1,6).
Формирование управляющих сигналов может иметь
многоуровневую структуру.
1. Линейная комбинация программного и
дополнительного управления при помощи обратной
связи
Пусть задано желаемое движение, которое в дальнейшем будем
называть программным: yn(t), ί € [*о> **)> *о < tk < оо, и
программное управление un(t), реализующее это движение в силу тождества
fyn(i)^/(yn(i),^)),
|un(*)€intfi, t€[<b,*fc).
При этом различают три ситуации:
1) программный управляемый процесс задан в явном виде;
2) программный управляемый процесс задан в неявном виде,
например, как решение экстремальной задачи;
3)программный управляемый процесс неизвестен.
Если программный процесс задан в явном виде, то можно
рассмотреть задачу позиционного управления, заключающуюся в
реализации программного движения yn(t). Для того чтобы осуществить эту
118
постановку, необходимо знать отклонения реального движения y(t)
от программного yn(t). Предположим, что имеется m измерительных
устройств, с помощью которых можно получить первичную
информацию о реальном движении. Обработав эту информацию, можно
оценить текущие отклонения x(t) = y(t) — yn(t) и построить алгоритмы
формирования управляющих сигналов.
Для постановки задачи позиционного управления ограничимся
простейшей моделью, описывающей получение первичной
информации ζ:
* = *(») + «*). (16-3)
где ξ(ί) — инструментальные погрешности измерительных устройств.
Будем формировать управление и как сумму программного и
позиционного управления:
u = un(t) + Au(x,t),
где χ — оценка отклонений χ = у — у", полученная с помощью
алгоритма оценивания, позволяющего обработать первичную
информацию.
Здесь координаты xi{t) описывают первый уровень управления,
координаты у"(£) — второй уровень управления.
В силу наличия как инструментальных погрешностей
измерительных устройств (16.3), так и возмущающих сил и моментов,
действующих на объект, на практике часто возникает именно такая ситуация.
При этом вместо математической модели (16.1) приходится
рассматривать более сложную модель
y = /(y,w,v), (16.4)
где ν — вектор-функция, описывающая влияние возмущающих сил и
моментов.
В связи с наличием начальных и постоянно действующих
возмущений приходится одновременно решать две задачи:
а) задачу нахождения программного управляемого процесса;
б) задачу реализации программного движения объекта (при этом
используются оставшиеся ресурсы управления)
Таким образом, замкнутая управляемая динамическая система
(УДС) имеет двухуровневую систему управления, нижний уровень ко-
119
Выбор
программного
управляемого
процесса
0
·(«)
—-^SH
Δν(£, t'
ш
^2S!!!5" Ьвижущийся! Измерительные
м^?ан"зм | объект | устройства |
Выбор
■—| позиционного
управления
Оценивание Μ
ко
JvW
Рис. 16.2. Двухуровневое управление УДС
торой решает задачу стабилизации программного движения
( х = Ах + ВАи{х, t) + С Αν, Аи = Кх,
х = Ах + ВАи + Κ(Αζ - Нх), Αζ = Ηχ + ξ,
* = %(№)> * = §У.О, * = f(yn), (ΐ6·5)
С = |£(у>п), *"=0.
Соответствующая функциональная схема управляемой
динамической системы изображена на рис. 16.2.
2. Оптимизация программного движения.
Принцип максимума Понтрягина
Для построения программного управления второго уровня, а в
некоторых случаях и для синтеза позиционного управления
первого уровня, будем использовать следующий результат, полученный в
1956—1958 гг. Л.С.Понтрягиным, В.Г.Болтянским и Р.В. Гамкрелид-
зе. Пусть дана управляемая система
У = /(у,«)> у(«о) = У*, «(■)€«, t€[t0,tk). (16.6)
В конечный момент tk система должна попасть на некоторое гладкое
и без особых точек многообразие Μ с Яп, (y(tk) € Μ), причем это
первый момент, когда достигается многообразие М.
Предположим, что:
1) система управляема относительно М, т.е. многообразие
достижимо;
2) существует оптимальное управление и°(·) € KC[to,tk],
доставляющее локальный минимум функционалу J(u) = <po(y(tk)):
J(l4°)= ?Ш1 Л1*)">
120
3) многообразие М гладкое и без особых точек: Μ = fai(y(tk) =
О, г = l,...,m}, rank|||^|| = т. Функции /, tpif г = 0,1,...,т
непрерывно дифференцируемы по своим аргументам.
Если известна тройка {у°(·), w°(·), [*o> *£]}> где w° — оптимальное
управление, у0 — соответствующая этому управлению траектория и
[ίο, tf.] — интервал времени, на котором это соответствие реализуется
в виде тождества y°(t) = /(у°(£), u°(t)), то можно выписать
сопряженную систему
к системе уравнений в вариациях
ЛЦ№^)Д„, (.6.8)
и функцию Понтрягина Я = ^т/.
Теорема 20. Если {у°(·), и°(·), [£о> *°]} — оптимальный
управляемый процесс, то существует ненулевая пара {λο > 0,^(·)}
такая, что
1. тюс J7(^(t)f y°(*)f u) = J7(^(*)9 i^(*)ft*°(*)),
u€MCRa
Vi € Г С [£o,*ife]> где Т — множество точек
непрерывности управления u(t).
Это условие означает, что максимум достигается на
оптимальном управлении (условие максимума);
2- ΨΨΙ) + Ьод<Ро^удуН^ -L Μ — условие трансверсальности
в точке у0(tk) € Μ;
3. H(t) = H(ip(t),y°(t),u°(t)) = 0 — условие
стационарности гамильтониана (t € [£°,£°]).
Теорема дает только необходимые условия экстремума, но, тем не
менее, во многих случаях позволяет произвести отбор управлений,
подозрительных на оптимальность.
3. Два уровня управления для сингулярно
возмущенных систем
Задачу формирования управляющих сигналов многоуровневой
управляемой системы будем рассматривать для трех вариантов:
1. Автоматических управляемых систем;
2. Биологических управляемых систем;
121
3. Полуавтоматических управляемых систем.
При полуавтоматическом управлении движением возникает еще
одна возможная схема двухуровневого управления. Предположим,
что второй уровень управления представлен человеком (пилотом). Он
осуществляет управление в реальном времени, используя
собственные данные о движении объекта. Первый уровень (автоматического)
управления вступает в действие в экстремальной ситуации либо
автоматически, либо по сигналу от верхнего (второго) уровня.
Динамическая система (после проведения процедур нормализации
и обезразмеривания) состоит из двух подсистем вида:
dz
μ-^=φ{ζ,ν,ν,ι), z(t0) = α, иг(·) €Wb (16.9)
^=/(s,V,tia), y(to)=b u2(-)€U2, (16.10)
где 0 < μ = const < 1.
Система вида (16.9), (16.10), с малым параметром μ при
производной, принадлежит к классу сингулярно возмущенных систем.
Векторная переменная называется медленной, а переменная ζ —
быстрой.
Выбор управления ιΐχ(·) е U\ позволяет реализовать синтез
нижнего (базового) уровня управления и одновременно выполнить
условия теоремы А.Н. Тихонова.
Примеры:
1) Управление торможением автомобиля: управление и2
реализуется водителем, управление и\ — антиблокировочной системой.
2) Управление спуском Л А с помощью руля высоты и\ и тяги
двигателя^.
Управление щ выбирается в виде линейной комбинации
основного и\ и дополнительного Au± управлений. Основное управление
выбирается из условия существования единственного корня уравнения
(16.11) при фиксированном значении координат второй подсистемы
Φ,ν,Αν)) = о =► ζ° = φ-ЪАШ- (16.11)
Дополнительное управление Ащ строится как отрицательная
обратная связь, позволяющая асимптотически по быстрому времени τ = ^
стабилизировать положение равновесия ζ° присоединенной системы:
^ = ψ(ζ, у, ωχ (у, Az)), (16.12)
122
Этот результат опирается на доказанную А.Н. Тихоновым (1952г.)
теорему о поведении решений системы дифференциальных уравнений
типа(16.9),(16.10)
μ-^ =<p(z,y,t), z(t0)=z*, t€[<o.ifc], z€&,
^ = f(z,y,t), y(t0) = y\ y€Rm, <16ЛЗ>
0 <μ = const <C 1, η = I -f m.
При μ = О получим вырожденную систему
dy
{
dt=f(z,y,t), y(t0)=y*.
{
При замене времени t = μτ и μ = 0 получим присоединенную
(быструю) систему
^ = ν(*,ν,*), *(*>) = Λ (1614)
,f(z,V,t)=0.
В системе уравнений (16.14) величины y,t рассматриваются как
постоянные параметры.
Теорема 21 (А.Н. Тихонов, 1952). Пусть выполнены пять условий
в открытом выпуклом подмножестве (ζ, у, t) € D с Я'+т+1;
/. функции φ(ζ, у, £), /(ζ, у, t) аналитичны в D по всем пере-
менным,
2. для присоединенной подсистемы уравнение φ{ζ, у, £) = 0
относительно ζ имеет изолированные корни (точки по-
коя) — ζ° = φ'1 (у, t) (при фиксированных у, t);
3. все точки покоя z^ асимптотически устойчивы;
4. начальные условия ζ* принадлежат области
притяжения точки покоя ζ°;
5. функция /(φ'1^, t), у, t) аналитична в В по у, L
Тогда найдется такое μο, что при 0 < μ < тщ решение
системы (16.9),( 16.10) существует, единственно и удовлетворяет
следующим соотношениям:
lim у(*,μ) = y(t) Vt € [*o,*), t < tk;
lim z(t,μ) = z(t) Vt € (t0,t\.
μ-+0
123
Персональная
навигационная
система и
система
управления
2-й уровень
и2
иг
Исполн. мех. 2
Исполн. мех. 1
Система
управления
1 -й уровень
Движущийся
объект
Сенсоры
Рис. 16.3. Двухуровневое управление сингулярной системой
Таким образом, система двухуровневого полуавтоматического
управления имеет функциональную схему (см. рис. 16.3) отличную от
схемы, представленной на рис. 16.2.
Возможно также и большее количество уровней управления,
образующих иерархическую систему управления движением.
Например, система управления тестирующим динамическим стендом-
тренажером имеет три уровня.
124
Лекция 17
Двухуровневое управление
планированием ЛА
Будем считать, что летательный аппарат (ЛА) представляет собой
твердую оболочку, имеющую плоскость симметрии, совпадающую с
вертикальной плоскостью. Центр масс (ц.м.) Л А расположен на
продольной оси и не меняет своего положения в процессе полета. При
выгорании топлива создается реактивная тяга Р, которая
направлена вдоль продольной оси ЛА. Тогда можно отдельно рассматривать
боковое движение Л А и движение в вертикальной плоскости. Для
полетов в районе аэродрома пренебрегаем вращением и сферичностью
Земли.
Уравнения движения центра масс в вертикальной плоскости
AMV τ7* Т-*1Ч ^
(~dT + [Ω х ν]) = F
спроектируем на оси скоростной системы координат Mx'y'z', где
проекции вектора скорости ц.м. имеют вид V = (V, 0,0)Т, а угловой
скорости аппарата Ω = (0,0,0)Т. Тогда уравнения движения ЛА в
вертикальной плоскости примут следующий вид:
MV = Pcosa - X(V,α,) - MgsmO,
MV9 = Ρ sin α + Υ(V, α) - Mg cos 0,
ψ = Ω,
• , ч (17.1)
ΛΩ = Αί,(ν,α,Ω,ί)ι
Μ = -ί/, P = vU
Η = V sin0,
где Η — высота полета, V — скорость ЛА, Μ — его масса, Ω —
угловая скорость поворота корпуса ЛА, α = φ — θ — угол атаки, φ —
угол тангажа, θ — траекторный угол, Jz — момент инерции корпуса
относительно z, Mg — сила тяжести, Χ, Υ — составляющие
суммарной аэродинамической силы, Μζ — аэродинамический момент, ν —
скорость истечения частиц из сопла двигателя, U — секундный
расход топлива, δ — отклонение руля высоты.
125
-Mg
Рис. 17.1. Полет ЛА в вертикальной плоскости
В рассматриваемом случае управляемый объект имеет два
управляющих воздействия — величину тяги Ρ и отклонение руля высоты
δ.
Аэродинамические силы X и Υ вычисляются согласно
соотношениям
oV2 oV2
Cy(a) = c°y + c£a, cx(a) =c°x + Bc2y(a)
где S — площадь крыла, ρ — плотность воздуха, Сх^Су —
безразмерные аэродинамические коэффициенты.
Рассмотрим режим планирования ЛА, при котором справедливы
допущения:
а) Р = 0 — планирование осуществляется без тяги;
б) θ < 0 — ЛА все время снижается;
в) изменение высоты сравнительно невелико, поэтому д,д =
const;
г) при вычислении аэродинамических коэффициентов можно
пренебречь слагаемыми с° и BcJ;
д) аэродинамический момент можно представить как
Mz = MZ(V, α, δ) = -^Sb(msJ + m?a),
где b — расстояние от ц.м. до центра давления ЛА, πιδζ > О, т£ > О
— аэродинамические коэффициенты.
126
Тогда уравнения (17.1) упрощаются
( MV = -X(V, а) - Мд sinfl,
MV0 = Y(V,a)-Mgcose,
φ = Ω, α = φ — θ,
JzU = Mz(V,a,S)
Построим двухуровневую систему управления планированием Л А,
разделив его движение на медленные и быстрые составляющие,
используя подход, изложенный в лекции 16. Покажем, что в нашем
случае управляемая система является системой тихоновского типа.
Рассмотрим последовательные этапы проектирования
двухуровневой системы управления по методике Тихонова [9].
1. Нормализация и обезразмеривание уравнений
движения
Предположим, что рассматриваемый аппарат принадлежит к
классу тяжелых летательных аппаратов, для которых характерное
время Гг фугоидных колебаний центра масс порядка Г2 « 1мин.
Пусть характерная скорость планирования К = 300 м/с,
характерное ускорение ц.м. связано с ускорением свободного падения и
дТ* = К, откуда характерное время спуска Г* « 30 с.
Характерное время движения корпуса вокруг центра масс
получим, выписав уравнения колебаний Л А вокруг центра масс в
горизонтальном полете с постоянной скоростью (при θ = 0, δ = 0 )
г .. m<;gV?Sb Λ .·2η
]ζψΛ·-^γ φ = 0, & φ + ω%φ = 0
2JZ
Выберем Τ* = * при га" « 1. Параметр Τι представляет
характерное время вращательного движения Л А (1/6 периода собственных
колебаний корпуса вокруг ц.м. и для нашего аппарата ΤΊ « 1сек).
Следовательно, выполнены соотношения ΤΊ < Т* « ^Г2.
Положим малый параметр равным μ = ^ < 1.
Считаем, что при планировании выполняется соотношение М*д =
^t£-S, выражающее баланс сил, действующих на ЛА ( при c!J = 1)).
Введем новые (безразмерные) переменные:
V = Viv, Ω = Ω*ω, Μ = гаМ*, Г = ЙГ*,
где Ω* = ±.
127
Нормализованная система уравнений примет вид
dv
άθ п cos θ
— = с" αν
dt y υ
μ^ = -(πιζ*α + πιδζδ)ν2
(17.3)
άφ
Начальные условия для системы (17.3) следующие: начальная
скорость v(to) = vq « 1, наклон траектории 0(£о) = #о (|0о| < 1),
угловая скорость корпуса ω(ίο) = ь>о (<*>о » 0), наклон корпуса v?(*o) = ψο
(0 < <^о < 1).
Отметим, что осталась всего одна управляющая переменная —
угол отклонения руля высоты δ.
2. Анализ присоединенной системы и синтез
алгоритма стабилизации
Рассмотрим быстрое (компьютерное) время
t
τ =
t € [0,tfc], tk < 1, τ € [0,rfc], rfc -> +00, при/х -> 0.
Присоединенная система запишется в виде
άω
dr
άφ
θ-φ.
= ω,
α
При ее анализе фиксируем параметры 0, υ = const, т.е.
приходим к линейной системе. Для применения теоремы Тихонова
должна существовать изолированная точка покоя, причем асимптотически
устойчивая. В точке покоя выполнены равенства φ = φ*, ω = О,
rn^OL + πιδζδ = 0, где некоторый угол φ* = φ+ (υ, θ).
Сконструируем управление в виде δ = δ0+Αδ, где Jo —
программное управление, а Δδ — корректирующее, в виде обратной связи по
быстрым переменным.
Допустим, что имеется точная информация от датчиков ζ\ — ω,
Ζ2 = φ. Тогда Αδ = k\(ip — φ*) -f Λ^ω, где φ* — соответствующая
точка покоя.
128
В покое m£(<p* - θ) + т% = О, откуда δ0 = -$(¥>*-0)—
изолированный корень.
Как будет показано в лекции 20, подбором fei, &2 можно, например,
добиться асимптотической устойчивости уравнений в отклонениях от
точки покоя присоединенной системы ( в быстром компьютерном
времени), а также оптимальности функционала
оо
/
го
(Αφ2 + ω2 + Αδ2)άτ -> min,
где Αφ = φ — φ+, ω — отклонения от точки покоя.
По теореме Тихонова в начальный момент точка (ωο,<ρο) должна
принадлежать области притяжения точки покоя. Это условие
выполнено, поскольку присоединенная система линейна. (При этом φ*(θ, υ)
— пока неизвестный нам угол тангажа, который определяется на
верхнем уровне управления.)
3. Редукция к вырожденной (упрощенной)
системе с помощью теоремы Тихонова
Вырожденная система описывает поведение медленных
переменных и имеет вид
<& 0-2 -Я ~/, \
— = -CIX - S1I10, V(t0) = V0,
άθ - cos0 - (17.4)
φ = ψ*(θ,ν), ώ = 0.
Согласно теореме Тихонова выполнено
lim0(*,/i) = 0(t) Vt€[to,**],
lim v(t, μ) = ΰ(ί) Vi € [to, tk],
lim ω(ί, /χ) = u(t) Vi € (t0, **],
lim^(i,^) = ^(i) Vi€(i0,ifc],
следовательно, решения вырожденной системы близки к решениям
полной системы уравнений.
В простейшем случае программное движение для медленных
переменных выберем следующим: 0 = 0* < 0 и ν = ν* — свободное
129
планирование с постоянной скоростью и постоянным углом
снижения. Отметим, что программное движение реализуется точно, если в
начальный момент выполнено v(to) = ν*, 0(£о) = 0*.
3.1. Построение управления для вырожденной системы и
анализ устойчивости программного движения (в реальном
времени). Движение с постоянной скоростью ν* возможно, если sin0 =
—c£v*> откуда 0* = — arcsincjjv2.
Выберем балансировочный угол тангажа из соотношения
COS0*
Обозначим α* = φ* — 0*.
Проверим, что программное движение реализуемо, когда имеются
начальные возмущения v(to) ф ν* и 0(£п) ф 0*. Для этого должны
выполняться условия устойчивости балансировочного решения
вырожденной системы.
Запишем уравнения в отклонениях от программного движения
—- = -2elvmAv - cos0*A0
at
d&0 α/ л \л . COS0* Α Sin0*A/J
-Ίτ- = <ζ(φ* - θ*)Δν 4- —2~Δν - β£ν*Δ0 + Δ0
откуда
—τ- = —2<£νφΔν - cos0*A0
<ίΔ0 /Λ cos0*4A .sinfl* а ЧАЛ
^Г = №♦ + -^-)Δ« + <— ~ ^)Δ·
Найдем корни характеристического уравнения системы
/ -2c!Jv* - λ - cos0* \
.«г /л ω η, sin0*4x . n cos02
λ2 4- (2c°xv* + c£ti* -)λ + cos0*c?a* + —^4-
\ χ у υ^ у υ2
+2с^(с^.-^) = 0
Так как с£ ν* — ^^ > 0 (0* < 0), то для устойчивости системы
достаточно, чтобы выполнялись неравенства:
Л η ,ν sin0*
2c°xv* 4- c£v* > 0
cos Θ+Cy a* > 0
130
Первое неравенство выполнено, поскольку ν* > 0, все
аэродинамические коэффициенты положительны, а 0* < 0.
Второе неравенство выполнено, если а* > 0, т.е. угол атаки
положителен. Тогда одъемная сила, действующая на Л А положительна.
Поскольку балансировочный угол атаки в нашей задаче положителен,
система уравнений в отклонениях от программного движения
вырожденной системы устойчива, и для вырожденной системы не
потребовалось формировать дополнительное управление верхнего уровня.
В действительности процесс планирования происходит на
ограниченном интервале времени, поэтому необходимо провести
исследование отклонений и оценить точность управления (величину отклонений)
на ограниченном интервале времени.
Таким образом, планирование возможно без тяги двигателя. Для
его осуществления необходимо знать 0*, зависящий от ν*, а также
текущие угол тангажа φ(ί) и угловую скорость корпуса ω(ί).
131
Лекция 18
Классическая вариация и необходимое
условие слабого локального минимума
Формула приращения функционала для задачи с
фиксированным временем и свободным концом
траектории
Рассмотрим частный случай задачи оптимального управления
системой
У = /(у,«), у(*>) = У*, (18.1)
когда время движения фиксировано t € [to, tk] и правый конец
траектории свободен Μ = Rn.
Предположим, что оптимальное управление удовлетворяет
условиям
«°(·) € Сг[и»гк], u°(t) € into с R8 (18.2)
и функционал J (и) = <po(y(tk)) достигает минимума.
Процесс {y(t),u(t), [to,tk]} называется допустимым, если
управление и(·) удовлетворяет условиям (18.2), а траектория у(·) —
условиям (18.1).
Обозначим {y°(t),u°(t), [to, tk]} — оптимальный процесс.
Введем норму в пространстве С1 следующим образом
||у||С1 =шах{||у||с, ||у||с}
где ||у||с = max |y(t)|.
te[t0itk]
Определение 19. Процесс {y°(t),u°(t),[to,tk]} доставляет
локальный слабый минимум функционалу J(u), если
существует δ > О такое, что для любого допустимого процесса
{y(t),u(t), [ίο,**]}, удовлетворяющего условию ||у(·) - у°(-)||с* <
δ, справедливо неравенство J(u) > J(u°).
Такой процесс будем называть локально оптимальным.
Запишем полное приращение управления в виде Au(t) = εδυ,(ί),
где вариация управления представляет любые функции δη(·) €
132
С1 [ίο,Ы> a величина ε выбрана достаточно малой, чтобы
выполнялось условие
и°(·) + е*|(·) € U = {«(·) € σ^ίο,ί*] | u(t) € Ω С R" Vi € [i0)ifc]}·
Соответствующее приращение функционала определяется как
Δ J(u°) = J(u° + Аи) - J(u°) =
= dMl°y{tk))Ay(tk)+o1(\Ay(tk)\). (18.3)
Рассмотрим функцию Понтрягина Я = фт f, где ψ —
сопряженные переменные, удовлетворяющие системе
Ф=.(^ш^шуф.
Положим ip(tk) = — (аУ°(* (*»))) (позднее докажем, что в данном
случае в формулировке принципа максимума выполнено условие Ло >
О, и в силу однородности сопряженной системы можно положить Ао =
1). Тогда, поскольку Ay(to) = 0, из (18.3) следует
AJ(u°) = -il>T(tk)Ay(tk) + i/>T(t0)Ay(to) + δι(|Δν(ί*)|) =
to to
Преобразуем второе слагаемое
фтАу = фт/(у0+Ау,и0+Аи)-фт/(у0,и0) = Н(ф,у0+Ау0,и°+Аи)
-Н(ф, у0, и0 + Ли) + Щф, у°,и° + Ли) - Щф, у°, и0) =
= ^(ф, у°,и° + Аи)Ау + АиЩф, у°,и°) + δ2,
где АиЩф, у0, и0) = Щф, у°, и0 + Аи) - Щф, у0, и0).
Подставим полученное выражение в (18.4), учитывая что φ явно
не зависит от у и поэтому фт^ = ^%^- = Щ. Получим
tfc
aj(u°) = -[(- i>Tj-*y + ψ(η° + Au)Av+Д.я(«°) W
to
133
tk tfc
to to
tk
+ АиН(ф^У)\м - j o2(\Ay{t)\)dt + oi(|Ay(tfc)l) (18.5)
формулу приращения функционала.
Необходимое условие слабого локального
минимума
В дальнейшем нам потребуется теорема о непрерывной
зависимости решений системы обыкновенных дифференциальных уравнений
(ОДУ) от параметра.
Рассмотрим уравнение в вариациях
d(Sy)
dt
-№>)*♦№>- *>=°·
Теорема 22. Если правая часть ОДУ гладкая, то приращение
траектории Ау (с точностью δ(ε)) выражается через
вариацию Ау = еду -f δ(ε) (Аи = εδη).
Поскольку и0 € int Ω, то можно записать
ЯН
AuH=^Au + o3(\Au(t))\).
Аналогично
дАиН &Н . , _ ... /Л...
Подставив Ау в формулу приращения функционала ( учитывая, что
Au(t) = εδη) и отбрасывая члены второго порядка малости по ε в
(18.5), получим
tk
AJ(u°) = -ε f ^Sudt + δ(ε)
to
В функциональном анализе доказывается, что если для
функционала J {и) существует производная по направлению для любого
направления 6и, то существует вариация Лагранжа
ε-+0
134
^(Ц0) = Пт^0 + ^^(Ц°).
В нашем случае выполнено AJ(u°) = eSJ(u°) + ο(ε), т.е. найдена
вариация Лагранжа
tk
SJ(u°) = -f^Sudt. (18.6)
Так как по предположению {y0(-),u0(-),[£o>*fc]} оптимальный
процесс, то AJ(u°) > О, откуда следует
г-
- -Sudt < 0.
ди
to
Но точка и0 внутренняя, поэтому вариации δη и —5и допустимы и
необходимое условие для выполнения неравенства таково:
м(тим,им)_в ¥te[t0i(l]. (18.7)
Это равенство представляет собой необходимое условие слабого
локального минимума.
Покажем, что этот результат следует из формулировки принципа
максимума Понтрягина (ПМП), приведенной в лекции 16.
Напомним формулировку ПМП. Если {y°('),w0(·), [*о>*°]} —
оптимальный процесс, то существует нетривиальная пара {λο > 0, ψ{-)}
такая,что
1. max НЦ>, у°,и) = Н(ф, у0, и0) Vt € Г С [to, tg];
и(*)бП
2. Ψ(4) + λ0(а*°у*»)т ± Μ в точке у°(*°);
3. H(t) = Я(^(*),у°(*),14°(*)) = Опри* € [to,**].
Приведем наш случай к виду, о котором речь идет в общей
формулировке, данной на лекции 16. Для этого перепишем систему (18.1) в
виде
y=f(y,u), 2/(*ο) = ίΛ
Уп+1 = 1, 2/η+ΐ(*θ) = *0·
Пусть ут = (у1\уп±г) — расширенный вектор состояния. Тогда
можно записать у = /(y,w). Функция Понтрягина расширенной
системы имеет вид Η = φΊf = фт f -f ψη+ι =Я + ψη+ι-
Сопряженная система выписывается как
ι
'-©''-{'■"ф''
Фп+1 = 0
135
Докажем, что задача невырождена. Допустим противное, т.е. λο = 0.
Терминальное множество Μ = {yn+i -<jfe = 0},Mc ϋη+1
представляет собой плоскость, параллельную span{ei,..., еп}, т.е. в
расширенном пространстве она параллельна (71,72, · · ·, 7п> 0) = (7,0).
Рассмотрим условие ортогональности
(^ + λο(^)Τ) 7 + V>n+i-0 = 0.
Поскольку 7 произвольное, то ip(tk) = — λο(^) . Если λο = 0, то
ф^к) = 0. Из условия ii(tk) = 0 следует ^n+i(£fc) = 0, откуда в
силу однородности сопряженной системы φ = 0, что противоречит
принципу максимума.
Следовательно, λο > 0 и можно нормировать λο = 1. Тогда из
условия 1 теоремы ПМП следует (18.7) как необходимое условие
слабого локального минимума.
136
Лекция 19
Лагранжева форма необходимых условий
оптимальности
1. Задача Больца в вариационном исчислении
Пусть кривая y(t), t € [to,ik], y(to) = у* минимизирует
функционал
J = J /o(», V)dt + l(y(tk)) = J L(y, y)dt + l(y(tk)),
to to
где лагранжиан L(y, у) и терминант /(y(tfc)) — гладкие функции.
Представим исходную задачу как задачу оптимального
управления с фиксированным временем и применим принцип максимума из
предыдущей лекции.
2/о =/о (у, и) уо(*о) = 0
У = и 2/(*о) = У*.
{
В расширенном пространстве состояний у = (уо,у)т функционал
можно представить как терминальный
J = <Po{y(tk)) = yo(tk) + l(y(tk))·
Ограничения на область значений управления отсутствуют, т.е.
Рассмотрим функцию Понтрягина Я = ф1f = -0о/о + Фт^
Учитывая, что
V_/O df0/dy\
ду [ρ ο ;■
выпишем сопряженную систему
ι
; ,0/ονΤ, (Ι91>
Поскольку из условия трансверсальности следует
137
получим *) = -1, а фт{1к) = -ЩШ.
ду
Тогда Я = -/о (у, u) + VTu.
Согласно условию (18.7) на оптимальном решении выполнено
равенство
дй(№,№и°{*))
ди
Следовательно
0.
ди ди ^ψ ϋί
откуда φ = ("я"") · Подставим полученное выражение для φ в
(19.1), заменим /о = L и транспонируем. В результате получим
уравнение Эйлера
Ь* = ЬУ- (19.2)
Из условий трансверсальности получим краевое условие для
уравнения Эйлера
w-rngu „ад
Из условия станционарности гамильтониана на оптимальном
решении Η = const следует интеграл энергии: функция E(t) = L^y —
L = const — постоянна на оптимальном решении системы.
Действительно, поскольку /о = L, а и = у, получим на оптимальной
траектории
Η = фти - /0(у, и) = L0 -L = E(t) = const.
2. О связи вариационных принципов механики с
принципом максимума
Пусть дана система материальных точек с массами га* и
координатами гi = (yf, yj, yi), г = 1,..., п. Кинетическая энергия системы
равна
1 п
2«
а потенциальная — задана функцией i7(ri,...,rn). Из принципа
Гамильтона—Остроградского следует, что движение системы проис-
138
ходит по экстремалям функционала действия по Гамильтону
S= JL(r,r)dt. (19.4)
Лагранжиан имеет вид L(r,r) = Τ — U, а моменты времени £(ь*ь а
также начальные и конечные условия фиксированы.
Следовательно, выполнено уравнение Эйлера (19.2) для
функционала действия (19.4):
dL-L
которое представляет собой уравнения Лагранжа второго рода для
системы материальных точек.
Таким образом, здесь уравнения движения получены из принципа
максимума как необходимого условия слабого локального минимума
для функционала действия по Гамильтону.
Получим теперь уравнения Гамильтона. Обозначим φι = L^ =
ШгГг — импульсы материальных точек системы.
Функция Понтрягина Я = X) Vtn — T + U — Τ + U
представляет полную энергию системы и связана преобразованием Лежандра с
функцией L.
Уравнения Эйлера в канонической (гамильтоновой) форме
принимают вид
Таким образом, в случае потенциальных сил, уравнения Лагранжа
второго рода (их гамильтонову форму) можно получить из принципа
максимума Понтрягина.
3. Лагранжева форма условий оптимальности
Лагранжеву форму принципа максимума Понтрягина получим на
примере задачи управления при фиксированных t^t^ y(to),y(tk)
V = Hv,u) (19.5)
«(·) €U = {«(·) €KC[t0)tfc] Iu(t) € Ω с Я3} (19.6)
tfc
J(u)= [ f0(y(t),u(t))dt-> min (19.7)
J u()€U
to
139
В соответствии с принципом Лагранжа [7] составим функционал
Лагранжа £(у, щ ψ, λ0) = λ0 f£ /о dt 4- /£ ipT(y - f)dt, где λ0 > 0,
где \ο>ψ(ί) — множители Лагранжа, поскольку математическую
модель (19.5) можно рассматривать как ограничение типа равенства
y-f(y,u)=Q.
Пусть {у°(£), u°(t)} — оптимальный процесс на [ίο, tk].
Рассмотрим Лагранжиан L = Ао/о+^т(2/—/(у, и))· Ему
соответствует расширенная функция ПонтрягинаЯ = ipTf—\ofo = фту—1,.
Для функционала С при фиксированном u°(t) выпишем условие
стационарности по траектории у(·):
to
(19.8)
Здесь x(t) = y(t) — y°(t) — вариация траектории y°(t).
Произведем замену линейного оператора (x(t) — A(t)x(t)), где
^ _ df(v (^,ц (*)) на сопряженный ему оператор (-ψ(ή—Ατ(ί)ψ(ί)).
В соответствии с определением сопряженного оператора (д, Рх) =
(Р*0, х) (здесь скалярное произведение (,) означает линейный
функционал, а Р* — сопряженный оператор) покажем, что выполнено
равенство
tk *fc
fipT(t)(x(t) - Ax(t))dt = f (-i>{t) - AT(t)ip(t))Tx(t)dt.
to to
Действительно,
tk
J (ψτχ - ψτΑχ + ψτχ 4- tpTAx)dt =
to
tk
= -[ά(<ψτχ) = 4>T(tk)x(tk) - tpT(t0)x(to) = 0.
Перепишем условие стационарности (19.8) в виде:
J [AoWtt>>"0(*)) _ m + ^(t))T]x(t)Λ = 0 (199)
to
140
Оно выполнено при любых х(-) € C[t(h*fc] с конечными условиями
x(to) = x(tk) = 0. Учитывая, что ψ{ί)τ = Ly, из (19.9) получим в
лагранжевой форме
Tt(Lv)-Lv^^--{ Q-y J ^+4 dy ) '
(19.10)
что соответствует гамильтоновой форме
^_ dH{y\t),u\t)Mt))T (1911)
ду
Поэтому в литературе по оптимальному управлению динамическими
системами употребляются два названия для системы (19.10), (19.11):
— сопряженная система дифференциальных уравнений, что
соответствует дифференциальному сопряженному оператору;
— уравнения Эйлера (что является расширением известных в
теоретической механике уравнений Лагранжа второго рода для
голономных консервативных систем).
Перейдем теперь к формулировке принципа максимума в
лагранжевой форме для задачи оптимального управления,
сформулированной в 16-ой лекции, т.е. оптимального прихода на гладкое
многообразие Μ = {<fi(y(tk)) = 0, г = l,...,m rank 9φΑν< = т} в смысле
терминального функционала Маера J = <fo(y(tk))·
Здесь лагранжиан задачи имеет вид L = фт{у — /(у, и)), терми-
нант — l(y{tk)) = Σ*1ο ^*'а Функция Лагранжа —
^A0,...,Am,*fc,^,y,u)= I Ldt + l(y(tk)).
to
Без доказательства сформулируем необходимые условия
оптимальности в форме Лагранжа (доказательство можно найти в [7]).
Теорема 23. Если {у0(-),гл°(·),!^^!^} — оптимальный
процесс, то существуют множители Лагранжа Ao,Ai,...,Am и
ψι,.,.,ψη не все равные нулю, такие, что выполняются
условия:
а) стационарности по у(-):
-il. + L.-b «i-(^)\
141
б) условия трансверсальности
в) стационарности по £*:
Ьи = 0 =► i„!/0(ig) = О =► 4T(tl)f(y0(tl),u0(t0k)) = WD = 0;
г) минимума по и лагранжиана L = фТу — Н:
rmnL(y°(t),y°(t),u) = L(yO(t),y0(t),u°(t)) *
& maxH(1>(t),y°(t),u) = Η(φ(ί),υ0(ί),η°(ί));
д) неотрицательности множителя: λο > 0.
142
Лекция 20
Оптимальная стабилизация при
неограниченных ресурсах
1. Управление линейной системой с квадратичным
функционалом качества на конечном интервале
времени
Рассмотрим уравнения в отклонениях от программного движения
χ = Ах + ВАи, x(to) = а ф 0, и = ир + Аи
где χ = у - у*>, А = %\у=уР, В = f£|u==uP. В дальнейшем дая
простоты будем считать ир = 0.
Функционал качества имеет вид
J(u) = / (xTGx + uTNu)dt -> min
to
Здесь G = GT > 0, N = NT > 0 — симметричные матрицы, т.е.
поставлена задача минимизации отклонений и ресурсов управления на
отрезке времени t € [to, t*], to < tk < οο.
Обозначим оптимальное решение задачи и°(·) € KCl[to, tk]-
Перепишем задачу в в виде
х0 = xTGx 4- uTN% xo(to) = 0,
χ = Ах-\- Вщ x(to) = χ*.
{■
Введем расширенный вектор состояния χ = (xq, x)t и запишем
функционал в виде J = y?o(£(*fc)) = ^o(*fc).
Рассмотрим функцию Понтрягина Η = ipo(xTGx + uTNu) +
^т(Ас + #u) и сопряженную систему
Краевые условия (трансверсальности) для сопряженной системы
имеют вид фа„) = -Ао(^§^)Т. Но ^ = (1,0,...,0).
143
(
Нормируем λο = -, тогда ^о = —ζ, а Ф(1к) = 0. Следовательно,
Δ Δ
сопряженную систему можно записать как φ = —Атф 4- Gx.
Необходимое условие оптимальности имеет вид
ЯН
^-=0 Vt€Mfc].
Из условия оптимальности следует —vJN+ijf^B = 0. Так как N > 0,
то
и° = Ν-χΒτψ.
Будем искать решение сопряженной системы в виде φ(ί) = —C(t)x,
где симметричная матрица С е Mnxn(R) > 0.
Тогда и0 = -N~1BTCx и
φ = -Сх-Сх = -Сх-С(Ах + Ви) = -Сх-С(Ах-ВМ^гВтСх).
С другой стороны, согласно сопряженной системе φ = АтСх 4- Gx,
поэтому
(АТС + G)x = (-£ - £А + CBN^BTC)x.
Поскольку χ — произвольное решение системы, получим
матричное уравнение — уравнение Риккати для управляемой системы
С + СА 4- АТС + С - CBN-XBTC = 0, £(**) = 0.
Заметим, что краевое условие этого уравнения задано на правом конце
t = tk.
Таким образом, осуществлен оптимальный синтез системы
стабилизации, так как функционал качества является строго выпуклым и
управляемая система линейна. Замкнутая оптимально
стабилизируемая система имеет вид:
х = (А- BN~1BTC)xi x(t0) = α,
С = -СА - АТС -G + CBN~lBTC, C(tk) = 0.
2. Стационарные системы при бесконечном
времени управления
Рассмотрим случай, когда система стационарна, а время
управления бесконечно, т.е. tk = оо, А, В, (?, N = const. В этом случае,
вообще говоря, может быть J(u) -> оо.
Добавим условие управляемости (см. лекцию 3):
rank[B, АВ,..., Ап~гВ] = п, А, В = const.
144
Тогда управляемая система стабилизируема, следовательно,
существуют управления и = Кх такие, что \x(t)\ < Ce~xt и
функционал J(u) конечен. Следовательно, поставленная задача имеет смысл
и верна следующая теорема.
Теорема 24 (Калман, 1962). Если система управляема, то
существует lim C(to) = Со > 0, где Со — единственное решение
tfc — to—>оо
алгебраического уравнения Риккати
С0А + АТС0 + С - CoBN-xBTCo = 0. (20.1)
Покажем, что при и0 = — N~~XBT Сох система экспоненциально
устойчива.
Рассмотрим функцию Ляпунова V = хтСох. Тогда
= хт((АС0 + £о^т) - 2CoBN-lBTCo)x =
= хт ( - CoBN^BTCo - G)x =
= -xTGx-uOTi\fa°<0,
(20.2)
так как по условию G > 0, N > 0. Таким образом, производная
функции Ляпунова в силу системы отрицательно определена, откуда имеет
место асимптотическая устойчивость системы.
Вычислим оптимальное значение функционала. Поскольку и0 =
-N-1BTCox, из (20.2) следует
оо оо
J(u°)= f{xrGx + u°TNu0)dt= f(xTGx+
to to
оо
+xTC0BN-1BTCox)dt = /-^ = V(t0) - V(oo) = V(t0).
to
Следовательно, J(u°) = V(to) = ж(£о)тА)#(*о) и получена явная
зависимость оптимальной величины функционала от начальных
условий.
Теперь найдем оценку сверху для самих отклонений. Из (20.2)
следует
Щ- = -xTGx - u0TNu° < -xTGx < 0,
at
т.к. матрицы G > 0, N > 0 по условию.
145
Известно, что существует ортогональное преобразование χ = £ξ,
приводящее положительно определенную квадратичную форму к
диагональному виду,
η
где λ» > 0 — собственные значения матрицы G. Тогда получим оценку
Amin||x||2<xTC?x<Amax||x||2.
Аналогично для квадратичной формы
/iminlWI2 < ХТС0Х < /imaxlkll2·
Используя эти неравенства получим
% < -xrGx < -Amta||xf < -^ϋϋ-ν,
Ο,Ζ Mmax
откуда следует
V{t)<V{to)exp(-^{t-to)
Ho
||χ(ί)||2 < -W < taN<to)||vfc*«-4
Pmin Pmin
потому верно неравенство
||*(*)|| < л/^|*(*о)|е-ЙЙг(*-«»), (20.3)
у Mmin
откуда следует экспоненциальная устойчивость нулевого решения
замкнутой системы с оценкой (20.3).
•
146
Лекция 21
Квадратичная стабилизация и линейные
матричные неравенства
Рассмотрим теперь другой подход к решению поставленной в
предыдущей лекции задаче. Мы получили, что для линейной
стационарной управляемой системы
х = Ах + Ви (21.1)
и критерия качества
оо
J = f(xTGx + uTNu)dt, G = GT > 0, N = NT > 0 (21.2)
управление в виде обратной связи и = — N"xBTCoxy где £0 —
решение алгебраического уравения Риккати (20.1), стабилизирует
замкнутую систему (21.1), а функция V(x) = xtCqx является для нее
функцией Ляпунова, и вдоль траекторий системы функция
оо
V(t)= ({xTGx + uTNu)dt
t
убывает.
Теперь попытаемся, не связываясь с уравнением Риккати, найти
матрицу С = Ст > 0 такую, чтобы квадратичная форма V = хтСх
была функцией Ляпунова для замкнутой системы (21.1) с
управлением и = -М-гВт£х
х = (А- BN~lBTC)x = Akx. (21.3)
Производная функции Ляпунова в силу системы удовлетворяет
условию
V = iv(x) = хт(САк + AjC)x < 0,
at
что эквивалентно выполнению матричных неравенств
CAk + AjC<Q, £>0. (21.4)
Подставляя в неравенство (21.4), выражение для матрицы Ак
получим
СА + АТС - 2CBN~lBT£ < 0. (21.5)
147
Обозначим обратную матрицу S = С"1 и умножим (21.5) слева и
справа на S. Получим
AS + SAT - 2ΒΝ-χΒτ < О, S > 0. (21.6)
Следовательно, надо разрешить относительно S матричное
неравенство (21.6), которое является линейным матричным
неравенством (LMI).
Линейным матричным неравенством называется неравенство
относительно неизвестных переменных χ = (χχ,..., xm)T следующего
вида
F(x)=F0 + x1F1 + ~- + >0, (21.7)
где Fi — действительные симметричные матрицы размера η χ η, т.е.
Fi=FJ, i = 0,...,m.
Для любого решения (21.7) матрица F(x) > 0 является
положительно определенной
zTF(x)z > 0, Vz € Дп, ζ φ 0.
Рассмотрим более общее, чем (21.6) неравенство
АХ + ХАТ + W>0, где W = WT>0, (21.8)
Д W — заданные матрицы, а X — неизвестная матрица. Тогда
выбрав базис {Ει,..., Em}у πι = η(η -f 1)/2 в пространстве
симметричных матриц (или в изоморфном ему евклидовом пространстве Rm),
запишем неравенство (21.8) в виде
m m
Χ = Σχ3Εί> ^χά{ΑΕό^ΕόΑτ) + W > 0,
j=i i=i
что имеет вид (21.7).
Линейное матричное неравенство (21.7) определяет выпуклое
ограничение на вектор х, т.е множество Τ — {х| F(x) > 0}
выпукло. Действительно, если χχ, х2 € Τ и а € [0,1], то
F(axi + (1 - а)х2) = aF(xi) + (1 - a)F(x2) > 0.
Понятно, что система линейных матричных неравенств
Fi(x)>0,...,Ffc(x)>0
может быть записана как одно неравенство
/ Fi(x) 0 0 \
F(x) = 0 F2(x) 0 > 0.
\ 0 0 Ffc(x) /
148
Для решения линейных матричных неравенств разработаны
эффективные методы численного решения, основанные на идеях выпуклой
оптимизации.
Вернемся к неравенству (21.6) и посмотрим, как меняется
функционал J при различных решениях S (соответственно С = 5-1).
Введем параметр η > 0 и усилим неравенство (21.6), добавив
слагаемое
AS + SAT - 2ΒΝ-χΒτ + Ί(ΒΝ^ΒΤ + SGS) < 0, S > 0, (21.9)
где матрица G > 0. Попытаемся найти решение этого квадратичного
матричного неравенства.
Нам понадобится следующая лемма, доказательство которой
можно найти в [29]:
Лемма 1. Матричное уравнение Ляпунова
АР + РАТ + W = 0
при W = WT имеет единственное решение тогда и только
тогда, когда Re(\i+\j) ^ о для всех собственных значений λ»
матрицы А. При этом
оо
Р= ieAtWeATtdt>0
to
тогда и только тогда, когда А гурвицева и:
1) либо W > 0;
2) либо W = ССТ и пара (А, С) управляемая.
Следовательно, если существует положительно определенное
решение уравнения Ляпунова, то матрица А гурвицева.
Следствие 1. Если матрица А гурвицева и W > 0, χ = Ах, x(to) =
хо, то значение функционала J можно вычислить по формуле
оо
J= fxTWxdt = x^Px0, (21.10)
где Ρ — решение уравнения, сопряженного к рассмотренному
выше уравнению Ляпунова
PA + ATP + W = 0.
Докажем это.
149
Пусть W = DTD. Пара (A, D) наблюдаема. Тогда Р можно
представить в виде
оо
Р= ί eAT^to)DTDeA^to)dt > 0.
Поскольку решение системы χ = Ах, с начальным условием ж(*0) =
жо есть x(t) = еЛ(*~*°)ж(ь то получим
оо оо
J = fxTWxdt = ixJeAr^-to)DrDeA^-t^x0 = xJPxo-
to to
Следствие 2 (неравенство Ляпунова). Пусть матрица А гурвице-
ва, пара (А, В) управляема иРо — решение уравнения Ляпунова
АР0 + Р0АТ + ВВТ = 0.
Тогда неравенство Ляпунова
АР + РАТ < -ВВТ
разрешимо, причем для любого решения Ρ справедливо
неравенство Ρ > Pq.
Применим следствие 1 леммы 1 для системы с гурвицевой
матрицей Ak = А — BN~~lBTC и матрицей функционала W = G +
CBN-XBTC. Напомним, что и = -N-1BTS-1xy где С = S'1
некоторая матрица.
Соответствующее такой системе уравнение Ляпунова запишется
так:
AjCk + СкАк = -{G + CBN-XBTC). (21.11)
Получив решение Ск > 0 уравнения (21.11), значение функционала
можно вычислить по формуле (21.10): J = xJCkXQ. Заметим, что в
уравнении Ляпунова (21.11) матрица С должна удовлетворять
неравенству (21.6) или усиленному неравенству (21.9).
Умножив левую часть неравенства (21.9) слева и справа на S"1,
получим
СА + АТС - 2CBN^BTC < -7(С + CBN^BTC). (21.12)
Перепишем (21.12) в виде
4Г(-£) + (-С)Ак < -(<? + CBN~XBTC)
150
В свою очередь матрица Ρ = }-С — Ск удовлетворяет неравенству
Вычтем из этого неравенства равенство (21.11) и получим неравенство
Aj(-C - Ск) + (-£ - Ск)Ак < 0. (21.13)
7 7
Как уже говорилось, матрица Ак гурвицева, и существует
положительно определенное решение уравнения Ляпунова (21.11): Ск > 0.
_. I
7
Ляпунова (21.13), и следовательно Ρ > 0
Таким образом, выполнены неравенства
J = Хп СкХ0 < —#0 £χ0 = ~ХС\ S" XOj
7 7
где S > 0 — решение квадратичного неравенства (21.9). Это
квадратичное неравенство можно заменить на линейное, используя
следующую лемму [15]:
Лемма 2. Дана блочная матрица
\-X21 -^22/
где Хц, Х22 —квадратные матрицы.
Если det\X22\ ф$,тоХ невырождена тогда и только тогда,
когда матрица Q = Хц — Χ\2Χ22Χ2ι (дополнение по Шуру)
невырождена и
det\X\ = det\X22\det\Q\.
Действительно, если вычесть из первой строки матрицы X вторую,
умноженную слева на Х\2Х22, получим
■(
Хц — Х\ъХ22 Хч\ 0
Χϊ\ X22j
откуда следует требуемый результат.
Следствие. Если Хц = Xjv Х22 = Х22> -^21 = Χχ2> то
χ > о «=> Х22 > 0, Q > 0.
Отметим, что если Х\2 ^ 0, а Х22 = β-Em, нестрогое неравенство
X > 0 выполняется, если и только если /? > 0, Q > 0.
Воспользуемся леммой 2, чтобы представить квадратичное
неравенство (21.9) в линейном виде.
Представим матрицу G в виде квадратного корня G = DDT. Тогда
система
(Λ5+ΪΛΤ^2)βΛ'"ΒΤ 'Г)s °· s > ° (2U4>
151
эквивалентна (21.9). Действительно, по следствию леммы 2
неравенство (21.14) выполнено, если итолько если дополнение по Шуру[15]
Q = AS + SAT + (7 - 2)ΒΝ-χΒτ + ^SGS < О,
что совпадает с левой частью неравенства (21.9). Попутно мы
получили такой результат: множество решений квадратичного неравенства
(21.9) выпукло.
Теперь можно получить оценку сверху для функционала. Если для
данного 7 > 0 существует решение системы (21.14), то применив
обратную связь
и = -N-1BTS"1x,
можно обеспечить значение функционала, ограниченное сверху
оо
J = i(xTGx + uTNu)dt < 7-1xJS'-1a;o. (21.15)
о
Для того, чтобы найти минимум функционала, надо решить задачу
одномерной минимизации правой части неравенства по параметру η €
(О, оо).
Как видим, на первый взгляд задача стабилизации с
использованием линейных матричных неравенств решается сложнее, чем
линейно-квадратичная оптимальная задача (через уравнения Рикка-
ти). Но, как покажем ниже, решение с использованием LMI
обобщается на случай, когда в системе присутствуют мультипликативные
неопределенности.
152
Лекция 22
Стабилизация линейной системы при
наличии возмущений
Результаты предыдущей лекции распространяются на случай,
когда в управляемой системе присутствуют неизвестные возмущения и
(или) неопределенности.
1. Робастная квадратичная стабилизация линейной
системы
Рассмотрим частный случай, когда матрица управляемой системы
содержит неопределенности
χ = A(q)x + Вщ q € Q С Дт, (22.1)
где Q — выпуклое множество. (Множество выпукло, если для любых
Чъ 42 € Q, следует Xiqx + λ2#2 € Q, при λι 4- λ2 = 1, λ» > 0).
Можно рассматривать разные виды неопределенностей:
a) интервальная неопределенность
ЯГ <Qi<Qt> г = 1,2...,т.
b) сферическая неопределенность
где W — симметричная положительно определенная матрица.
Множество Q — эллипсоид с центром в точке #ο·
c) аффинная матричная неопределенность
т
где Ао, Ai — заданные матрицы, а множество Q — выпуклый
многогранник в Дт.
Поставим задачу робастной квадратичной стабилизации [29]:
найти управление и = Кх такое, чтобы замкнутая система
χ = (A(q) + ВК)х, х(0) = ж0
при любом q e Q была асимптотически устойчива.
153
Рассмотрим решение для случая с) — аффинной
неопределенности. Попытаемся найти и = Кх так, чтобы для всех q € Q
гарантировать некоторый заданный уровень μ для квадратичного критерия
качества
оо
J= j(xTGx + uTNu)dt < μ.
о
Для простоты будем считать, что матрицы B,G = GT > О, N = Ντ >
О известны точно.
Чтобы сформулировать результат для случая матричной
аффинной неопределенности, воспользуемся материалом прошлой лекции.
Кроме того нам понадобится необходимое и достаточное условие
выполнения линейного матричного неравенства
F(x,q)>0, q€Q,
где Q — многогранник, а именно выполнение конечного числа
неравенств
F{x,q*)>0J = l,2,...,l (22.2)
в вершинах ^многогранника Q.
Надо отметить, что число этих неравенств может получиться очень
большим, например для куба или параллелепипеда / = 2т, а если ин-
тервально ограничен каждый элемент матрицы А, то I = 2П .
Нам известно решение задачи о квадратичном регуляторе при
фиксированных q?
J < i~lxJS-xx^
где симметричная матрица S > 0 является решением системы
линейных неравенств
(Atf)S + SA{q*)T + (7 - 2)BN~1BT ^SD}
\ y/jDTS -E J"'
G = DDT, j = l,2,...,Z.
Для вычисления матрицы S в этом случае необходимо использовать
методы решения системы линейных неравенств большой размерности.
2. Стабилизация при наличии аддитивных
возмущений
Постановка задачи об устойчивости системы при наличии
постоянно-действующих возмущений дана в работе [26].
154
Рассмотрим частный случай этой задачи. Пусть дана возмущаемая
система
у = У(*,у) + г(*). (22.3)
Известно лишь, что постоянно действующие возмущения r(t) =
(гx(t),...,rn(t)) являются функциями, ограниченными по норме
IH^IUp ^ ^о, а решения системы (22.3) существуют в окрестности
невозмущенного (при y(to) = 0 и r(t) = 0) движения y*(t) = 0.
Определение 20. [26]. Невозмущенное движение y*(t)
устойчиво при постоянно действующих возмущениях, если для
любого ε > 0 существуют ηχ(ε) и 772(e) такие, что всякие решения
y(t) системы (22.3), удовлетворяющие при t = to неравенствам
|у(*о) — У*(*о)1 < Ήι(ε), удовлетворяют при t > to неравенствам
\Ш-уШ<с
для всех рассматриваемых функций r(t), удовлетворяющих
неравенству \\r(t)\\Lp < щ(ε).
Теперь рассмотрим управляемую систему для частного случая
аддитивных возмущений, которые ограничены по L2 норме:
χ = Ах + Ви + Cw, \\w\\L2 < 1, х(0) = 0, (22.4)
где
оо
\\w\\l2=jwT(t)w(t)dt.
о
Будем искать управление в виде обратной связи и = Кх. Управление
должно минимизировать функционал
оо
J= sup \(xTGx + uTNu)dt^mm (22.5)
INIia<ijf K
Обозначим матрицу замкнутой системы Ak = А 4- ВК. Тогда задачу
можно переписать так:
χ = Акх + Cw, \\w\\l2 < 1, х(0) = 0, (22.6)
J
σο
= sup fxT(G + KTNK)xdt (22.7)
IHI!2<^
Определим множество достижимости в момент времени Τ как
Г>(Т) = {х(Т) x(t) — решение (22.6) при некотором w: ||ги||£а ^ !}·
155
Объединение множеств достижимости для Τ > 0 называется просто
множеством достижимости
V= \JV(T).
т>о
Теорема 25. Если пара (Ак,С) управляема, то множество
достижимости системы (22.6) представляет собой эллипсоид
V(T) = {χ : χτ\ν~1(Τ)χ < 1},
где матрица W(T) имеет вид
τ
eAktCCTeAltdt
о
Если матрица Ак гурвицева, то множество достижимости V имеет
вид
V = {х : xTW~1x < 1},
где W > 0 — граммиан управляемости (относительно возмущений w):
W(T) = ji
оо
W= IеАкгССТеА^аЬ.
о
(Матрица W является решением уравнения Ляпунова Ak W+WA£ =
-ССТ.)
Оценку для функционала (22.5) можно получить, используя
следующую теорему.
Теорема 26. Если матрица Ak гурвицева, а пара {А^С) —
управляема, и при некотором η > 0 уравнение Риккати
РАк + ΑξΡ 4- \РССТР + G 4- ΚΤΝΚ = 0 (22.8)
имеет решение Ρ > 0, то выполнено неравенство
J(w) < 72.
Доказательство.
Рассмотрим квадратичную форму V(x) = хТРх. Тогда
V = (Акх 4- Cw)TPx 4- хтР(Акх + Cw).
Допустим, что выполнено неравенство
V < -xT(G + KTNK)x + j2wTw. (22.9)
156
Учитывая, что V(x(0)) = 0, проинтегрируем неравенство (22.9) и
перейдем к пределу при Г -> оо (это возможно, т.к. матрица Ак гурви-
цева):
оо оо
О < - / xT(G 4- KTNK)xdt 4- 72 / wTwdt,
о о
откуда следует
J(w)<72. (22.10)
Неравенство (22.9) выполнено, если для любых пар ж, w (включая
и решения системы) справедливо неравенство
xT{PAk + AlP+G+KTNK)x + xTPCw+wTCTPx--)2wTw < 0.
Это верно, если матрица квадратичной формы отрицательно
определена, т.е.
<РАк 4- AjP + G 4- KTNK PC
,)-
Последнее неравенство на основании леммы 2 лекции 21
эквивалентно квадратичному матричному неравенству
РАк 4- AjP 4- \рССтР 4- G 4- KTNK < 0,
решение которого Ρ > 0 в том случае, когда уравнение Риккати имеет
положительно определенное решение.
Замечание 17. Можно показать, что supw и оценка сверху для
функционала J достигаются, т.е. если (при фиксированном К)
существует решение задачи:
7min = min{7, для которых 3 решение Ρ > 0 уравнения (22.8)},
то max™ J = 7^.
3. Стабилизация линейной стохастической
системы
Рассмотрим теперь случай, когда в управляемой системе
аддитивные постоянно действующие возмущения представляют собой
случайный процесс
χ = Ах + Ви 4- Cw, (22.11)
где w — белый шум единичной интенсивности, т.е. M[w(t)] = 0, а
M[w(t)wT(r)] = EmS(t — τ). Введем обозначения: вектор q = Cw и
157
Q = CCT — симметричная матрица. Пусть известна М[х(0)х (0)] =
Рх(0) = Р° — матрица ковариаций в начальный момент времени.
Сначала примем предположение, что в нашем распоряжении
полная информация о реализациях случайных отклонений x(t).
Рассмотрим задачу выбора управления и(·), минимизирующего
функционал
J = M[xT(tk)Sx(tk) + J (xTGx + uTNu) dt] -> min, (22.12)
о
где S,N,G — симметричные положительно определенные матрицы, а
tk < оо фиксировано.
Постановка задачи похожа на детерминированный случай q = 0.
В детерминированном случае решение находится в виде линейной
обратной связи и° = — Кх, где К = N~XBTC, С — симметричная
матрица, являющаяся решением уравнения Риккати:
С 4- СА + АТС 4- G - CBN^BTC = 0, C(th) = S. (22.13)
Наводящие рассуждения: поскольку M[q(t)] = 0, то в среднем
траектории ведут себя так же как при ^ξΟ. Отсюда решение
стохастической задачи предположительно должно быть таким же, как и
детерминированной, рассмотренной на лекции 20.
А можно ли сделать вывод, что вообще не нужно рассматривать
стохастическую систему, а ограничиться детерминированным
случаем? Этот вывод сделать нельзя, поскольку в детерминированном
случае управление в виде обратной связи и программное дают одно и то
же значение критерия качества. Действительно, проинтегрировав
систему с« = Кх, получим зависимость x{t) и, следовательно, и u°(t),
которое дает то же значение функционала качества. В стохастическом
случае это не так, что показывает следующий пример.
Пример 22.1. Рассмотрим случайный процесс с двумя состоя-
ниями. Начальное хо — дискретная случайная величина,
принимающая значения 0 или 1 с вероятностью \:
fxo О Л
U ϊ &
Динамика процесса описывается уравнением х\ = хо + щ.
Необходимо минимизировать функционал J(u0) = М[х\] -> min.
Программное управление щ = — \ 4- с = const.
158
=» J° = - при с = 0, wg = - -.
Управление с обратной связью дает
ug = -ж0 => J0 = 0.
Как видим, в стохастическом случае управление с обратной связью
строго лучше программного.
Вернемся к задаче о линейном регуляторе с квадратичным
критерием. Действительно, можно показать, что в этом случае оптимальное
решение есть и0 = Кх и оно полностью совпадает с
детерминированным оптимальным стабилизатором. Этот результат есть следствие
линейной обратной связи и квадратичного критерия качества. Он
выражает «робастность» оптимального детерминированного решения к
действию постоянно действующих возмущений. Разница только в
величине функционала качества. В стохастической задаче функционал
всегда больше, чем в детерминированном случае. Покажем это.
Критерий качества (22.12) можно переписать в виде
«к
J = Tr[SPx(tk) + f(G + KTNK)Px{t)dtl (22.14)
о
где Px{t) — матрица ковариаций Рх = M[xxT], a Tr — операция
взятия следа матрицы: Tr \\a>ij\\ = ΣΓ=ια« — сумма диагональных
элементов. При выводе (22.14) использовалось свойство операции Тг:
для векторов а, Ь справедливы равенства атЬ = Тг[аЬт] = 1¥[Ьат].
Можно показать, что оптимальное значение критерия качества
вычисляется по формуле
J° = Έτ[£(0)Ρ,(0)] + Ί*[ (QC{t)dt). (22.15)
о
Первое слагаемое Tr[£(0)Pa;(0)] = М[жт(0)£(0)ж(0)] совпадает со
значением функционала в детерминированном случае. В
стохастическом варианте добавляется второе слагаемое. Поскольку Q > 0, а
£(£) > 0, то второе слагаемое положительно, и оно тем больше, чем
больше величина Q.
3.1. Совместная задача оценивания и управления
стохастической системой Рассмотрим теперь случай, когда нет полной
информации о состоянии стохастической системы
z = Hx + r.
159
Здесь q — белый шум M[q(t)qT(r)] = QS(t — т)у г — белый шум
M[r(t)rT(r)] = RS(t - τ), M[x(0)rT(s)] = Ο, M[q(t)rT(s)] = Ο,
M[x(0)qT(s)] = 0.
В рассматриваемом случае управление надо формировать по
оценке и = Кх, где коэффициенты обратной связи выбираются таким
образом, чтобы минимизировать функционал (22.14).
Итак, оценка и управление в рассматриваемой задаче связаны.
Управление влияет на оценку и наоборот. Тот факт, что эти задачи
можно разделить указанным выше способом, составляет содержание
теоремы разделения.
Пусть χ — оптимальная оценка координат ж, доставляемая
линейным оценивателем вида
έ = Ах + Ви + Κ(ζ - Нх),
K = PHTR~1, (22.17)
Ρ = АР + РАТ + Q - KRKT, Р(0) = Р°.
Здесь Ρ = M[Ax(t)Ax(t)T], Αχ — χ —χ — ошибка оценки.
Теорема 27 (Разделения). Для задачи о стохастическом
регуляторе с неполными наблюдениями оптимальным является
управление и0 = —N^1BTCx, где С — решение уравнения Рик-
кати (22.13), ах — линейная оценка по измерению z(r), r €
[Ο,ί] с минимальной среднеквадратичной ошибкой,
определяемая фильтром Калмана (22,17),
Замечание 18. Теорема содержит два утверждения. Первое
заключается в том, что оптимальное управление можно
строить как функцию оптимальной оценки х, те, задачи
оценивания и управления можно разделить. Это следует из линейности
динамической системы и гауссовости распределений ж, х.
Второе утверждение заключается в том, что
оптимальные коэффициенты обратной связи в управлении по неполным
данным совпадают с коэффициентами в управлении по полным
данным для этой же системы, а именно и0 = —N~xBTCx (как
будто χ есть точное значение х). Это так называемый
принцип стохастической эквивалентности. Это следствие квадра-
тичности функционала качества. Для линейных систем с не
квадратичным критерием принцип разделения может
выполняться, а принцип стохастической эквивалентности — нет,
пие, оптимальное управление будет отличаться от решения по
полным данным.
160
Лекция 23
Игольчатая вариация и необходимое
условие сильного локального минимума
1. Доказательство принципа максимума Понтря-
гина
Рассмотрим частный случай задачи оптимального управления,
сформулированной на лекции 16 — задачу с фиксированным
временем движения и свободным правым концом траектории
(23.1)
{y = f(y,u), уЫ = у*, te[to,tk],
«(·) € U = {«(-) € KC\u(t) € Ω С Я5}.
Функционал качества управления возьмем терминальный:
■7(«) = Vo(v(*fc)) -> ?ώι ·
«(•)ew
Пусть {у°(·), u°(·)}— оптимальный процесс.
На лекции 18 доказана формула приращения функционала в
случае, когда управления кусочно-гладкие и°(-) € С1 [ίο, tk] и
оптимальное управление принимает значения внутри допустимого множества
u°(*) €intO:
to
tk
- jo2(\Ay(t)\)dt + 5i(|Ay(tfc)|).
При этом оптимальная траектория получается гладкой у(-) €
C^fab**]. Напомним, что норма в пространстве С1 вводится
следующим образом
||у||С1 =тах{||у||о,||у||о},
где||у||о= max |y(t)|.
te[to,tk\
161
Сейчас мы будем считать, что управления принадлежат классу
кусочно-непрерывных функций и(·) € KC[to,tk] и будем
рассматривать вариации траектории ||у(·) — у°(-)||с малые по норме в
пространстве С.
Определение 21. Процесс {у°('),и°(·)} — сильный локально-
оптимальный процесс, если существует ε > 0 такое, что
выполнено неравенство J (и0) < J (и) для всех и € U таких, что
№)-У%)\\с<е.
Теперь, в отличии от
в предыдущего случая
варьировать «в обе
стороны по вертикали»
нельзя, поэтому для получения
условий минимума
построим специальную сигольча-
тую вариацию» (малую по
горизонтали).
Пусть τ — некото-
Рис. 23.1. Игольчатая вариация Рая точка непрерывности
и°(т - 0) = и°(т + 0).
Построим управление
V*€[*o,T-a)U[r,*fc],
Vt € [τ-α,τ),
где параметры υ € Ω, α > 0 произвольны.
Рассмотрим условие минимума AJ(u°) > 0.
Проварьируем траекторию в соответствии с вариацией управления
иа. Тогда на отрезке t€[to,r — a] выполнено равенство
y«(t) = y°(t) ν*€[*0,τ-α].
В точке τ приращение траектории обозначим
Ау(т) = уа(т)-у°(т).
Разложим решения на малом интервале (г—а, т) по формуле Тейлора
У°(т) = У°(т - <*) + oty(r - а) + д(а) = у°(т - а)+
4- otf(y(r - α), и0(τ - а)) + д(а)
и
Уа(т) = уа(т-а)+а£а(т-а)+о(а) = у°(т-а)+а/(у(т-а), ν)+δ(α)
162
Следовательно
Ау(т) = a[f(y(r - α),υ) - f(y(r - α),и0(τ - α))] + ο(α).
Поскольку τ — точка непрерывности и° и / — гладкая функция, то
при малых а выполнено
Ау(т) = а[/(у°(т), t;) - /(у°(т), i*°(r))] 4- ο(α) = αΔ/(τ, t;) 4- ο(α).
(23.2)
На промежутке [τ, £*] используем следующую теорему о дифференци-
руемости решений системы ОДУ по начальным условиям.
Теорема. Рассмотрим систему ОДУ
У = /(*> у) с начальными условиями у(г) = ξ,
на отрезке t € [r,tk], где у € Υ с Яп, f £ C2[Rx Υ]. Тогда
решение y(t, ξ) допускает непрерывные частные производные по
начальным данным * .
Решение у(£, ξ) удовлетворяет уравнению
|у(а) = /(*,2/(а)). (23.3)
Дифференцируя (23.3) по f и пользуясь тем, что для у(£, ξ) € С2
смешанные производные не зависят от порядка дифференцирования,
получим уравнение
д_ (дуМ\ = (df&vM)\ дУ&$ (23.4)
dt\ 9ξ J \ ду J θξ
При фиксированном ξ это уравнение представляет собой линейную
систему ОДУ относительно неизвестной матрицы Ф(£) = ( yfffl 1,
удовлетворяющей уравнению
±ф=ГдП*М*,ОУ
dt
(*№»)*<«,,
а начальные условия получаются из дифференцирования тождества
У(т, О = £ и равны Ф(т) = Еп.
Следовательно, матрица Ф(£) — фундаментальная матрица
решений уравнения в вариациях (по начальным данным) относительно
решения y(t, ξ)
s-да* (2з-5)
163
Изменим начальные условия у(т) — ξ + Δξ. Разлагая в ряд
Тейлора, получим
y(t, ξ + Αξ) = y(t,t) + Щ^-Αξ + ο(\\Αξ\\).
В нашем случае Αξ = αχ{τ) = αΔ/(τ, υ) в силу (23.2), и можно
записать
ν(ί,ξ+Αξ) = y(i,0-f- ^αΔ/(τ,ν)+ο(α) = y(t,t)+ax(t)+o(a)
где x(t) — решение уравнений в вариациях (23.5) с начальным
условием ж(т) = Δ/(τ, υ). Тогда для приращения траектории выполнено
соотношение
Ay(t) = ax(t) + ο(α) при ί € [τ, tfc].
Запишем сопряженную к (23.5) систему
Для решений прямой и сопряженной систем выполнено
4-(ФТх) = 0=> ipT(t)x(t) = const.
at
На лекции 18 доказано, что в рассматриваемом случае условие
трансверсальности принципа максимума Понтрягина фигурирует как
следующее краевое условие для сопряженной системы
*τ(ίι)._(β!Β^Μ). (Я7)
Рассмотрим
Перепишем
AJ=**^»Ay(tk) + o(\Ay(tk)\.
AJ(u°) = -αφ1\tk)x(tk) + o(a) > 0.
Поскольку α > 0 произвольно, то i>{tk)x(tk) < 0. Но тогда для
t € [т, tk] выполнено неравенство
i>T(t)x(t) <0=^ фт(т)/(у(т),у) - VT(t)/(j,(t),«°(t)) < 0,
откуда
[Щф(т),у°(т),ν) - Н(ф(т),у0(т),и°(т))] < 0 W € Ω,г € Т,
164
где Г = {τ € [ί0, tfc] и таких, что и°(т - 0) = и°(т 4- О)}.
Значит, выполнено условие максимума функции Понтрягина
тахНМт)91?(т),у) = Я(^(т),у0(т),«°(т)). (23.8)
Осталось показать стационарность гамильтониана вдоль
оптимальной траектории H(t) = H(ip(t), у°(*), и°(у°(*о), *)).
Функции ψ и у0 непрерывны, a w° может быть разрывна, но на
оптимальной траектории функция Η непрерывна. Докажем это.
Рассмотрим неравенства, выполненные в силу условия (23.8):
H(i/>(t + Δ*), y°{t + Δ*), u°(t - Δ*))-
- Η(ψ(ί- At),y°(t- At),u°(t- At)) <
<U(t + At) -U(t- At) <
< H(iP(t + At),y°(t + At),u°(t + Δ*))-
- H(1>(t - At), y°(t - Δί), u°(t + Δ*))
При At -> 0 получим, что H(t 4- 0) — %(t — 0) -> 0, откуда следует
непрерывность Н.
Λ U{t')-U{t)
Аналогичные оценки верны для отношения разности ——J—т~^:
ъ — ъ
HW),yO(t%u0(t)) - Я WO, y°(<), i*°(t))
ί'-ί
, HW(t%y0(t),u0(t))-HMt),y0(t),u°(t))
t'-t
H(1f)-H(t)
t'-t
HW(t%y0(t%u0(t'))-HMt>),y0(t),u0(t')) ,
, Я^(О,у0(^),Ц°(О) ^Я^(^),у0(0,Ц°(О)
Отсюда следует (при £' -> ί)
ЭД> dt * ду dt - dt - ду dt + d0 dt
Системы уравнений, как прямая (23.1), так и сопряженная (23.6)
представлены в форме
*=-(f)T *-(%У· «
165
поэтому
дНаф dHdy
dip dt + ду dt~ '
Следовательно, ^~Ή, = 0ηΉ, = const.
Следует отметить, что функция Понтрягина Η (ψ, у,и) не
является функцией Гамильтона (как ее иногда ошибочно называют) с
точки зрения классической механики. Она превращается в функцию
Гамильтона, если из условия принципа максимума (23.8) найти неявную
функцию u°(t,y,xl)) и подставить в функцию Понтрягина. При этом
уравнения (23.9) принимают вид канонической гамильтоновой
системы. Сопряженные переменные φ аналогичны импульсам фазовых
переменных в классической механике (см. лекцию 19).
Следовательно, вдоль оптимальной траектории термин
гамильтониан H(t) корректен.
Следствие 3. Если {y°(-),w°(·), [ίο,*°]} — оптимальный процесс,
то существует φ{ί) — решение сопряженной системы (23.6) с
краевым условием (23.7) такое, что
m*xH(il>(t),y°(t),v) = H(xl>(t),y0(t),u°(t)) = const, t € [t0,t°k]·
ν€!Ω
2. Задача быстродействия
Рассмотрим задачу быстрейшего перехода фазовой точки в начало
координат
У = /(у,и)> 2/(*о)^0, (23 10)
«(•)€И, у(«*) = 0,
ι
Функционал представляет собой время движения
J {и) = tk — to -» min.
Цель — попасть в начало координат, т.е. конечное многообразие
имеет вид Μ = {y(tk) = 0}. Чтобы свести задачу к постановке,
сформулированной на лекции 16, введем дополнительную координату
У = /(У,«), (23.11)
«(·) € U.
Функционал J(u) = <Po(y(tk)) = 2/o(*fc) -> minu(.)6W, где у —
расширенный вектор состояния у — (уо, Ут)т·
166
Конечное многообразие примет вид
М = {(7о,0,...,0), 7о€Д+}.
Из условия трансверсальности принципа максимума следует
Φ(4) + Χο(^ψ^)Τ ±М, (23.12)
где сопряженные переменные удовлетворяют системе
( Фо = О,
Тогда условие ортогональности в (23.12) выглядит как равенство нулю
скалярного произведения
(^о + λ0)7ο + Фт(4) · б = 0 => Vo = -λ0, < 0 = const.
Если ψ = 0, то из условия ПМП равенства нулю гамильтониана
H(t) = 0 следует, что ψο = 0, λο = 0 — нулевая пара, что
противоречит ПМП.
Следствие 4. Если {2/°(·), «°(·)> [*ο, £°]} — оптимальный по
быстродействию процесс, то существует нетривиальное решение
сопряженной системы ψ^Ο такое, что
maxH(i/>(t),y°(t),v) = ff(^(i),y0(i),w°(t)) = const > 0.
νξΩ
167
Лекция 24
Достаточные условия оптимальности
управляемой системы
1. Достаточность принципа максимума для
линейных систем
Для линейной задачи быстродействия принцип максимума Понт-
рягина является не только необходимым, но и достаточным условием
оптимальности. Ограничимся для простоты системами с одним
управлением
х = Ах + Ы, (24.1)
где начальные условия х(0) = с Φ О, ограничения на
управляющие воздействия удовлетворяют условиям u\{t) е [μ, ν], причем μ <
О, ν > О, и терминальное условие x(tk) = О — приход в начало
координат. Рассмотрим задачу быстродействия
tk —> min .
«(.)ew
Предположим, что система является полностью управляемой, т.е.
выполнено условие det(b, Ab,..., АП_1Ь) φ 0.
Пусть {ж°(·), w?(')> [0> *2]} — управляемый процесс,
удовлетворяющий принципу максимума. Следовательно, существует
нетривиальное решение сопряженной системы
φ = -Ατψ. (24.2)
Функция Понтрягина имеет вид Я = ψτΑχ + фтЬи. Следовательно,
решение (24.2) удовлетворяет условию
il)T{t)bu\(t) = max il)T(t)bui ^ 0.
Неравенство следует из условия максимума функции Понтрягина Я и
включения 0 € (μ, и).
Предположим теперь, что существует управляемый процесс
{#(·)>*2ι(·), [0, tk]}, позволяющий привести систему (24.1) из
начальной точки х(0) = х°(0) = с в начало координат x(tk) = 0 за меньшее
время tk < t°, чем управление и°. Напомним, что ж°(£°) = 0.
Рассмотрим выражение
168
^T(**)x°(ik) = il>r(tk)x°(tk) - фт(1к)х{1к) =
= (vT(i*)Aifc) - Фт(о)Ао)) - №T(tk)x(tk) - ντ(ο)ί(ο)),
Поскольку ip(t) и χ(ί) дифференцируемы, получим
Ψτ&)χ0&) = J £t(iPTx°) dt-f ^{ψτχ) dt.
о о
Ho
ftWTx°) = ^T*° 4- ψτχ° = -^х° + ^T(Ac° + 4) = ^Tbw?i
аналогично ^(фтх) = ^тЬй, откуда следует
ipT(tk)x°(tk) = /V(*)4(*) dt - ii)T(t)bu1(t)dt =
о о
tfc
i[ifT(t)tml(t) - ^T(t)№i(t)]A > 0,
о
так как в силу принципа максимума Я(^, х°, й) < Я(^, х°, t*°).
С другой стороны
ipT(tk)x°(ik) = tfT(tfc)*°(**) - *т(*2)*°(*2) =
«5
= - f ^T{t)ba\{t)dt<Q,
поскольку подынтегральное выражение неотрицательно при всех t
Из последних двух неравенств следует, что tl>T(ik)x°(tk) = 0.
Так как подынтегральная функция неотрицательна, получим
ψΎ {t)hu\{t) = max^TW^i=0 Vt€(ffc,t2).
Поскольку (i/jTbui) линейна по щ9 максимум функции Понтрягина
достигается на концах отрезка [μ, ι/]. Так как по условию μ < 0, ν > 0,
полученное тождество возможно лишь в случае, когда
4>T(t)b = 0 V*€(ffcjtg).
Продифференцировав последнее тождество (п — 1) раз, получим
однородную систему алгебраических линейных уравнений относительно
фт{Ь)Ь = 0, i/>T(t)Ab = 0, .... VT(<)4n_1b = 0.
169
Так как ψ(ί) — нетривиальное решение системы (24.2), то
основной определитель алгебраической системы равен нулю, т.е. выполнено
равенство det(b, Ab,..., An"xb) = 0, что противоречит условию полной
управляемости динамической системы (24.1). Получили противоречие
предположению, что tk <t%.
Следовательно, управляемый процесс, удовлетворяющий
принципу максимума, является оптимальным по быстродействию.
Достаточность доказана.
Теорема 28. Для задачи линейного быстродействия в случае
полностью управляемой системы принцип максимума
является необходимым и достаточным условием оптимальности
(глобального минимума функционала).
Пример 24.1. Применим теорему 28 для решения задачи
стабилизации вертикального положения перевернутого
маятника, установленного на движущемся основании.
При этом предположим, что ускорение тележки
ограничено: \ui(t)\ ^ u+, и имеются датчики, поставляющие точную
информацию о положении у\ = ч>и скорости у2 = φ. Тогда
можно решить задачу для любого начального положения,
принадлежащего некоторому множеству, т.е. построить оптимальный
синтез системы управления данной механической системой.
Примем для простоты изложения ω2 = 1, и+ = 1. Тогда
линеаризованные уравнения в отклонениях примут вид
*1=Х2' (24.3)
Х2 = Я?1 + 1*1 , \ui(t)\ ^ 1.
Поскольку Я = ^1X2+^2(^1+^1), получим и\ = sign ^2, где функция
ψ2 определяется системой
Φι = -lb >
ф2 = -ψχ.
Так как характеристическое уравнение для сопряженной системы
имеет действительные корни ±1, то решение ip2(t) есть линейная
комбинация двух экспонент, и, следовательно, оптимальное по
быстродействию управление w?(i) может иметь не более одного
переключения. Полученный качественный вид оптимального управления
позволяет осуществить оптимальный синтез на фазовой плоскости. Для
этого построим сначала траектории системы (24.3) при ι*ι = 1 и при
и\ = — 1.
170
Рис. 24.1. Синтез оптимального быстродействия.
Эти траектории являются либо прямыми, приходящими
асимптотически в особые точки (-1,0) и (1,0), либо гиперболами,
описываемыми уравнениями
я! = (Я1±1)2+С1.
Среди траекторий выделим две полугиперболы, приводящие
изображающую точку в начало координат.
Очевидно, что для любой точки, расположенной на линии Го,
описываемой уравнениями
#2 = γ#ι — 2χι при χι < 0,
#2 = — γ #1 + 2χι при χι > 0,
задача оптимального синтеза решена, так как построено управление,
приводящее систему из этой точки в начало координат. Как легко
показать, любое другое управление, приводящее систему из этой же
точки в начало координат, не удовлетворяет принципу максимума, так как
имеет более одного переключения. Аналогично строятся траектории,
приводящие в начало координат изображающую точку, если она
расположена в открытой полосе X. При этом оптимальное управление
будет иметь одно переключение.
Таким образом, при наличии ограничения на управление
оптимальный синтез осуществим только на открытой полосе X. Легко
показать, что из любой точки (χ*, х2) £ X вообще невозможно попасть
171
в начало координат, т.е. X — область управляемости системы (24.3)
при ограничениях на управление. Здесь следует отметить, что при
отсутствии ограничений на управление областью управляемости
является вся фазовая плоскость, так как эта система полностью
управляема (см. лекцию 3).
Отметим вторую особенность построенного оптимального синтеза
— нелинейную зависимость оптимального управления от отклонений
в области X:
u\(xi,x2) = <
+1,
-ι,
если
или
если
или
Х2 < —\/Х1 +2^1 И Χι > О
х2 < у/х\-2х\ и χι < 0 ,24 4^
х2 > -yjxl + 2xx иж! >0 К
х2 > л/х\ — 2χι и χι < 0.
Для того чтобы на практике осуществить построенный оптимальный
синтез «5(χι,χ2), необходимо иметь датчики положения и скорости,
которые в течение всего времени управления [0, £°] давали бы точную
информацию об отклонениях xi(t), x2(t).
Известны ли еще задачи кроме только что представленной, для
которых можно сформулировать достаточные условия оптимальности?
Ответ положителен.
Ниже мы рассмотрим задачу оптимизации с фиксированным
временем и интегральным функционалом, для которой справедлив
принцип оптимальности Р. Беллмана, из которого выводятся достаточные
условия оптимальности.
Кроме этого в дополнении к лекции 24 приведена
формулировка регулярного синтеза оптимального управления по В.Г.
Болтянскому, где на основе принципа максимума сформулированы достаточные
условия оптимальности задачи управления с функционалом Больца.
2. Метод динамического программирования
Беллмана как достаточное условие оптимальности
Метод динамического программирования основан на
принципе оптимальности, который заключается в следующем: каковы бы ни
были состояние системы и управление в начальный момент
времени, последующее управление должно быть оптимальным
относительно состояния, в котором будет находиться система
в результате предшествовавшего управления. Другими словами,
оптимальное управление не зависит от предыстории системы и
определяется состоянием системы в данный момент и целью управления
— интегральным функционалом.
172
Применительно к задаче оптимального управления,
сформулированной на лекции 16, принцип оптимальности означает, что для
любого момента времени t € [to>*fc) на оптимальной фазовой траектории
второй ее отрезок — также оптимальная траектория. Справедливость
этого утверждения доказывается методом от противного.
Учитывается единственность оптимальной траектории для задачи оптимального
управления со свободным концом траектории, фиксированным
временем управления и функционалом вида
tk
J = ffo(v,u,t)dt. (24.5)
Управляемая система задана соотношениями:
У = /(У,^), у(*о) = у*,
ι*(·) € U = {«(-) € КСг[Ьо,Ь], u(t) € Ω с Я5}.
С помощью принципа оптимальности получим критерий
оптимальности синтеза управления для задачи с фиксированным
временем и свободным концом траектории. Введем функцию, называемую
функцией Беллмана
tk
S(t, у) = min { / /0(у(т), «(τ), t) dr} , (24.7)
t
где у = /(у(т),м(т)), a y(t) = у — начальное условие. Используя
принцип оптимальности, можно вывести уравнение, которому
удовлетворяет эта функция.
Предположим, что функция £(£, у) существует и непрерывно
дифференцируема по t и у.
Рассмотрим два состояния (£, у) и (t 4- At, у 4- Ду). Имеем
t+Δί tfc
S{t,y)= nun { / /о(у(т),«(т),т)<*т+ / /o(y(r),w(T),T)dr}.
* t+Δ*
В силу принципа оптимальности последнее соотношение можно
переписать в виде
t+Δ* tk
S(t,y)= min { / /o(y,w,r)dr+ min / /o(y,«,r)dr},
* t+Δ*
173
или
t+Δ*
5(t,y) = min { / /0(у,и,т)£*т+5(*+А*,у+Ау)}, (24.8)
u(-)€U{t,t+At] J
t
причем Ay зависит от управления и на интервале [£, t+At]. При малом
At можно записать
S(t + Δί, у + Δν) = 5(ί, у) 4- ^Δί + |% + ο(|Δ*|, |Δν|). (24.9)
Подставив (24.8) в (24.9), получим при At -> 0 уравнение
™ + пип{/0(у,М) + ^/(»,«)> = 0 (24.10)
с очевидным граничным условием S(tk,y(tk)) = 0. Функциональное
уравнение (24.10) называется уравнением Беллмана. Его смысл со-
стоит в том, что исходная задача о минимизации функционала по
множеству всех допустимых стратегий и(-) € U заменяется минимизацией
по множеству Ω.
Поскольку заранее о существовании функции S(t, у), а также о ее
дифференцируемое™ ничего не известно, предыдущие рассуждения
можно рассматривать как наводящие, позволяющие сформулировать
теорему о достаточных условиях оптимальности.
Теорема 29. Пусть существуют непрерывно
дифференцируемая функция S(t,y), удовлетворяющая уравнению Беллмана
(24.10), и управление u°(t), минимизирующее
соответствующую часть этого уравнения. Тогда управление u°(t)
оптимально, те. минимизирует функционал J.
Доказательство. Пусть S(t, у) — решение уравнения Беллмана с
граничным условием S(tk, y(tk)) = 0, u(t) — некоторое управление из
W, тогда
on on
-^ + ^/(ν>«) + /ο(ν,Μ)>0.
В качестве аргумента у примем решение уравнения у = /(у, и) с
выбранным управлением и заданным начальным условием у*, тогда
dS dS. . , Λ ^ . dS ^ , , ^ν
~dt + ~д~У + Л(у,и,<) > ° или -fa ^ ""/ο(2/'η'*) ·
Проинтегрируем последнее соотношение в интервале [to, tk]:
S(th,y{tk)) - S(t0, y(t0)) >- j /o(y, u, r)dr.
174
Отсюда с учетом граничного условия следует
J(u)>S(t0,y(t0))·
Пусть и° — управление, на котором достигается минимум выражения
If + /o(y, w, t) на множестве Ω. Тогда из (24.10) следует
Повторяя предыдущие преобразования в этом случае, получим
J(u°) = S(to, у0), т.е. J{u) ^ J(w°), что и доказывает теорему.
2.1. Линейная задача с квадратичным критерием качества
Рассматривается задача минимизации функционала
J= l(xTGx + uTNu)dt
о
при условии
χ = Ах + Ви,
где tk — фиксированный момент времени, N, G — симметричные
положительно-определенные матрицы;
Решим эту задачу, применяя достаточные условия оптимальности
в форме уравнения Беллмана
^ + min {xTGx + uTNu + ~(Ax + Bu)} = 0 (24.11)
с граничным условием
S{tk,y{tk)) = 0. (24.12)
Необходимое условие минимума выражения в фигурных скобках
имеет вид
ал
2uTN+—B = 0,
ох
откуда
«° = -iiV-^(g)T. (24.13)
Ищем решение уравнения Беллмана (24.11) в виде квадратичной
формы S — xTC(t)x, где C(t) ^ 0 — симметричная матрица.
Тогда (||) = 2£х. Подставляя в уравнение (24.11) и используя
(24.13), получим
хтСх + xTGx + xTCBN^BTCx + 2хтС(Ах - BN~1BTCx) = 0.
175
Придав выражению 2СА = (СА 4- АТС) симметричный вид,
перепишем предыдущее выражение
хт(С + G + СА + АТС - CBN~xBTC)x = О,
откуда следует уже полученное нами в лекции 20 уравнение Риккати.
3. Связь метода динамического
программирования с принципом максимума
Предположим, что в задаче (24.5), (24.6) решение S(t, у)
уравнения Беллмана (24.10) существует и имеет непрерывные вторые
частные производные по всем аргументам, а функции /о и / —
непрерывные частные производные по всем аргументам. Рассмотрим функцию
R(t,y,u) = ^М + «/(,,«) + f0(y,u,t).
Пусть {у°(£), u°(t), t € [to, tk]} — оптимальный процесс.
Из уравнения Беллмана следует, что на оптимальной траектории
функция й(£, w°, у°) = 0, а для произвольной траектории в
окрестности (у0, и0) выполнено R(t,u,y) ^ 0. Необходимым условием
минимума функции R на оптимальной траектории y°(t) является условие
ад(*,у°,ц°)
ду
Следовательно выполнено равенство
д_
dt
= 0.
■№)*№><Λ·Ή
, dS(t,y«)df(y",u») | Э/0(у0,Ц°)=0
ду ду ду '
поскольку при наших предположениях результат не зависит от
порядка дифференцирования. В силу уравнений движения первые два
слагаемых в (24.14) равны
д [dS(t,yQ)\ (d*S(t,y°)\ о 0 _
di\~ду—) + [~ду*~)Пу'и)-
д (dS(t>yQ)\ (&S(t,y°)\dy = d (dS(t,y°)\
m\ ду J + \ ду2 )dt dt\ ду у
Обозначив
176
из уравнения (24.14) получим
Из граничного условия для функции Беллмана S(tjb,y(tjb)) = 0
следует i)(tk) = 0. Из уравнения Беллмана для всех t € [to, tk] функция
R(t, у, и) удовлетворяет условию
min R(t,y,u) = R(t,u°(t),y°(t)),
ι*(*)€:Ω
откуда получим условие максимума
max Н(ф,у,и) = Й(ф(Ь),у0(Ь)У(г)),
ιχ(*)€·Ω
где Η = —/о(*,у,гл) 4- φ1f{y,u) — расширенная функция Понтря-
гина в задаче (24.5), (24.6), а ψ(ί) — решение сопряженной системы
(24.15).
177
Лекция 25
Особые оптимальные управления
1. Вариация Келли и необходимые условия
оптимальности второго порядка
Рассмотрим задачу оптимального управления, где управление ска-
лярно и правые части линейны по управлению.
Г У = /Ы + д(у)и, y(t0) = у*,
I u(-) €U = {и(·) € KC\\u(t)\ < μ} (25.1)
{ y(tk) в Μ С Яп.
Функционал задачи терминальный
■7(«) = Vo(y(*fc)) "> ™п ·
u(-)6W
Считаем, что все функции <ро, 0, / гладкие.
Функцию Понтрягина запишем в виде
Я = Vх/ + Фтди = Н0(ф,у) + Нг(1>,у)и.
Рассмотрим оптимальный процесс {у°(-)>^?(·)» [*<ь*$·} Из ПМП
следует, что необходимым условием оптимальности является
максимум функции Понтрягина на оптимальном решении
шах ВД(*),У°(*)) · «(*) = Нг(№,А*))-А*).
\η(ί)\<μ
Ситуации, в которых решение этой задачи достигается в единственной
точке u°(t) называются регулярными.
Будем говорить, что оптимальный процесс {у°(·), «?(·)> [ίο, ί£]}
содержит особые участки, если существует интервал (£, I) С [ίο, *21»на
котором #ι(£) = 0.
На особом участке условие максимума ПМП становится
тривиальным и не работает.
Для того, чтобы получить необходимые условия экстремума,
Дж.Келли в 1967 г. предложил новый тип вариации управления
(«комбинацию» классической и игольчатой вариации), где приращение
управления имеет вид Аи = εδυ,, но в отличие от классической
вариации здесь 6и — не любая гладкая функция, а формируемая как
специальная игольчатая в окрестности момента времени τ (см. рис. 25.1).
178
Таким образом, появляется второй порядок малости по ε
Приращение
τ + ε
Рис. 25.1. Вариация Келли
функционала с
точностью до малых
второго порядка по ε
запишем в виде
AJ(u°) = eSJ(u°)+
+S2J(u°)e2+o(e2),
где SJ(u°) —
вариация функционала
первого порядка, а
S2J(u°) — вариация второго порядка.
Допустим, что на особом участке τ € [t, t\ выполнено u° (i) € int Ω,
тогда в силу ПМП выполнено условие ^ = 0.
Используя полученную ранее (лекция 18) формулу для вариации
Лагранжа, получим
tk τ+ε
SJ(u°) = - f ^Sudt = - f ^Sudt = 0.
to τ—ε
To есть из вариации первого порядка ничего получить нельзя.
Условие минимума AJ(u°) > 0 приводит к условиям на вторую
вариацию S2J(u°) > 0.
Можно показать, что отсюда следует
Теорема 30 (необходимое условие Келли). Пусть {у°(-)>и°(-),
[to, ifc]} — оптимальный процесс, т.е.
1) выполнен ПМП;
2) на особом участке Vt £ (£,!) с [*о,*2] Hi(t) = 0 выполнено
|«°(*)|<μ;
Тогда для оптимальности и° необходимо выполнение
неравенства
Ι(έ*Φ°·
179
2. Скобки Пуассона
Рассмотрим скобки Пуассона: пусть а(у, ф) и /?(у, ф) — гладкие
скалярные функции векторных аргументов. Оператор
называется скобками Пуассона.
Перечислим основные свойства скобки Пуассона:
1 ){«,£} =-{А а};
2){а,а} = 0;
3) {а,/?+ 7> = {<*>/?} +К 7>;
4){а,с£} = с{а,£}, с€Й.
Заметим, что скобки Пуассона широко используются в
аналитической механике.
Покажем, что условие Келли можно записать в форме
{#!(*),{#!(*),#()(*)}} <0.
Как было показано в лекции 23, оптимальное решение задачи
может быть записано в гамильтоновой форме
• (дн\т
Рассмотрим произвольную гладкую функцию S(y,%l>). Тогда
производная в силу системы
dt ду^дф' дф^ду' { ' ''
В нашем случае Я = Щ + Ηχχι, и в качестве функции S выберем
Н\ на особом участке (ί,ί), где Hi(t) = 0. Вычислим производную в
силу системы
^ = {Яь Я} = {Яь Щ + Щи} =
= {Яь Н0} + и^Н^Щ} = {Щ, Но} = 0.
^ = ^{ЯЬЯ0} = {{ЯЬЯ0},Я} = {{ЯьЯо^Яо + Я1«} =
= {{ЯьЯо},Яо} + {{ЯЬЯ0},Я1}« = 0
Условие Келли приводит к неравенству
~^ = {{ЯьЯоЬЯх} > 0 Vi € (*Д
180
откуда следует неравенство
{Я1,{ЯьЯо}}<0.
Если неравенство строгое, то
о _ {{#ι,#ο},#ο}
{Ни{НиН0}У
Если же {Ях, {#ι, Но}} = 0, то нет возможности определить wj.
Это означает, что особая траектория имеет более высокий порядок и
следует продолжить дифференцирование Н\.
Определение 22. Порядком особой траектории на t € (£, t) с
[ίο,*2] называется натуральное число q € N такое, что Vs =
0,1,2,..., 2q — 1 выполнено
1 а (^ (дЩф,у)\\
\du\d№\ ди ))ψ '
где (ф,у) принадлежит некоторой открытой окрестности
(V>,3/°).
Таким образом, приходим к следующей формулировке.
Теорема 31 (Обобщенное условие Келли). Пусть
{у°(·), ιι°(·), [ίοί^]} оптимальный процесс, т.е.
1) выполнен Π МП;
2) особый участок имеет порядок q.
Тогда для оптимальности особого участка необходимо
выполнение неравенства
Условие (25.2) для случая q = 2 называют условием Коппа-
Мойера[13].
3. Структура оптимального управления
Рассмотрим вопрос о сопряжении регулярного и особого участков
оптимальной траектории. Возможны следующие случаи,
изображенные на рис. 25.2.
1) Разрыв управления в точке сопряжения t. Регулярный случай,
управление слева и справа от t принимает значения на концах отрезка
Ω.
181
i
пЛи°
*--**-
"\uoc
t \ t
1
1)
2)
Рис. 25.2. Сопряжение особого и регулярного участковгслучай 1,2
2) Особый случай. В точке сопряжения регулярной и особой
траектории управление терпит разрыв u(t — 0) φ u(t 4- 0). В этом случае
порядок особой траектории q должен быть нечетным, что следует из
сформулированной ниже теоремы.
3)
4)
<0.
Рис. 25.3. Сопряжение особого и регулярного участков:случай 3,4
Теорема 32 (Келли, Копп, Мойер,1967). Пусть оптимальная
траектория y°(t) на особом участке t е (ί,ί) имеет второй или
любой четный порядок q, и выполнено условие Келли в строгой
форме
ди \dt2« \ ди
Тогда особый участок траектории у° не может сопрягаться
с регулярной (не особой) кусочно-гладкой траекторией у0,
если управление и° в точке сопряжения особого и регулярного
участков терпит разрыв.
3) Особый случай: управление в точке склейки непрерывно u(i —
0) = u(t-f 0), а производная терпит разрыв u'(t — 0) ^ u'(t+0). Здесь
(-!)«
0)
182
i
'
I1
'—μ-
V
ll ΝΛί°°
И ι
Рис. 25.4. Чаттеринг режим
порядок особой траектории q должен быть четным.
4) Особый случай:
управление в точке склейки
гладкое u(i — 0) = u(t + 0),
u'(t - 0) = uf(t + 0). Здесь
порядок особой траектории
q должен быть нечетным.
Как видим, при четном q
разрыва быть не может. Но
в 1961 г. на первом
конгрессе ИФАК,
проходившим в г. Москве, Фуллером
предложен пример задачи,
в которой сопряжение регулярного и особого участков происходит
с бесконечным числом переключений на конечном отрезке времени
(chattering-режим).
5) Разрывы управления (точки переключения) сгущаются к
точке сопряжения с особым участком, и оптимальное управление
оказывается измеримой по Лебегу функцией со счетным множеством точек
разрыва.
Таким образом, оптимальное управление u°(t) может содержать
следующие участки:
а) регулярный участок. В этом случае оптимальное управление
u°(t) можно найти из ПМП и и(·) е KC[to,tk], т.е. может иметь
конечное число точек разрыва 1 -го рода;
6) особый участок;
в) участок с учащающимися переключениями (только если
расширим U до и(-) € C°°[to,tk] (chattering-режим).
183
Лекция 26
Задача Годдарда
На лекции 17 были получены уравнения движения Л А в
вертикальной плоскости. При выводе уравнений мы предполагали, что ЛА
имеет плоскость симметрии, изменение высоты полета мало по
сравнению с радиусом Земли, вследствие чего пренебрегали кривизной
земной поверхности, а поле тяготения однородно, кроме того
атмосфера имеет постоянную плотность ρ. Как и в предыдущих примерах
на лекциях 15 и 17 считаем, что Земля не вращается.
Тогда вырожденная по Тихонову система уравнений (при 9{t) =
φ(ί) = π/2) описывает строго вертикальный полет ЛА
(метеорологической ракеты):
[ /ι = ν,
πιύ = —тд — Q 4- -Ρ,
πι = — и, 0 < и < μ,
где Ρ = ηη — реактивная тяга ракеты, η = const — относительная
скорость истечения частиц топлива, Q = ^Sc^. = kv2 —
сопротивление воздуха.
Обозначим 2/1 = /ι, 2/2 = ν, уз = ^ и перепишем систему в виде
"*-». и(0)-о,
fr.-,-£ + 2u, »(0)«0,
Уз Уз ...
уз = -и> Уз(0)=то.
Ограничения на управление следующие: 0 < и < μ.
Рассмотрим две задачи:
1) Задача подъема на максимальную высоту в момент выгорания
всего топлива. Пусть πΐχ — масса собственно ракеты. Тогда
терминальное многообразие имеет вид Μ = {уз(^) = mi < га0}, а
экстремальная задача
Viih) -> max , φ0 = -2/i(*fc)·
0<ν<μ
Это классическая задача Годдарда, поставленная им в 1919г. и
полностью решена советскими учеными А.А. Космодемянским и Д.Е. Охо-
цимским.
184
2) Полет беспилотного (автоматического) самолета на заданную
высоту с минимальным расходом топлива.
Тогда терминальное многообразие имеет вид Μ = {yi(tk) = Λι},
а функционал
(m0 - Уз(**)) -> „min > <Po = rno- у3(**).
0<ι*<μ
Рассмотрим первую задачу. Выпишем функцию Понтрягина
Я = <0i2/2 + V>2( - 9 - — + —) + ^(-u),
Уз уз
и сопряженную систему ^т = — ^:
^1=0
; , 1 ЭД ,
УЗ#У2
Многообразие Μ можно представить в виде Μ = {уз(**)~mi = 0} =
{71 j 72,0}, где 7ι, 72 — произвольные числа.
Из условий трансверсальности следует
(^1(*2)-Ао)71+^(*2Ь=0,
откуда ^ι = λο = const > 0, а ф2^%) = 0.
Докажем, что λο φ 0. Допустим противное, т.е. λο = 0. Тогда
Из условия равенства нулю гамильтониана следует ff(t°) =
Поскольку условие остановки определяет первый момент, когда
достигается уз(^) = mi, то в левой окрестности t^ функция уз(£)
должна убывать, следовательно u°(t) > 0 и в этой окрестности
выполнено и°(£°) > 0. Но тогда фъ{Ь%) = 0, и (λο,^Ο составляют
нулевую пару, что противоречит ПМП. Поэтому λο φ 0, и нормируя ф,
получим V*i = 1·
Поскольку стартуем с нулевой скоростью, то из физических
соображений (тяга больше веса) следует неравенство η μ > дгщ.
Представим функцию Понтрягина в виде
Н = у2-ф2(9+—) + (—-Фг)и = Но + Н1и.
Уз Уз
Допустим, что есть интервал Δ = (ί, ί) с [ίο, **], где Hi(t) ξ 0.
185
Сопряженная система (при φι = 1) примет вид
Уз #2/2
|/>2 / \
Уз
Из условия максимума функции Понтрягина следует вид
оптимального управления
οη\ = ίμ приЯ1(^,у)>0
U U [0 приВД,у)<0'
**(*,*).
На особом участке определить оптимальное управление из ПМП
нельзя.
Найдем производную в силу системы
d#i (φ2Ί Уз^27
dt
4 = (:
г/з
г/1
-ά) =
v Уздуч'уз yi ч г/| Узхду2уз ' Уз
= Уз2 Ыщ?Ь ~ У3) + О**] = °
(26.1)
Поскольку уз(£) > 0 на особом участке, то квадратная скобка в
последнем выражении равна нулю.
Найдем теперь вторую производную в силу системы, учитывая
тождество (26.1):
=0
dt2
dyf
Я„,2 /1 y2i \ Qy2/\ ду2Уз'
, ,7ω Q .,dQ d2Q., 7 r, i>i,dQ 8PQ.-,
+*<»-2-'>fe+i^r>]-aI1+»(e2+7«sr)l,,f
г/з »г/г ду2Уз
-^(- + ί)·(|^+7χτ)]=°· (26.2)
Чг/3 ' V%2 %2
186
Из уравнения (26.2) можно определить особое управления.
Для его оптимальности необходимо выполнение условия Келли
| (£*«))> 0, (26.3)
откуда следует необходимость выполнения неравенства
Покажем, что оно выполнено. Для этого надо выяснить знак ψ2, так
как в нашем случае Q = ку2, где к > О и, следовательно, круглая
скобка в левой части неравенства положительна.
На оптимальной траектории гамильтониан H(t) = О, откуда на
особом участке выполняется тождество #o(t) = 0(таккак#1(£) = 0).
Но тогда у2 = Ф2 (^ + д), откуда следует неравенство
3 ^2 = ^->о.
Из условия (26.1) следует 72/з = Ψ2 (Q + 7^) > откуда получим
7Уз(^4-^)=У2(д4-7|^) (26.5)
Уз оу2'
уравнение особой поверхности.
Подставляя в (26.5) выражение Q = ку2, получим уравнение
особого участка
9УЗ=*(У%+7У1). (26.6)
В свою очередь уравнение (26.2) можно переписать в виде
Ί[№ + 3fc2/i 4- 2куу2]и - ky2{kyl + gy3(3y2 + 47)) = 0. (26.7)
Поскольку у2 > 0, то в (26.7) квадратная скобка при и больше нуля,
откуда следуют строгое неравенство Келли и оптимальность
полученной особой траектории.
Из уравнения (26.7) вычислим особое управление
иоС = 1ку2(ку% + ду3(3у2+4:ч))
7 (дуз + Ъку1 + 2к-уу2)
В исходных переменных уравнение особого участка (26.6) имеет
вид
,2.о,_...ч - (26.8)
771 = К .
70
187
то
= {и = μ, ν = 0}
Рис. 26.1. Особая поверхность
Соотношение (26.8) в исходных переменных можно переписать в виде
иос _1гЬ2 , mQ_ mgv(v + b) ι _
fcv2(v + 27)(3v + 27)
>0. (26.9)
η(ν2 + 47ν 4- 272)
На рис.26.1 изображена проекция особой поверхности на
плоскость (ν, га).
В зависимости от начальных условий оптимальная траектория
либо достигнет особой поверхности, либо нет.
Если двигаемся по
особому участку, то и0 = woc.
При этом нужно
проверить:
а) сохранились ли
ограничения на управление;
б) как склеивается
регулярное и особое
управление.
Выше особой
поверхности Hi > 0, а ниже —
Нг<0.
На рис.26.1 изображена кривая А, заданная уравнением kv2 4-
т9 = 7М> на которой dv/dt = 0 при максимальной тяге двигателя
Рис. 26.2. Оптимальное управление ракетой
188
и = μ. Эту кривую траектории системы пересекают с вертикальной
касательной. При движении по особой траектории dv/dt < 0. Для
всех точек особого участка в области ниже кривой А (в этой области
физически реализуется старт с нулевой скоростью) выполнено
неравенство kv2 -f mg < η μ.
Тогда из формулы (26.9) следует
Ч" = 1 [to2 + mg - ™ff + У „] < V2 + mg) < μ,
7 υ2 4- 47V + 2j2 J 7
т.е. особое управление является допустимым.
Зависимость оптимального управления и° от времени показана на
рис.26.2.
189
Лекция 27
Численные методы решения
экстремальных задач
Рассмотрим управляемую систему
y=f(y,u), у(*о) = гЛ
«(·) € U = {«(·) € RC[to,*fc] | «W € Ω С Я5}, (27.1)
*€[«o,*fc], y(tk)€McRn.
Функционал качества задачи управления терминальный
J(u) = vo(y(t*)) -> min
u(«)6W
Указанная задача охватывает многие важные для приложений случаи
экстремальных задач.
Единого универсального метода решения задачи до сих пор не
разработано, что объясняется трудностью решения задач оптимального
управления.
1. Классификация методов численного решения
задач оптимального управления
Условно численные методы решения задачи можно разбить на
четыре группы:
1) Сведение к задаче оптимизации функции конечного числа
переменных при наличии ограничений.
Исходная задача — это задача минимизации в функциональном
пространстве, но если на отрезке [to, tk] ввести сетку Т{ = to 4- г * (^ —
tk)/N> где N — большое число, а дифференциальные уравнения
заменить разностными, то задачу приближенно можно свести к
конечномерной. Построить решение такой конечномерной задачи очень
трудно. Во-первых, число переменных будет очень большим, во-вторых,
возможно появление многих дополнительных экстремумов
функционала как функции многих переменных.
2) Методы вариации в пространстве состояний (фазовых
переменных). При таком подходе как правило используется принцип
оптимальности Беллмана. К недостаткам подхода относится то, что он тре-
190
{.
бует запоминания всего поля экстремалей и отсюда возникает
трудность, названная самим Беллманом «проклятием размерности».
3) Прямые методы — вариации в пространстве управлений.
К ним относятся метод Крылова-Черноусько, метод линеаризации
Р.П.Федоренко и др.
4) Сведение задачи оптимального управления с помощью ПМП к
краевой задаче, используя необходимые условия экстремума
функционала, и дальнейшее решение двухточечной краевой задачи.
Проблемы численной реализации методов этой группы мы и рассмотрим.
2. Сведение к двухточечной краевой задаче
Рассмотрим для простоты задачу с фиксированным временем и
свободным правым концом траектории.
Исходя из ПМП оптимальное управление находится из решения
краевой задачи относительно переменных ψ(ή, y(t):
У° = /(у°,А 2/(*ο) = ίΛ
т=-яллих*), №) = -^. (27'2)
Н(ШУ°ЮУ№ = та»:Н(№>А*)М*))· (27.3)
ι*(*)6Ω
Это нелинейная краевая задача размерности 2п для системы ОДУ
(27.2). Здесь η краевых условий (для у) задано на левом конце, а п
условий (для ф) — на правом.
Схема метода стрельбы такова: зададим произвольное значение
ψ(ίο) = ги подходящим численным методом интегрируем систему
(27.2), при этом для каждого момента времени t находим максимум по
и в выражении (27.3). Получим значения y{t^ ζ) и ^(*ь ζ). Вычислим
невязку
X{z)=*{tk,z) + ?j&(th,z). (27.4)
Решение краевой задачи сводится к решению нелинейного векторного
алгебраического уравнения (27.4).
2.1. Решение системы нелинейных уравнений. Для решения
задачи рассмотрим процедуру Ньютона. Представим функцию X(z)
в виде разложения
X(z + Az) = X(z) + №pj Az + o(Az2).
191
Зададим некоторое начальное приближение и вычислим последующие
приближения по формулам
ζί+1 = ζί-αί( — ) Х&).
Здесь матрица F = ^ — матрица Якоби, а* — специальным
образом подобранные коэффициенты.
Применение метода Ньютона предполагает достаточную малость
отклонения (ζ»+ι — Ζ{), поскольку фактически требуется решить
линейную систему уравнений (а* = 1)
X(zi) + F(zi)(z-Zi) = b (27.5)
отбросив члены малости ο(||2»+ι — Zi ||2). Если начальное приближение
достаточно далеко от искомого решения X(z*) = 0, то квадратичные
члены отбрасывать нельзя.
Улучшить сходимость можно, двигаясь по направлению
z(a) = Zi- aF^iz^Xizi)
до тех пор, пока невязка ||Х(а)|| убывает, например, решая задачу
одномерной минимизации
min \\X(zi - aF-1^)^^))!! (27.6)
a>0
и полагая a» = α*, где a* — решение (27.6). Такой подход называется
модифицированным методом Ньютона.
Теорема 33. Пусть в ограниченной области \\X(z)\\ < C%
функция X(z) имеет равномерно ограниченные первые и вторые
производные, а отображение χ = Χ(ζ) взаимно
однозначно, причем ||F_1(z)|| < C2, и имеется единственный корень
X(z*) = 0. Тогда модифицированный метод Ньютона
сходится, если начальная точка принадлежит указанной области, т.е.
\\Х(г°)\\<Сг.
На практике вместо задач одномерной минимизации (27.6)
пользуются схемой а0 = 1, а? — \а?~х до тех пор, пока не выполнится
неравенство \\X(z{ — aPF"1{zi)X{zi))\\ < ||Х(г*)||. Затем полагают
OLi =aJ.
Итак, метод Ньютона состоит из следующих шагов: а)
определение матрицы Якоби; б) решение линейной системы (27.5).
Поскольку размерность этой системы, как правило, невысока, то поиск
решения обычно трудностей не вызывает (исключая случаи, когда матрица
192
Якоби плохо обусловлена). Для ее решения можно использовать
метод исключения Гаусса с выбором главного элемента.
В нашей задаче вычисление функции невязок и построение
матрицы Якоби производится численно, когда частные производные
приближаются конечными разностями, например:
j ~ |Δ;Ι
o,i-i i+ι,η
Применение этих формул требует решения (п +1) задач Коши для
системы (27.2).
Если функция невязок, вычисляемая для текущего приближения,
оказывается неопределенной (нельзя провести интегрирование и
вычислить невязку), то шаг смещения в итерационной процедуре делится
пополам; если неопределенность возникла при вычислении матрицы
Якоби, то можно использовать формулы численного
дифференцирования «назад», либо «центральные разности». Если это не помогает,
то уменьшается в два раза значение шага Δ.
Основная трудность использования метода Ньютона — выбор
хорошего начального приближения. Для этого можно использовать
процедуру «случайного» поиска, когда начальное положение
разыгрывается с помощью датчика случайных чисел. Однако все это не
дает гарантии получения численного решения. Как правило, попытки
успешны, если удается выявить структуру оптимального управления и
использовать ее при формировании задачи пристрелки.
В настоящее время используется несколько схем метода
пристрелки:
а) получение начального приближения из решения
вспомогательной задачи более низкого порядка, либо более простой, решение
которой известно;
б) использование метода многоточечной пристрелки. Вектор
параметров ζ дополняется значениями фазовых и сопряженных
переменных в промежуточных точках. При этом функция невязки X
дополняется условиями непрерывности фазовых и сопряженных переменных
в этих точках. Решается серия задач Коши на наборе отрезков, на
которые выбранные промежуточные точки делят весь интервал;
в) использование метода встречной пристрелки. Выбирается
промежуточная точка и решаются задачи Коши слева и справа.
193
t
\
t
η
L·-
*'ψ'
t
Рис. 27.1. Метод хорд
Как было сказано выше, с применением метода стрельбы,
двухточечная краевая задача сводится к задаче Коши для системы
обыкновенных дифференциальных уравнений.
Разработано большое число методов численного решения задачи
Коши. На практике (когда нет сведений о характере поведения
правой части) широкое распространение получили одношаговые методы
Рунге-Кутта 4-го порядка точности:
Уп+i = Уп + -h[k0 + 2fci + 2fc2 + fa],
fa =/(Уп,*п),
fcl=/(2/n + 7jfco,*n+ 2)»
k2 =f(Vn + ^hitn + -),
fa =f(yn + hfa,tn + h),
где h = tn - tn-\.
Существуют особенности применения численных методов при
решении двухточечной задачи: в точке разрыва управления правые части
могут терять гладкость, поэтому методы высокого порядка
аппроксимации теряют свою точность.
Само оптимальное решение может оказаться чрезвычайно
чувствительным относительно определения момента переключения
управления.
Следовательно, надо отслеживать точки разрыва. Полагать, что
приближенно разрыв происходит в узле сетки нельзя, так как
решение задачи может быть чувствительно к моменту разрыва управления.
194
Пусть для простоты Я = Щ 4- Н\и. В каждом узле сетки
надо отслеживать знаки величины #ι и ее производной, чтобы
исключить случай, когда на отрезке интегрирования дважды происходит
смена знака Н\. Далее точка разрыва уточняется методом хорд (см.
рис.27.1). Как правило, хватает 1-2 итераций.
Вторая сложность, с которой можно столкнуться при
использовании метода Ньютона при решении двухточечной задачи, заключается в
том, что в некоторых случаях при вариации ζ матрица F(z) становится
вырожденной. Но численное построение не улавливает
вырожденности матрицы Z, так как на практике она плохо обусловлена, и в методе
Ньютона вычисляется неправильное, случайное направление спуска.
Здесь помогает следующий прием. Необходимо провести
регуляризацию и вместо (27.5) решать так называемую нормальную задачу
(FTF + εΕ)Αζ = -FTX(z°), (27'7)
где величина ε мала по сравнению с элементами матрицы F.
Кроме того полезна нормировка системы, при которой одни и те же
вариации ζ приводят к примерно равным вариациям компонент
невязки X.
Для этого решается нормированная задача минимизации
minXTSX = sxXl + s2Xl + s3*3 >
где выбор Si осуществляется по формулам
i=i 3
Это существенно улучшает сходимость метода Ньютона.
Ниже рассмотрим пример [17], в котором принципиально нельзя
решить двухточечную краевую задачу методом стрельбы.
Пример 27.1. Задача о плоте.
Рассмотрим задачу движения плота через речку с
известным профилем течения. Пусть требуется в фиксированный
момент времени максимально удалиться вдоль реки от точки
старта.
Профиль течения зададим в виде V(y) = 1 — у2. Управление
плотом осуществляется перпендикулярно течению у = иу где ускорение
плота ограничено |и| < 1. Сделаем замену х\ = х, х2 = У, #з = *·
195
Уравнения управляемой системы следующие:
Ίτι = 1-Ж2> ^ι(Ο) = °»
±2 = w, \u(t)\ < 1 х2(0) = -1, (27.8)
{is = 1, я?з(0) = 0.
Терминальное множество Μ = {хз(^) = Т}.
Минимизируемый
функционал
ψο = -xi(*fc) ->min.
Функция Понтрягина
имеет вид
Я = Vi(l-X2) + Ф2и + фз.
Сопряженная система
^1 = 0,
^2 = 2^iX2, (27.9)
фз = 0.
Из условия трансверсальности
^*) + λο(-1,0,0)τ±Μ = (71,72,0)
следуетфг(гк) = λ0 и Vbfafe) = 0.
Докажем, что λο ^ 0. Пусть λο = 0, тогда ф\ = 0 => ф2 = 0.
Тогда из условия H(t) = 0 => ^з = 0 и получаем нулевую пару, что
противоречит ПМП. Следовательно, φι > 0 и можно нормировать
Φι = λ
1
0
У
~^\^
~^ч
\
)
/ X
1
1
/
^У
Рис. 27.2. Профиль скорости
2·
Получили двухточечную задачу
(±2 = U (
Ф2=Х2 \
х2(0) = -1
^2(Т)=0
(27.10)
Вектор ζ (в данной задаче скаляр) зададим как ζχ = ^г(0).
При Τ < 1 решение краевой задачи следующее
Х2(*) = —1 + *, ф2(г) = *2/2- * + * = |[(t-1)2 - (г-1)2].
Если 1 < Г, то в этой задаче существует особый режим на участке
[Г,Г], где ^г(*) = 0 и, следовательно, χ2(ί) = 0, а иос = 0.
Проверьте, что условие Келли выполнено и особый участок
является оптимальным.
196
Φ2
"Т_й
1.0 1.4 t
-0.5(ί - **}? - y/2e(t - t*)
Рис. 27.3. Поведение решения при изменении начальных условий
Из предыдущей формулы следует, что начало особого режима есть
точка t* = 1 и оптимальное решение имеет вид:
|(*-1)2 при*<1,
при* > 1.
{
жг(<) = — 1 + ί πρΗί<1,
0 при*>1,
1°
(ί)
Решение получается с начальным условием ζ\ = \. Наличие особого
режима приводит к тому, что невозможно методом стрельбы получить
решение задачи. Действительно, если мы получим решение с любой
точностью ζ\ = \ ± ε, то соответствующая экстремаль (при ошибке
—ε) будет такой:
ίν-2(ί) = |(ί-1)2-ε
\fo(t) = -Ut-t*)2-y/2e(t-t*) при<>£
при t < t* „ /—-
к где t* = 1 - V2e,
(
x2(i) = -l+t при t<t*
x2(t) = -\/2ε - (t - Г) при ί > t*
Вид решений изображен на рис.27.3.
Видно накопление ошибки (невязки) (ψ2(Т) — 0) к концу
интервала [0, Т], вследствие чего невозможно численно решить задачу
пристрелки. Как видно из рис. 27.3, в решении по х2 тоже накапливается
ошибка.
Выход здесь состоит в том, что нужно перейти к
модифицированному методу пристрелки, вводя промежуточную точку z2 = t* и
соответствующую невязку Χ2(ζχ, ζ2) = x2(t*). По такой схеме удается
найти численное решение.
197
Лекция 28
Задача Булгакова о накоплении
возмущений и максиминное тестирование
качества стабилизации
1. Задача Булгакова о накоплении возмущений
Рассмотрим задачу оптимального управления с фиксированным
временем, где для простоты применяется скалярное управление
х = Ах + Ви, х(0) = 0, u(-)€U, t€[0,tfc], (28.1)
а функционал представляет квадрат нормы вектора состояния в конце
процесса
J(u) = vo(x(tfc)) = \\x(tk)\\2 -> max .
\Η-)\\<μ
Физический смысл функции u(t) в данной задаче — это возмущения,
действующие на динамическую систему.
Впервые на возможность применения вариационного метода для
решения такого рода задач обратил внимание профессор МГУ
Б.В. Булгаков. В 1939 г. он поставил и решил задачу о влиянии
северной составляющей скорости корабля на отклонение
гирокомпаса. О скорости предполагалось известным только, что она является
кусочно-непрерывной функцией, ограниченной по модулю. Было
показано, что наихудшая ситуация осуществляется тогда, когда корабль
идет с максимальной скоростью вперед и назад по меридиану, меняя
курс на обратный через каждый полупериод собственных колебаний
гирокомпаса, и найдено максимальное отклонение гирокомпаса от
направления на север. В 1946 г. Б.В. Булгаков дал полное решение
задачи о максимальном отклонении линейной системы по одной
координате [12].
Рассматриваемая экстремальная задача представляет собой
обобщение задачи Б.В. Булгакова о накоплении возмущений.
Как сказано выше, Б.В. Булгаковым была решена задача о
максимальном отклонении по одной координате, т.е. для линейного
функционала J(u) = cTx(tk)y где с — заданный вектор.
Решение этой задачи легко получить из принципа максимума. На
лекции 18 мы получили с помощью ПМП решение задачи оптималь-
198
ного управления с фиксированным временем, терминальным
функционалом и свободным концом траектории.
Рассматриваемая нами задача Б.В. Булгакова полностью
укладывается в постановку задачи лекции 18, где функционал качества —
линейный вида <po(x(tk) = -cTx(tk).
Выпишем функцию Понтрягина Я = ф1(Ах+Ви) и сопряженную
систему
ψ = - Атф
Θφο (28·2)
дх
ι
tf(fc)=-
= с.
Оптимальное возмущение, доставляющее максимум функционалу,
следующее:
при^т(*)В(*)>0,
-μ npHi/>T(t)B(t) <0.
А*)
-ι-,
(28.3)
Это решение имеет
простой геометрический смысл
(см. рис.28.1) — проекция
соответствующей данному
управлению точки
множества достижимости fl(tk)
на направление, заданное
вектором с максимальна.
Вернемся теперь к
исходной задаче — с
квадратичным функционалом
вида φ0 = xT(tk)x(tk).
Тогда из ПМП следует
краевое условие для
сопряженной системы
Рис. 28.1. Решение линейной задачи о
максимальном отклонении
Проблема решения двухточечной задачи в том, что мы не знаем x°(tk).
Трудности решения двухточечной задачи методом стрельбы
обсуждались на прошлой лекции.
Применим для решения задачи оптимизации прямой метод —
метод условного градиента.
199
Метод условного градиента. Опишем метод условного
градиента для решения следующей задачи:
J(u) -> min ,
где U — замкнутое ограниченное множество в евклидовом
пространстве Rs, причем функционал J (функция) непрерывно
дифференцируем J(u) € С1 (U).
Обозначим щ € U — некоторое начальное приближение. Пусть
известно i-oe приближение щ € U. Рассмотрим главную линейную
часть gi(u) приращения AJ: gi{u) = VJ{ui)T(u — щ), где вектор
VJ(u) = (§έ)Τ· Найдем вспомогательное приближение щ из
условия
VJ(ui)T(ui — щ) = min VJ(ui)T(u — щ))
или, что то же, из условия
V J(ui)Tui = min V J(ui)Tu. (28.4)
Можно показать, что минимум в (28.4) достигается хотя бы на одном
Затем полагаем
tK+i = щ + a.i(ui - щ), a.i € [0,1], (28.5)
где параметр oti может быть выбран одним из способов:
• αϊ определяется условием
<Pi(<*i) = ominVi(ot), (28.6)
0<α<1
где φί(α) = J(ui + а(щ - щ))
• если градиент удовлетворяет условию Липшица
||VJ(u)-VJ(ti;)||<L||t;-ti;||,
то можно положить
^ \\ui-Ui\\2) L + 2e
где ει, ε > 0 — параметры метода
• задать а» = 1, проверить условие монотонности J(iii+i) <
J(ui) и при необходимости положить а* = \otu пока не
выполнится условие монотонности.
200
Рис. 28.2. Алгоритм решения задачи Булгакова
Доказана сходимость решения по методу условного градиента к
стационарной точке функционала J для последовательности {щ},
определяемой этим методом при любом выборе начального
приближения wo € U.
Как видно, шаг алгоритма условного градиента представляет
собой решение задачи Булгакова для линейного функционала «4 (и) =
cjx(tk),mea = 2ж'(^).
Тогда при каждом t решение линейной одномерной задачи
приводит к формуле (28.3).
Отсюда следует, что шаг метода условного градиента (при а* = 1)
полностью совпадает с решением соответствующей задачи Булгакова
(совпадает с решением ПМП) и имеет тот же геометрический смысл:
найдена максимальная проекция множества достижимости системы
fltk на направление с (см. рис.28.2).
Для случаев η = 2,3 доказана сходимость этого метода [8] в задаче
Булгакова.
Действительно (при η = 2), на текущем шаге решается задача
J*+1 = max xjx(tk) = xjxi+i > xjx% = «/%
x(tk)e&
если ж*+1 ^ Xim Вычисления прерываются, когда выполнено
равенство и, следовательно, ж» = χ%+ι·
Метод Крылова-Черноусько. Рассмотрим теперь нелинейный
вариант задачи (28.1), т.е. управляемую систему с фиксированным
временем и свободным правым концом траектории
У = /(у,и), y(*0) = y*, u(-)€W, i€[t0,*fc],
(28.7)
201
о оч-л/.ч .^.ч_ δ¥Ό (28.8)
и терминальным функционалом
J(u) = vo(y(**)) -> mm
Исходя из ПМП оптимальное управление находится из решения
краевой задачи относительно переменных i/)(t),y(t):
Г 2/° = /(гЛА »(«·) = у·,
\ фу> = -ну(у°, и°)ф(ь), Ф{ьк) = - ду ,
HMt),y°(t),u°(t)) = max Η(φ(ί),y°(t),«(«)). (28.9)
u(t)Gi2
В работе [25] был предложен следующий алгоритм поиска
оптимального управления:
Пусть задано некоторое начальное приближение u(t) = «*(£).
1) При известном и* можно проинтегрировать систему (28.7) и
вычислить у*(£). Зная yi(tk)t можно вычислить Jjfuk\ и получить
краевые условия для сопряженной системы.
Теперь можно независимо проинтегрировать сопряженную
систему (28.8) справа налево, вычисляя правые части в (28.8) Hy(yi(t)) как
функции времени.
2) Промежуточное управление находится из решения задачи ПМП
#(*)= шах ЩгРЩ,уЩ,и).
u(t)eu
3) Следующее приближение вычисляется по формуле
где oci подбирается из условия, чтобы J(ui+1) < J(w*).
Как видим, схема данного метода полностью совпадает со схемой
условного градиента. Сходимость этого метода в общем случае не
доказана.
Известны различные модификации, для которых при некоторых
ограничениях доказана сходимость в пространстве состояний.
2. Алгоритм проектирования точки на множество
достижимости
Рассмотрим линейную систему (28.1) и следующий функционал
J(u) = <po(x(tk)) = \\x(tk) - Хс||2 -> и nun ,
где хс — фиксированная точка, не принадлежащая множеству
достижимости, построенному в момент времени ί&: хс g Clu(tk)·
202
Мы хотим найти минимальное расстояние между хс и точками
множества достижимости.
Метод условного градиента в этой задаче строится
аналогично предыдущему примеру, но решение сопряженной системы (28.2)
ищется с другим краевым условием:
ф(1к) = -2(a?°(tfcji*) - Хс). (28.10)
Сходимость метода условного градиента существенно зависит от
того, насколько далеко точка хс находится от границы множества
достижимости. Если точка близка к границе, то необходимо
использовать методику подбора коэффициента щ на каждом шаге алгоритма.
3. Максиминное тестирование качества робастной
стабилизации
Разработка сложных систем управления всегда включает этап
испытания и тестирования созданных алгоритмов управления
динамической системой. Как правило, такая проверка проводится путем
моделирования условий работы алгоритма самим коллективом
разработчиков алгоритмов. При этом существенно, что сам алгоритм
управления известен системе, с помощью которой проводится тестирование.
Другая ситуация, когда необходимо провести приемку и выбор
лучшего алгоритма из нескольких, причем созданных разными
разработчиками. В этом случае, как правило, сам алгоритм представляет «черный
ящик», в котором известны только вход и выход.
Аналогичная проблема возникает, когда надо проверить работу
человека-оператора или пилота, так как в этих случаях структура
алгоритма управления тоже неизвестна.
Для того, чтобы объективно получить оценку качества управления,
а также провести тренировки пилотов-операторов с целью улучшения
показателя качества управления, необходимо создать проверочный
стенд. Сам стенд может иметь различный уровень сложности — быть
чисто компьютерным, либо и компьютерным, и динамическим, быть
полунатурным, т.е. включать отдельные элементы системы
управления в натуральном виде (это может быть сам человек-оператор, либо
микроконтроллер с зашитыми алгоритмами управления).
Все стенды должны содержать модель динамики управляемого
объекта и, кроме того, если стенд динамический, нужно так
организовать движение стенда, чтобы имитировать условия реального
движения для измерителей и сенсорных систем пилота. Таким образом,
203
f-
Алгоритмы
управления
J Исполн.
(механизмы
м .Γ
η
< * 1
Движущийся!
объект |
А А
Сенсоры
Г
i
| А
Среда 1
(Имитаторы
движения)
Алгоритмы тастиповяния
< *
Рис. 28.3. Структурная схема тестирующего стенда
очень важно создать на стенде соответствующую реальным
условиям визуальную обстановку. Имея в распоряжении такой стенд, можно
проверять либо качество работы алгоритмов управления, либо навыки
пилота по управлению динамическим объектом.
Часто требуется проверить качество алгоритмов управления в
экстремальных условиях их функционирования. Это характерно,
например, при разработке космических систем, где цена ошибки
непомерно высока. Для этого надо моделировать динамику управляемого
объекта при наихудшем поведении возмущений (параметров,
мешающих управлению), действующих на управляемый объект.
Следовательно, в процессе проверки алгоритма либо тренировки надо решать
задачу поиска этих наихудших возмущений.
Структурная схема такого тестирующего стенда представлена на
рис. 28.3.
Рассмотрим более подробно функционирование системы
тестирования на примере решения задачи об оценке точности алгоритмов
стабилизации программного движения.
Если система стабилизации сконструирована достаточно хорошо,
то реальное движение будет осуществляться в окрестности
программного движения, и можно рассматривать линейную систему уравнений
в отклонениях при наличии внешних возмущений ν
х = Ах + Ви + Cv, x(0) = х0€ Х°, (28.11)
где и(-) €li,v(·) € V — ресурсы управления и возмущения, а Х° —
область начальных возмущений.
Поставим задачу: оценить точность стабилизации для некоторого
управления и — й(х, t) в заданный момент времени tk в смысле
следующего функционала
J(u,v) = x(tk)TEsx(tk),
204
где Е3 = I J ίο'")' т,е· по отклонениям в момент tk первых s
\ о '.'.'. ... о/
координат.
Следующие две задачи составляют дифференциальную
антагонистическую игру между управлением и возмущением:
а) управление стремится минимизировать критерий качества
max J (и, υ) —> min:
vev v ' um
б) возмущение же стремится его максимизировать
min J(u, υ) —> max.
ueu v ' vev
Задача системы тестирования — сформировать те наихудшие
возмущения, при которых будет происходить тестирование алгоритма
управления на стенде.
Предположим, что указанную дифференциальную игру будем
решать в классе программных стратегий, т.е. u(t) € U и v(t) € V —
функции времени.
Сделаем замену χ = у — ζ. Тогда систему (28.11) можно
представить в виде двух подсистем
у = Ау + СЧ у(0) = уо € Х°, (28.12)
i = As-Bu, z(0) = 0. (28.13)
Критерий качества (функционал) представим как квадрат
расстояния между фазовыми векторами этих подсистем в конечный момент
**:
J(u, ν) = (у - z)TEs(y - ζ) = Q2(y,z).
Рис. 28.4. Седловая точка геометрической игры
205
Для простоты считаем, что s = п.
Множества точек z(tk) € flu и y(tk) € Ων при всевозможном
допустимом поведении управлений u(t) € W и возмущений v(t) € V
составляют множества достижимости систем (28.13) и (28.12),
соответственно. Ограничения на управление и возмущение таковы, что
множества достижимости Ωη, Uv — ограниченные выпуклые замкнутые
множества.
Таким образом, дифференциальная игра между управлением и и
возмущением υ свелась к антагонистической геометрической игре на
множествах достижимости между z(tk) и y(tk):
а) минимакс: max g(y, z) -> min;
ι/6Ων zeftu
б) максимин: min g(y,z) -> max.
ze&u yeftv
Покажем, что всегда выполнено неравенство
max min g(y,z) < min max^(y,z).
ι/6Ων zeQu ze&u yeQv
Действительно, зафиксируем у = yf. Тогда Vz € Slu g{y\z) <
max g(y, z)y откуда
1/6Ων
min g(yf, z) < min max g(y, ζ) = ρ°.
Поскольку это неравенство выполнено при любом у', то
0O = maxmin0(y,z) < ρο
yeuv ze\iu
Седловая точка геометрической игры существует, если ρο = ρ° —
Q(y°> z°)· Величина ρο называется ценой игры.
Оптимальная стратегия тестирования существует, если
существует седловая точка дифференциальной игры.
В этом случае максиминное тестирование проводится в три этапа
по следующей схеме:
1) находим решение задачи на максимин и, соответственно, цену
игры ρο = £(yV°);
2) моделируем на стенде подсистему (28.13) с тестируемым
алгоритмом управления и (проводим тренировки пилота) и вычисляем
точку £(**).
Тогда ρ° < £(у°, ζ) — ρ и, следовательно, ρ = £(у°, ζ) > ρο',
3) вычисляем оценку результатов тестирования по десятибальной
шкале 10· ^.
При этом существование сед/ювой точки соответствует
возможности для пилота (автоматического алгоритма) получить «отличную»
206
оценку в 10 баллов. Таким образом, максиминное тестирование в этом
случае дает объективную оценку качества управления.
Как видим, существенное место при формировании тестовых
возмущений занимает выяснение условий существования седловой точки
в геометрической игре на множествах достижимости. Известно
много различных критериев существования седловой точки в
геометрической игре. Например, если пара (z°,y°) составляет седловую точку,
то, как показано на рис. 28.4, в этих точках существуют опорные
гиперплоскости к множествам достижимости Slu и Ων, которые
параллельны между собой и перпендикулярны отрезку [z°, y°].
Заметим еще, что только единственная точка ζ° множества
достижимости подсистемы по управлению Пи может составлять седловую
точку игры (z°, y°), тогда как решений по возмущению у° может быть
бесконечно много.
Существуют численные итерационные алгоритмы поиска седловой
точки геометрической игры, которые представляют собой
комбинацию алгоритма решения задачи Булгакова, рассмотренной в п. 1 и
задачи проектирования точки на множество, рассмотренной в п.2.
Если седловой точки не существует, то можно перейти к так
называемому смешанному расширению игры.
Процедура перехода к смешанному расширению дана в
дополнении к лекции 28.
207
Дополнения к лекциям
В Дополнения к лекциям вошли только те материалы, которые
непосредственно примыкают к материалам лекций — либо их развивают, либо
дополняют. В лекции они не вошли из-за недостатка времени, отводимого на чтение
курса.
Дополнение к лекциям 5-7. Декомпозиция
алгоритмов управления и оценивания по компонентам
соответственно вектора управления и вектора
наблюдения
Рассмотрим задачу построения алгоритмов управления для систем с
несколькими управляющими входами (величина и — вектор). Для
простоты, но не нарушая общности, будем считать, что вектор и двумерный: ит ==
{и\ гхг). Тогда уравнения управляемой системы можно представить в виде
х = Ах + и1Ъ1+и2Ъ2, В = (ЪгЪ2). (D5.1)
Введем две последовательности
fl1 = bV = V,...,ffi+1 = V,·..
f = b^f = Afiji+i = Afit
Пусть также
/<+i = ft/1+ ..·+ /*/«. (D5'2>
Каждый из наборов {дг>..., gm} и {/*, ...,/*} состоит из линейно
независимых векторов.
В свете вышесказанного каждый из наборов представляет базис
управляемого подпространства соответственно при помощи управления щ и при
помощи управления «2. Если пара (А, В) управляема, то m + I > η, и
среди векторов указанных наборов найдется η линейно независимых векторов,
которые в совокупности могут быть выбраны в качестве базиса полного
пространства. Очевидно, выбор базиса в общем случае неоднозначен.
Из всех возможных вариантов такого выбора два представляют
наибольший практический интерес.
1. Базис полного пространства составим из всех векторов
первого набора, дополнив их до η векторов первыми векторами второго набора
{д1,..., £т, /\..., /r}, m + г = п. Имеет место представление
/-+1 = Ίι9* + . . . + 1шд™ + δχί1 + . .. + Srf. (D5.3)
208
Введем векторы ξ = (ξι... £m)T и η = (771... Vr)T, составленные из контра-
вариантных координат вектора χ в новом базисе
x = tig1 + --- + (mgm+mf1 + --- + vrfr·
(D5.4)
Подставив (D5.4) в (D5.1), аналогично предыдущему, получим с учетом (D5.2)
h(D5.3):
= Ац£ 4- Αχ2η + b\m,
= A22V + blu2l
(D5.5)
где
Ац =
A22 =
/00
1 О
V о о
/00
1 О
V о о
О αϊ \
0 а2
1 От /
0 6г\
0 δ2
1 Sr J
А12 =
/ о
о
V о
О 71 \
О 72
О
« =
<^
\о/
«=
7т /
О
\о/
Пары (Ацу bl) и (Л22, &2), очевидно, управляемы.
Задачу стабилизации можно решить при помощи линейной обратной
связи т = с1Т£, и2 = с2Т?7. В результате характеристическое уравнение
получившейся системы распадается на два
det (ХЕт - (Ац + blc1T)) = 0, det (XEr - (А22 + btc2T)) = 0.
В каждом из них векторы с1 и с2 можно выбрать так, чтобы коэффициенты
этих уравнений были любыми наперед заданными. В частности, может быть
обеспечена экспоненциальная устойчивость системы с любой наперед
заданной степенью.
2. Базис полного пространства будем составлять, выбирая поочередно
векторы из наборов {д1,..., дт} и {/*,. ..,/*} до тех пор, пока очередной
вектор не окажется линейно зависимым от ранее выбранных векторов.
Пусть им оказался вектор /fc+1. Недостающую часть базиса
доберем из очередных векторов набора {#*}. В результате получим базис
{giy · · · j д*у Ζ1» · · · > fk}> где s > &»s + & = n· Имеют место представления
?·+1 =
fk+1 __
= μlg1 + ···+μaga+^Ίf1+·· + ^'kfk,
= 7101 + · · · + lkgk + -rk+igk+1 + Sif1 + ··· + Skfk
(D5.6)
В последнем соотношении содержатся два разноименных вектора с
одинаковыми старшими индексами, что эквивалентно дифференциальным
уравнениям, не разрешенным относительно старших производных. Для того, чтобы
209
освободиться от этого обстоятельства, которое могло бы причинить нам
вычислительные трудности, проведем некоторые преобразования.
Введем векторы ft = fj — 7&+ι0* и управление гх* = щ + 7*η-ι^2· Легко
видеть, что fi+1 = Afi. В новых переменных исходные соотношения
перепишутся следующим образом
χ = Ах + и+д1 +u2fl, (D5.7)
9a+1 = μ^ + '-'+μ^' + νι/Ι + '-' + ^ίϊ,
/ί+1 = 7iV + ---+7i^ + ^i/*+--- + ^/i, (D5.8)
где
μϊ = /ii + ^i7fc+b 7i =7j+7fc+i<*7, J = l,...,fc
(D5.9)
μ* = μ-
Покажем, что существует базис {р1,... ,ρβ, ν1,..., ν*5}, в котором вектор
х = up1 + · · · + ξ*Ρ* + ηιν1 + ··· + ηι*υ* (D5.10)
описывается следующими уравнениями
ξι = 6,
6 = is,
6 = μϊξι + ···+ μΐξβ + 7i*7i + · · · + 7**7* + u*,
Vi = *?2»
»?2 = ?73,
Vk = ^1171 Η l· ftfeffc + *ί£ι Η Ь^л + иг.
В самом деле, подставив (D5.10) в (D5.1), получим соотношения для
определения базисных векторов
и\ : д1 = р% и2 : fl = Λ
ξ8: Ар* =ρθ-1+/χ;ρβ, ?7fc: Λυ* = vk~x + 4vfc + 7*pe>
£e_x ^p-1 = ρ-2 +μ;_ιρβ, ijfc-i rite*-1 = ι>*"2 +<**-ιΐ>* +7*-ιΡβ>
&: V =pfc-1+/iipe+^vfc,
£2 : 4p2 = Ρ1 + μ$Ρβ + Wfc, 772 : Λν2 = υ1 + S2vk + 72pe,
ξι : Ap1 = μίρ* + vwk\ 771 : Λυ1 = Sivk + 7ipe.
210
Теперь следует положить
ма _1
Ρ = 9 >
Ma—1 Л2 ..*Л1
Ρ = 0 -β89 >
р —9 - μ89 - μ8-ι9 >
ρ1 = ΐ-μΐέ-1 tig1-^-1 ^/*,
ν
= Λ,
„*-* = β-ья-αϊ,
υ
1 = Ζ*-**/**"1 bfl-ИаГ-1 ιίΛ1·
Соотношения при ξι и 771 выполняются тождественно. Очевидно, что набор
{р1,... ,ρβ, ν1,..., vk} составляет базис.
Пусть измеряются все компоненты вектора состояния χ и, значит, могут
быть вычислены величины ξ и η. Задачу стабилизации будем решать по
принципу обратной связи, сформировав управления м* и иг в виде
и* = -(7ι*7ΐ + ·'' + 7**7*0 + с1Т£, mrln
tX2 - -(«*ίι+ ··· + «***)+<?Ч 1и0-И)
Напомним, что «* = «ι 4- 7fc+it*2· Отсюда находится гл. В результате такого
выбора полная система распадается на две замкнутые подсистемы
6=6» *Ь=*?2>
£2=£з> ??2=773)
ξ, = (μί + ci)6 + · · · + (μ; + cj)6, ft = fa + с?)тд + · · · + fa + с\)щ.
Векторы с1 и с2 могут быть выбраны так, чтобы обеспечить в каждой из
подсистем любые наперед заданные характеристические уравнения, а, стало
быть, обеспечить желаемую экспоненциальную устойчивость.
В заключение пунктов 1 и 2 заметим, что изложенные в них процедуры
могут быть названы по своему результату декомпозицией (расщеплением)
уравнений динамической системы по компонентам вектора управления.
3. Перейдем теперь к задаче построения алгоритма оценивания для
систем с несколькими выходами (величина ζ — вектор). Процедура построения
будет сопряжена аналогичной процедуре в задаче управления.
Для простоты, но не нарушая общности, будем считать, что вектор ζ
двумерен: zT = fa 22). Имеем
zi = h1Tx, z2 = h2T, х = Ах. (D5.12)
211
Введем две последовательности векторов
Пусть
^ = kV = i»V ^+1 = AV,..
9m+1 = адЧ-4-атЛ
/'+1 = А/Ч-'+Д/1.
(D5.13)
Каждый из наборов {у1,... ,^11*}, {Ζ1,... ,/1} состоит из линейно
независимых векторов. Тогда каждый из наборов представляет базис подпространства,
вполне наблюдаемого при помощи, соответственно, измерений ζ\ и ζ^. Если
пара (Л, Я) вполне наблюдаема, тот + I > пи среди векторов указанных
наборов найдется η линейно независимых, которые и могут быть выбраны в
качестве базиса полного пространства.
Но выбор базиса неоднозначен. Из всех вариантов такого выбора
рассмотрим (в этом и следующем пунктах) два наиболее употребительные.
Составим базис полного пространства из первого набора, дополненного
до η векторов первыми векторами второго набора {д1,..., #т, /*,..., /г},
т + г = п. Имеет место представление
/'+1 = м1 + ... + 7т£- + Sxf1 + ··· + Srf. (D5.14)
Введем векторы ξ = (ξι... fm)T и η = (771... ?7г)т, составленные из ковари-
антных координат вектора χ в новом базисе
& = хТЯ? (J = 1,... ,т), ?7< = xTfx (г = 1,... ,г).
Получим с учетом (D5.13) и (D5.14),
6 =£з,
*?1 =*?2>
»>2 =^73,
£т = «l6 Η l· Οίτηξτπ, ήν = 7l6 Η l· 7*n£m + δχηΐ Η h SrVr,
Ζ\ =£l, *2 =171-
Или в матричной форме
ή = Α2\ξ + ^22*7,
С = АггЬ
Zl = e(m)£> *2 = β(^?7.
где
^11 =
/01 0 ... 0 0 \
0 0 1 ... 0 0
\αΐ Q2
, ^21 =
ОСт/
/о ... о о \
о ... о о
\7ι 72 ... 7т/
212
A22 =
/О 1 О ... О 0\
О 0 1 ... О О
\δι δ2
О
> е(т) =
«г/
О
' е(г) =
W
W
Представляется естественным следующий алгоритм оценивания
η = Α21ξ + Α22ή + Κ2(ζ2 - e\J^).
Уравнения ошибок
Δτ) = A21At + (A22^-K2e\J))AV.
(D5.15)
(D5.16)
Характеристическое уравнение последней системы расщепляется на два
det (ХЕт - (Ац - Kxe\Z))) = 0, det (XEr - (А22 - tf2e$)) = 0.
Вследствие наблюдаемости пар (Ац,е[т)), (А22,е\г)) в каждом из
характеристических уравнений выбором соответственно векторов К1 и К2 можно
обеспечить любые наперед заданные коэффициенты, а стало быть, и
асимптотическую устойчивость уравнений ошибок.
4. Базис полного пространства будем составлять, выбирая
поочередно векторы из наборов {tf1,...,^"1}, {Z1,···>/'} до тех пор, пока
очередной вектор не окажется линейно зависимым от предыдущих. Пусть им
оказался вектор /r+1. Недостающую часть базиса доберем из
очередных векторов набора {<?*}. В результате получим совокупность векторов
{#\ · · · > 9*ι /\ · · ·»/г}» г < s, s + г = п. Имеют место разложения
„«+1 —
fr+l __
= μι9Χ + ··· + μ89* + vxfx + · · · + vrfr,
1 + · · · + yrgr + 7r+iffr+1 + ίι/1 + · · · + ir/r. ф5Л7)
Аналогично тому, как это делалось в задаче управления, проведем некоторые
преобразования, дабы освободиться от наличия во втором соотношении двух
разноименных векторов с одинаковыми старшими индексами.
Введем векторы fl = fj - 7γ+ι^, (/*+1 = Ατ f})t и новое «измерение»
ζ* = flTx = z2 - 7r+i*i.
В новых величинах соотношения (D5.17) можно переписать в виде
гг+1 _
Ίϊ
= 7< + A*7r+i. г = 1,...,г.
(D5.18)
213
Покажем, что существует базис {р1,..., ра, q1,..., qr}, в котором ковариант-
ные координаты вектора χ описываются следующим образом
& = a?"V(j = l,...,s), 77» = a?V (* = !»· ··»»·),
21 = €1, ζ* = Τ7ι,
ξι = μ8ξι + ξι + ^**2, ί)ι = <Jr77i + 7?*ι + Щ,
6 = Μβ-ΐξΐ + ξζ + Vs-lZ2, ή2 = Sr-lTfr + 773 + Ir-lZl,
6 = μιξι+ι>ιΖ2, r)r = <W+7i*i>
причем uj = 0 при j > г.
Последовательно имеем из первого столбца
ξι = хтд1=хтр1,
6 = ξι- μ8ξι - vaZ2 = xT(g2 - μ89Χ - Vaf1) = xTp2,
ξ, = ят(<7в - μ.?'1 μ291 - ι/./-1 Ι/2/1) = жV-
Последнее уравнение столбца выполняется тождественно в силу (D5.17).
Аналогично,
*7ΐ = ^ /* = х Я >
772 = xT(fi-Srrt-ifgl) = xTf,
Vr = хт(/: - ir/Г1 fc/*1 - 7?<Г"1 72P1) = * V-
В качестве алгоритма оценивания выберем следующий:
|ι = μ8ξι + & + vaZ2 + Ku(zi -ξι),
f« = μιίι + viZ2 + Ku(zi - £1),
ijl = ίΓήΐ + ib + ηΐζχ + #21 (** - Г71),
7% = ir^l + 71^1 + Κϊτ{ζ* - 77l).
Уравнения ошибок оказываются расщепленными на две независимые друг от
друга группы:
Δ£ι = (μ* - Κιι)Δξι + Δξ2ι Δτ)ι = (Sr - Κ2ι)Αηι + Δτ/2,
Δ& = (μι-ϋΓι.)Δ€ι, Δτ)Γ = (<*ι-#2γ)Δτ7ι.
Из предыдущего ясно, что в каждой из подсистем параметры Кij и К2%
можно выбрать так, чтобы соответствующие характеристические уравнения имели
любые наперед заданные коэффициенты, а стало быть, так, чтобы уравнения
ошибок были асимптотически устойчивы.
214
Дополнение к лекции 13. Субоптимальное
сглаживание
Фильтр Калмана применяется для решения задач оценивания в реальном
времени. Это означает, что определение оценок χ фазового вектора χ
исследуемой линейной системы происходит в темпе поступления измерительной
информации и определяемая этим алгоритмом оценка x(U) учитывает
измерения, полученные к текущему (реальному) моменту времени t».
Однако, существуют многочисленные приложения, допускающие
постобработку измерительной информации, что позволяет иначе сформулировать
задачу оценивания. Суть новой постановки состоит в том, что для
определения оценки вектора состояния в каждый момент времени необходимо учесть
весь массив измерительной информации, тем самым используя в
соответствующем алгоритме как «прошлые», так и «будущие» измерения. Такие задачи
носят название задач сглаживания.
Рассматривается стандартная задача оценивания вектора состояния Xj
линейной динамической системы
«i+i = *i«i + g,·, (D13.1)
при помощи измерительной информации zq, z\y..., ζν·
Zj = HjXj+rj, (D13.2)
поступающей в дискретные моменты времени to, *i,..., *лг (tj € [to, to]).
Принимаются стандартные гипотезы для параметров а^, Р0~, qj, rj
задачи калмановской фильтрации. Требуется в каждый момент времени tj
определить несмещенную линейную оценку щ вектора состояния Xj системы
(D13.1), учитывающую весь массив измерений ζο, ζχ,..., ζν на интервале
решения задачи [to, to]. В качестве критерия оптимальности рассматривается
критерий ортогональности. Такая задача носит название задачи сглаживания
на фиксированном интервале.
В настоящее время, по-видимому, наиболее конструктивным для
численной реализации алгоритмов сглаживания на фиксированном интервале
является подход, согласно которому в процедуре определения оптимальной
сглаженной оценки Xj используются два независимых алгоритма:
стандартный фильтр Калмана (прямой фильтр) и так называемый обратный фильтр —
фильтр в обратном времени. Каждый фильтр использует свой набор
измерительной информации: прямой фильтр Калмана использует «прошлые»" и
«настоящие» измерения {zo,..., Zj-i, Zj}, обратный фильтр — «будущие»
измерения {*я-ь ...,**}.
1. Сглаживающий субоптимальный фильтр Калмана на
фиксированном интервале.
Выделяются три этапа вычисления оптимальной сглаженной оценки.
215
а) Прямой фильтр Калмана определяет текущую оценку:
it = M[xj/zo,...,zj].
б) С помощью обратного фильтра, описываемого ниже, определяется
оценка
£y=Mfo/*,·+! ,...,**]
в) Искомая оптимальная сглаженная оценка Xj определяется в результате
«склейки» независимо полученных оценок ret и ж^·.
Опишем эти алгоритмы.
Прямой фильтр Калмана. Алгоритмы численной реализации фильтра
Калмана приведены выше и здесь опускаются.
Обратный фильтр. В процессе вычислений, осуществляемых обратным
фильтром, определяется оценка у^ вспомогательной величины, связанной с
оценкой rcj~. исходного вектора состояния соотношением
Уъэ=ръ*хьэ-
Здесь Рьа — ковариационная матрица ошибки оценки обратного фильтра.
В алгоритме выделяются следующие функциональные блоки:
инициализация стартовой точки; этап коррекции; этап прогноза оценок между
измерениями.
2. Субоптимальный алгоритм сглаживания.
Опыт непосредственного применения алгоритма оптимального
сглаживания показывает, что точная численная реализация обратного фильтра и
процедуры «склейки» оценок является плохо обусловленной и может приводить
к неустойчивым вычислениям.
В приложениях хорошо зарекомендовал себя подход, когда вместо
точного оптимального алгоритма, используется субоптимальный алгоритм
сглаживания. Его «субоптимальность» по сути, заключается только в иной
инициализации ковариационной матрицы P^N обратного фильтра:
(р^Г^о.
Используется следующая ее аппроксимация:
рт = ж' еу гАе « > 1.
Далее для обратного фильтра задача оценивания записывается в обратном
времени, при этом ее модель имеет обычную калмановскую структуру.
Опишем численную реализацию субоптимального алгоритма.
а) Инициализация граничной точки обратного фильтра:
йш = 0>
216
PbN = ae · Ε, ae — большое число.
б) Этап коррекции:
xtj = «у + Kbj[zj - HjXb-j],
pbj = [E- KbjH^P^j,
Kbj = PbjHj [HjPbjHj + Rj]~ .
Эти соотношения в точности совпадают с соотношениями этапа коррекции
фильтра Калмана в прямом времени.
в) Этап прогноза:
Αϊ = *7i-iK5 + Qi-i]*7j-i. (D13·3)
ΦΤΤ Λ = Гф7* JT
Соотношения (D13.3) структурно совпадают с уравнениями этапа прогноза
прямого фильтра Калмана. Выделим отличие: в (D13.3) фигурирует обратная
переходная матрица Ф"1, в отличие от прямой переходной матрицы Φ в
обычном фильтре Калмана. Матрица Ф"1 может быть определена при наличии
соответствующей непрерывной модели линейной системы
например, следующим образом:
л*2
Ф-Х = Е-ЫА+Ц-А2.
Склейку можно осуществить, используя следующие два равноценных
подхода.
Подход /. Рассмотрим вспомогательную задачу: требуется построить
оценку ж вектора χ и определить ковариацию Рд* ошибки оценки Ах = х—х,
если заданы два векторных измерения:
ζι = χ + η и ζιι = χ + г//,
где
M[r/] = 0, M[m] = 0, M[rirJ) = Ru
М[тгЪ] = RIU М[пгЪ] = 0.
Оценка строится как линейная, несмещенная и удовлетворяющая критерию
ортогональности.
х = Κιζι + Κιιζπ.
Условие несмещенности приводит к равенству
К!+КП = ЕУ
217
при этом
Ах = -Kiri - Кпгп,
ζι = Δα;+ 77,
ζ π = Ах + гц.
Условия ортогональности:
M[AxzjT] = 0, M[AxzjjT] = 0.
Отсюда следует
Pax = KiRi, Pax = Я>/Д//
или
Κι = PaxRj , uf// = РдхЯц .
Из условия несмещенности получаем:
Рдх = (Д71 + Д7/Г1·
В нашем случае
ζι = £+, Л/ = Ρ/, ζ// = ж^ь, Rn = Р^·
Окончательный результат склейки таков:
где
К>ь = Р?(РГьГ\
Ρ» = (Ρ/)-1^^)-!.
Подход 2. Рассмотрим вспомогательную задачу: оценить вектор χ по
измерению ζ = χ 4- г, Μ [г] = 0, Μ [rrT] = R, если известна априорная
информация о векторе х:
μχ = Μ [ж], Рж = Μ [(ж - μχ)(χ - μχ)Τ].
На основании ранее полученного, имеем соотношения:
х = μχ + Κ(ζ - μ*),
где
К = Ρχ(Ρχ 4" -R) , Pax == Ρ» — ΚΡχ.
В нашем случае:
μχ = Xj > Ρχ = Pj ι ζ = #£&>
λ = *^ь> Ρδχ == Pj > # == ^j ·
218
В результате получаем:
if = xf + K(xJb-xf),
Kj = Pf^ + Pf^.
Полученные соотношения эквивалентны соотношениям, полученным при
первом подходе, что проверяется непосредственно.
Например, величина (Р/*)"1, полученная при первом подходе,
умноженная на Р* при втором подходе, равна единичной матрице.
Дополнение к лекции 14. Меры оцениваемости
Задача оценивания вектора состояния линейной динамической системы
при помощи доставляемой измерителями информации неизбежно
порождает вопрос о том, может ли такая задача быть принципиально решена. Ответ
на этот вопрос дает теория наблюдаемости, позволяющая выделить
наблюдаемое подпространство. Но практически важно знать не только наблюдаема
ли некоторая комбинация компонент вектора состояния, но и хорошо ли она
наблюдаема (или оцениваема). Конечно, если задача оценивания
сформулирована как задача калмановской фильтрации, то точность оценки полностью
определяется решением соответствующего ковариационного уравнения.
Однако из этого решения напрямую не ясно, какую роль в обеспечении
этой точности сыграли измерения, а какую — априорная информация о
системе и ее динамические свойства.
Со многих точек зрения целесообразно строить отдельно алгоритмы для
тех переменных состояния, которые могут быть оценены с
удовлетворительной точностью именно при помощи информации, доставляемой измерителями.
Другими словами, нужны математически формализованные характеристики,
определяющие меры оцениваемости переменных задачи.
Вопрос о конструктивном введении такой характеристики не является
однозначным. В полном виде она должна учитывать по крайней мере четыре
обстоятельства:
• внутренние свойства системы — свойства пары (А, Я);
• диапазон изменения переменных на интервале оценивания;
• время наблюдения (оценивания);
• уровень шумов в измерениях.
Ниже рассматриваются некоторые из таких характеристик.
1. Сингулярные числа как меры оцениваемости.
Обсудим еще одну модификацию алгоритма, доставляющего оценку по
методу наименьших квадратов вектору χ в виде решения переопределенной
системы
z = Hx + r, M[r] = 0, M[rrT] = a2E. (D14.1)
219
Вычислительная процедура, составляющая основу этой модификации, в
отличие от рекуррентной процедуры, в которой уточнение оценки происходит
от измерения к измерению, имеет дело с полным массивом измерений с
самого ее начала. Важным достоинством рассматриваемой модификации является
получение некоторых положительных чисел, имеющих смысл мер
оцениваемости.
Вернемся к методу наименьших квадратов. Решение переопределенной
системы (D14.1) в соответствии с этим методом ищем как решение,
минимизирующее функционал J(x):
J(x) = \\Нх - zf = (Нх - z)T(Hx - ζ). (D14.2)
Известно, что любая матрица Н(т χ η) ранга к представима в виде
сингулярного разложения
Я = USVT.
Здесь U(m x m), V(n χ η) — ортогональные матрицы,
S = ( 0* θ)' sk = diag(sus2,...,sk),
si >s2 > ... >sk >0. (D14.3)
Величины Sj (j = 1,..., fc) называются сингулярными числами и
определяются следующим образом:
8з = лАь
где Xj — корни характеристического уравнения матрицы НТН. Очевидно,
если Η максимального ранга, то Xj > 0. Далее будем предполагать, что это
условие выполнено и матрица S такова:
-(t)-
Сделаем невырожденные ортогональные замены. Пусть у — новый
вектор состояния, д — новый вектор измерения:
y = VTx, g = UTz.
Представим вектор д в виде
д = ( 9I J , где gj(n χ 1), дп(т - η) χ 1.
Вследствие ортогональности использованных преобразований очевидно, что
min \\Hx - z\\2 = min \\Sy - д\\2.
χ у
220
Согласно (D 14.3)
11%-</112 = 11&.у-<//|12 + 1Ы12,
Sny = gn-
Оценка у имеет вид:
y^ST'gi, (D14.4)
или, в скалярной форме,
fe = a j = l,2,...,n. (D14.5)
8з
Найдем ошибку оценки. Имеем
g = Sny + r\ r' = UTr, M[rrT] = σ2Ε.
Из (D 14.5) следует:
ЬУэ = Уз - Ю = -Α Μ[Δ2/2] = ^.
Ошибка оценки величины у, порожденная погрешностью информации о
векторе ду усиливается с коэффициентом усиления 1/sj и, стало быть, число
сингулярности может служить количественной мерой оцениваемости.
Если сингулярное число мало, то часто оказывается целесообразным в
качестве оценки соответствующей переменной принять нуль и тем самым
понизить порядок оцениваемого вектора. Понижение порядка оцениваемого
вектора называется редукцией.
Приведем без доказательства две важные для приложений теоремы. Из
них во-первых, ясно, что сингулярные числа устойчивы к возмущениям
матрицы Я, т.е. малые изменения элементов матрицы Я приводят к малым
изменениям чисел Sjf и во-вторых, они обосновывают процедуру редукции.
Теорема 34. Пусть А, В, Г — матрицы размерности (тхп) ит> п,
Г = А—В. Обозначим сингулярные числа этих матриц, упорядоченные
по невозрастанию, соответственно через а.3, β$, yj. Тогда
IA-«il>7i.
Теорема 35. Пусть А — матрица размерности (т χ η) и В —
матрица размерности (тх (п — 1)), полученная из А вычеркиванием п-го
столбца. Если занумеровать сингулярные числа матрицы В в порядке
невозрастания, то они будут разделять сингулярные числа olj
матрицы А следующим образом:
«1 > ft > OL2 > ft > · · · > OLn-l > βη-1 > «η > 0.
221
2. Стохастическая мера оцениваемости.
Пусть χ = (a?i, X2,..., жп)т — случайный вектор с априорным
математическим ожиданием μχ и ковариацией Рх, {Ζ} — совокупность измерений,
коррелированных с ж, ж — оценка вектора ж, доставляемая алгоритмом L:
x = L[{Z}\.
Стохастическая мера оцениваемости μα скалярной величины α = стх,
с = (ci, C2,..., Сп)т определяется соотношением
М.--^—=1- — ,1-^__-, 0<μβ<1, (D14.6)
где Рдх — ковариация ошибки оценки Ах = х — х.
Мера оцениваемости характеризует относительное изменение
среднеквадратичного отклонения σ&α ошибки оценки Δα переменной α при ее
оценивании посредством алгоритма L.
Для приложений важна задача выделения переменных с малыми мерами
(если они существуют), которая ставится как задача отыскания стационарных
(экстремальных) значений мер в зависимости от направления, определяемого
вектором с:
%^- = 0. (D14.7)
ос
Из (D14.6) следует, что указанная задача эквивалентна хорошо известной
задаче приведения одним преобразованием двух квадратичных форм к
диагональному виду. Ее решение сводится к отысканию собственных чисел А7,
j = 1,2,..., η, и собственной матрицы Φ = (Φ1, Φ2,..., Φη) регулярного
пучка квадратичных форм Pax — АР*.
Имеют место соотношения
|ΡΔ*-λΡ*| = О, ΡΔ*Φ> = А,РЖФ>, д
ФТР*Ф = Ε, ΦΤΡΔ*Φ = diag(Ai,...,An). l }
Преобразование у = Фае приводит квадратичные формы СТРХС и СтРдхС
соответственно к виду £ ае2 и Σ А^ж2.
Стационарные значения мер определяются соотношениями
^ = 1-^. (D14.9)
Рассмотрим определение мер оцениваемости в задаче оптимальной калма-
новской фильтрации.
Непрерывный фильтр Калмана. Матрицы Рх и Рдх находятся из
уравнений
рх = АРХ + ΡχΑ + Q,
Ρδχ = АРАх + РахА + Q- РАхНТВГгНРАх,
222
Px(to) = PAx(to).
Дискретный фильтр Калмана. Матрицы Рх и Рдх находятся из
уравнений
Px(j + 1) = ФШЛ0')*т(Й+«Ш.
K(j) = Рдх0-)ят0)[Я0-)^а)ят0-) + йУ)]-1.( }
Для вычисления меры в моменту следует положить Pax(j) = P&x(j)-
Знание стохастических мер позволяет понять, насколько велик вклад
измерений в оценку тех или иных комбинаций вектора х. В частности, для
линейных комбинаций сТх с малыми мерами может оказаться целесообразной
замена их оценок на априорные значения, т.е. сведение задачи оценивания к
меньшей размерности.
Стохастическая мера оцениваемости показывает, в какой степени
измерения ζ позволяют улучшить знание компонент вектора состояния x(t)> и она
является инструментом для выделения комбинаций переменных с малыми
мерами и возможной последующей редукции задачи. Но между мерой
оцениваемости какой-либо переменной и ее наблюдаемостью нет прямой зависимости.
Из условия «мера равна 1» не следует, вообще говоря, что соответствующая
переменная наблюдаема.
Пример 14.1.
Xl = Я?1, Х2 = #1 — #2»
ζ = χι 4- г, M[r(t)r(s)] = S(t — s).
Здесь axi(t) и aX2(t) —► oo при t —> oo, a σΔαι(£), σΔ*2(*)
ограничены. Отсюда, в частности, следует, что мера μΧ2 (t) очевидно ненаблюдаемой
переменной Х2 стремится к 1 при t —> oo.
Замечание. При Q = 0 и R = Ε уравнение для матрицы, обратной к
ковариационной, Рд^ = Л/**, в алгоритме калмановской фильтрации то же, что и для
грамиана наблюдаемости М\
ΛΓ = -АТЛГ - ЛГ А + НТН.
Отличие в начальных условиях
ЯЫ = О, ЛГ (to) = ΡΔχίίοΓ1.
Как уже говорилось выше, априорная информация о начальном состоянии
вектора χ может интерпретироваться как дополнительное разовое измерение.
В этом случае характеристические числа матрицы Л/** (t) более полно
отражают возможность определения x(t), чем соответствующие характеристические
числа матрицы Af(t).
223
Дополнение к лекции 24. Регулярный синтез по
Болтянскому
Рассмотрим задачу оптимального управления
У = /(У» u), y(t0) = 2/*, t e [to,**],
м(.) € И = {и(·) в KC\u(t) € Ω С Дв}, (D24.1)
y(tk) € Μ С Дп,
где требуется минимизировать следующий функционал качества управления
J(tx) = <po(y(tk)) + / /o(2/,«)dt -+ mm .
to
Считаем, что решение задачи существует. Тогда верна теорема о достаточных
условиях оптимальности
Теорема 36. Управляемый процесс {у°('))и°(-)) [*о,**]}>
удовлетворяющий принципу максимума, является оптимальным, если выполняются
шесть условий регулярного синтеза по В.Г. Болтянскому.
Приведем формулировку условий регулярного синтеза для случая, когда
размерность пространства состояний системы равна η = 2.
Синтез оптимального управления осуществлен, если оптимальное
управление построено как функция фазовых координат и0 = и0(у).
Условие 1. Пусть G С R2 открытая область управляемости и
справедливы утверждения:
а) терминальное множество Μ — гладкое многообразие (гладкая кривая
или точка);
б) множество N — особое множество, размерности s < 1;
в) множества Ро, Pi, ft — кусочно-гладкие множества, замкнутые в G и
не имеющие общих точек с Μ и N. Множество Ро представляет
нульмерные клетки, множество Pi — кусочно-гладкие линии, одномерные
клетки, а множество Р2 = G \ (M U N U Ро U Pi) — двумерные клетки;
Условие 2. Все клетки разбиваются на два типа. Клетки Ро всегда
являются клетками второго типа, а клетки Рг — клетками первого типа. Клетки
Pi могут быть как первого, так и второго типа.
Условие 3. Через каждую точку клетки 1 -го типа σ проходит
единственная траектория, которая через конечное время покидает клетку, упираясь в
клетку меньшей размерности, т.е. существует управление и0 (у) гладкое, и
траектория у0 = f(y°,u°(y°))t покидающая за конечное время эту клетку
и попадающая в клетку π(σ) второго типа (под ненулевым углом, если σ
двумерная).
224
Если σ — клетка 2-го типа, то для любой ее точки существует клетка 1 -го
типа Σ(σ) большей на 1 размерности, примыкающая к σ. Существует гладкое
управление и(у) на σ U Σ(σ) и траектория, начинающаяся в σ и проходящая
через Σ(σ).
Условие 4. Из условий 1 —3 следует, что можно продолжать траекторию
из клетки в клетку, пройдя конечное число клеток и попадая на терминальное
многообразие Μ. Такая траектория называется отмеченной траекторией.
Условие 5. Отмеченные траектории удовлетворяют принципу
максимума Понтрягина.
Условие 6. Функционал J (и), вычисленный вдоль отмеченной
траектории, непрерывно зависит от начальных условий.
Используя условия теоремы В.Г. Болтянского можно осуществить синтез
оптимального управления, доставляющего глобальный минимум
функционалу качества.
Пример. Задача о параметрическом резонансе колебаний
математического маятника.
Рассмотрим малые колебания математического маятника, у
которого точка подвеса может перемещаться вертикально с ускорением и (см.
рис. D24.1 а). Требуется раскачать колебания маятника.
Уравнения движения управляемой системы следующие:
у + иу = 0, 0 < I < u(t) < m
Все решения системы колебательны (рис. D24.1 б), поэтому поставим
задачу максимального увеличения амплитуды колебаний на полуколебании
системы (рис. D24.1 в). Пусть выполнены граничные условия
y(fe) = ι, y(to) = о, м = {у(*,о = о} = {71, о}, 71 > о
для управляемой системы
Уг = 2/2,
2/2 = -иуи
где функционал качества управления до(у(4ь)) = yi(tk) —► тши(.)еи < 0.
Выпишем функцию Понтрягина Я = ф\у + 2 + ф2{-иух) и сопряженную
систему
φι = ифъ
ф2 = -^ь
Следовательно фъ — —иф2, и рассматриваемая управляемая система
является самосопряженной.
Из ПМП следует, что оптимальное управление имеет вид
°=/т пРи^22/1<0
\l приф2у1>0
225
ί«
Рис. D24.1. Маятник с подвижной точкой подвеса
Условие трансверсальности следует
откуда (^ι(*2) + λο)7ι + Vto(tfc) · 0 = 0 и следовательно ^ι(ί2) = —λο < 0.
Докажем, что управление и° регулярно, т.е., ни на одном подынтервале
t € [*ι»*а] не может быть выполнено ifo(t)yi(t) = 0.
Допустим противное. Условие у\ (t) = 0 не может выполняться, иначе как
2/1 (t), так и 2/2 (t) ξ 0 на всем интервале, что противоречит начальным
условиям.
Если ψ2&) = 0, то и ψι(ί) = 0, откуда следует ^ι(?2) = ^2(£2) = 0. Но
тогда и на всем отрезке t € [*2,*л] выполнено φ(ί) = 0. Аналогичное верно
для левого интервала. Следовательно (λο, φ) нулевая пара, что противоречит
ПМП.
Рассмотрим условие стационарности гамильтониана H(t) = 0.
В конечный момент времени у2(*£) = 0, откуда ф2^%) = 0. Если λο = 0,
то ^i(tfc) = 0 и опять получаем нулевую пару.
Поэтому λο > 0, и после нормировки можно считать λο = 1. Тогда:
MU) = -φι(£) = 1.
Отсюда следует, что в левой окрестности точки t° выполнено неравенство
ip2(t) < 0. Но в этой окрестности yi(t) < 0 ( поскольку 2/ι(*&) = α < 0).
Значит в этой окрестности выполнено условие u°(t) = I = const —
оптимальное управление знак не меняет и можем проинтегрировать исходную
2/1 (t) = Ci sin yfl(t -t°k) + C2 cos Vl(t - tg), fa(t°k) = 0 =>
Ci = 0, C2 = α < 0
226
Рис. D24.2. Параметрический резонанс
и сопряженную системы
ty*{t) = С3 sin V7(t - t°k) + С4 cos V7(t -t£), ф2(й) = 0 =>
C4 = 0,C3 = 47 >°·
VI
Из вида решений следует, что выражение ip2(t)yi(t) меняет знак в момент
временит -ί£ = -^.
На отрезке времени [ίο, τ] решение системы продолжается с управлением
u°(t) = т.
Из краевого условия yi(to) = 1 и гладкости у\ в точке τ следует
to — τ = —
2y/rn
tfc — *ο = r"-"7= +
2V7 2^'
aa= γ/ψ > 1 — возрастание амплитуды на одном полуколебании.
Если продолжить решение на следующих полуколебаниях системы
аналогичным образом, то получим неограниченное возрастание амплитуды
колебаний (см. рис. D24.2). В силу полученного решения верно соотношение
sign ^2 = sign 2/2, и можно осуществить синтез оптимального управления
«°(yi,2/2) = <
1*
при 2/12/2 > О
т при 2/12/2 < 0.
Проверим условия регулярного синтеза Болтянского (см. рис. D24.3).
Мн-во N = {0} — начало координат.
Область G = R2 \ {0}.
Терминальное множество Μ = {2/2 = 0} — ось абсцисс.
227
Pi
и°шт
/'"
ί»
V4
«° = ί ^
V
Μ° = ί
\
Ъ \\ы
nj *
""" u° = m
~~*l
Рис. D24.3. Регулярый синтез
Множество нульмерных клеток Р0 = 0 — пусто.
Множество одномерных клеток Pi = {yi = 0} линия переключения, ось
ординат.
Множество двумерных клеток Ръ — набор координатных четвертей.
Таким образом, в данной задаче выполнены условия регулярного синтеза
и, следовательно, построено глобально-оптимальное решение.
Дополнение 2 к лекции 24. О достаточности
принципа максимума в общем случае.
На лекции 24 было рассказано о достаточности принципа максимума
Понтрягина (ПМП) для линейной задачи быстродействия. В предыдущем
приложении приведен результат В.Г. Болтянского о достаточности ПМП в
форме синтеза, когда управление имеет конечное число переключений.
В 2003 году А.В. Арутюновым [10] была доказана теорема о ПМП как
необходимом и достаточном условии минимума. Сформулируем эту теорему
для задачи, когда математическая модель управляемой системы имеет вид
fy = /(y»ti), y(to) = y*, te [ίο,**], где у*, tk — заданы, (т42)
\гх(.)€^ = {гх(.)€£оо№о,^],Яв)|гх(^€ПсДв}, 1 ' '
где Ω — ограниченное, замкнутое выпуклое и регулярное множество [10], а
y(tk) € Μ = {yn(y(tfc)) = 0, г = 1,..., πι < η}.
Критерий качества
J(u) = / /o(y,M)dt + <po(y(*fc))
mm .
u(-)€W
to
Все функции являются гладкими поу,ми измеримыми по t
228
Определение 23. Допустимый процесс 0/°(·), u°(·)} является понтря-
гинским локальным минимумом, если существует δ > 0 такое, что для
любого допустимого управления и(·) € U, для которого
ll«°(-)-«()lki<<5 и \y°(tk)-y(tk)\<s
выполняется неравенство
j(«()) > j(«°()).
Из определения следует, что в рассматриваемом случае управляемый
процесс, являющийся сильным локальным минимумом (см. лекцию 23), является
одновременно и понтрягинским локальным минимумом.
Функция Понтрягина имеет вид Н(фу у, и) = ^т/(з/, и) — Ао/о(з/> м,t),a
лагранжиан — L = ipTy — H.
Теорема 37. Для того, чтобы допустимый управляемый процесс
{у°(-), и°(-)} являлся понтрягинским локальным минимумом,
необходимо и достаточно существование ненулевого вектора (λο, λι,..., Am)
при λο > 0, ε > 0 и абсолютно непрерывной вектор-функции
(ψι(ή,..., фп(Ь)) таких, что выполнены следующие условия:
1. функция ip(t) является решением уравнения Эйлера
d(dL°\ dL°
dt\dy ) ду
или
^=-(/(y0y(t)))T^+Ao(/o(y0(y(t),t))T;
2. условие трансверсальности при t = tk
3=0 У
3. усиленное условие максимума по управлению
я(*(*),у°(*),«°(*)) > н(Шу°(*)М*)) + Ф°(«) - «I2
при всех ueilu почти всюду not € [t0> **], где
ε = 0 при рассмотрении необходимости;
ε > 0 при рассмотрении достаточности.
229
Дополнение к лекции 28. О смешанных стратегиях
реализации динамической игры
В том случае, когда седловой точки в игровой задаче методики
тестирования не существует, можно перейти к так называемому смешанному
расширению игры.
Процедуру перехода к смешанному расширению объясним в случае, когда
рассматривается игра на конечном множестве стратегий управления и
возмущения.
Обозначим щ = Ui(t) € Uy i = 1,2,. ..,n, a Vj = Vj(t) € V,
j = 1,2,..., πι — конечный набор стратегий по управлению и возмущению
в задаче стабилизации.
Перебирая все стратегии, можно составить матрицу
(J{u\,vi) J(u2,vi)
j(uiyv2) J(u2iv2)
J(ui,Vm) J(u2,Vm)
которая называется матрицей игры. Обозначим Яу = «/(«»> Vj) и вычислим
ρο = maxj mint Rij и ρ° = min» max, Яу. Если ρο = ρ°, то игра имеет сед-
ловую точку в чистых стратегиях щ и Vj.
Пример!. Игра против природы.
Пусть природа имеет два состояния: дождь и сухо. При прогулке в сухую
погоду без плаща турист получает удовольствие в 10 баллов, а в плаще — 8
баллов. Прогулка под дождем в плаще приносит 7 баллов, а без плаща — 1
балл. Отказ от прогулки приносит 0 баллов. Таким образом у туриста 3
стратегии: 1) выйти без плаща; 2) выйти в плаще; 3) отказаться от прогулки.
Матрица игры выглядит следующим образом
Λ=(ΐ0 8 θ)'
В этой игре есть седловая точка: min» max, Rij = max, min» Rij = 7,
соответствующая стратегии природы — «дождь» и стратегии туриста —
«прогулка в плаще». И туристу и природе в этой игре невыгодно отклоняться от
их оптимальных стратегий, при которых они получают гарантированный
выигрыш в 7 баллов.
Пример 2. Приведем пример матричной игры, где не существует седло-
вой точки:
Пусть стратегии управления щ = г, г = 1,2,3,4, стратегии возмущения
Vj = j, j = 1,2,3,4, а функционал представляет расстояние между точками
J(un,vi)
J(un,V2)
J(un,Vm)
230
г, j,to есть Rij = «/(«», Vj) = \i — j\. Тогда матрица игры
(О 1 2 3\
ίϊίϊ
3 2 10/
В этой игре ρ° = mint max, Rij = 2 > 0, a ρο = max, mint #tj = 0, то есть
седловой точки не существует и следовательно не существует чистой макси-
минной оптимальной стратегии возмущений, (также и управлений) дающей
гарантированный результат.
В случае, когда не существует седловой точки игры в чистых стратегиях,
можно перейти к смешанному расширению игры, когда стратегии выбираются
случайным образом. Рассмотрим векторы ξ = (ξι,... ,ξη), где Χ)Γ=ι & = *»
& > 0 и η = (?7ι,... ,?7т),где Σ)^1ι Vj — 1» Vj > 0» которые имеют смысл
вероятности выбора стратегии щ и Vj соответственно. В качестве критерия
игры теперь рассмотрим математическое ожидание исходного функционала
η m
Κ(ξ9η) = M[J(u,v)] = ]T£ Ri&m.
t=l j=l
Можно записать Κ(ξ,η) = (?7ТД)£ = ητ(Βξ). Стратегии ξ, η в расширеной
игре называются смешанными.
В матричной игре можно считать Rij > 0, поскольку если добавить
положительную константу ко всем элементам матрицы Д, то игра не меняется.
Теорема 38. Всякая матричная игра имеет седловую точку в
смешанных стратегиях.
Доказательство.
С каждой расширенной игрой можно связать пару задач линейного
программирования следующим образом.
Рассмотрим вектор р = (1,1,..., 1)т состоящий из η единиц и вектор
w = (1,1,..., 1)т состоящий из т единиц.
Составим задачу линейного программирования
min ρτξ
* (D28.3)
Щ < w, ξ>0
и двойственную к ней
max w η
η (D28.4)
RTv >p> v>Q-
Поскольку элементы матрицы Rij > 0, то во второй задаче существует
допустимое решение, если выбрать элементы вектора 77 достаточно большими.
231
В первой задаче решение ξ = 0 тоже является допустимым. В теории
линейного программирования доказывается, что в этом случае существует
решение первой и второй задачи, и они совпадают по функционалу. Обозначим
это решение
ητνυ = ξτρ = го > 0.
Произведем замену 77* = f- > 0 и ξ* = ^- > 0.
Тогда выполнены условия Σν] = 1 и Σ£Γ = *» следовательно 77*, ξ*
являются решением смешанной задачи.
Поскольку из (D28.3) следует неравенство w > Щ, а из (D28.4)
неравенство ητΒ, >рт,то
го = VTw > ητ(Ι1ξ) = (ητΚ)ξ > ρτξ = r0,
откуда получим выражение го = Т7Т#£.
Вычислим теперь функционал смешанной задачи
Го Г0
Обозначим ξ' κ η' — произвольные смешанные стратегии управления и
возмущения. Тогда выполнены неравенства
*KV) = vmT*£ = V^' > Vr = ± = * (iW)
Го Го Го
и
Го Го Го
откуда следует существование седловой точки в смешанных стратегиях.
Замечание 19. Заметим, что в отличие от случая существования сед-
ловой точки в чистых стратегиях процедура тестирования
усложняется, поскольку этап 2 надо проводить многократно, моделируя
случайный выбор стратегии возмущений в соответствии с вероятно-
стями, заданными вектором η*.
Усложняется и третий этап процедуры, поскольку для получения
объективной оценки качества управления надо вычислить
статистические показатели (доверительные интервалы) оценки
тестирования.
Переход к смешанному расширению игры возможен и в случае, когда оба
игрока имеют бесконечное множество стратегий. Однако, в отличие от
конечномерного случая, здесь седловая точка в смешанных стратегиях может не
существовать. Даже сам средний выигрыш зависит от выбора вероятностных
мер, связанных с множествами стратегий 14 и V.
232
Если множества стратегий 14 η V представляют собой метрические
компакты, а функция выигрыша J (и, ν) непрерывна по совокупности
переменных, то седловая точка ( цена игры ) для смешанного расширения игры
существуют [28].
Более того, если функция выигрыша выпукла по и для каждого ν € У,
и множество стратегий 14 выпукло (заметим, что эти свойства выполняются
для рассматриваемой в задаче тестирования дифференциальной игры,
которая может быть редуцирована к геометрической игре, где функция выигрыша
представляет расстояние между точками множеств достижимости подсистем
по управлению и по возмущению), то выполнены следующие замечательные
свойства структуры оптимального решения:
а) существует цена игры АГо, равная
Ко = minmax J(u. v):
б) оптимальное решение первого игрока (человека-оператора) и
существует в чистых стратегиях;
в) спектр оптимальной смешанной стратегии второго игрока ν конечен
и состоит не более, чем из η + 1 точки множества V.
Пример 3. Тестирование точности сближения космического модуля
с орбитальной станцией.
Станция движется с постоянной скоростью по круговой орбите.
Относительно нее в плоскости орбиты движется модуль, снабженный продольными
(маршевыми) и боковыми реактивными двигателями. Программное движение
модуля в задаче сближения реализуется с помощью маршевых двигателей и
состоит из участка разгона, участка свободного движения с постоянной
скоростью и участка торможения. Линеаризованные уравнения в отклонениях от
программного движения имеют вид:
XI = Х2,
X2 = Vr{t),
ХЗ = #4>
Х4 s= — iC5tlP(t),
XS = #6,
[ Хб = Mr(t)/B..
Здесь χ = (ж1,жз)т — отклонение от программной траектории в плоскости
движения космического модуля, х& — отклонение по углу от программного
движения, up(t) — программное управление маршевыми двигателями
(заданные функции времени), w(·) € U = {w(·) € Loo[*o,*i]| \u(t)\ < /, / = const}
— стабилизирующее боковое управления, vr(t) — ошибка тяги маршевых
двигателей, Mr(t) — возмущающий момент, связанный с разнотяговостью
(D28.5)
233
маршевых двигателей, Bz — момент инерции модуля. Предположим, что
начальные условия x(to) = хо фиксированы.
С помощью боковых двигателей космонавт пытается уменьшить
отклонение от станции в момент причаливания — критерий качества управления
имеет вид J = x\{tk) 4- #§(*fc)· ^Ри замене χ = у — ζ справедливо
разложение исходной системы (D28.5) на подсистему по возмущению (28.12) и по
управлению (28.13). Множество достижимости <2U, соответствующее системе
(28.13), представляет собой отрезок прямой на оси гз, а множеству
достижимости системы (28.12) соответствуют две точки Gv = {ух> у™} (рис. D28.4).
Будем считать для простоты, что точки у™ и у$ лежат по одну сторону от оси
2з, а их проекции на ось z$ принадлежат множеству Gu.
zi>Vi
*з,уз
Рис. D28.4.
Оптимальной чистой стратегией управлений будет точка ζ*, так как в ней
достигается min max J (у, ζ) (см. рис. D28.4).
zeGu y€Gv
Найдем смешанную стратегию возмущений 77* при условии, что ни одна из
точек yw не лежит на множестве Gu- Для этого определим вероятности 771,772,
соответствующие смешанной стратегии.
Математическое ожидание выигрыша в точке ζ определяется из
соотношения АТ(т7*,г) = ηι\ζ - yi\ + ryi\z - у%\. Градиент этой функции по ζ в
проекции на множество Gu имеет вид
К' = (тух
k -я
2/1 , п. Z~y* ff\
>-йГ
Если принять во внимание тот факт, что уравнение К' = 0 имеет
единственный корень на Gu при фиксированных 771,772, то придем к следующему
утверждению:
необходимым и достаточным условием седловой точки является
следующее условие для вероятностей 771 и 772:
/■_ z - Vl , _ ζ ~ V2 g ч n
Ί«*-»Γ
■\*>-tf\'
234
Найденные таким образом цена игры Jo = min max Jfy, ζ), чистая
страус?,, ve^t v
тегия управлений ζ* и смешанная стратегия возмущений η* позволяют
реализовать второй и третий этапы методики тестирования.
Отметим, что и в этом случае максиминное тестирование дает
объективную оценку действий управления(человека-оператора).
235
Предметный указатель
грамиан наблюдаемости, 26
дифференциальная
антагонистическая игра, 204
дисперсия, 59
задача Булгакова о накоплении
возмущений, 198
запас устойчивости, 17
игольчатая вариация, 162
инерциальная навигационная
система (ИНС), 103
инвариантное ненаблюдаемое
подпространство, 51
инвариантное управляемое
подпространство, 45
коэффициент корреляции, 60
критерий устойчивости Гурвица,
17
линейное матричное неравенство,
148
марковский случайный процесс,
66
математическое ожидание, 59
матрица корреляции, 65
матрица ковариации, 59
матрица наблюдаемости, 28
множество достижимости, 156
непрерывный фильтр Калмана, 99
обратный фильтр Калмана, 216
особые участки оптимальной
траектории, 178
плотность вероятности, 58
порядок особой траектории, 181
процесс белого шума, 72
процесс с независимыми
приращениями, 69
робастная стабилизация, 153
седловая точка игры, 206
сингулярные числа, 220
сингулярно возмущенная
система, 122
скобки Пуассона, 180
сопряженная система, 121
среднеквадратичное
(стандартное) отклонение, 59
стабилизируемость, 19
стационарный случайный
процесс, 66
уравнение Беллмана, 174
уравнение Ляпунова, 149
условная функция распределения
вероятности, 58
уравнение Риккати, 99
формула приращения
функционала, 134
функция Беллмана, 173
функция Понтрягина, 121
центральная предельная теорема
,62
центрированная случайная
величина, 59
236
Основная литература
[1] Александров В.В., Злочевский СИ., Лежак СС,
Парусников НА. Введение в динамику управляемых систем. М.: Изд-во
мех-мат МГУ, 1993.
[2] Александров В.В., Болтянский В.Г., Лемак С.С,
Парусников Η.Α., Тихомиров В.Μ. Оптимальное управление движением.
М.: ФИЗМАТЛИТ, 2005.
[3] Голован А.А., Парусников НА. Математичские основы
навигационных систем. Часть 1. М.: Изд-во Моск. ун-та, 2007.
[4] Голован А.А., Парусников НА. Математичские основы
навигационных систем. Часть 2. М.: Изд-во Моск. ун-та, 2008.
[5] Ройтенберг Я-Н. Автоматическое управление. М.:
ФИЗМАТЛИТ, 1992.
Дополнительная литература
[6] Алексеев В.М., Галеев Э.М., Тихомиров В.М. Сборник задач по
оптимизации. М.: Наука, 1984.
[7] Алексеев В.М., Тихомиров В.М., Фомин СВ. Оптимальное
управление. М.: Наука, 1979.
[8] Александров В.В. К задаче Булгакова о накоплении возмущений
// Докл. АН СССР. Сер. Кибернетика и теория регулирования.
1969. Т. 186, №3. С. 526-528.
[9] Александров В.В., Герреро-Санчес В.Ф., Лемак СС
Применение теоремы Тихонова для автоматической стабилизации
управляемого движения// Веста. Моск. ун-та. Матем. Механ.
2007, № 1.С. 63-67.
[10] Арутюнов AS. Условия экстремума. М.: Факториал, 1997.
[11] Брайсон Α., Χο Ю-Ши. Прикладная теория оптимального
управления. М.: Мир, 1972.
[12] Булгаков Б.В. О накоплении возмущений в линейных
колебательных системах//Докл. АН СССР. 1946. Т. 51. С. 339-342.
[13] Габасов З.Р., Кириллова Ф.М. Особые оптимальные
управления. М.: Наука, 1973.
[14] Галеев Э.М., Тихомиров В.М. Краткий курс теории
экстремальных задач. М.: Изд-во Моск. ун-та, 1989.
[15] Гантмахер Ф.Р. Теория матриц. М.: Наука, 1988.
[16] Гнеденко Б.В. Курс теории вероятности. М.: Наука, 1969.
237
[17] Григорьев И.С. Методическое пособие по численным методам
решения краевых задач принципа максимума в задачах
оптимального управления. М.: Изд-во ЦПИ при мех-мат. ф-т. МГУ,
2005.
[18] Девис М.Х.А. Линейное оценивание и стохастическое
управление. М.: Наука, 1984.
[19] Демидович Б.П. Лекции по математической теории
устойчивости. М.: Наука, 1967.
[20] Зеликин М.И. Оптимальное управление и вариационное
исчисление. М.: УРСС, 2004.
[21] Иоффе А.Д., Тихомиров В.М. Теория экстремальных задач. М.:
Наука, 1974.
[22] Калман Р., Фалб П., Арбиб М. Очерки по математической
теории систем. М.: Мир, 1971.
[23] Красовский Н.Н. Проблемы стабилизации управляемых
движений (прил.) // Малкин И.Г. Теория устойчивости движения. М.:
Наука, 1966.
[24] Красовский Н.Н. Управление динамической системой. М.:
Наука, 1985.
[25] Крылов И.А. Черноусько Ф.Л. О методе последовательных
приближений для решения задач оптимального управления// Журн.
вычислит, мат. и мат. физ., 1962, т.2, № 6.
[26] Малкин И.Г. Теория устойчивости движения. М.: Наука, 1966.
[27] Парусников Н.А., Морозов В.М., Борзое В.И. Задача
коррекции в инерциальной навигации. М.: Изд-во Моск. ун-та, 1982.
[28] Петросян Л.А., Зенкевич Н.А., Семина Е.А. Теория игр. М.:
Высш.шк., 1998.
[29] Поляк Б.Т., Щербаков П.С. Робастная устойчивость и
управление. М.: Наука, 2002.
[30] Понтрягин Л.С., Болтянский В.Г., Гамкрелидзе Р.В.,
Мищенко Е.Ф. Математическая теория оптимальных процессов.
М.: Наука, 1969.
[31] Понтрягин Л.С. Обыкновенные дифференциальные уравнения.
М.: Наука, 1968.
[32] Розанов Ю.А. Случайные процессы. М.: Наука, 1979.
[33] Ройтенберг Я.Н. Автоматическое управление. М.: Наука, 1978.
[34] Maybeck P.S. Stochastic Models, Estimation and Control. New
York: Academic Press. 1979.
Учебное издание
АЛЕКСАНДРОВ Владимир Васильевич
ЛЕМАК Степан Степанович
ПАРУСНИКОВ Николай Алексеевич
ЛЕКЦИИ ПО МЕХАНИКЕ
УПРАВЛЯЮЩИХ СИСТЕМ
Учебное пособие
Оригинал-макет изготовлен
издательской группой механико-математического факультета МГУ
Технический редактор Ж.Г. Гаврилова
В оформлении обложки использована фотография Н.Н. Молчанова
Подписано в печать 15.12.2011 г.
Печать офсетная. Бумага офсетная.
Формат 60x90 1/16. Усллечл. 15,0. Тираж 200 экз. Изд. № 033.
Издательство ООО "МАКС Пресс**
Лицензия ИД N 00510 от 01.12.99 г.
119992, ГСП-2, Москва, Ленинские горы,
МГУ им. М.В. Ломоносова, 2-й учебный корпус, 527 к.
Тел. 939-3890,939-3891. ТелУФакс 939-3891.
Напечатано с готового оригинал-макета
Типография МГУ
119991, ГСП-1, Ленинские горы, д. 1, стр. 15
Заказ 1696.
ков