/
Текст
Глава 8. Методы оптимального
управления
Классические методы теории вариационного исчисления являются основой методов
синтеза оптимальных систем, т. е. систем управления, демонстрирующих наилуч-
шее (в смысле выбранного критерия) качество процессов. В роли критериев ка-
чества оптимальных систем выступают различные функционалы, что и связывает
теорию оптимального управления с классическими методами оптимизации.
В этой главе изучаются основные методы и задачи оптимального управления, к
которым относятся методы решения линейных квадратичных задач (п. 8.1), прин-
цип максимума Л. С. Понтрягина (п. 8.2) и принцип оптимальности Р. Веллмана
(п. 8.3). Следует отметить, что методы, во-первых, являются развитием тех или
иных подходов классической теории оптимизации и, во-вторых, взаимосвязаны,
т. е. их основные положения, как правило, могут быть получены одно из другого.
8.1. Квадратичные функционалы и линейные
регуляторы
Задачи управления линейными объектами и оптимизации их поведения с исполь-
зованием интегральных квадратичных функционалов относятся к классу задач
линейного квадратичного регулирования (ЛКР). Этот класс включает наиболее
распространенные и относительно простые задачи, сходные по своим формулиров-
кам и используемым алгоритмам к задачам модального управления (см.[1, 15, 24]).
Основополагающие результаты по ЛКР получены А. М. Летовым, Р. Калманом,
А. А. Красовским и др.
8.1. Квадратичные функционалы и линейные регуляторы
Ж
8.1.1. Квадратичные функционалы, задачи
оптимизации, линейные обратные связи
Наиболее распространенной задачей линейной теории управления является задача
стабилизации многомерного объекта
х = Ах + Ви (8.1)
относительно положения равновесия х = 0. Здесь х е IRn, z(0) = х0, и е Кт; А,
В — матрицы соответствующих размерностей. Замкнутое решение задачи предпо-
лагает нахождение алгоритма управления (регулятора)
и = U(x), (8.2)
который обеспечивает перевод системы (8.1) из произвольного начального состо-
яния х0 е Rn в точку х = 0, т. е. обнуление с течением времени вектора rr(t),
характеризующего отклонение от конечной точки х = 0.
Естественно, что решение задачи — неоднозначно, т. е. стабилизация может быть
осуществлена множеством алгоритмов вида (8.2). Для уточнения задачи необхо-
димо ввести дополнительные требования к системе, определяющие ее поведение,
т. е. критерии качества (см. также п. 7.1).
1
Динамическая точность. Введем в рассмотрение показатель динамической точ-
ности в виде интегрального квадратичного отклонения
1 ftf
Jx — т / хТ (f)Qx(Jt)dt, (8.3)
* Jo
где Q = QT > 0 — весовая матрица, tf > 0 — время окончания процесса (может
быть бесконечно большим). В случае когда Q > 0, подынтегральное выражение
функционала (8.3) можно представить в виде квадрата взвешенной нормы откло-
нения x{ty
fx(x) = x(t)TQx(e) = ||x(t)||^, (8.4)
или мгновенной квадратичной ошибки. Поэтому функционал (8.3) для задан-
ного значения начального условия хо определяет интегральное значение квадра-
та нормы отклонения системы на промежутке [0,tf], и следовательно, принимает
меньшие значения в тех случаях, когда переходные процессы протекают ^быстрее
и с меньшей колебательностью. Таким образом, фунционал является штрафом за
интегральную ошибку системы.
Проанализируем решения оптимальной задачи с критерием качества (8.3). Введем
в рассмотрение матрицы Ро = Р$ >0 размера п х п и С размера m х п как
решения системы алгебраических уравнений
АТР0 + Р0А = -Q + cTC, (8.5)
Р0В = 0 (8.6)
ш
Глава 8. Методы оптимального управления
и определим вектор у € В"1 — виртуальный выход системы:
у = Сх. (8.7)
После подстановки (8.5)-(8.7) и (8.1) выражение (8.3) принимает вид
ftf г 1 ftf т
( хт Poxdt + - / yTydt.
о 2 Jo
Тогда в силу легко проверяемого выражения
iTPoxdt
1 т
= -х1 Рох
Хх(0) = 1х<МТрох^> - ^(0)ТЛ>х(0)
(8.8)
имеет место следующее свойство критерия динамической точности.
Свойство 8.1.
1 т
--Х1 Рох
x(t0)
1 m
+ o / y(t) y(t)dt.
* Jo
(8-9)
Свойство 8.1 подтверждает, что задача оптимизации управления по критерию (8.3),
как правило, приводит к вырожденным решениям. Действительно, при z(0) = х0
и x(tf) = 0 выражение (8.9) принимает вид
1 1
Jx = -ж J РОХО + - y(t)Ty(t)dt.
* Jo
Формула показывает, что наименьшее значение функционала
Л* = (8.10)
обеспечивается при условии, что для любых t > 0 виртуальный выход у имеет
нулевое значение, т. е. выполняется
Сх = 0. (8.11)
Последнее уравнение описывает гиперплоскость Z* (подпространство простран-
ства Rn), являющееся в указанном случае множеством нулевой динамики (см.
3.2.2). При условии, что det(CB) / 0, нетрудно получить управляющее воздей-
ствие, обеспечивающее выполнение тождества (8.11) при xq € Z:
и = -(СВ^САх. (8.12)
На основании вышеизложенного можно сделать вывод, что минимальное значение
J* функционала (8.3) достигается, если переходный процесс имеет вид
x(t) = х0 при t — 0,
rr(t) е Z* при t > 0,
8.1. Квадратичные функционалы и линейные регуляторы
205
что соответствует мгновенному перемещению системы на гиперплоскость Z*
и дальнейшему движению вдоль этой гиперплоскости. Естественно, что первый
этап такого процесса предполагает использование бесконечно больших управляю-
щих сигналов, т. е. задача минимизации функционала (8.3) является вырожденной.
Последнее обусловлено отсутствием в условиях задачи каких-либо ограничений на
управляющее воздействие и.
Пример 8.1. Рассмотрим объект управления 2-го порядка:
±1 = х2, = и (8.13) (8.14)
и функционал J 1 г°° ' = _ / & о / 2 Jo (я? 4- q2X%) dt, (8.15)
где q2 > 0. Здесь Q = 1 0 0 92 > 0 , и система уравнений (8.5)-(8.6) имеет решения
и следовательно, где Ро = 0 0 0 _ 2 - 2 жю , с = [1 Jq& 1 + о У2 dt, Л J0 * (8-16)
У = 4- y/q^x2.
(8.17)
Минимум функционала (8.16) J* = (^/92/2) достигается при условии у = О,
что соответствует движению вдоль прямой
Z* : Xi 4- y/q2X2 = О
с управляющим воздействием
и
(8.18)
Быстрое попадание из произвольной начальной точки (®ю,гг2о) на прямую Z*
можно осуществить с помощью управления
и = -Uo sign у, (8.19)
где Uq > 0 — достаточно большое число. Для случая q2 = 0.16 фазовые траектории,
близкие к оптимальным, представлены на рис. 8.1. □
Затраты энергии и задача терминального управления. Для постановки ре-
гулярной задачи оптимального управления и исключения решений с бесконечно
206
Глава 8. Методы оптимального управления
Рис. 8.1. Фазовые траектории системы, оптимальной по динамической точности (пример 8.1)
большими управлениями необходимо ввести ограничения на вектор управления и.
Такие ограничения вводятся с помощью неравенств (см. п. 8.2) либо дополнитель-
ных интегральных компонент функционала качества:
1 ftf
Ju = п uT(t)Ru(t)dt, (8.20)
2 Jo
где R = RT > 0 — весовая матрица. Интеграл (8.20) называется функционалом
затрат (потерь) энергии. Подынтегральное выражение можно представить в виде
квадрата взвешенной нормы управления u(i):
/£(«) = u(t)TRu(t) = ||u(t)||t (8.21)
и поэтому функционал Ju принимает меньшие значения в тех случаях, когда тре-
буются меньшие управляющие воздействия, т. е. является штрафом за энергети-
ческие затраты системы. В общем случае задача минимизации затрат энергии
также является вырожденной и приводит к тривиальным решениям типа u(t) = О,
что обусловлено отсутствием в ее условиях требований к качеству переходного
процесса x(t).
Будем рассматривать комбинированный критерий качества, включающий в себя
интегральные квадратичные значения как отклонения x(t), так и управления u(t):
J(x,u) = (xT(t)Qx(t) 4- uT(t)Ru(t)^dt. (8.22)
В тех случаях, когда значение времени окончания процессов tf и конечная точка
x(tf) заданы, имеет место классическая постановка оптимальной задачи с закреп-
ленным правым концом (типа Лагранжа), или так называемой терминальной
задачи.
Задача 8.1. Найти оптимальный переходный процесс x*(t) и оптимальное управ-
ление u*(t), обеспечивающее за время tf > 0 перевод объекта управления (8.1)
8.1. Квадратичные функционалы и линейные регуляторы
207
из начального состояния х0 е в терминальную (конечную) точку x(tf) = О
с минимальным значением функционала (8.22), т. е. определить
{z*(t),u*(t)} = arg minJ(x,u),
u
а также значение
J* = J(z*,u*) = min J(x,u).
u
Наибольшее распространение получили задачи терминального управления, в ко-
торых tf = оо, т. е. задачи оптимизации на бесконечном интервале.
Задача 8.1, а. Найти оптимальный переходный процесс x*(t) и оптимальное управ-
ление u*(i), обеспечивающее асимптотический перевод объекта управления (8.1)
из начального состояния xq G Rn в точку х — 0, т. е.
lim a;(i) = 0 (8.23)
t—>оо
с минимальным значением функционала
1 г00 / \
J(x,u) = - j \^xT(t)Qx(t) Ц-uT(t)Ru(t)jdt. (8.24)
♦
Задачи со свободным правым концом. В тех случаях, когда терминальное зна-
чение x(tf) не задано, имеет место задача со свободным правым концом (типа
Больца). Так как в постановке такой задачи не содержится указаний на конечное
состояние системы, то минимизация функционала вида (8.22), как правило, при-
водит к тривиальным решениям. Для того чтобы синтезируемая система в своем
движении приближалась к состоянию х = 0, в функционал качества необходимо
ввести дополнительную компоненту вида
= i||x(tz)'||2p (8.25)
£ и
где Pf = Pj > 0 — весовая матрица. Выражение (8.25) характеризует квадра-
тичную ошибку системы по окончании процесса, или штраф за терминальные
отклонения от точки х = 0.
Задача 8.2. Найти оптимальный переходный процесс x*(t) и оптимальное управ-
ление u*(t), обеспечивающее за время tf > 0 перевод объекта управления (8.1) из
начального состояния х0 € Rn в некоторую окрестность точки х = 0 с минималь-
ным значением функционала
J(x,u) = ^:xT(tf)Pfx(tf) + i (xT(t)Qx(t) + uT(t)Ru(t)\dt. (8.26)
2 2 /п \ /
208
Глава 8, Методы оптимального управления
Отметим, что дополнительная компонента Jf (штраф за квадратичную ошибку в
конце процесса) восполняет неопределенность конечного значения x(i/) и обеспе-
чивает приоритет переходных процессов x(t), заканчивающихся в меньшей окрест-
ности точки х = 0.
Задачи синтеза оптимального регулятора. Приведенные формулировки опти-
мальных задач предусматривают нахождение функций времени ж* (У) и u*(i), т. е.
получение решений в разомкнутом виде. Тем не менее решения перечисленных
задач, как правило, могут быть найдены и в виде обратных связей — пропорцио-
нального регулятора отклонений.
Задача 8.3. Найти оптимальный алгоритм управления вида
и = Кх, (8.27)
где К = К(t) — матрица коэффициентов обратной связи, обеспечивающий для
любых начальных состояний х0 € Rn получение оптимальных процессов x*(t) и
управления u*(t), являющихся решениями задач 8.1 или 8.2.
В связи с тем, что минимизация интегральных квадратичных функционалов для
линейных объектов управления может быть реализована с помощью линейных
алгоритмов вида (8.27), рассматриваемые здесь оптимальные задачи принято от-
носить к классу задач линейного квадратичного регулирования (ЛКР).
Замечание 8.1. Задачи ЛКР могут быть сформулированы по отношению к неста-
ционарным объектам и функционалам качества, т. е. для случаев, когда
А = A(t), В = B(t\ Q = Q(t\ R = R(t).
При этом общий подход к их решению, рассматриваемый в следующем разделе,
обычно не претерпевает изменений. □
8.1.2. Решение общей задачи ЛКР
Будем рассматривать задачи 8.1-8.3 оптимального перевода объекта управления
(8.1) в точку x(tf) = 0 или ее окрестность, полагая, что функционал качества
задан в форме (8.26). Конечной целью приведенной ниже процедуры синтеза яв-
ляется получение оптимального регулятора (решение задачи 8.3), что в качестве
промежуточного этапа предусматривает нахождение канонической системы (см.
пример 7.7 и 7.4.2), представляющей собой дифференциальную форму решений
задач 8.1-8'2.
Построение канонической системы. Задачи 8.1-8.2 сводятся к задаче на услов-
ный экстремум (см. п. 7.4) со свободным или закрепленным правым концом тра-
ектории. Действительно, воспользовавшись свойством (8.8), запишем
ftf 1
I xTPfxdt = -xTPfX
о 2
*(*/)
XQ
|zT(t/)P/£r(i/) - ^x%PfX0 (8.28)
8.1. Квадратичные функционалы и линейные регуляторы
209
и преобразуем функционал (8.26) к виду
J(x,u) =
1 1 rf
-XoPfXo + - / (xTQx + uTRu + xTPfx)dt.
2 2 JQ
(8.29)
Так как компонента х^Р/х0 не зависит от функций x(t) и u(t), то задача опти-
мизации системы с функционалом (8.29) может быть решена по схеме решения
задач вариационного исчисления, приведенной в 7.4.2. В рассматриваемом случае
лагранжиан принимает вид
f° = ^(xTQx + uTRu + 2xTPfX^ + Хт(х — Ах — Ви), (8.30)
где A(t) € Rn — вектор-функция множителей Лагранжа (вектор состояния со-
пряженной системы). Решая простейшую задачу вариационного исчисления для
расширенного функционала, найдем систему уравнений Эйлера-Лагранжа
xTQ — XTA — XT = 0, (8.31)
uTR — XTB = 0, (8.32)
х — Ах — Ви — 0 (8.33)
и далее — каноническую систему, т. е. 2п-мерную динамическую модель ф
А = -ATX + Qx, (8.34)
и = R~rBTX, (8.35)
х — Ах + Ви = Ах + BR~xBTX, (8.36)
представленную основным объектом управления (8.36), алгоритмом управления
(8.35) и сопряженной системой (8.34).
Для терминальной задачи 8.1 2п краевых условий записываются в виде ж(0) = xq
и x(tj) — Xf. Для задачи 8.2, в которой терминальное состояние x(tf) не задано,
значения переменных на правом конце подчиняются п условиям трансверсально-
сти (см. 7.3.4):
X(tf) = -Pfx(tf). (8.37)
Решениями системы (8.34)-(8.36) являются функция А = A(t), а также функции
х = x*(t) и и — u*(t), доставляющие минимальное значение функционалам (8.22)
или (8.26) соответственно и являющиеся искомыми решениями задач 8.1 и 8.2.
Синтез оптимального регулятора. Для получения решения оптимальной задачи
в замкнутой форме (задача 8.3) будем искать вектор сопряженной системы (8.34)
в виде
А = -Рх, (8.38)
210
Глава 8. Методыоптимального управления
где P(t) = P(t)T > 0 — матрица, подлежащая определению. После дифференци-
рования выражения (8.38) по времени и соотвествующих подстановок получаем
(P + ATP + PA-PBR~1 2BTP-Q)x = 0. (8.39)
Последнее уравнение справедливо при любых х — x(t), если матрица Р является
решением дифференциального матричного уравнения Риккати
P + ATP + PA-PBR~1BTP = —Q. (8.40)
Подставляя (8.38) в (8.35), находим пропорциональный алгоритм управления
и = Кх, (8.41)
где К = K(t) — матрица коэффициентов обратной связи, рассчитываемая по фор-
муле
К = -/?-1ВтР. (8.42)
Уравнение оптимальной системы получается подстановкой (8.41) в (8.1) и прини-
мает вид (рис. 8.2)
х = Асх, (8.43)
где
Ас = A-BR-^P'P
— матрица замкнутой системы.
Рис. 8.2. Оптимальная система в задаче ЛКР
Теперь определим значение функционала J(x, и) на найденных оптимальных ре-
шениях. После соответствующих подстановок нетрудно получить
1 1 rtf
J* = J(x*,u*) = -xT(tf)Pfx(tf)-- (xTPx + xTPx + xTPx)dt. (8.44)
2 2 Jo
Принимая во внимание, что
— (хТРх\ = хт Рх + хт Рх + хт Рх, (8.45)
at \ /
8.1. Квадратичные функционалы и линейные регуляторы
211
находим
J* = | (xT(tf)Pfx(tf) - хтРх
•А'О ' "
Таким образом, решение задачи 8.3 базируется на следующем утверждении.
Теорема 8.1. Алгоритм управления, обеспечивающий для любых начальных состо-
яний х0 е Rn получение оптимальных решений x*(t), u*(t) задач 8.1-8.2, описыва-
ется выражениями (8.41)-(8.42), где матрица P(t) является решением уравнения
Риккати (8.40). При этом наименьшее значение функционала J(utx) рассчитыва-
ется по формуле
J* = J(rr*,zz*) = Р(0);го- (8.46)
Замечание 8.2. Для получения решения P(t) дифференциального уравнения Рик-
кати (8.40) необходимо определить краевые условия. Из выражения (8.38) найдем
A(tz) = -P(tf)x(tf). (8.47)
В задаче 8.2 воспользуемся условием трансверсальности (8.37), сопоставляя кото-
рое с (8.47), получаем
W = Pf. (8.48)
Последнее условие определяет значение матрицы P(t) в конце переходного процес-
са, что при решении уравнения (8.40) вызывает необходимость применения метода
интегрирования в обратном масштабе времени: т = tf -1 (см. пример 8.3).
Проблема нахождения матрицы P(t) в терминальной задаче 8.1 в общем случае
носит несколько более сложный характер (см. [1, 15]). □
Пример 8.2. Рассмотрим задачу синтеза оптимального управления объектом
х = и, (8.49)
где х и и — скалярные переменные состояния и управления, полагая, что заданы
граничные значения tf, ж(0) = ж0, x(tf) = 0 и квадратичный функционал качества
1
J(x,u) = - / (qx2 + pu^dt, (8.50)
2 Jo
где q > 0, p > 0.
Каноническая модель принимает вид (см. также пример 7.7)
А = qx, (8.51)
и = \ (8.52)
Р
х = и=-\. (8.53)
Р
212
Глава 8. Методы оптимального управления
Для получения решений используются условие ж(0) = х0 на левом конце тра-
ектории и условие x(tf) = 0 на ее правом конце. Нетрудно показать, что задача
сводится к задаче Коши, для чего необходимо рассчитать значение Ло = А(0) такое,
чтобы для заданного значения xQ выполнялось x(tf) = 0.
Рис. 8.3. Переходные процессы канонической системы в терминальной задаче (пример 8.2)
На рис. 8.3 представлены интегральная кривая и переходные процессы для задачи
оптимального управления при q ~ 4, р = 1, tf = 1 с и х(0) = 1. Здесь Ло = -2.075.
Для получение решения в замкнутом виде запишем
Л = -Pifyx, (8.54)
где Р > 0 — решение дифференциального уравнения Риккати:
= __q (8.55)
Р
Из условия Ло = -Р(0)хо находим начальное значение
Р(0) = (8.56)
•Го
необходимое для интегрирования уравнения (8.55)
Подставляя (8.54) в (8.52), получаем пропорциональный алгоритм управления
и = K(t)x = -~P(t)x. (8.57)
р
Решение уравнения (8.55) и графики переходных процессов для указанного выше
частного случая приведены на рис. 8.4. Здесь Р(0) = 2.075 и K(t) = — P(t).
Нетрудно получить также минимальное значение J* = (xq/2)P(0) = 1.0375.
Найденные оптимальные решения x(t) и u(t) совпадают с представленными на
рис. 8.3.
8.1. Квадратичные функционалы и линейные регуляторы
213
Рис. 8.4. Переходные процессы оптимальной системы (пример 8.2)
Следует обратить внимание на то, что при t —> tf решение уравнения (8.40) устрем-
ляется в бесконечность: Р —► оо. Это обусловлено нулевым краевым условием:
х/ = 0. Отметим также, что при tf —> оо получаем задачу 8.1, а оптимизации на
бесконечном интервале, где А(0) = — 2 и Р = 2 (см. пример 7.7). □
Пример 8.3. Рассмотрим задачу синтеза оптимального управления объектом (8.49),
полагая, что заданы только значения tf и .т(0) = х0, а функционал качества со-
держит штраф за конечное состояние Xf = x(tf), т. е.
J(x,u) = -^-x?f + / (qx2 + pvPjdt, (8.58)
2 2 Jo
где q > 0, p > 0, Pf > 0. В этом случае имеет место задача со свободным
правым концом. Каноническая модель сохраняет вид (8.51), и вводится условие
трансверсальности, связывающее значения Xf = X(tf) и Xf = — x(tf):
Xf = -PfXf. (8.59)
Условие определяет в пространстве состояний канонической модели прямую ко-
нечных значений Sf (см. рис. 8.5). Нетрудно показать, что задача сводится к
задаче Коши, для чего необходимо рассчитать значение Ао = А(0) такое, чтобы
для заданного значения х0 выполнялось условие (8.59).
На рис. 8.5 представлена интегральная кривая /переходные процессы для задачи
оптимального управления при q — 4, р ~ 1, Pf = 1, tf — 1 с, ж(0) = 1. Здесь
Ао = -1.975.
Для получение решения в замкнутом виде используется уравнение Риккати (8.55),
в котором задано краевое условие P(t/) = Pf. Решение уравнения Риккати может
быть получено при интегрировании в обратном масштабе времени: т = tf — t
(рис. 8.6, а). Пропорциональный алгоритм управления принимает вид (8.57).
Кривая изменения коэффициента обратной связи K(t), а также графики переход-
ных процессов x(t) и u(t) для указанного выше частного случая приведены на
214
Глава 8. Методы оптимального управления
Рис. 8.5. Переходные процессы канонической системы в задаче со свободным правым концом
(пример 8.3)
рис 8.6, б и показывают, что оптимальные решения для замкнутой системы совпа-
дают с приведенными на рис. 8.5, б. Так как Р(0) = 1.975, то по формуле (8.46)
находим J* = (ж§/2)Р(0) = 0.99. □
Рис. 8.6. Решение уравнения Риккати и переходные процессы оптимальной системы (пример 8.3)
Избыточность задач ЛКР. Одно и то же решение оптимальной задачи может
соответствовать различным квадратичным критериям (8.26), т. е. такие функци-
оналы, как правило, содержат несущественную часть. Действительно, с исполь-
зованием свойства 8.1 (выражение (8.9)) функционал (8.26) можно переписать
в виде
J(x, и) — ^Xq Рохо + J(x,u), (8.60)
где
J(x, и)
1 1 Pf /
+ 2 Jo \уТ^у^
+ uT(t)Ru(t)^dt.
(8.61)
8.1. Квадратичные функционалы и линейные регуляторы
215
Здесь у е является виртуальным вектором выхода:
у = Сх, (8.62)
матрицы Pq = Pq > 0 и С (т х п) находятся как решения системы алгебраических
уравнений (8.5)-(8.6), и
Pf = Pf-P0. (8.63)
Решение оптимальной задачи сводится к минимизации функционала J и не зависит
от первого слагаемого выражения (8.60). Поэтому для различных весовых матриц
Q, доставляющих одинаковое решение С системе уравнений (8.5)-(8.6), можно
получить (при соответствующем выборе матрицы Pf) идентичные решения x*(t) и
u*(t), а также идентичные матрицы обратной связи K(t). Последние определяются
по формуле
К = -R~1BTP, (8.64)
где матрица Р является решением дифференциального уравнения Риккати вида
Р + ATP + PA-PBR-1BTP = -СТС (8.65)'
с краевым значением (см. замечание 8.2)
P(tf) = Pf- *8.66)
Минимальное значение функционала J находится по формуле, аналогичной (8.46):
J* = xq Р(0)я?о/2, и следовательно, минимальным значением исходного функцио-
нала (8.26) будет
Г = (8.67)
Пример 8.4. Рассмотрим объект управления 2-го порядка:
X! = Х2, Х2 — U
и функционал
Здесь Q =
мер 8.1)
О
Q2
1 f°°
J = - / (^1 + <72-^2 + Р^2) ^t.
2 Jo
(8.68)
(8.69)
и система уравнений (8.5)-(8.6) имеет решения (см. при-
Ро = ° , с = [1
Следовательно, можно записать
/92 2
2 Х1{
(8.70)
216
Глава 8. Методы оптимального управления
где
J
У
1 г00
к / (у2 + ри2) dt,
2 Jo
+ y/q2X2.
(8.71)
(8.72)
Таким образом, исходная задача эквивалентна минимизации функционала J, в
котором весовая матрица при переменных состояния имеет вид СТС. Откуда сле-
дует, что для обеих задач оптимальными будут идентичные решения x*(t) и и*(£),
а также идентичные матрицы обратной связи К (см. пример 8.6). Более того,
нетрудно показать, что для функционалов
1 г°°
т * / / 9 л 9 о \ у
J — - / (х1 4- 2^12^1X2 + q2x2 + риг) dt,
J Jo
(8.73)
где Q =
1
912
912
92
, 912 G [0, д/92-], система (8.5)-(8.6) имеет то же решение
С = [15/92], и следовательно, функционал J остается без изменений. Естественно,
что решение оптимальной задачи приводит к тем же переходным процессам x*(t)
и u*(t). □
Отмеченная избыточность рассматриваемого класса оптимальных задач как пра-
вило устраняется при выборе весовой матрицы
Q = СТС. (8.74)
В этом случае задача оптимального управления формулируется как задача ми-
нимизации функционала (8.61) и решается по приведенной выше схеме. Таким
образом, имеет место следующее положение.
Теорема 8.2. Алгоритм управления, обеспечивающий для любых начальных состо-
яний xQ е Кп получение оптимальных решений z*(t) и управления u*(t) системы
(8.1), (8.62) в задаче минимизации функционала (8.61) описывается выражениями
(8.41), (8.64), где матрица P(t) > 0 является решением уравнения Риккати (8.65)
с краевым значением (8.66). При этом функционал J(x,u) принимает наименьшее
значение
7* = = ^4Р(О)то.
8.1.3. Задача оптимизации на бесконечном интервале
Задачи 8.1, а оптимизации на бесконечном интервале времени и соответствующая
задача 8.3 синтеза оптимального регулятора, для которых функционал качества
принимает вид
I Г°° / ч
J(x,u) = - (xT(t)Qx(t) + uT(t)Ru(t))dt,
(8.75)
8.1. Квадратичные функционалы и линейные регуляторы
217
обычно рассматриваются как предельный случай терминальной задачи 8.1 при
tf —> оо [15]. Использование уравнений Эйлера-Лагранжа приводит к канони-
ческой системе (8.34)-(8.36), решения которой ищутся для заданных начального
значения х(0) = х0 и конечного значения я(оо) = 0, а оптимальный регулятор
синтезируется по схеме, рассмотренной в 7.4.2 и 8.1.2.
Синтез оптимального регулятора. Для получения решения оптимальной задачи
в замкнутой форме (задача 8.3) вектор сопряженной системы ищется в виде (8.38),
где в рассматриваемом случае Р = Рт > 0 — стационарная матрица, являющая-
ся решением алгебраического матричного уравнения Лурье (или уравнения шипа
Риккати, см. 7.4.2)
AtP + PA-PBR~1BtTP = —Q. (8.76)
Подставляя (8.38) в (8.35), находим пропорциональный алгоритм управления
и = Кх, (8.77)
где К — матрица постоянных коэффициентов обратной связи, рассчитываемая по
формуле
К = —R~1BTP. (8.78)
Уравнение оптимальной системы получается подстановкой (8.77) в (8.1) и прини-
мает вид
х = Асх, (8.79)
где
Ас = A-BR~1BTP
— стационарная матрица замкнутой системы.
Отметим, что алгебраическое уравнение (8.76) имеет несколько решений. Су-
ществование положительно определенного решения Р, а также асимптотическая
устойчивость системы, или Re Ai{Ac} < 0, обеспечивается при некоторых допол-
нительных условиях. Пусть весовая матрица Q имеет ранг и < п и, следовательно,
может быть представлена в виде
Q — Q?Qi,
где Qi — матрица размера v х п и ранга и. Имеет место следующее положение.
Теорема 8.3. Пусть пара А, В полностью управляема, а пара A,Qi полностью
наблюдаема. Тогда:
1) существует решение Р > 0 уравнения Риккати (8.76);
2) оптимальные решения x*(t) и u*(t) задачи минимизации функционала (8.75) для
любых начальных состояний х0 е Кп обеспечиваются пропорциональным алгорит-
мом управления (8.77)—(8.78), где матрица Р > 0 является решением уравнения
Риккати (8.76);
218
Глава 8. Методы оптимального управления
3) замкнутая система (8.79) с матрицей обратной связи (8.78) асимптотически
устойчива, т. е. выполняется условие (8.23), и
Re Ai{Ac} <0, i = l,n;
(8.80)
4) наименьшее значение функционала (8.75) —
= J(x*,ZZ*) = ^XqPxq.
(8.81)
Пример 8.5. Рассмотрим объект управления (8.68) и функционал (8.69) (см. пример
8.4). Здесь
и R = р . Решением уравнения Риккати (8.76) является
положительно определен-
ная матрица
У^/рТ^ у/р
у/р урЦу/р + дэ)
По формуле (8.78) находим матрицу обратной связи
_ |_J_ У^Ур+1
I у/р у/р I ’
Следовательно, можно записать
1 У^у/р + 52
и =-----—Xi-----—-----®2-
у/р у/Р
(8.82)
(8.83)
Уравнение оптимальной системы приобретает вид
1 У^у/Р + 52
Xi = Х2, Х2 =---------— Xi--------—---- Ж2.
у/р у/р
(8.84)
Полюсы системы —
Р1,2
~^Ур + 5г) •
(8.85)
Р =
Для случая Q2 = 0.16, р = 0.25 получим:
Р =
1.08 0.5
0.5 0.54
К = -| 2 2.15 |,
алгоритм управления —
и — — 2.Г1 — 2.15x2
(8.86)
8.1. Квадратичные функционалы и линейные регуляторы
219
Рис. 8.7. Процессы оптимальной системы (пример 8.5, р=0.25)
и уравнение замкнутой системы —
Xi = а?2, Х2 = —2a?i — 2.15^2,
(8.87)
т. е. Ас
0
-2
1
-2.15
. Полюсы системы — р^? = -1.08 =f J0.92. При жДО) =
= 1, а?2(0) = 0 по формуле (8.81) найдем J* = 0.54.
й«
Графики оптимальных процессов для рассматриваемого случая приведены на
рис. 8.7. □
Избыточность задачи и минимизация выходной переменной. Как и в общем
случае (см. 8.1.2), одно и то же решение рассматриваемой задачи обычно соответ-
ствует различным функционалам качества. Действительно, критерий (8.75) можно
переписать в виде
1 1 г°°
J(x,u) = -XqPqXo +-z
* Jo
[x(t)TСтCx(t) + ит
(8.88)
где матрицы Pq = Pq > 0 и С (т х п) находятся как решения системы алгебраи-
ческих уравнений типа (8.5)-(8.6). Так как решение оптимальной задачи сводится
к минимизации второго слагаемого выражения (8.88), то для различных весовых
матриц Q, доставляющих одинаковое решение С системе уравнений (8.5)-(8.6),
получаются идентичные выражения (8.78) для матрицы обратной связи К, где
матрица Р является решением уравнения типа Риккати
Ат Р + РА-PBR~XBT Р = -СТС. (8.89)
Выберем весовую матрицу
Q = СТС
(8.90)
220
Глава 8. Методы оптимального управления
и поставим задачу оптимального управления как задачу минимизации функциона-
ла
1 Г°° / \
J(x,u) = -у \yT(t)y(t) + uT(t)Ru(t) jdt, (8.91)
где у е Rm — виртуальный выход системы:
у = Сх. (8.92)
Задача минимизации функционала (8.91) эквивалентна задаче оптимального
управления системой (8.1), (8.92) (рис. 8.8) с учетом динамической ошибки по
выходной переменной y(tj. Как следствие теоремы 8.3 сформулируем следующее
положение.
Рис. 8.8. Оптимальная система с выходом у.
Теорема 8.4. Пусть система (8.1), (8.92) не вырождена, т. е. тройка матриц
(А, В, С) полностью управляема и полностью наблюдаема. Тогда:
1) существует решение P(t) > 0 уравнения Риккати (8.89);
2) оптимальные решения x*(i) и u*(t) задачи минимизации функционала (8.91) для
любых начальных состояний х0 е R” обеспечиваются пропорциональным алгорит-
мом управления (8.77)-(8.78), где матрица P(t) > 0 является решением уравнения
Риккати (8.89);
3) замкнутая система (8.79) с матрицей обратной связи (8.78) асимптотически
устойчива, т. е. выполняются условия (8.23) и (8.80);
4) наименьшее значение функционала (8.91) определяется выражением (8.81).
Пример 8.6. Рассмотрим объект управления (8.68) и функционал
1 роо -| рОО
J = - / (у2 4- ри2) dt = - / ((а?1 4- С2Ж2)2 + ри2) dt. (8.93)
Jo Jo
Здесь
У = + С2Ж2, (8.94)
1
С2
С2
С2
и Q =
> 0. Нетрудно показать, что при С2 = y/qi (см. пример 8.4)
задача эквивалентна рассмотренной в примере 8.5 и имеет те же решения. □
8.1. Квадратичные функционалы и линейные регуляторы
221
8.1.4. Асимптотические свойства задачи ЛКР
Решение общей задачи линейного квадратичного регулирования зависит от выбо-
ра матриц Q, R, Pf (см. также 8.1.1). Нетрудно показать, что увеличение нормы
матрицы Q и, следовательно, штрафа за мгновенные квадратичные отклонения
системы от точки х = 0 приводит к более быстрым и менее колебательным про-
цессам, увеличение нормы матрицы R и штрафа за большие управления влечет
за собой уменьшение управляющих воздействий и замедление переходных процес-
сов, а увеличение нормы матрицы Pf и штрафа за терминальные отклонения систе-
мы — умешьшение нормы конечного состояния x(tf). Более конкретные заключе-
ния могут быть сделаны после рассмотрения асимптотических свойств решений
задачи оптимального управления, т. е. свойств оптимальных систем при неограни-
ченном увеличении (или уменьшении) соотвествующих весовых матриц [15].
Далее ограничимся рассмотрением частного случая задачи оптимизации на беско-
нечном интервале времени (задача 8.1, а) для одноканального объекта управления
(см. рис. 8.8)
х = Ах + Ви (8.95)
с виртуальным выходом
у = Сх $.96)
и функционалом
J = (!/2(t)+^2(t))dt, (8.97)
2 Jo
где В и С матрицы п х 1 и 1 х п соответственно и р > 0. Полагаем, что трой-
ка (А, В, С) удовлетворяет условиям теоремы 8.4, и следовательно, существует
решение задачи ЛКР в замкнутой форме:
и = Кх, (8.98)
где К — матрица-строка постоянных коэффициентов обратной связи, рассчитыва-
емая по формуле
К = -р~1ВтР, (8.99)
Р = Рт > 0 — решение алгебраического уравнения типа Риккати
АтР + РА-р~1РВВтР = -СТС (8.100)
Будем исследовать свойства оптимальной системы
х = Асх, (8.101)
где Ас = А — р~1ВВтР — стационарная матрица замкнутой системы, при изме-
нении весового коэффициента р. Отметим, что аналогичные свойства могут быть
222
Глава 8. Методы оптимального управления
получены для функционалов более общего вида (8.75), что предполагает приведе-
ние задачи к рассматриваемой (см. 8.1.2) и нахождение матрицы С в результате
решения системы уравнений вида (8.5)-(8.6).
Запишем уравнения объекта управления (8.95)-(8.96) в операторной форме
3/(t) = W(p)u(t), (8.102)
где W(p) — передаточная функция разомкнутой системы. Пусть объект управле-
ния имеет относительную степень п - и, нули (г = Т^Т) и полюсы pi = Л;{А}
(г = 1,п). Тогда
W(p) = С(р1 - АГ1 В = = , (8.103)
а(р) (Р-Р1)..АР-Рп)
где /?о / 0.
Определим также полюсы pic = Aj{Ac} (г = 1,п) и передаточную функцию зам-
кнутой системы (8.101), (8.96):
Wc(p) = С(р1 — Ас)~1В = ^44, (8.104)
а также комплексные числа р~ (г = 1,п — и), равные п — и вещественно-
отрицательным корням нормированного полинома Баттерворта порядка п — и (см.
[24]), т. е.
< 0, ]р“| = 1.
Имеет место следующее положение.
Теорема 8.5. Пусть система (8.95)-(8.96) не вырождена, т. е. тройка матриц
(А, В, О') полностью управляема и полностью наблюдаема. Тогда:
1) lim pic р-^0 ( Pi, если Re р® < 0, . — ~ | —р°, если Re > 0, г~ ,Z/’ (8.105)
2) Г) 2
lim — = рг , i = и + 1, п, р—»0 ш г (8.106)
где /^2 1/(2^-!,)) ^ = (—) ; \ р j (8.107)
3) lim pic р—*(Х> f Pi, если Re pi < 0, . -— — < n п г = 1, n. I — pi, если Ke pi > 0, (8.108)
8.1. Квадратичные функционалы и линейные регуляторы
223
Теорема показывает, что при уменьшении штрафа за управление (а точнее за
энергетические потери) п — и полюсов замкнутой системы асимпототически стре-
мятся к вещественно-неположительным числам, равным нулям разомкнутой си-
стемы (при Rep° < 0), либо числам, им противоположным (при Rep° > 0). Осталь-
ные и полюсов устремляются в бесконечность, приближаясь к корням полинома
Баттерворта с радиусом распределения (8.107). При этом, как правило, процессы
в системе значительно ускоряются благодаря достаточно большим управляющим
сигналам.
При увеличении штрафа за управление все корни системы асимптотически
стремятся к вещественно-неположительным числам, равным полюсам разомкну-
той системы (при Repi < 0), либо числам противоположным по знаку (при
Repi > 0). В тех случаях, когда все полюсы разомкнутой системы вещественно-
неположительны, достаточно большие штрафы на управление приводят к нуле-
вым управляющим воздействиям, т. е. размыканию системы (8.101): Ас —> А. Для
неустойчивых разомкнутых систем с вещественно положительными полюсами, да-
же большие штрафы на управление обеспечивают отображение корней в левую
полуплоскость:
ReAi{Ac} —> —ReAj{A} < 0,
и получение устойчивых переходных процессов.
Пример 8.7. Рассмотрим объект управления (8.68) и функционал (8.69). Как по-
казано в примере 8.6, задача оптимизации по функционалу (8.69) эквивалентна
оптимизации системы по функционалу (8.93), где виртуальный выход определяет-
ся выражением (8.94), т. е.
С = | 1 I • (8.109)
Матрица обратной связи определяется выражением (8.82). Нетрудно видеть, что
при р —> оо имеет место К —> 0 и, следовательно, система становится разомкну-
той. При р —> 0 коэффициенты обратной связи неограниченно возрастают, и при
достаточно большом значении р можно записать
К ~ - 4= I 1 у/о^ \ = ~ С. (8.110)
Vp \Гр
Передаточная функция разомкнутой системы с выходом у имеет вид
IV(p) = ^2+1 . (8.111)
Система имеет 2 нулевых полюса и один нуль р° — -l/y/q^.
По теореме 8.5 получим свойства полюсов рс ij2 замкнутой системы:
limpd =-------4, lim — — —1, (8.112)
р—►о y/qi р—ш
224
Глава 8. Методы оптимального управления
где
(8.113)
и
lim рс 12 = Pi,2 = 0.
р—*оо
(8.114)
Рис. 8.9. Корневой годограф оптимальной системы (пример 8.5)
Корневой годограф системы для случая д2 = 0.16 (С = |1 0.4|) представлен на
рис. 8.9. На рис. 8.10, а приведены оптимальные переходные процессы при
р = 0.0025, а на рис. 8.10, б — при р = 0.0064. Процессы оптимальной системы
при р = 0.25 были представлены в примере 8.5 (см. рис. 8.7). Сравнение графиков
показывает, что при малых р переходные процессы a?i(i) имеют лучшие качествен-
ные показатели, что достигается за счет достаточно больших управлений w(i) (см.
также пример 8.1, в котором рассматривается случай р = 0). При увеличении р
и, следовательно, штрафов за энергетические потери управляющие воздействия
уменьшаются. □
Рис. 8.10. Процессы оптимальной системы (пример 8.7)
8.2. Принцип максимума
225
8.2. Принцип максимума
Основным недостатком классической теории вариационного исчисления и соответ-
ствующих ей методов оптимального управления является отсутствие ограничений
типа неравенств и предположение о гладкости оптимальных решений. В связи с
этим попытки их использования для целого ряда оптимальных задач приводят
к вырожденным решениям (например, к бесконечно большим управлениям или
разрывным траекториям). В реальных системах всегда присутствуют ограничения
на управляющие воздействия и переменные состояния, что, как правило, связано
с использованием негладких и разрывных управляющих воздействий. Указанные
ограничения и расширение класса рассматриваемых решений являются важной
отличительной особенностью принципа максимума, основные положения которого
выдвинуты Л. С. Понтрягиным и развиты В. Г. Болтянским, Р. В. Гамкрелидзе
и Е. Ф. Мищенко [33].
8.2.1. Функция Гамильтона и основная теорема
Принцип максимума является обобщением теории Гамильтона для задач управле-
ния с ограниченными и негладкими функциями.
Рассмотрим нелинейную систему *
х = f(x,u),
(8.115)
где х G Rn, и = {uj} — m-мерный вектор управления, t е [O,ty], / — вектор-
функция, непрерывная по ж и и и непрерывно-дифференцируемая по х, а также
функционал
(8.116)
ftf
J(x,u) = I f°(x(t),u(t)dt,
Jo
где /° — функция, непрерывная по х и и и непрерывно-дифференцируемая по х,
tf > 0 — время окончания процесса, величина которого в общем случае может
быть неизвестна (не задана). Будем полагать, что для объекта управления (8.115)
заданы граничные условия я(0) = xQ, x(tf) == Xf и ограничения на управление
и е U,
(8.117)
где U — односвязная область m-мерного пространства. Отметим, что указанные
ограничения часто задаются в виде неравенств |и7| < Uj, где Uj > 0, j = l,m, и
после некоторого преобразования уравнения объекта (8.115) могут быть представ-
лены как
Ы < 1, (8.118)
что соответствует гиперкубу в пространстве Rm. Кусочно-непрерывные управления
uj(t), удовлетворяющие условию (8.117) (или (8.118)), называются допустимыми.
Задача оптимального управления формулируется следующим образом.
226
Глава 8. Методы оптимального управления
Задача 8.4. Найти оптимальный переходный процесс я: = a?*(t) и оптимальное
допустимое управление и = u*(t), обеспечивающее перевод объекта управления
(8.115) из точки ж(0) = а?о в точку x(tf) = Xf и доставляющее минимум функцио-
налу (8.116), т. е.
{x*(t),u*(t)} = arg mmJ(x,u).
По схеме, рассмотренной в 7.5.2, сформируем гамильтониан
Н(х,и, Л) - -f°(x,u) + XTf(x,u),
(8.119)
где Л = A(t) — вектор-функция множителей Лагранжа, являющаяся решением
сопряженной системы
дх /
(8.120)
Напомним (см. 7.5.2), что для функции Н справедливо также следующее выраже-
ние:
дН\т
~дх)
(8.121)
идентичное дифференциальному уравнению объекта управления (8.115) и состав-
ляющее совместно с уравнением (8.120) каноническую модель оптимальной зада-
чи. Для случая гладких неограниченных управлений решение задачи сводится к
нахождению функции u*(t), удовлетворяющей условию стационарности гамильто-
ниана
Й ГУ
= о. (8.122)
ди
При этом на оптимальных решениях выполняется Н = 0 и, следовательно,
Н(х*, и*, Л) = const.
(8.123)
Нетрудно показать, что функция u*(t), соответствующая стационарному решению,
доставляет наибольшее значение функции Гамильтона (8.119), и записать
Н(х,и, Л) = /1(ж*,А), (8.124)
где
/я(ж,А) = тахЯ(гт,и, А). (8.125)
Пример 8.8. Рассмотрим задачу синтеза оптимального управления объектом
(8.126)
8.2. Принцип максимума
227
где х и и — скалярные переменные, полагая, что заданы граничные условия tf > О,
х(0) = xq, x(tf) = 0 и функционал качества (затрат энергии)
1 ftf
Дх,и) = - / u2dt. (8.127)
2 Jo
Здесь функция Гамильтона принимает вид
Н(и, Л) = — |u2 + Aw, (8.128)
а уравнение сопряженной системы —
А = 0. (8.129)
Оптимальное управляющее воздействие ищется из условия стационарности
— = —и + А = 0, (8.130)
ди
и определяется как
и = A. ffc.131)
Принимая во внимание, что решением сопряженной системы является А = А(0),
найдем: х = хо + At, и следовательно,
А = А(0) = (8.132)
tf
Решения канонической системы, соответствующие tf = 1 и различным начальным
значениям ж(0), приведены на рис. 8.11, а.
Рис. 8.11. Траектории системы, оптимальной по затратам энергии (пример 8.8)
228
Глава 8. Методы оптимального управления
Подставляя (8.130) и (8.131) в (8.128), получаем наибольшее значение гамильто-
ниана:
1
р(Х) = тахН(и,Х) = -А2 = (8.133)
' ' 2 '
На рис. 8.11, б представлены оптимальные процессы и соответствующая функция
Гамильтона у — maxu Н при ж(0) = 0.8. □
Для задач с ограниченным управлением стационарное решение u*(t) может ока-
заться вне области U, что в первую очередь и определяет ограниченные
ности теории Гамильтона.
Определим наибольшее значение функции Гамильтона для допустимых
ний и:
р(х,Х) = тах.Н(х, и, Л),
и&Я
запишем уравнение сопряженной системы (8.120) в развернутом виде
• /df\T /df°\T
\дх/ \ дх /
и представим формулировку принципа максимума.
Теорема 8.5. Пусть х = x*(t) и и = u*(t) — решения задачи 8.4. Тогда:
1) существует ненулевое решение A(t) уравнения (8.120) такое, что
Н(х,и, А) = //(ж, А);
2) если время процессов tf не задано, то
/1(ж(^),А(^)) = 0.
возмож-
управле-
(8.134)
(8.135)
(8.136)
Замечание 8.3. Условие 2) носит характер условий трансверсальности (см. 7.3.4)
и может быть использовано, например, для нахождения неизвестного значения tf.
Если конечное время tf задано, то условие 2), вообще говоря, несправедливо. Тем
не менее в любом случае при t е [0, tf] имеет место тождество
p(x(t), A(i)) = const, (8.138)
т. е. на оптимальных решениях функция Гамильтона сохраняет постоянное значе-
ние. □
Замечание 8.4. В случае когда конечное время tf не задано, и следовательно,
выполняется (8.137), выражение (8.138) для любых t G [0, tf] имеет вид
/z(z(t),A(t)) = 0
(8.139)
8.2. Принцип максимума
229
и оба условия принципа максимума сводятся к формуле
maxZT(x, и, Л) = 0. (8.140)
□
Как отмечалось выше, в простейших случаях оптимальные решения получаются
из условия стационарности гамильтониана (8.122). Если это условие дает значе-
ния и, лежащие за пределами области U, то резонно предположить, что значения
управления, доставляющие максимум гамильтониану, будут лежать на границе
указанной области (для случая (8.118) это будут значения Uj = ±1). Для неглад-
ких функций Гамильтона следует также допустить возможность существования
решений в сингулярных точках, где функция дН/ди не определена. Наконец, не
исключена возможность неединственности решений s*(t) и u*(t), удовлетворяю-
щих формулировке теоремы 8.5. В связи с этим вводятся следующие понятия.
Задача оптимального управления называется нормальной, если для нее существу-
ют единственные оптимальные решения x*(t) и u*(t), и вырожденной в противном
случае.
8.2.2. Оптимальные управляющие воздействия
(частные случаи)
Пусть объект управления является аффинным и имеет один вход, т. е.
х = f(x)+g(x)u.
(8.141)
где и — скалярное управляющее воздействие, а ограничение на управление задано
в виде неравенства
|u| < 1. (8.142)
В этом случае функция Гамильтона принимает вид
Н(х,и, Л) = — /°(а?, и) + Хт f(x) + Хт g(x) и, (8.143)
где вектор-функция Л = Л(£) является решением сопряженной системы
• fdf дд fdf°\T
А — — (о—Ь и) + (-д—)
\дх дх / \ дх /
(8.144)
Гамильтониан как функция управления и может достигать наибольших значений
в стационарных точках, в которых дН/ди — 0, граничных точках и — ±1, а также
в сингулярных точках, в которых производная дН/ди не определена.
Оптимальные решения на границах множества U (т. е. и = ±1) во многих случаях
могут быть получены как и* = sign(<?TA) (см. ниже). Для анализа решений во
внутренности множества запишем
дРТ
— = -F*(x,u) + XTg(x), (8.145)
230
Глава 8. Методы оптимального управления
где F°(x,u) = dfQ/du. Выражение показывает, что в сингулярных точках пре-
терпевает разрыв функция F°(х,и), а для нахождения стационарных решений
(в предположении существования функции F°(x,u)) необходимо решить относи-
тельно и уравнение
—F°(u,x') + XTg(x') = 0. (8.146)
Если указанные решения существуют и на некоторых интервалах времени удовле-
творяют ограничению (8.142), то рассматриваемая задача допускает оптимальные
решения на внутренних точках интервала U = [-1,1].
Отметим, что если на некотором конечном интервале времени выполняется дтХ =
= 0, то рассмотренные решения оптимальной задачи не единственны, что делает
такую задачу вырожденной.
Далее рассмотрим частные случаи, соответствующие наиболее распространенным
функционалам качества, представляющим:
• затраты времени
(8.147)
• затраты энергии и времени
J = [ Г1 + ^u2(t)\dt = tf + [ pu2(t}dt\ (8.148)
Jo ' 2 / 2 Jo
где p > 0;
• затраты топлива и времени
J = [ (1 + p\u(t)\\dt = tf + [ p\u(t)\dti (8.149)
Jo v ' Jo
где p > 0.
Отметим, что во всех рассматриваемых случаях подинтегральное выражение не
зависит от х, и следовательно, сопряженная система (8.144) принимает вид
Л = _(|£)Та+(^)\ (8.150)
а управляющее воздействие может быть найдено в форме
и = U(gTX\ (8.151)
где £/(•) — функция, подлежащая определению (см. рис. 8.13). Общая структура
канонической модели указанных задач оптимального управления представлена на
рис. 8.12.
8,2. Принцип максимума
231
Рис. 8.12. Каноническая модель оптимальных систем
Оптимальное быстродействие. Для функционала (8.147), соотвествующего за-
тратам времени, функция Гамильтона определяется выражением
Н(х,и,Х) — -1 + Хтf (х) + Хтд(х) и. (8.152)
Нетрудно показать, что задача не имеет решений на внутренних точках интервала
ZZ, а граничные решения, доставляющие максимум гамильтониану, определяются
выражением (рис. 8.13, а)
u = sign (8.153}
Рис. 8.13. Типовые нелинейные блоки оптимальных систем
Пример 8.9. Рассмотрим задачу синтеза оптимального управления объектом
х — ах + Ъи, (8.154)
где х и и — скалярные переменные, b 0, полагая, что заданы граничные условия
г(0) — хо, x(tf) = 0 и функционал затрат времени (8.147). Функция Гамильтона
принимает вид
Н(х,и,Х) = — 1 + Л(аа; + Ьи), (8.155)
а уравнение сопряженной системы —
А = —аХ. (8.156)
Условие стационарности
— = ЬХ = О (8.157)
ди
232
Глава 8. Методы оптимального управления
показывает, что система не имеет нетривиальных стационарных решений. Гранич-
ные решения определяются выражением (рис. 8.13, а)
и — sign(bA). (8.158)
Подставляя (8.158) в (8.155), получаем наибольшее значение гамильтониана:
ц(х, Л) — тах.Н(х, и, Л) = — 1 + Хах + |ЛЬ|. (8.159)
и
Так как время процесса tf не задано, то для любых t > 0 выполняется
/л(яг, А) = — 1 + Хах + |АЬ| = 0. (8.160)
В частности при t = tf получаем —1 + |A(t/)b| = 0.
Рис. 8.14. Процессы системы, оптимальной по быстродействию (а, пример 8.9)
и оптимальной по затратам энергии (б, пример 8.10)
На рис. 8.14, а для случая а = —1, b = 1 представлены оптимальные процессы
и соответствующая функция Гамильтона р = maxu Н = 0 при а;(0) = 2. □
Оптимальные затраты энергии. Для функционала (8.148) функция Гамильтона
определяется выражением
Н(х,и, А) = — 1 — ^и2 + Хтf(x) + XTg(x) и. (8.161)
Найдем
ЭН
—- = -ри + Хтд, (8.162)
ои
и следовательно, стационарные решения определяются выражением
и = -дтХ. (8.163)
8.2. Принцип максимума
233
При |fifTA| < р управление принимает значения на интервале [—1,1], и следова-
тельно, полученное решение соответствует отрезку оптимальной траектории. При
|(7ТА| > р наибольшее значение гамильтониана достигается на граничных точках,
а управление определяется выражением (8.153). Таким образом, в общем случае
оптимальное решение u*(t) представлено отрезками функций, удовлетворяющих
условиям (8.153) и (8.163). Полученные решения можно записать в компактном
виде (рис. 8.13, б)
(8.164)
Пример 8.10. Рассмотрим задачу синтеза оптимального управления объектом
(8.154), полагая, что заданы граничные условия а;(0) = я?0, x(tf) = 0 и комби-
нированный функционал затрат времени и энергии (8.148). Функция Гамильтона
принимает вид
Н(х,и,Х) — — 1 — ^и2 + Х(ах + Ьи), (8.165)
а уравнение сопряженной системы сохраняет форму (8.156).
Условие стационарности гамильтониана принимает вид
= —ри + ЬХ = 0, <8.166)
ди
и следовательно, стационарные решения находятся из выражения
и = -А. (8.167)
Р
При |ЬА| < р получаем и е [-1,1], и следовательно, решение (8.167) соответствует
отрезку оптимальной траектории.
При |ЬА| > р наибольшее значение гамильтониана достигается на граничных точ-
ках, а управление определяется выражением (8.158). Таким образом, для опти-
мального решения u*(t) можно записать (рис. 8.13, б)
и — satf-A\ (8.168)
На рис. 8.14, б для случая а — —1, b = 1 представлены оптимальные процессы и
соответствующая функция Гамильтона р = тахиН = 0 при я;(0) = 2. □
Оптимальный расход топлива. Для функционала (8.149) функция Гамильтона
определяется выражением
Н(х,и, А) = — 1 — p|u| + Хт f(x) + Хт д(х) и. (8.169)
Производная функции претерпевает разрыв в точке и = 0. Нетрудно получить, что
это решение действительно доставляет максимум Н при условии \дтА| < р.
234
Глава 8. Методы оптимального управления
При |ртА| > р наибольшее значение гамильтониана достигается на граничных
точках, а управление определяется выражением (8.153). Таким образом, в общем
случае оптимальное решение u*(t) представлено отрезками и = 0 (при |ртЛ|/ < р),
и (8.153). Решение можно записать в компактном виде (рис. 8.13, в)
A f 1 Т \
и = dez I -д Л
(8.170)
Пример 8.11. Рассмотрим задачу синтеза оптимального управления объектом
(8.154), полагая, что заданы, граничные условия х(0) = xq, x(tf) — 0 и комби-
нированный функционал затрат времени и топлива (8.149). Функция Гамильтона
принимает вид
Н(х,и, Л) = — 1 — р|ад| + А(ах + Ъи), (8.171)
а уравнение сопряженной системы сохраняет форму (8.156).
Производная гамильтониана
= — р sign ад + ЬА (8.172)
претерпевает разрыв в точке ад = 0. Это решение доставляет максимум Н при
условии |ЬЛ| < р. При |ЬЛ| > р наибольшее значение гамильтониана достигается в
граничных точках, а управление определяется выражением (8.158). Таким образом,
для оптимального решения u*(t) можно записать (рис. 8.13, в)
(8.173)
На рис. 8.15 для случая а = — 1, b = 1 представлены оптимальные процессы
и соответствующая функция Гамильтона р = maxu Н = 0 при а;(0) = 2. □
Рис. 8.15. Процессы системы, оптимальной по затратам топлива (пример 8.11)
8.2. Принцип максимума
235
Отметим, что рассмотренные задачи допускают единственные решения и являются
нормальными при условии, что функция дтХ принимает нулевые значения только
в изолированные моменты времени.
8.2.3. Оптимальное быстродействие линейных
объектов
Рассмотрим линейную систему с одним входом
х = Ах + Ви (8.174)
и фунционал оптимального быстродействия
rtf
J(x,u) = / dt — tf. (8.175)
Jo
Здесь и — скалярное управляющее воздействие, удовлетворяющее ограничению
|u| < 1, (8.176)
tf > 0 — время окончания процесса, величина которого не задана. ф
Функция Гамильтона принимает вид
Н(ж,и,А) = -1 + Хт Ах + ХтВи, (8.177)
где вектор-функция Л = A(t) является решением сопряженной системы (рис. 8.16)
А = —Атх, (8.178)
и следовательно,
А = e~ATtX0, (8.179)
где Ао = А(0).
Рис. 8.16. Каноническая система задачи оптимального быстродействия
Решением оптимальной задачи является кусочно-постоянное управление
и* = sign(BTA).
(8.180)
236
Глава 8. Методы оптимального управления
В этом случае функция Гамильтона принимает вид
Н(х*,и*,Х) = —1 + ХтАх* + |АТВ|, (8.181)
а в конечной точке имеет место
-1 + |А^В| = 0. (8.182)
Если условие sign(BTA) = 0 выполняется только в изолированные моменты време-
ни, то задача не вырождена и имеет единственное оптимальное решение (8.180).
Необходимым и достаточным условием невырожденности является полная управ-
ляемость пары (Л, В).
Пусть матрица А имеет только вещественные
корни:
Im АДЛ} = 0, г = г,п.
Тогда по теореме Фельдбаума (см. [9]) функ-
ция (8.179) имеет не более п — 1 корней, т. е.
при t е [0, оо) переключается не более п—1 раз.
При дополнительном условии полной управля-
емости пары (А, В) это же справедливо и для
функции BTA(i), а следовательно и для управ-
ляющего воздействия u(t), рассчитываемого по формуле (8.180). Таким образом,
имеет место следующее положение.
Теорема 8.6 (об п интервалах). Если матрица А имеет только вещественные
корни и пара (Л, В) полностью управляема, то оптимальное управление принимает
граничные значения ±1 и имеет не более п интервалов постоянства.
Отметим, что при некоторых начальных условиях оптимальное управление может
содержать и менее чем п интервалов постоянства (см. пример 8.12).
Пример 8.12. Рассмотрим задачу оптимального быстродействия системы второго
порядка (см. также примеры 2.5 и 6.2)
±1 = Я?2, х2 = и (8.183)
с ограничением на управление (8.176). Нетрудно показать, что система полностью
управляема, и в соответствии с теоремой об п интервалах оптимальное управление
принимает значения ±1 и допускает два интервала знакопостоянства.
Напомним, что для постоянных значений управления система имеет решения
z ^2
X2(t) = Х20 + Ut, X^t) - X10+x2Gt+-t,
8.2. Принцип максимума
237
и ее фазовые траектории описываются выражением (см. рис. 2.3)
xi = х10 +—(х2 - х20) +—(х2 - х20)2. (8.184)
и 2,и
Принимая во внимание наличие не более двух интервалов знакопостоянства, сле-
дует заключить, что оптимальная фазовая траектория из произвольного начального
состояния (гс1О,^2о) в начало координат (0,0) может быть реализована с помощью
следующих импульсных последовательностей:
и = 1, -1, (8.185)
и = -1, 1, (8.186)
а также (для определенных начальных состояний) —
и = 1, (8.187)
и = -1. (8.188)
Анализ множества фазовых траекторий (8.184) (см. рис. 2.3) показывает, что до-
стижение нулевого конечного состояния за один интервал знакопостоянства управ-
ления возможно из точек, принадлежащих отрезкам фазовых траекторий (участкам
парабол, рис. 8.17, а) *
х2
S+ : х^ - (+1)у =0, z2<0
и
X2
S~ : a?i - (~1)у =0, х2 > 0,
полученных при значениях и = 1 и и = -1 соответственно.
Х1
a
xi
б
Рис. 8.17. Структура фазовой плоскости и траектории системы, оптимальной по быстродействию
238
Глава 8. Методы оптимального управления
Определим кривую
5 = S+US-|JO : ф^хг) = О,
где
Ф(х1,х2) = Xi +-(sign ж2)а?2, (8.189)
соответствующую оптимальному переходному процессу, осуществляемому с помо-
щью указанных управлений. Отметим, что кривая 5 делит фазовую плоскость R2
на две области
R+ :
R~ :
</>(а?1,гг2) < О,
Ф(х1,х2) > 0.
При этом фазовые траектории, начинающиеся в области R+ (при а?о € R+), до-
стигают начала координат при использовании управляющей последовательности
(8.185), а фазовые траектории, начинающиеся в области R~ (при а?о € R~), —
при использовании управляющей последовательности (8.186). Переключение зна-
ка управления происходит точно на кривой S, называемой оптимальной линией
переключений системы (8.183).
Таким образом, можно сделать вывод, что оптимальное управление рассматривае-
мым объектом имеет вид:
«’(*) =
при х е R+\JS+,
при х е R~{JS~.
(8.190)
Оптимальное управление может быть реализовано с помощью замкнутых алго-
ритмов управления релейного типа. Первый из них описывается выражением (см.
примеры 2.6 и 6.2-6.3)
и = —sign v, (8.191)
v = kixi + k2x2, (8.192)
где коэффициенты обратной связи A?i > 0 и к2 > 0 должны выбираться в за-
висимости от начального состояния системы (8.183). При постоянных значениях
коэффициентов регулятор обеспечивает лишь приближенное решение оптимальной
задачи и является квазиоптимальным.
Второй тип регулятора является оптимальным и представлен формулами (8.191) и
v — ф(х1,х2), (8.193)
или
и = -signal + | (signal (8.194)
Фазовые траектории оптимальной системы представлены на рис. 8.17, б, а кривые
оптимальных переходных процессов при х0 = 2 — на рис. 8.18. □
8.3. Принцип оптимальности и уравнение Беллмана
239
Рис. 8.18. Переходные процессы системы, оптимальной по быстродействию
8.3. Принцип оптимальности и уравнение Беллмана
Принцип оптимальности был разработан в 50-е годы Р. Веллманом для решения
многошаговых задач оптимизации дискретных процессов и является основой так
называемого метода динамического программирования [3, 13]. Формулировка
принципа остается справедливой и для систем непрерывного времени, где он часто
используется для решения задач оптимального управления, основой чего является
уравнение Беллмана. При этом если для стационарных задач управления результа-
ты практически повторяют некоторые формулировки принципа максимума, то для
задач управления, в которых описание объекта и функцинала содержит функции
времени, уравнение Беллмана может служить основой для синтеза нового класса
регуляторов.
Сначала рассмотрим нелинейную стационарную систему
х = /(ж, и) (8.195)
и функционал
J(x,u) = / /°(т(£), u(ty)dt, (8.196)
Jo
где х е Rn, ж(0) = х0, и — m-мерный вектор управления, удовлетворяющий огра-
ничению
и. € U, (8.197)
t е [0, ty], f и f° — достаточно гладкие функции.
Принцип оптимальности Беллмана. Пусть существует решение задачи опти-
мального управления (задачи 8.4), т. е. допустимое управление и = u*(t) и пере-
ходный процесс х = x*(t), доставляющие минимум функционалу J(x,u):
{х*(t), и*(t)} = arg min J(x, и).
uEU
340
Гпава 8. Методы оптимального управления
Зафиксируем произвольный промежуточный мо-
мент времени t\ е (0, tf) и точку оптимальной
траектории х = rr*(ii). Рассмотрим поведение си-
стемы (8.195) на интервале t е [ii, tf] и функци-
онал
(8.198)
полагая, что начальным состоянием является точ-
ка х = ж*^1). Пусть управление и = u*f(t) и пе-
реходный процесс х = x*f(t) доставляют минимум функционалу Jf(x,u), т. е.
{x}(t),u}(t)} = arg mmJf(x,u),
где
Xf^t-t) = ac*(ti).
Запишем
/•ti
J(x,u) = I f°(x(t), u(t))dt + Jf(x, u)
Jo
и в силу оптимальности решения u*(t),x*(t) —
Г*1
min J(x,u) = / f°(x*(t), u*(t))dt + Jf(x*, и*).
u£U In
(8.199)
(8.200)
Так как по определению минимальное значение функционала Jf доставляется
функциями x*f(t) и uj(t), то оптимальное решение на интервале обеспе-
чивается именно этими функциями.
Таким образом, справедливо следующее положение, соответствующее принципу
оптимальности для рассматриваемого случая стационарных непрерывных систем.
Теорема 8.7. Если функции x*(t) и u*(t) при t е [0, tf] доставляют минимум
функционалу J(x,u), а функции x*j(t) и u*f(t) при t е где t± е (O,tf) и
x*f(ti) = a?*(ti), — минимум функционалу Jf(x,u), то при t G [ti,tf] имеет место:
x*(t)=Xj(t) и u*(t)=Uf(t).
Иными словами, установлено следующее.
Вне зависимости от предшествующего решения оптимальной задачи
до произвольного момента tx е (O,tf) (т. е. предыстории оптимальных
процессов), последующие отрезки оптимальных процессов {x*(t),u*(t)}
должны доставлять оптимальное решение задаче с начальным состо-
янием a;*(ii), полученным в результате оптимизации на предыдущем
интервале.
Принцип оптимальности используется при выводе уравнения Веллмана.
8.3. Принцип оптимальности и уравнение Беллмана
241
Уравнение Беллмана. Сначала рассмотрим задачу оптимального управления 8.4,
т. е. будем искать допустимое управление и = u*(t), обеспечивающее получение
переходного процесса х = x*(t) объекта управления (8.195) с граничными усло-
виями -ж(0) = х0 и x(tf) = Xf и доставляющее минимум функционалу (8.196),
полагая, что время окончания процесса tf > 0 не задано. Зафиксируем момент
времени t € [0, tf] и введем в рассмотрение функцию Беллмана
ftf
S(x(t)) = min / /°(z(t),u(t))dT. (8.201)
Полагая, что x(t) = z*(t) и используя принцип оптимальности (теорема 8.7), за-
пишем
S(x*(t)) = / f°(x\t),u\t)dr, (8.202)
Jt
т. е. функция S(x) представляет собой минимальное значение функционала (8.196)
при движении из промежуточной точки x(t) оптимальной траектории. Очевидно,
что
5(жо) = minJ(a;,u), S(xf) ~ 0.
и&Л
Функция S(x) обладает следующим свойством.
Теорема 8.8. Если функции 5(ж) является достаточно гладкой, то она является
решением уравнения
*
min (f°(x,u) Ч- /(ж, w)) = 0 (8.203)
и&л \ ох /
с краевым условием S(xf) = 0.
Для доказательства теоремы рассмотрим момент времени t + At, где At > 0 —
малое приращение, и соответствующее значение
ГЧ п Г*' п
S(x*(t -I- At)) = min / /°(z(t), u(t))dr = / /°(a;*(t), u*(t)dr. (8.204)
uEU Jt+At Jt+^t
Принимая во внимание (8.204) и (8.202), найдем
ft+^t
S(x*(t)) = / f°(x\t),u\t)dr + S(x*(t + At)), (8.205)
Jt
и следовательно,
/°(£(t),u(t))dr + S(z(t + At)) — S^t))) = 0. (8.206)
Если функции f° и S(x) являются достаточно гладкими, то для малых At имеет
место
/0(z(t),u(t))dr
/°(a;(t),u(t))At,
S(x(t + At)) - S(x(t)) ~
dS dx dS „ чл
dx dt dx
(8.207)
(8.208)
9 Зак. 281
242
Гпава 8. Методы оптимального управления
и следовательно,
min (/°(®(t),u(t))At + —/(ж, u)At + ©(At)) = 0, (8.209)
s ueu \ ox /
где o(At)/At —> 0 при At —► 0. После деления всех слагаемых на At и перехода
к пределу при At —► 0 получаем искомое выражение (8.203).
Замечание 8.5. Введем обозначение
dS\T
дх )
(8.210)
и перепишем уравнение (8.203) в виде
max ( — f°(x(t), u(t)) + Лг(ж)/(ж, u) j = 0.
(8.211)
Нетрудно видеть, что выражение (8.211) совпадает с формулой (8.140), полученной
для принципа максимума (см. замечание 8.4, 8.2.1). Соответственно, совпадают и
способы нахождения оптимального управления. □
Пример 8.13. Рассмотрим задачу синтеза оптимального управления объектом
х = и,
(8.212)
где х и и — скалярные переменные, полагая, что tf = оо, заданы граничные
условия ж(0) = ж0, х(оо) = 0 и квадратичный функционал качества
1
J(x,u) = - / (qx2 + pu2)dt,
2 Jo
где q > 0, p > 0 (см. также пример 7.7).
Уравнение Беллмана принимает вид
. /1, о 2ч &S \
mm -(фг +ри) + — и) = О,
«ew\2v ' дх /
(8.213)
(8.214)
где S(oo) = 0. Из условия стационарности минимизируемой функции получаем
dS \ dS п
—и) = ри + — = О,
дх / дх
и следовательно,
1 dS
и ~------7Г-
р дх
После подстановки (8.216) в (8.214), получаем
1 2 _£/^\2_V£^\2
2?ж р\дх)
(8.215)
(8.216)
(8.217)
8.3. Принцип оптимальности и уравнение Беллмана
243
и следовательно,
= V^P х' (8.218)
ох
Подстановка последнего выражения в (8.216) дает искомый алгоритм управления
(см. также пример 7.7)
и = - у/J х. (8.219)
Отметим, что процедура синтеза регулятора не требует нахождения функции S.
Тем не менее эта функция может быть легко получена как решение уравнения
(8.217) *и для краевых условий S'(oo) = 0, ж(оо) = 0 принимает вид
S = ж2. (8.220)
Так как S'(O) = J*, то наименьшее значение функционала (8.213) находится как
•Г = ^4 (8.221)
Рис. 8.19. Оптимальные процессы и функция Беллмана (пример 8.12)
Найденные оптимальные решения и функция S(t) для случая q = 1, р = 4 пред-
ставлены на рис. 8.19. □
Теперь рассмотрим более общий случай задачи оптимального управления, соот-
ветствующий нестационарной системе
х - f(x,u,t)
(8.222)
и функционалу
J(x, и)
/°(a;(t),u(t),£)dt,
(8.223)
244
Глава 8. Методы оптимального управления
где вектор управления и удовлетворяет ограничению (8.197), время окончания про-
цесса tf > 0 фиксировано, а конечное состояние Xf полагается произвольным.
Введем в рассмотрение нестационарную функцию
г*/ a ft} п
S(x(t),t) = min / /°(ж(£), u(i),t)dr = / /°(z*(t), t)dr. (8.224)
«ем Jt Jt
Функция S(x,t) удовлетворяет уравнению в частных производных, которое назы-
вается уравнением Беллмана.
Теорема 8.9. Если функции S(x,t) является достаточно гладкой, то она является
решением уравнения Беллмана
дБ , / .n, . дБ.. .\
= min (f°(x,u,t) + — f(x,u,t)). (8.225)
Ot u&4 \ OX /
Решение задачи оптимального управления с использованием уравнения Беллмана
предусматривает:
а) нахождение управления
дЯ
и* = U*(x,-—-,t) (8.226)
дх
из условия
и* = argmin (f°(x,u,t) + ^f(x,u,t)\, (8.227)
б) решение уравнения в частных производных
™
и получение функции Б = 5(ж, t);
в) нахождение окончательного алгоритма управления после определения дБ/дх
и подстановки в (8.226).