Main menu

Уравнения Гамильтона-Якоби-Беллмана-Айзекса (HJBI) в стохастических дифференциальных играх

В задачах, где два экономических агента (например, маркет-мейкер и информированный трейдер, или компания и регулятор) конкурируют в непрерывной стохастической среде, классическая теория оптимального управления переходит в теорию стохастических дифференциальных игр. Математическим аппаратом для поиска равновесных стратегий в таких играх служат нелинейные уравнения в частных производных Гамильтона-Якоби-Беллмана-Айзекса (HJBI).

Дифференциальная игра с нулевой суммой между двумя игроками формализуется следующим образом. Игрок 1 выбирает стратегию управления $u_t$ для максимизации функционала выигрыша, а Игрок 2 выбирает стратегию $v_t$ для его минимизации. Динамика состояния системы описывается СДУ: $dX_t = b(t, X_t, u_t, v_t)dt + sigma(t, X_t, u_t, v_t)dW_t$. Ожидаемый выигрыш (Payoff) при старте из состояния $(t, x)$ задается как $J(t, x, u, v) = mathbb{E} left[ int_t^T f(s, X_s, u_s, v_s) ds + g(X_T) ight]$. Если Беллман разработал принцип оптимальности для одного агента, то Руфус Айзекс расширил его, доказав, что при выполнении определенных условий минимакса (условий Айзекса), верхняя и нижняя цена игры совпадают, образуя седловую точку.

Функция ценности (Value Function) $V(t, x)$ в этой седловой точке является вязким решением уравнения HJBI: $frac{partial V}{partial t} + min_{v} max_{u} left{ b(t,x,u,v) frac{partial V}{partial x} + frac{1}{2}sigma^2(t,x,u,v) frac{partial^2 V}{partial x^2} + f(t,x,u,v) ight} = 0$. Математическая сложность заключается в вычислении оператора минимакса, который часто приводит к сильной нелинейности. В финансовой практике уравнение HJBI является основой теории Робастного управления (Robust Control). В этом фреймворке Игрок 1 — это инвестор, а Игрок 2 — это абстрактная "Природа" (рынок), которая выбирает наихудшую возможную статистическую модель активов из определенного доверительного множества (моделирование Model Risk).

Инвестор максимизирует свою полезность, предполагая, что природа выберет модель, наносящую максимальный ущерб его портфелю. Штраф за слишком сильное отклонение Природы от базовой модели измеряется через относительную энтропию Кульбака-Лейблера. Решение уравнения HJBI в таком случае дает робастную инвестиционную стратегию, которая математически гарантированно защищена от ошибок спецификации эконометрической модели (Misspecification). Этот аппарат перевел концепцию "паранойи риск-менеджера" на язык строгой вариационной оптимизации, обеспечив выживаемость стратегий в периоды структурных сдвигов на рынках.

Список литературы:
1. Isaacs R. Differential Games. — John Wiley and Sons, 1965.
2. Hansen L.P., Sargent T.J. Robustness. — Princeton University Press, 2008.
3. Fleming W.H., Souganidis P.E. On the existence of value functions of two-player, zero-sum stochastic differential games. — Indiana University Mathematics Journal, 1989.
Эксперты: Руфус Айзекс, Ларс Питер Хансен, Томас Сарджент.

Оценить
(0 votes)
Вверх

Соц. сети