Multi-Agent Reinforcement Learning
从这一节开始进入 Multi-Agent Reinforcement Learning,也就是多智能体强化学习。 在单智能体 RL 中,我们通常只关心一个 agent 的 return: $$J(\pi) = \mathbb{E}_{\pi}[G_t]$$但是在多智能体场景下,环境中同时存在多个 agent,每个 agent 的收益不仅取决于自己的动作,也取决于其他 agent 的动作。也就是说,问题从“一个 agent 怎么最大化自己的回报”,变成了“多个 agent 在相互影响时会形成什么结果”。 所以在正式进入 MARL 算法之前,需要先补充一些博弈论中的基本概念。 前置准备 布雷斯悖论 先看一个很经典的例子:布雷斯悖论(Braess’s Paradox)。 假设有 $4000$ 辆车要从 Start 开到 End,中间有两个途径点 $A$ 和 $B$,一开始有两条路线可以选: $$S \rightarrow A \rightarrow E$$$$S \rightarrow B \rightarrow E$$每条边的通行时间如下,其中 $t$ 表示这条边上的车辆数: 路段 时间 $S \rightarrow A$ $\frac{t}{100}$ $A \rightarrow E$ $45$ $S \rightarrow B$ $45$ $B \rightarrow E$ $\frac{t}{100}$ 设选择 $S \rightarrow A \rightarrow E$ 的车辆数是 $x$,那么选择 $S \rightarrow B \rightarrow E$ 的车辆数就是 $4000-x$。 ...