← 戻る ライブラリ › 応用数学と計算数学 › 経済・社会の数学 応用数学と計算数学
ゲーム理論 合理的な主体間の戦略的意思決定を扱う数学で、ナッシュ均衡などの概念を持つ。
直観 最善手が相手の手に依存するとき 2台のフードトラックが、互いに相手の駐車位置を見ないまま、通り沿いのどこに駐車するかをそれぞれ選ばなければならない。混雑した端を選ぶのはもう一方が静かな端を選んだ場合 には最善だが、両方が混雑した端を選んで同じ人だかりを分け合うことになれば最悪である。最適化だけではこれを解けない: 唯一最善の選択などなく、あるのは相手が何をするかに応じた 最善の選択だけである。ゲーム理論 は、まさにこの種の相互依存的な意思決定の数学である。
z = x 2 − y 2 z = x^2 - y^2 z = x 2 − y 2 :鞍型の利得曲面。x x x (最小化する側の選択)に沿って上に湾曲し、y y y (最大化する側の選択)に沿って下に湾曲する;中央の平坦な点は、どちらのプレイヤーも単独で動いても得をしない場所 — ゲームの値である。この形は偶然ではない。多くの2人競争ゲームでは、一方の利得がもう一方の利得のちょうど負になる — ゼロサムゲーム — そして両プレイヤーの選択の関数として見た利得は、最小化する側の戦略については凸で、最大化する側の戦略については凹である: まさに上の鞍型である。中央の平坦な点は鞍点 であり、これは両者の合理的なプレーに正確に対応することがわかる。
大学 標準形ゲーム 定義: 標準形ゲーム
標準形ゲーム は、有限個のプレイヤー 1 , … , n 1, \dots, n 1 , … , n の集合、各プレイヤー i i i に対する有限な純粋戦略 集合 S i S_i S i 、そして各プレイヤー i i i に対する利得関数 u i : S 1 × ⋯ × S n → R u_i : S_1 \times \cdots \times S_n \to \mathbb{R} u i : S 1 × ⋯ × S n → R (すべてのプレイヤーが同時に選んだ戦略の組み合わせごとにプレイヤー i i i の利得を与える)から構成される。
2人ゲームはしばしば利得行列として書かれる。古典的な囚人のジレンマ では、2人の容疑者が独立に黙秘か自白かを選ぶ;各マスは(行プレイヤーの服役年数、列プレイヤーの服役年数)を示す — それぞれにとって小さいほうがよい:
囚人のジレンマの利得行列(服役年数;小さいほうがよい) 行 \ 列 列: 黙秘 列: 自白 行: 黙秘 ( 1 , 1 ) (1, 1) ( 1 , 1 ) ( 5 , 0 ) (5, 0) ( 5 , 0 ) 行: 自白 ( 0 , 5 ) (0, 5) ( 0 , 5 ) ( 3 , 3 ) (3, 3) ( 3 , 3 )
大学 混合戦略とフォン・ノイマンのミニマックス定理 定義: 混合戦略
プレイヤー i i i の混合戦略 とは、S i S_i S i 上の確率分布 x i x_i x i である: 1つの純粋戦略にコミットする代わりに、プレイヤーはランダム化する。これは、マッチングペニーのように、予測可能などの純粋な選択も相手に利用されてしまう、安定した純粋戦略の結果を持たないゲームで最も重要になる。
u i ( x 1 , … , x n ) = ∑ s 1 ∈ S 1 ⋯ ∑ s n ∈ S n ( ∏ k = 1 n x k ( s k ) ) u i ( s 1 , … , s n ) u_i(x_1, \dots, x_n) = \sum_{s_1 \in S_1} \cdots \sum_{s_n \in S_n} \left(\prod_{k=1}^n x_k(s_k)\right) u_i(s_1, \dots, s_n) u i ( x 1 , … , x n ) = s 1 ∈ S 1 ∑ ⋯ s n ∈ S n ∑ ( k = 1 ∏ n x k ( s k ) ) u i ( s 1 , … , s n ) 2人ゼロサムゲームでは、行プレイヤーの利得行列 A A A (m × n m \times n m × n の実数行列)は列プレイヤーの利得行列のちょうど負になるため、行プレイヤーは x ⊤ A y x^\top A y x ⊤ A y を最大化したく、列プレイヤーはそれを最小化したい。ここで x x x と y y y は両プレイヤーの混合戦略(確率ベクトル)である。
任意の m × n m \times n m × n 実行列 A A A に対して max x ∈ Δ m min y ∈ Δ n x ⊤ A y = min y ∈ Δ n max x ∈ Δ m x ⊤ A y \max_{x \in \Delta_m} \min_{y \in \Delta_n} x^\top A y = \min_{y \in \Delta_n} \max_{x \in \Delta_m} x^\top A y max x ∈ Δ m min y ∈ Δ n x ⊤ A y = min y ∈ Δ n max x ∈ Δ m x ⊤ A y が成り立つ。ここで Δ m \Delta_m Δ m 、Δ n \Delta_n Δ n はそれぞれ長さ m m m 、n n n の確率ベクトルの集合である。この共通の値 v v v がゲームの値 である。
なぜ正しいのか? ランダム化しなければ、「後で」動く側(相手の戦略を知ってから選ぶ側)が有利になるため、maximin(先に行を確定する)は一般に minimax(先に列を確定する)以下である。この定理の驚くべき内容は、混合戦略のもとではこのギャップが完全に閉じることである: ランダム化により、後から動く側の有利さが消える。なぜなら相手は固定された選択をもはや予測 — そして利用 — できないからである。
証明 弱双対性。 任意の固定した x 0 ∈ Δ m x_0 \in \Delta_m x 0 ∈ Δ m と y 0 ∈ Δ n y_0 \in \Delta_n y 0 ∈ Δ n に対して: min y x 0 ⊤ A y ≤ x 0 ⊤ A y 0 ≤ max x x ⊤ A y 0 \min_y x_0^\top A y \le x_0^\top A y_0 \le \max_x x^\top A y_0 min y x 0 ⊤ A y ≤ x 0 ⊤ A y 0 ≤ max x x ⊤ A y 0 。左辺の max x 0 \max_{x_0} max x 0 と右辺の min y 0 \min_{y_0} min y 0 を取っても不等式は保たれる: max x min y x ⊤ A y ≤ min y max x x ⊤ A y \max_x \min_y x^\top A y \le \min_y \max_x x^\top A y max x min y x ⊤ A y ≤ min y max x x ⊤ A y 。この向きはランダム化の議論をまったく必要としない。
線形計画への帰着。 y ↦ x ⊤ A y y \mapsto x^\top A y y ↦ x ⊤ A y は線形であるため、単体 Δ n \Delta_n Δ n 上でのその最小値はある頂点、すなわちある純粋戦略 j j j で達成される: min y x ⊤ A y = min j ∑ i = 1 m x i A i j \min_y x^\top A y = \min_{j} \sum_{i=1}^m x_i A_{ij} min y x ⊤ A y = min j ∑ i = 1 m x i A ij 。よって行プレイヤーの問題 max x min y x ⊤ A y \max_x \min_y x^\top A y max x min y x ⊤ A y は次の線形計画である: v v v を最大化、制約は ∑ i = 1 m A i j x i ≥ v \sum_{i=1}^m A_{ij} x_i \ge v ∑ i = 1 m A ij x i ≥ v (すべての j = 1 , … , n j = 1, \dots, n j = 1 , … , n について)、かつ x ∈ Δ m x \in \Delta_m x ∈ Δ m 。
双対問題。 線形計画の標準的な双対理論により、この線形計画の双対は: w w w を最小化、制約は ∑ j = 1 n A i j y j ≤ w \sum_{j=1}^n A_{ij} y_j \le w ∑ j = 1 n A ij y j ≤ w (すべての i = 1 , … , m i = 1, \dots, m i = 1 , … , m について)、かつ y ∈ Δ n y \in \Delta_n y ∈ Δ n — これはまさに列プレイヤーの問題 min y max x x ⊤ A y \min_y \max_x x^\top A y min y max x x ⊤ A y の線形計画による定式化である。
強双対性。 主問題と双対問題の実行可能領域(Δ m \Delta_m Δ m と Δ n \Delta_n Δ n )はともに空でなくコンパクトであるため、この線形計画は実行可能かつ有界である;線形計画の強双対定理により主問題と双対問題の最適値は一致する: max x min y x ⊤ A y = min y max x x ⊤ A y \max_x \min_y x^\top A y = \min_y \max_x x^\top A y max x min y x ⊤ A y = min y max x x ⊤ A y 。この向きにすでに ≤ \le ≤ を与えていた弱双対性と合わせて、等号が成り立ち、定理が証明される。
よくある誤り. ミニマックス定理は2人ゼロサム ゲームに特有のものである。3人以上のプレイヤー、あるいは利害が対立しない場合、max min \max \min max min と min max \min \max min max は一致するとは限らず、「ゲームの値」という概念は意味をなさなくなる — 別の均衡概念が必要であり、それがまさにナッシュ均衡の提供するものである。 大学 ナッシュ均衡とその存在 定義: ナッシュ均衡
戦略プロファイル x ⋆ = ( x 1 ⋆ , … , x n ⋆ ) x^\star = (x_1^\star, \dots, x_n^\star) x ⋆ = ( x 1 ⋆ , … , x n ⋆ ) がナッシュ均衡 であるとは、他のすべてのプレイヤーの戦略が固定されたまま、どのプレイヤーも一方的に別の戦略に切り替えることで利得を改善できないことをいう: すべてのプレイヤー i i i とすべての純粋戦略 s i ∈ S i s_i \in S_i s i ∈ S i に対して u i ( x i ⋆ , x − i ⋆ ) ≥ u i ( s i , x − i ⋆ ) u_i(x_i^\star, x_{-i}^\star) \ge u_i(s_i, x_{-i}^\star) u i ( x i ⋆ , x − i ⋆ ) ≥ u i ( s i , x − i ⋆ ) が成り立つ。ここで x − i ⋆ x_{-i}^\star x − i ⋆ は i i i 以外のすべてのプレイヤーの戦略を表す。
u i ( x i ⋆ , x − i ⋆ ) ≥ u i ( s i , x − i ⋆ ) for every i and every s i ∈ S i u_i(x_i^\star, x_{-i}^\star) \ge u_i(s_i, x_{-i}^\star) \quad \text{for every } i \text{ and every } s_i \in S_i u i ( x i ⋆ , x − i ⋆ ) ≥ u i ( s i , x − i ⋆ ) for every i and every s i ∈ S i 上の囚人のジレンマでは、(自白、自白)が唯一のナッシュ均衡である: 相手が何をしようと自白は黙秘に厳密に勝るため、どちらも戦略を変える動機を持たない — たとえ(黙秘、黙秘)が両容疑者にとって厳密により良い結果であっても。この均衡と最良の共同結果とのギャップこそが「ジレンマ」の核心であり、均衡が必ずしも効率的とは限らないことを示している。
任意の有限標準形ゲーム(プレイヤー数 n n n は任意で、各プレイヤーは有限の純粋戦略集合 S i S_i S i を持つ)は、混合戦略において少なくとも1つのナッシュ均衡を持つ。
なぜ正しいのか? 証明は、すべての戦略プロファイルの空間上に、連続な「戦略を少し改善する」写像を構成する: 現在平均より良い成果を出している純粋戦略へ確率を寄せる。戦略プロファイルの空間はコンパクトかつ凸であるため、ブラウワーの不動点定理により、この写像は不動点 — 写像が変化させたくないプロファイル — を持つことが保証される。証明の残りの部分は、不動点がまさに有利な逸脱を持たないプロファイル、すなわちナッシュ均衡であることを示す。
証明 Δ = Δ 1 × ⋯ × Δ n \Delta = \Delta_1 \times \cdots \times \Delta_n Δ = Δ 1 × ⋯ × Δ n とする。これはプレイヤーたちの混合戦略単体の積であり、ユークリッド空間のコンパクトで凸な部分集合である。x ∈ Δ x \in \Delta x ∈ Δ 、プレイヤー i i i 、純粋戦略 j ∈ S i j \in S_i j ∈ S i に対し、利得関数 g i j ( x ) = max ( 0 , u i ( s i j , x − i ) − u i ( x ) ) g_{ij}(x) = \max\big(0,\, u_i(s_{ij}, x_{-i}) - u_i(x)\big) g ij ( x ) = max ( 0 , u i ( s ij , x − i ) − u i ( x ) ) を定義する。これはプレイヤー i i i が純粋戦略 j j j に完全に切り替えることで得られる利得(有利でなければ 0 0 0 )である。f : Δ → Δ f : \Delta \to \Delta f : Δ → Δ を f i ( x ) j = x i j + g i j ( x ) 1 + ∑ k ∈ S i g i k ( x ) f_i(x)_j = \dfrac{x_{ij} + g_{ij}(x)}{1 + \sum_{k \in S_i} g_{ik}(x)} f i ( x ) j = 1 + ∑ k ∈ S i g ik ( x ) x ij + g ij ( x ) により定める;u i u_i u i は x x x に関して連続(実際には多重線形)であるため g i j g_{ij} g ij は連続であり、よって f f f は連続であり、構成により各 f i ( x ) f_i(x) f i ( x ) は再び確率ベクトルである。
ブラウワーの不動点定理により、コンパクト凸集合 Δ \Delta Δ 上の連続写像 f f f は不動点 x ⋆ x^\star x ⋆ (f ( x ⋆ ) = x ⋆ f(x^\star) = x^\star f ( x ⋆ ) = x ⋆ )を持つ。S i : = ∑ k ∈ S i g i k ( x ⋆ ) S_i := \sum_{k \in S_i} g_{ik}(x^\star) S i := ∑ k ∈ S i g ik ( x ⋆ ) とおくと、各 ( i , j ) (i,j) ( i , j ) に対する不動点方程式は x i j ⋆ ( 1 + S i ) = x i j ⋆ + g i j ( x ⋆ ) x_{ij}^\star (1 + S_i) = x_{ij}^\star + g_{ij}(x^\star) x ij ⋆ ( 1 + S i ) = x ij ⋆ + g ij ( x ⋆ ) 、すなわち x i j ⋆ S i = g i j ( x ⋆ ) x_{ij}^\star S_i = g_{ij}(x^\star) x ij ⋆ S i = g ij ( x ⋆ ) である。
プレイヤー i i i を固定し d i j : = u i ( s i j , x − i ⋆ ) − u i ( x ⋆ ) d_{ij} := u_i(s_{ij}, x_{-i}^\star) - u_i(x^\star) d ij := u i ( s ij , x − i ⋆ ) − u i ( x ⋆ ) とおくと g i j ( x ⋆ ) = max ( 0 , d i j ) g_{ij}(x^\star) = \max(0, d_{ij}) g ij ( x ⋆ ) = max ( 0 , d ij ) である。不動点方程式に d i j d_{ij} d ij を掛けて j ∈ S i j \in S_i j ∈ S i について足し合わせる: 左辺は S i ∑ j x i j ⋆ d i j = S i ( ∑ j x i j ⋆ u i ( s i j , x − i ⋆ ) − u i ( x ⋆ ) ∑ j x i j ⋆ ) = S i ( u i ( x ⋆ ) − u i ( x ⋆ ) ) = 0 S_i \sum_j x_{ij}^\star d_{ij} = S_i\left(\sum_j x_{ij}^\star u_i(s_{ij}, x_{-i}^\star) - u_i(x^\star)\sum_j x_{ij}^\star\right) = S_i(u_i(x^\star) - u_i(x^\star)) = 0 S i ∑ j x ij ⋆ d ij = S i ( ∑ j x ij ⋆ u i ( s ij , x − i ⋆ ) − u i ( x ⋆ ) ∑ j x ij ⋆ ) = S i ( u i ( x ⋆ ) − u i ( x ⋆ )) = 0 となる。ここで ∑ j x i j ⋆ u i ( s i j , x − i ⋆ ) = u i ( x ⋆ ) \sum_j x_{ij}^\star u_i(s_{ij}, x_{-i}^\star) = u_i(x^\star) ∑ j x ij ⋆ u i ( s ij , x − i ⋆ ) = u i ( x ⋆ ) と ∑ j x i j ⋆ = 1 \sum_j x_{ij}^\star = 1 ∑ j x ij ⋆ = 1 を用いた。
右辺は ∑ j g i j ( x ⋆ ) d i j = ∑ j max ( 0 , d i j ) d i j = ∑ j : d i j > 0 d i j 2 ≥ 0 \sum_j g_{ij}(x^\star)\, d_{ij} = \sum_j \max(0,d_{ij})\, d_{ij} = \sum_{j:\, d_{ij} > 0} d_{ij}^2 \ge 0 ∑ j g ij ( x ⋆ ) d ij = ∑ j max ( 0 , d ij ) d ij = ∑ j : d ij > 0 d ij 2 ≥ 0 である。両辺を等置すると ∑ j : d i j > 0 d i j 2 = 0 \sum_{j:\, d_{ij}>0} d_{ij}^2 = 0 ∑ j : d ij > 0 d ij 2 = 0 となり、これは平方和がゼロであるから各項がゼロである: d i j > 0 d_{ij} > 0 d ij > 0 となる j j j は存在しない。i i i は任意であったから、すべてのプレイヤー i i i とすべての純粋戦略 j j j について u i ( s i j , x − i ⋆ ) ≤ u i ( x ⋆ ) u_i(s_{ij}, x_{-i}^\star) \le u_i(x^\star) u i ( s ij , x − i ⋆ ) ≤ u i ( x ⋆ ) が成り立つ — これはまさにナッシュ均衡の条件である。したがって x ⋆ x^\star x ⋆ はナッシュ均衡である。
大学 実世界での応用と具体例 ゲーム理論は、経済学者が競争や価格設定をモデル化する方法、セキュリティ技術者が攻撃者と防御者について推論する方法、生物学者が進化的に安定な戦略を通じて動物の行動を説明する方法、そしてオークション設計者(オンライン広告市場を含む)が正直な入札が各参加者の最良応答となる仕組みを構築する方法を形作っている。
例: ネットワーク防御ゲームにおける混合戦略均衡
攻撃者はサーバーAかサーバーBを攻撃対象に選び、防御者はどちらを監視するかを選ぶ。攻撃者が監視されているサーバーを狙うと攻撃は捕捉される(攻撃者の利得 − 4 -4 − 4 );監視されていない方を狙うと成功し、サーバーAなら 2 2 2 、サーバーB(より価値が高い)なら 6 6 6 を得る。これはゼロサムゲームであり、攻撃者の利得行列(行: A攻撃、B攻撃;列: A監視、B監視)は A = ( − 4 2 6 − 4 ) A = \begin{pmatrix} -4 & 2 \\ 6 & -4 \end{pmatrix} A = ( − 4 6 2 − 4 ) である。攻撃者の最適混合戦略とゲームの値を求めよ。
解答 まず純粋戦略の鞍点を確認する: 行の最小値は min ( − 4 , 2 ) = − 4 \min(-4,2)=-4 min ( − 4 , 2 ) = − 4 と min ( 6 , − 4 ) = − 4 \min(6,-4)=-4 min ( 6 , − 4 ) = − 4 で maximin = − 4 =-4 = − 4 ;列の最大値は max ( − 4 , 6 ) = 6 \max(-4,6)=6 max ( − 4 , 6 ) = 6 と max ( 2 , − 4 ) = 2 \max(2,-4)=2 max ( 2 , − 4 ) = 2 で minimax = 2 =2 = 2 。− 4 ≠ 2 -4 \ne 2 − 4 = 2 であるため純粋戦略の鞍点は存在せず、混合戦略が必要である。
攻撃者が確率 p p p でAを攻撃する(Bは確率 1 − p 1-p 1 − p )とする。防御者がAを監視した場合の期待利得は − 4 p + 6 ( 1 − p ) = 6 − 10 p -4p + 6(1-p) = 6 - 10p − 4 p + 6 ( 1 − p ) = 6 − 10 p ;Bを監視した場合は 2 p − 4 ( 1 − p ) = 6 p − 4 2p - 4(1-p) = 6p - 4 2 p − 4 ( 1 − p ) = 6 p − 4 である。最適な p p p はこれらを等しくしなければならない — さもなければ防御者は常に攻撃者にとって小さい方を選び、攻撃者は p p p を調整することでより良くできてしまう。
6 − 10 p = 6 p − 4 6 - 10p = 6p - 4 6 − 10 p = 6 p − 4 を解くと: 10 = 16 p 10 = 16p 10 = 16 p より p = 10 / 16 = 5 / 8 p = 10/16 = 5/8 p = 10/16 = 5/8 。攻撃者はサーバーAを確率 5 / 8 5/8 5/8 、サーバーBを確率 3 / 8 3/8 3/8 で攻撃すべきである。
ゲームの値は v = 6 − 10 ( 5 / 8 ) = 6 − 6.25 = − 0.25 v = 6 - 10(5/8) = 6 - 6.25 = -0.25 v = 6 − 10 ( 5/8 ) = 6 − 6.25 = − 0.25 である: 最適にプレーしても攻撃者の期待利得はわずかに負であり、防御者の監視戦略が全体としてわずかに有利であることを意味する。
例: 規格採用ゲームにおける複数の純粋ナッシュ均衡
2つのスマートフォンメーカーは、それぞれ充電規格AかBを選ばなければならない;ネットワーク効果と共有アクセサリのおかげで、両者が同じ規格を選んだときに利益が最大になる。利得(企業1、企業2)は: ( A , A ) = ( 8 , 8 ) (A,A){=}(8,8) ( A , A ) = ( 8 , 8 ) 、( A , B ) = ( 2 , 3 ) (A,B){=}(2,3) ( A , B ) = ( 2 , 3 ) 、( B , A ) = ( 3 , 2 ) (B,A){=}(3,2) ( B , A ) = ( 3 , 2 ) 、( B , B ) = ( 6 , 6 ) (B,B){=}(6,6) ( B , B ) = ( 6 , 6 ) である。すべての純粋戦略ナッシュ均衡を求めよ。
解答 4つのマスそれぞれについて、有利な一方的逸脱がないか確認する。( A , A ) (A,A) ( A , A ) では: 企業1がBに切り替える(企業2はAのまま)と 3 < 8 3 < 8 3 < 8 で得はない;対称性により企業2も得はない。よって ( A , A ) (A,A) ( A , A ) はナッシュ均衡である。
( B , B ) (B,B) ( B , B ) では: 企業1がAに切り替える(企業2はBのまま)と 2 < 6 2 < 6 2 < 6 で得はない;企業2も対称。よって ( B , B ) (B,B) ( B , B ) もナッシュ均衡である。
( A , B ) (A,B) ( A , B ) では: 企業1は 2 2 2 を得る;Bに切り替える(企業2はBのまま)と 6 > 2 6 > 2 6 > 2 で厳密に改善するため、企業1は逸脱する — ( A , B ) (A,B) ( A , B ) は均衡ではない。同じ論理で ( B , A ) (B,A) ( B , A ) も均衡ではない。
よってこのゲームには2つ の純粋ナッシュ均衡 ( A , A ) (A,A) ( A , A ) と ( B , B ) (B,B) ( B , B ) がある — どちらも各企業が単独で逸脱したくないという意味で安定しているが、理論だけではどちらに市場が落ち着くかは決まらない;この均衡選択 問題(歴史上のVHS対ベータマックスの規格争いに対応する)は存在証明を超えた真の微妙さである。
歴史的ノート
1928年、ジョン・フォン・ノイマンは論文Zur Theorie der Gesellschaftsspiele で2人ゼロサムゲームのミニマックス定理を証明した。「ゲーム理論」という名前がつく何年も前のことである。その後、彼は経済学者オスカー・モルゲンシュテルンとともに1944年の著書Theory of Games and Economic Behavior でこの分野の基礎を築いた。ゼロサムで純粋に対立的な争いを超えた理論の広がりはすぐ後に訪れた: 1950年から1951年にかけて、ジョン・ナッシュは任意の利害を持つ任意の人数のプレイヤーへと均衡分析を拡張し、この功績により1994年にジョン・ハーサニおよびラインハルト・ゼルテンとともにノーベル経済学賞を共同受賞した。
ジョン・フォン・ノイマン
研究の最前線 2026年時点
2026年現在 、一般にナッシュ均衡の計算は計算論的に困難であることが知られている: Daskalakis、Goldberg、Papadimitriou(2009年)は、標準形ゲームのナッシュ均衡を求める問題がPPAD完全 であることを証明した。これは多項式時間とNP困難性の間に厳密に位置すると考えられている複雑性クラスであり、問題をブラウワーの不動点定理そのものの離散化版へ帰着させることで示された。これにより研究は、効率的に計算できる 均衡概念であって、繰り返しプレーから自然に生じるものへと向かっている: 後悔なし学習動学 では、各プレイヤーが自分自身の実現利得のみを用いて多くのラウンドにわたり戦略を適応させ、2人ゼロサムゲームの値 へ、より一般には一般のゲームにおけるより広い均衡的な集合(粗相関均衡)へ収束することが知られている — これはゲーム理論をオンライン学習、マルチエージェント強化学習、そしてアルゴリズムが双方の役割を演じる市場やオークションの設計へと結びつける活発な研究領域である。
あるゼロサムゲームの(行プレイヤーの)利得行列は A = ( 4 1 2 3 ) A = \begin{pmatrix} 4 & 1 \\ 2 & 3 \end{pmatrix} A = ( 4 2 1 3 ) である。純粋戦略の鞍点は存在しない。このゲームの値はいくらか。
ナッシュ均衡 x ⋆ x^\star x ⋆ を正しく定義する条件はどれか。
すべてのプレイヤー i i i とすべての純粋戦略 s i s_i s i に対して u i ( x i ⋆ , x − i ⋆ ) ≥ u i ( s i , x − i ⋆ ) u_i(x_i^\star, x_{-i}^\star) \ge u_i(s_i, x_{-i}^\star) u i ( x i ⋆ , x − i ⋆ ) ≥ u i ( s i , x − i ⋆ ) u i ( x ⋆ ) u_i(x^\star) u i ( x ⋆ ) はすべての戦略プロファイルにわたってプレイヤー i i i が得られる可能性のある最大の利得であるx ⋆ x^\star x ⋆ ではすべてのプレイヤーが等しい利得を得るx ⋆ x^\star x ⋆ において、あるプレイヤーが一方的に戦略を変えることで利得を厳密に増やせる2人の容疑者はそれぞれ黙秘か自白かを選ぶ。両者黙秘: 各1年。両者自白: 各3年。一方が自白しもう一方が黙秘: 自白した者は釈放(0年)、黙秘した者は5年。相手が何をしようと自白は黙秘より厳密に良い結果を与える。このゲームのナッシュ均衡は何か。
両者自白 両者黙秘 一方は自白、一方は黙秘 ナッシュ均衡は存在しない
テニスのサーバーは左か右を狙える;レシーバーは左か右を予測する。サーバーは、レシーバーが方向を外したとき 80 % 80\% 80% の確率でポイントを取り、正しく予測されたときはわずか 50 % 50\% 50% である — 両方向で対称。混合戦略ナッシュ均衡において、サーバーは左を狙う確率をいくらにすべきか。
50 % 50\% 50% 80 % 80\% 80% 20 % 20\% 20% 100 % 100\% 100%