熵的鏈式法則與最大熵原則:多階段決策的資訊熵拆解與最大熵推斷
熵的鏈式法則(Chain Rule)
$H(X)=H(X1)+H(X2∣X1)+H(X3∣X1,X2)$
如果一個決策可以拆成連續幾個階段,總熵 = 每個階段的熵之和(後面的階段用「條件熵」,也就是在前面已知的情況下,那個階段還剩多少不確定性)。
對應到你的例子
第一步:中式 vs 西式,各佔一半機率 → $H_1 = -\left(\frac12\log_2\frac12+\frac12\log_2\frac12\right)=1$
bit
第二步:已經知道是中式(或西式)了,再從裡面 2 組選 1 組,一樣是對半分 → $H_2 = 1$ bit
第三步:已經知道是哪一組了,再從組裡 2 家選 1 家,還是對半分 → $H_3 = 1$ bit
總和 = 1+1+1 = 3 bits,跟直接算 $H = -\sum_{i=1}^{8}\frac18\log_2\frac18 = 3 bits$ 完全一致。

最大熵原則(Maximum Entropy Principle)
這是 E.T. Jaynes 在 1957 年提出的一個統計推斷原則,核心精神很簡單:
在你所擁有的資訊(限制條件)下,選擇熵最大的機率分布,作為對這個系統最誠實、最不偏頗的猜測。
熵管的是結果確定不確定,
- 8個事件,概率平均為 1/8,熵值 3bit;不確定
- 2個事件,一個概率高,一個概率低,熵值低;幾乎確定
從分佈反推出背後真正的約束是什麽 - 均匀:範圍
- 指數:有均值,不能為負
- 正態:均值+波動範圍
讀懂市場的能力
為什麼這是「最大」不確定性
對於一個只有兩種可能結果的系統,熵函數 $H(p)=−plog_{2}p−(1−p)log_{2}(1−p)$ 是一個對稱的凹函數(concave function),在 p=0.5 處取得最大值。
直覺理解:
- 如果硬幣是灌鉛的,比如 p(H)=0.99,那麼你幾乎已經知道結果會是正面——驚訝程度低,資訊量小,熵趨近 0。
- 只有當兩種結果完全等機率時,你對結果毫無預判能力,每次翻硬幣帶來的「新資訊」才是最大的。
用「1 bit」來衡量也很自然:1 bit 正好是「回答一個是/否問題」所需的最小資訊單位——公平硬幣的結果恰好就是一個純粹的、不含任何偏誤的二元問題。