熵的鏈式法則(Chain Rule)

$H(X)=H(X1​)+H(X2​∣X1​)+H(X3​∣X1​,X2​)$

如果一個決策可以拆成連續幾個階段,總熵 = 每個階段的熵之和(後面的階段用「條件熵」,也就是在前面已知的情況下,那個階段還剩多少不確定性)。

對應到你的例子

第一步:中式 vs 西式,各佔一半機率 → $H_1 = -\left(\frac12\log_2\frac12+\frac12\log_2\frac12\right)=1$
bit
第二步:已經知道是中式(或西式)了,再從裡面 2 組選 1 組,一樣是對半分 → $H_2 = 1$ bit
第三步:已經知道是哪一組了,再從組裡 2 家選 1 家,還是對半分 → $H_3 = 1$ bit

總和 = 1+1+1 = 3 bits,跟直接算 $H = -\sum_{i=1}^{8}\frac18\log_2\frac18 = 3 bits$ 完全一致。

03575-mvd9drw0vzk.png


最大熵原則(Maximum Entropy Principle)

這是 E.T. Jaynes 在 1957 年提出的一個統計推斷原則,核心精神很簡單:

在你所擁有的資訊(限制條件)下,選擇熵最大的機率分布,作為對這個系統最誠實、最不偏頗的猜測。

熵管的是結果確定不確定,

  • 8個事件,概率平均為 1/8,熵值 3bit;不確定
  • 2個事件,一個概率高,一個概率低,熵值低;幾乎確定
    從分佈反推出背後真正的約束是什麽
  • 均匀:範圍
  • 指數:有均值,不能為負
  • 正態:均值+波動範圍
    讀懂市場的能力

為什麼這是「最大」不確定性

對於一個只有兩種可能結果的系統,熵函數 $H(p)=−plog⁡_{2}p−(1−p)log_{⁡2}(1−p)$ 是一個對稱的凹函數(concave function),在 p=0.5 處取得最大值

直覺理解:

  • 如果硬幣是灌鉛的,比如 p(H)=0.99,那麼你幾乎已經知道結果會是正面——驚訝程度低,資訊量小,熵趨近 0。
  • 只有當兩種結果完全等機率時,你對結果毫無預判能力,每次翻硬幣帶來的「新資訊」才是最大的。

用「1 bit」來衡量也很自然:1 bit 正好是「回答一個是/否問題」所需的最小資訊單位——公平硬幣的結果恰好就是一個純粹的、不含任何偏誤的二元問題。

無標籤

關注作者:

新增評論