DC娱乐网

1948年,香农发表《通信的数学理论》,用"信息熵"第一次给"信息"下了精确定义

1948年,香农发表《通信的数学理论》,用"信息熵"第一次给"信息"下了精确定义:H = -Σp(x)log p(x)。一个看似抽象的公式,却把"不确定性"变成了可度量的量——比特(bit)由此诞生。

今天的大语言模型,本质上正是在做同一件事。Transformer的注意力机制,是在海量Token序列中寻找"最不意外"的关联;交叉熵损失函数,直接继承自香农熵的定义;而模型"涌现"出的理解能力,正是对训练数据中统计规律的压缩与重构。

从比特到Token,从信息熵到交叉熵,七十多年来数学没有变,变的是规模。香农证明信息可以编码传输,今天的AI证明信息可以被压缩为"理解"。这条路,从1948年一直走到了2024年,而且还在延伸。