这是一个非常有意思的问题。我做了十几年算法,从最早的搜索推荐到现在的生成式大模型,在这行摸爬滚打久了,你越往底层钻,越会发现一个让人毛骨悚然的事实: 这个世界的底层代码是复用的。
很多时候,我们觉得自己在搞创新,其实不过是在用几十年前甚至几百年前物理学家、生物学家用剩下的公式,换了个变量名而已。
咱们不整那些虚头巴脑的科普,我直接从我这些年做项目、带团队的实际视角,给你们扒一扒那些看似八竿子打不着,实则共用一套数学内核的东西。这一篇很长,也没什么废话,建议先收藏,慢慢看。
第一块: 扩散方程 ,从铁棒传热到华尔街赌徒再到AI画图
这几年Stable Diffusion、Midjourney火得一塌糊涂。很多入行的小朋友问我,这扩散模型到底是个啥原理?我跟他们说,你回去翻翻大二学的物理热学,或者去问问搞金融工程的,他们熟。
这里面藏着一个极其狂野的数学联系: 热传导、期权定价、图像生成,本质上是同一回事。
早在19世纪,傅里叶这帮人就在研究一个问题:我拿一根铁棒,在一头加热,这热量是怎么顺着铁棒传导过去的?最后他们搞出了热传导方程。简单说,就是描述能量如何随时间在空间中扩散、平滑化的过程。系统的熵在增加,有序变成无序。
这事儿本来属于物理系。但是到了1973年,Black和Scholes这两个天才想搞定股票期权的定价问题。他们发现,股票价格的波动充满了随机性,跟花粉在水里的布朗运动一模一样。如果不考虑手续费和利息,股票价格的概率分布随时间的演化,竟然完美符合热传导方程。
你们能想象吗?描述热量在金属中流动的公式,竟然精准地预测了贪婪的人类在华尔街的赌博行为。这就是大名鼎鼎的Black-Scholes方程。那个年代搞金融的赚得盆满钵满,其实就是把物理系的作业抄了一遍。
时间拨到2020年代。现在的AI绘画是怎么回事?扩散模型(Diffusion Model)的核心逻辑是:我先拿一张清晰的照片,一步步往上加高斯噪声(就像滴墨水进水里,或者热量扩散),直到这张图变成纯粹的雪花点噪声。这个过程,就是正向的扩散过程,数学上依然遵循随机微分方程那一套逻辑。
既然只要有方程,我能不能求逆解?如果我能训练一个神经网络,学会把这个扩散过程倒过来,从一堆毫无意义的噪声里,一步步减去噪声,恢复出清晰的图像,这不就是生成吗?
所以,你在电脑上跑Stable Diffusion生成一个二次元妹子的时候,显卡里疯狂运算的数学逻辑,和1822年傅里叶研究热量怎么穿过铁板,以及1973年华尔街交易员计算看涨期权价格,用的是同一套底层数学架构。
第二块: 特征值分解 ,从量子力学到谷歌霸权再到你的脸
我在面试算法工程师的时候,最喜欢问线性代数。很多候选人把公式背得滚瓜烂熟,但我问他:矩阵的特征值和特征向量到底是个什么物理意义?十个人有九个支支吾吾。
如果不懂这个,你根本没法理解为什么原子弹能炸,也没法理解谷歌怎么挣到的第一桶金。
看似毫不相干的三个东西: 量子力学的能级、Google的PageRank算法、人脸识别( Eigenface ),它们共享同一个数学灵魂——特征值分解。
咱们先说量子力学。薛定谔方程本质上就是一个算子作用在波函数上。物理学家不仅要解方程,更重要的是找到那个“不变量”。在量子力学里,算符对应的特征值,往往就是我们能观测到的物理量,比如能量。原子在那儿并不是乱跑,它有固定的能级,这些能级就是哈密顿算符的特征值。
好,把视角切到互联网。1998年,Larry Page和Sergey Brin在想怎么给网页排序。当时的搜索引擎很烂,谁关键词多谁排前面。他们想了一个绝妙的主意:一个网页重要不重要,得看有多少重要的网页链接指向它。这听起来是个死循环,A重要因为B指着它,B重要因为C指着它。
但如果你把整个互联网看作一个巨大的矩阵,每个网页是一个节点,链接是边。那么求解这个网页重要性排名的过程,本质上就是求这个巨大转移矩阵的最大特征值对应的特征向量。那个特征向量里的每一个分量,就是每个网页的权重(Rank)。谷歌靠着算这个万亿级矩阵的特征向量,干翻了雅虎,建立了商业帝国。
再看人脸识别。早期的做法人脸识别不是靠现在的卷积神经网络,而是用一种叫“特征脸”(Eigenface)的技术。也就是把人脸图像压扁成向量,堆成一个大矩阵,算它的协方差矩阵,然后求特征向量。这些特征向量就是“主成分”,它们构成了人脸的“基底”。任何一张脸,都可以表示成这几张标准“鬼脸”的加权和。
你说神不神奇?微观粒子的跳动、万维网的流量分配、你手机解锁时扫的那一下脸,数学上都是在找那个矩阵的“主轴”。
这里推荐大家去看Gilbert Strang教授的线性代数公开课,MIT出的。
别看国内教材,国内教材上来就是算行列式,把人算傻了。
Strang教授会告诉你矩阵的几何直观,那才是线性代数的灵魂。
视频地址: 【官方双语/合集】线性代数的本质 - 系列合集 。
关于3Blue1Brown的补充:视频终归只是一种呈现方式,真正深入消化理解,还得依靠笔记和文字。 市面上已经出现不少针对3Blue1Brown系列的笔记整理,目的是帮助大家系统复盘内容、补充细节,也方便查找、回顾与复习。 值得一提的是,有一批笔记,不只单纯翻译,还针对视频中略过的部分补充了更多细致的推导和背景知识。下面,我结合个人体验和观察,给大家介绍一份我认为值得参考的中英文笔记。(注:3Blue1Brown的讲解固然精彩,但它并非万能。它的核心价值在于建立几何直觉,而非替代传统学习中的计算训练和证明逻辑,可以配合《线性代数的几何意义》,有奇效!! 注意是西安电子科技那本,这本书籍我也放在下面这个链接里面了)
3Blue1Brown线性代数笔记:可能是全网最好的中英文整理
第三块:最短路径与最小作用量,光线、救生员与神经网络的训练
这里有一个极具哲学意味的数学原理,叫 变分法 ,或者更通俗点说,是极值原理。
这里涉及的事物有: 光的折射、救生员救人、以及神经网络的 梯度下降 。
大家初中物理都学过光的折射定律(斯涅尔定律),光从空气进水里会偏折。老师告诉你是n1 sin(theta1) = n2 sin(theta2)。但为什么?为什么光要这么走?
费马(Fermat)给出了一个解释:光遵循“最少时间原理”。光不傻,它知道在水里跑得慢,在空气里跑得快。为了从A点到B点用时最短,它会在空气里多跑一段,在水里少跑一段。如果你算一下从A到B的时间函数,对路径求导让它等于0,你推导出来的就是折射定律。
这跟救生员有什么关系?这就涉及到一个经典 案例。一个救生员在沙滩上,看到海里有人溺水。救生员跑得快,游得慢。他应该走直线冲过去吗?不,他应该在沙滩上斜着多跑一段,缩短在水里的路程,这样到达溺水者的时间最短。救生员的本能选择的路线,和光线的折射路径,数学上是一模一样的。
那这跟我的老本行AI有什么关系?太大了。
现在的深度学习,训练过程本质上就是在找一个高维曲面上的最低点。我们定义的那个“损失函数”(Loss Function),就是那个“时间”或者“能量”。神经网络参数的每一次更新(梯度下降),就像是光线在寻找那条阻力最小、代价最小的路径。
虽然光线是在空间中找路径,我们在训练模型时是在几亿维的参数空间里找最优解,但背后的数学思想—— 通过变分求极值,也就是让一阶导数为零 ——是完全一致的。物理学家叫它“最小作用量原理”,拉格朗日和哈密顿为此建立了宏大的力学体系;我们搞算法的叫它“优化理论”。
甚至连大自然的进化也是这个逻辑。树叶的脉络怎么长才能输送效率最高?肥皂泡为什么是圆的(表面张力势能最小)?全都是在解同一个极值问题。
如果你想补一下这方面的数学直觉,推荐看看《普林斯顿微积分读本》。别被名字吓到,这不是那种枯燥的课本,它非常强调直观理解。
微积分初学者必读---《普林斯顿微积分读本》《托马斯微积分》.pdf
对于优化理论感兴趣的,Boyd的《Convex Optimization》是圣经,虽然厚,但哪怕读懂前三章,你在算法岗面试里都能横着走。
这一块是我觉得最深刻的。
热力学(蒸汽机效率)、信息论(数据压缩)、机器学习(分类算法)。
19世纪,玻尔兹曼他们在研究气体的时候,为了解释为什么热量总是从高温流向低温,提出了“熵”的概念。公式是S = k * log(W)。这个W代表微观状态数。简单说,系统越混乱,微观状态越多,熵就越大。宇宙的命运就是熵增,最后热寂。
几十年后,香农在贝尔实验室琢磨怎么让电话线传输更多信息。他需要量化“信息”到底是多少。他推导出了一个公式,H = -Σ p(i) log p(i)。
当香农把这个公式拿给冯·诺依曼看的时候,冯·诺依曼那是相当鸡贼,他告诉香农:你就叫它“熵”吧。第一,它数学形式上跟热力学的熵几乎一样;第二,没人真正懂熵到底是什么,所以你在辩论中永远占上风。
事实证明,这不仅仅是巧合。信息本质上就是消除不确定性。一个系统越混乱(热力学熵大),包含的未知信息就越多(信息熵大)。
在机器学习里,我们最常用的损失函数叫“交叉熵”(Cross Entropy)。比如我训练一个模型识别猫和狗。模型预测的概率分布,和真实的标签分布之间,差多少?我们就用交叉熵来算。
我们在优化模型,其实就是在最小化这个系统的信息熵,让模型对世界的认知从“混乱”变得“有序”。
你写代码用的压缩软件(Zip),原理是哈夫曼编码或者算术编码,核心逻辑是把出现概率高的字符用短编码,概率低的用长编码,这其实就是在逼近香农熵的极限。
所以,驱动蒸汽机运转的热力学定律,和驱动互联网数据传输的信息论,以及驱动AI学习的损失函数,在数学底层是打通的。它们都在处理“有序”与“无序”的对抗。
第五块: 傅里叶变换 ,音乐、X光与数论
如果说上帝创造宇宙有乐谱,那一定是傅里叶变换。
看似不相干的事物: MP3音乐播放、医院的CT扫描、甚至是大整数乘法加速。
傅里叶变换的核心思想极其暴力又优美:任何周期函数,都可以看作是一堆不同频率的正弦波叠加出来的。
你听到的音乐,是一段随时间变化的声波。但是为了存储它,MP3算法把它切碎,通过傅里叶变换转到“频域”。它发现,哎,这里面有很多频率是人耳听不见的,或者被大声音掩盖的,直接扔掉!剩下的数据再存起来。这就实现了压缩。
再去医院看CT。CT机围着你转一圈,接收的是X光穿过人体后的衰减强度。但这只是一堆投影数据,医生怎么看到你身体内部的横切面?这里用的是Radon变换,而Radon变换的逆变换核心就是傅里叶切片定理。简单说,CT机就是在频域里把你“重组”了出来。
甚至在纯数学和计算机基础算法里,你要算两个几万位的超大整数相乘,直接乘太慢了(O(N^2))。聪明人把大整数看成多项式系数,应用快速傅里叶变换(FFT),在频域里做乘法,然后再变回来,复杂度瞬间降到O(N log N)。
没有傅里叶变换,就没有现代通讯,没有多媒体,甚至连现在的芯片设计都搞不定。
第六块:控制理论,抽水马桶、巡航导弹与 Adam优化器
这也是一个极其实用但容易被忽视的领域。
抽水马桶的水箱、汽车的定速巡航、生物体温调节、神经网络的Adam优化器。
这几个东西看起来风马牛不相及,但它们都在解决同一个问题: 负反馈控制。
你想想马桶水箱,水位低了,浮球下降,阀门打开充水;水位高了,浮球上升,阀门关闭。这是一个最原始的P控制(比例控制)。
汽车定速巡航要复杂点。如果只看速度差(P),上坡时速度掉得快,油门猛踩,到了坡顶又会冲过头。所以需要引入积分项(I)来消除稳态误差,引入微分项(D)来预判趋势。这就是经典的 PID控制 。
你的身体也是一样。体温高了出汗,低了发抖,这是一套精密调节的内稳态系统,数学本质依然是反馈控制。
到了人工智能领域。训练神经网络时,最火的优化器叫Adam。它本质上在干嘛?它不仅仅是看当前的梯度(P),它还记住了过去梯度的平均值(类似I),以及梯度的方差(类似对波动率的适应)。它在根据地形自动调节“学习率”这个油门的大小。
所以,当你在这个行业待久了,你会有一种虚无感,也会有一种敬畏感。
虚无是因为,你发现所谓的“高科技”,拆解到最后,往往是几百年前数学家在草稿纸上画出来的那些符号。高斯、欧拉、傅里叶、拉格朗日,这些老家伙仿佛坐在云端,看着我们拿着显卡和电缆,笨拙地重新演绎他们的思想。
敬畏是因为,这些数学原理具有普适性。不管载体是电子、光子、生物细胞还是金融货币,只要逻辑结构一致,数学表现就一致。
我经常跟团队里的新人说,别光盯着那些新出的框架、库看。PyTorch每年都在变,但线性代数五十年没变过,概率论一百年没变过。
你要是想真正在这个行业这就走得远,甚至具备跨学科解决问题的能力,就得去啃这些硬骨头。
作为一名在数学之路上探索踩坑了很久的人,深知优质教材对于数学学习非常重要。因此,精心搜集了76本国外经典数学教材,涵盖代数、几何、分析、概率等多个数学分支,希望能帮助热爱数学的同学们构建更完善的知识体系。
76本国外经典教材,全方位覆盖代数、几何、分析、概率等核心领域(附PDF下载)
此外,见证国内数学学科发展的“活化石”,科学出版社的《现代数学基础丛书》自1981年诞生以来,已持续更新至204卷,堪称中国数学界的“四库全书”,也一并整理好了。
5000字硬核盘点!《现代数学基础丛书》204卷必读清单(附PDF及领域分类),建议收藏备用 !
数学不是枯燥的数字游戏,它是上帝写给这个世界的源代码。当你能透过现象看到底下的公式时,那种通透感,比任何爽文都过瘾。
行了,就扯这么多。如果觉得有点意思,给个赞,咱们评论区见。
送礼物
数学爱好者栖息地