### [从 y = mx + b 看懂人工智能:一场始于中学数学的奇妙之旅](https://www.thinkhow.tech/article/876) **Published:** 2026-07-26T15:03:47 **Author:** 段, 誉 **Excerpt:** 从初中数学的一次函数 y = mx + b 出发,一路推到神经元、神经网络、卷积网络和 Softmax——本文用 LaTeX 公式呈现了人工智能的完整数学骨架。无需高数,中学数学足矣。读完你会发现:AI 不是什么”会思考的灵魂”,而是一个擅长从数据中找规律的数学函数族。 ## 一、一张图揭开 AI 的家族史 ![](https://thinkhow.tech/wp-content/uploads/2026/07/%E5%9B%BE%E7%89%87%E6%B8%85%E6%99%B0%E5%BA%A6%E6%8F%90%E5%8D%87%E4%B8%8E%E6%A8%AA%E7%89%88%E8%BE%93%E5%87%BA.webp) 场景铺陈 → 概念界定 打开手机,短视频 App 总能猜中你的喜好;喊一声”小爱同学”,房间里的灯就亮起来;把照片上传到云端,系统能自动给远方的亲友贴上名字。这些场景背后,都站着同一个主角——\*\*人工智能(Artificial Intelligence, AI)\*\*。 现象对比 → 结构归纳 但翻看科技新闻,你会发现”人工智能””机器学习””深度学习”这几个词经常交替出现,让人分不清彼此。恰好有一张图(见题图),把这三者的关系画得很明白:它们是三个层层嵌套的同心圆——\*\*最外层是人工智能(AI),中间层是机器学习(ML),最内核是深度学习(DL)\*\*。换一种说法:AI 是一个大箩筐,机器学习是实现 AI 的一种主流方法,而深度学习则是机器学习中近年异军突起的一支精锐部队。在圆圈的旁边,还停着两颗”卫星”:\*\*机器视觉(CV)\*\*和\*\*自然语言处理(NLP)\*\*——一个让机器”看懂”图像,一个让机器”听懂”人话。 主线预告 → 主题升华 这看上去像一张”族谱”,但它真正的妙处在于:\*\*哪怕你只会中学数学,也能顺着这张图走完 AI 的全部核心\*\*。下面我们就一起,从最熟悉的 $y = mx + b$ 出发,一路推到深度神经网络。 ## 二、从一次函数到神经元 起点回顾 → 方法延伸 初中数学里,我们都学过最简单的一次函数: $$y = mx + b$$ 这是一条直线。给定一个输入 x,函数就会告诉你对应的输出 y。系数 m 决定斜率,b 决定截距——两个参数,把一根线的形状说得清清楚楚。 问题引入 → 多元推广 现实世界的问题当然远比一根直线复杂。买一套房子,价格不会只和面积有关,还得看楼层、房龄、是否学区……把这些因素都考虑进去,就变成了中学多元函数的样子: $$text{房价} = w\_1 times text{面积} + w\_2 times text{楼层} + w\_3 times text{房龄} + cdots + b$$ 你会发现,公式结构和一次函数一模一样——只不过输入从一个 x 变成了好几个,参数也从一个 m 变成了好几个 w。这正是机器学习的起点:\*\*找一组最合适的 w 和 b,让公式的预测值尽量接近真实情况\*\*。 概念深化 → 本质揭示 问题在于,房子价格与这些因素之间的关系,往往不是简单的直线所能表达的。比如楼层太高,可能”价格先涨后跌”。这时候,中学数学里还有一个工具——\*\*非线性函数\*\*。把上面的加权结果再送进一个非线性函数 f 中”加工一下”,就得到了\*\*神经元\*\*的数学表达: $$y = f(w\_1 x\_1 + w\_2 x\_2 + cdots + w\_n x\_n + b)$$ 这里的 f 就是所谓的”激活函数”,中学常见的 sigmoid、ReLU 函数,都能担任这个角色。它们的存在让模型能够刻画”先涨后跌”这样的弯曲关系,而不是一根筋的直线。一个神经元就是这样诞生的:本质上,它就是中学函数的一次”升级”。 ## 三、神经网络的”深度”奥秘 结构递进 → 公式堆叠 一个神经元能力有限,但成百上千个神经元排成多层、彼此连接,就是\*\*神经网络\*\*。把这种堆叠写得数学化一些: $$Y = f\_3left( f\_2left( f\_1(w\_1 x\_1 + w\_2 x\_2 + w\_3 x\_3 + b) + cdots right) cdots right)$$ 看起来吓人,但拆开看,每一层无非都是”加权求和 → 激活函数”两步的反复,\*\*和中学复合函数 $f(g(x))$ 完全一致\*\*。层数越多,模型能刻画的规律就越复杂——这就是”深度学习”中”深度”的由来。 方法延伸 → 数学对应 那么,神经网络是怎么”学会”调整那些参数 w 和 b 的呢?这要借助中学数学里另一个熟悉的概念——\*\*最值\*\*。 回想求二次函数 $y = ax^2 + bx + c$ 顶点的过程:要让误差(损失)最小,就要找到让平方差 $(y\_{text{真实}} – y\_{text{预测}})^2$ 取得极小值的那组参数。机器学习中,这个衡量”预测值”与”真实值”差距的函数就叫\*\*损失函数(Loss)\*\*;寻找最优参数的过程就叫\*\*优化\*\*。最常用的优化算法是\*\*梯度下降\*\*——你可以把它理解为”沿着斜率最陡的方向下山”,一步一步逼近谷底。这种步步逼近的几何直觉,与中学数学里用导数判断函数增减方向,本质上是一回事。 收束一句 → 训练完成 参数调好之后,神经网络就有了一身”知识”——它能在新数据上做出又快又准的预测。 ## 四、让计算机”看”懂世界 角色引入 → 工具介绍 学会了理论,我们再看图片中那颗”卫星”——机器视觉,是如何把数学公式变成日常所用的能力。\*\*机器视觉(CV)\*\*的核心武器是\*\*卷积神经网络(CNN)\*\*。一张图片在计算机眼里,其实就是一个巨大的数字矩阵(每个像素对应一个 0~255 的灰度值)。 过程拆解 → 类比阐释 CNN 的第一步叫做”卷积”:让一个 3×3 或 5×5 的小矩阵(卷积核)在图片上滑动,把每个小窗口内的数字加权求和,提取出”边缘””角点”这样的低级特征。这个过程,可以把它想象成一个拿着望远镜的观测员——视野虽小,但每到一处,就把看到的有用信息记录在案。 若干个负责不同任务的”观测员”(不同卷积核)协同工作:有的专找横线,有的专找曲线,有的专找某种颜色。然后是”\*\*汇聚\*\*”(池化):把 16×16 的一小块图片信息压缩成 8×8,取最大值或平均值,留下最重要的特征,同时大幅减少计算量。这样一层一层堆叠下去,最终网络就能从”边缘”组合成”轮廓”,从”轮廓”组合成”眼睛”,从”眼睛”组合成”人脸”——最后输出”这是张三,置信度 99%”。 总结应用 → 功能印证 这就是为什么手机能刷脸支付、安检能瞬间识人、医疗影像能辅助筛查病灶——都是中学函数的层层叠加在做功。 ## 五、让计算机”读”懂人话 问题提出 → 转化思路 另一颗”卫星”是\*\*自然语言处理(NLP)\*\*。文字不像图像天然就是数字,那怎么让数学公式理解”今天天气真好”这句话的含义?答案是把每个词也变成一个数字向量,然后训练网络去预测”下一个词最有可能是什么”。 公式对应 → 中学关联 中学概率里我们学过条件概率 P(A|B):已知今天多云,预测明天下雨的可能性。这里有一个非常相似的函数——\*\*Softmax\*\*,它能根据模型给出的原始分数,算出每个候选词出现的概率: $$P(text{词}=c) = frac{e^{z\_c}}{sum\_{k=1}^{K} e^{z\_k}}$$ 你看,分子是中学里指数函数 e 的一个取值,分母是所有候选词指数值的总和。模型只要找到让历史语料概率最大的参数组合,就能”言之成理”。 成果呼应 → 应用展望 这就是 ChatGPT、文心一言这些对话系统背后的统计魔法——再复杂的语言,也都能化作 e 的指数与除法。 ## 六、从数学公式到“智能”时代 本质澄清 → 全文归纳 走完这一程,你会发现:\*\*AI 从来不是什么”会思考的灵魂”,而是一个异常擅长从数据中找规律的数学函数族\*\*。它的骨骼是中学函数,它的肌肉是梯度下降,它的大脑是层层堆叠的神经元。 意义升华 → 号召收束 理解这一点,并不只是为了”懂”。当 AI 走入各行各业、走入国家的法律与战略(如欧盟已正式出台人工智能法案),每个人其实都需要这种最朴素的数学直觉,去分辨新闻里哪些是真突破、哪些是营销话术、哪些是潜在风险。\*\*学会用 $y = mx + b$ 的眼光看 AI,是我们这个时代最划算的”投资”\*\*——因为它不收一分钱的门槛费,却能让我们在信息洪流里站得更稳。 **Tags:** 交互, 知识, 高级 **Categories:** 学科, 数学 ---