1665 年,剑桥大学因疫情停课,二十出头的艾萨克·牛顿回到林肯郡伍尔索普的农庄。没有老师,没有同学,他在一年多里独自想清楚了三件事:光的颜色从何而来、天体为何这样运动,以及一种计算“变化”的新方法。他从运动出发,把一切量都想象成随时间流动的东西,称这种方法为“流数术”。
0Prologue · A speedometer and two young minds
速度表上的 72,与两个年轻人
“一瞬间有多快”这个问题,为什么值得发明一门新数学?
0.1速度表上的 72
你坐在车里,看一眼仪表盘,速度表的指针稳稳地指着 72 公里/小时。你每天都看它,从没怀疑过。
现在,我们只追问一个词:它显示的是此刻的速度。
速度是怎么算的?
路程除以时间。一小时走 72 公里,就是时速 72 公里。
那“此刻”这一瞬间,车走了多远?
一瞬间……没有时间流逝,也就没走任何距离。0 米。
用了多少时间?
0 秒。
那么速度 = 0 米 ÷ 0 秒 = ?
0 ÷ 0。这不是一个数,小学老师说过,除数不能是 0。
可指针明明指着 72,你也确实在以这个速度前进。一瞬间的速度,到底存不存在?它又该怎么算?
这不是抬杠。两千四百年前,古希腊的芝诺就提出过同样的难题:一支飞行的箭,在每一个瞬间都占据一个确定的位置,在那一瞬间它是静止的;既然每一瞬间都静止,箭怎么会飞起来?
这个问题困住了人类将近两千年。解开它的,是两个年轻人。
0.2两个年轻人,同一个答案
1672 年,二十六岁的戈特弗里德·莱布尼茨以外交官身份来到巴黎。他学的是法律和哲学,数学几乎是门外汉。荷兰物理学家惠更斯给他出了几道题,成了他的老师。仅仅三年后,1675 年 10 月 29 日,他在手稿里写下了一个拉长的 S——∫(中文读“积分号”,英文读 integral /ˈɪntɪɡrəl/),意思是“总和”;几周后又写下了表示“差”的 d(就读字母 d,英文 /diː/)。他从数列的求和与求差出发,走到了和牛顿同一个地方。
图 0-1一个在英格兰乡间,从运动出发;一个在巴黎,从数列出发。两人互不相识,走了两条完全不同的路,却抵达了同一个答案:变化率与总量是一对互逆的运算。
先下个注:今天全世界的微积分课本,用的是谁的符号?是先想到的牛顿,还是三年前才开始学数学的莱布尼茨?
是莱布尼茨的。今天任何一本教科书里的 dy/dx(读作“d y 比 d x”,英文 dee-y dee-x /diː waɪ diː ɛks/)和积分号 ∫,都出自他的手稿。牛顿的记号(在字母头上加一点表示变化率)只在物理学里表示“对时间求导”时还留着一席之地。
原因不在于谁更聪明,而在于莱布尼茨把大量心思花在“让符号替人思考”上:他的记号写起来顺手,推导时甚至能像分数一样约分。一个好的符号,能让后来的千千万万人更轻松地思考。第 2 章会讲这段历史的全貌,包括两人后来那场著名的“谁先发明”之争。
一个从农庄的独处里走出来,一个从数学门外汉起步;一个重视运动的直觉,一个重视符号的力量。他们都回答了芝诺的难题,让“一瞬间的速度”变得既有意义、又能计算。这就是微积分的一半。
另一半,藏在你车上另一块仪表——里程表里。第 1 章会把这两半摆在一起。
微积分是
- 一种处理“不断变化的量”的思考方法
- 回答两个问题:此刻变得多快?一共变了多少?
- 天气预报、药物剂量、火箭轨道的共同语言
微积分不是
- 一堆需要死记的公式和符号
- 只有数学家才用得上的屠龙之术
- 必须先懂很多高深数学才能入门的东西(你只需要会四则运算、见过坐标系)
莱布尼茨的故事还说明了一件事:从零开始学微积分,并不需要天赋异禀。他用三年从门外汉走到了前沿;你只需要按顺序搭好几块积木,就能看懂他当年写下的那两个符号。
0.3这本书怎么走
很多人害怕微积分,并不是因为它难,而是因为课本从定义开始,从不先说“为什么”。本书反过来:先讲为什么,再讲怎么做,最后讲它是什么、能做什么。这是黄金圈的顺序。
图 0-2本书地图。底部是 Why:它解决什么问题、从哪里来;中间是 How:从函数到多元微积分,每章只放一块积木,上一块托住下一块;顶部是 What:它在真实世界做了什么,以及它怎样改变你的思考方式。
整本书只围绕三个动作、三句话展开。现在你不必懂,读完时你会发现自己能把它们推导出来:
切成碎片,再加起来。
变化率与总量,是同一件事的两面。
阅读时,你会反复遇到几种小标记:
- 问 / 答:苏格拉底式的对话。试着先自己回答“问”,再看“答”。
- 停一下:一个值得思考片刻的问题,答案折叠着。先想,再展开。
- 类比:用生活里的东西给新概念一个轮廓;紧跟着的“是 / 不是”会告诉你类比在哪里失效。
- 符号卡:每个希腊字母或数学符号第一次出现时,都会有一张紫色边框的小卡片,告诉你它怎么读(附音标)、从哪里来、为什么选它。尾章还附有全书符号读音表。本书的读音按国内课堂通行的英文读法给出,并附中文近似读音。
- 伏笔:第 1 章会在你的日常生活里埋下六个问题——天气预报、地下勘测、存款利息、吃药、仓库进货、火箭发射。它们会在学到对应工具的章节里被部分回收,在第 13 章全部揭晓。
本章带走
“一瞬间有多快”看似是 0 ÷ 0,却真实存在;为了算出它,人类发明了微积分。
- 速度表上的 72 隐含一个悖论:一瞬间走 0 米、用 0 秒,0 ÷ 0 没有意义。
- 牛顿从运动出发,莱布尼茨从数列出发,两人各自找到了答案。
- 今天全世界使用莱布尼茨的符号:好的符号让更多人能够思考。
于是,下一个问题他们发明的这门学问,到底解决了什么问题?
1Chapter 1 · Two old questions
两个古老的问题
微积分到底在解决什么问题?
上一章留下的问题:他们发明的这门学问,到底解决了什么问题?
课本通常这样开头:“设函数 f(x) 在点 x₀ 的某邻域内有定义……”读到这里,大多数人已经合上了书。
本章换一种开法:先不碰任何公式,而是跟你过一天普通的日子。你会发现,微积分要解决的问题,你每天都在遇到,只是从来没有人告诉你它们叫这个名字。
1.1你的一天里藏着微积分
下面六个场景,每一个都藏着一个你也许从没认真想过的问题。现在只提问,不作答。请把它们记在心里——它们是本书埋下的六个伏笔,会在后面的章节里一个一个被揭开。
07:30 出门前看天气
手机上写着:“下午 3 点降水概率 70%,气温 26°C。”
明天的天空还没有发生,计算机凭什么把它算出来?
第 10 章回收一半 · 第 13 章揭晓
08:10 地铁穿过城市地下
隧道要避开流沙和溶洞,高楼的桩基要打到坚硬的岩层上,石油公司要在几千米深处找到油层。可是没有人能钻进地下看一眼。
看不见地下,怎样知道几公里深处是什么?
第 9、10 章回收一半 · 第 13 章揭晓
12:00 午休时看一眼银行 App
理财产品写着“年化 3%,按日计息”。你想:按月计息比按年多一点,按日又比按月多一点。
如果把计息拆得无限细——每小时、每秒、每一瞬间——钱会不会变得无限多?
第 10 章回收 · 第 13 章揭晓
13:00 饭后吃药
药盒上写着“一日三次,每次一片”。
为什么是分三次,而不是早上一次吃三片?天天吃,药会不会在身体里越积越多?
第 10、11 章回收一半 · 第 13 章揭晓
18:30 外卖与快递
你点的东西半小时就到了,因为附近的仓库早就备好了货。仓库经理每周都在纠结:一次进货太多,压钱、占地方;进得太少,就要频繁补货,每次补货都有运费和人工。
一次进多少货最划算?这个“最划算”的点在哪里?
第 6 章回收 · 第 13 章揭晓
21:00 新闻里的火箭发射
火箭升空,一边加速,一边把燃料烧掉喷出去,自己越来越轻。
一枚火箭装多少燃料,最后才能跑到足够快、进入太空?
第 9 章回收一半 · 第 13 章揭晓
六个场景横跨气象、地质、金融、医药、物流和航天,看起来毫不相干。本章结束时你会看到:它们问的其实只有两类问题。而这两类问题,就藏在你汽车的仪表盘上。
1.2仪表盘上的两个问题
汽车仪表盘上有两块最重要的表。
图 1-1速度表回答“此刻多快”,里程表回答“一共多远”。前者是变化率问题,后者是累积问题。微积分的两半,分别对应这两块表。
第一块,速度表,回答的是“此刻有多快”。它关心的是一个量变化的快慢,我们叫它变化率。
第二块,里程表,回答的是“到现在一共走了多远”。它关心的是一个量一点一点攒起来的总和,我们叫它累积。
这两个问题听起来很简单。它们难在哪里?
如果你以每小时 60 公里的速度,一直匀速开 2 小时,走了多远?
60 × 2 = 120 公里。小学算术。
反过来,2 小时走了 120 公里,速度是多少?
120 ÷ 2 = 60。也是小学算术。
现在真实一点:你在城里开车,红灯停、绿灯走、上高架加速、下匝道减速,速度每一秒都在变。开了 2 小时,你能用乘法算出走了多远吗?
不能。“速度 × 时间”里的速度,该取哪个值?每一刻都不一样。
那速度表怎么知道“此刻”是多快?用路程除以时间吗?
这就回到序章的速度表了:一瞬间走 0 米、用 0 秒,0 ÷ 0 没有意义。
1.3第一性原理:麻烦只来自“不均匀”
我们用第一性原理,把问题拆到最朴素的地方:麻烦到底来自哪里?
不是来自数字太大,也不是来自公式太复杂。麻烦只来自一件事:变化不均匀。
- 速度不变时,“路程 = 速度 × 时间”,一步到位。
- 水龙头流量不变时,“水量 = 流量 × 时间”,一步到位。
- 利率不变、只算一次时,“利息 = 本金 × 利率”,一步到位。
只要世界是均匀的,乘法和除法就够了。可是真实世界几乎从不均匀:车速在变,气温在变,血液里的药物浓度在变,火箭的质量在变。
于是,微积分的全部策略可以浓缩成一句话:既然整体不均匀,那就把它切到足够小,小到每一小块里几乎是均匀的;在每一小块里用小学算术,再把结果拼起来。
“切小”有两种用法,正好对应两块表。
1.4第一个动作:放大
先看速度表的问题:此刻有多快。
把汽车的“位置随时间变化”画成一条曲线。车速在变,所以这条线是弯的。弯线没有统一的“坡度”,所以说不出一个统一的速度。
但如果我们拿一台显微镜,对准曲线上的某一点,不断放大,会发生什么?
图 1-2同一条曲线,原图里弯得厉害;放大 4 倍还看得出弯;放大 32 倍,它和那条红色虚线(切线)已经分不开了。光滑的曲线,放大到足够细,局部就是一条直线。
放得越大,曲线越直。放到足够大时,它在那一小段上就是一条直线。而直线的坡度,一除就有。
这就是导数的思想:一瞬间的变化率,就是把曲线放大到变成直线之后,那条直线的坡度。本书把这条放大后的直线叫作切线。
地球是圆的,但你家门口那条路看起来是平的。原因不是地球不圆,而是你站得太近——你看到的只是巨大球面上极小的一块,而足够小的一块弯曲表面,几乎就是平面。几千年来,人们在“平地”上盖房子、修路、测量土地,靠的就是这一点。
这个类比说明了
- 弯曲的东西,局部可以当成平直的来处理
- 看得越局部,“当成直的”误差越小
这个类比没说明
- 放大到底要放多大才算“足够”——这要等第 4 章的“极限”来回答
- 有尖角的曲线(比如 V 字形的尖)无论放多大都不会变直,那里没有切线
1.5第二个动作:切碎,再加起来
再看里程表的问题:一共走了多远。
速度一直在变,没法用一个乘法算完。但我们可以把 2 小时切成很多小段,比如每段 1 秒。在 1 秒之内,车速几乎不变,于是这 1 秒走的路 ≈ 这 1 秒的速度 × 1 秒。把 7200 个小段的结果加起来,就是总路程。
画在图上,这件事有一个清楚的样子:把速度画成曲线,总路程就是曲线下面那块面积。切碎,就是把这块面积切成细长条。
图 1-3曲线下的面积切成 6 条时,长方形的顶和曲线差得明显;切成 30 条,锯齿几乎贴住了曲线。每一条都被当作“高度不变”的长方形,这正是把不均匀切成局部均匀。
切得越细,每一条越接近“高度不变”,拼起来的总和就越接近真实答案。这就是积分的思想:一个不均匀变化的总量,就是把它切成无数小块,每块用乘法,再全部加起来。
电表就是这样算电费的。你家的用电功率一直在变:开空调时高,半夜时低。电表并不需要知道“平均功率”,它只是在每个很短的时间里记下“此刻功率 × 这一小段时间”,然后一直往上加。月底你看到的“度数”,就是一整个月切碎再加起来的结果。
“放大”和“切碎”,本质上是不是同一招?它们的区别在哪里?
底层是同一招:把不均匀的东西切到足够小,让每一小块近似均匀。区别在于切完之后做什么。
“放大”只盯着一小块,问它的坡度是多少,得到的是某一刻的变化率。
“切碎再加起来”要用上所有小块,把它们的贡献全部加总,得到的是一段时间里的累积。
1.6两块表之间的秘密
到这里,微积分似乎是两门独立的手艺:一门叫“微分”,负责放大看变化率;一门叫“积分”,负责切碎求总和。古希腊人和中国古代数学家其实早就会一些“切碎求面积”的技巧,而“求切线”的技巧在 17 世纪上半叶也已零星出现。
那么,牛顿和莱布尼茨到底发明了什么,值得争得你死我活?
看着仪表盘想一想:速度表的读数和里程表的读数之间,有没有关系?
有,而且非常紧密:里程表的数字跳得多快,就是速度表指的数。速度表指 72,意味着里程表正以每小时 72 公里的速度往上跳。
反过来,如果你从头到尾记录下速度表的每一刻读数,就能推出里程表最后会停在哪里。
换句话说,变化率和累积不是两件事,而是同一件事的两面。牛顿和莱布尼茨各自看清了这一点,并把它变成一套人人可用的算法。这就是第 8 章的主角——微积分基本定理。
1.7回看六个伏笔
有了这两块表,我们回头给早上的六个问题归个类。
| 伏笔 | 场景 | 核心问题 | 类型 | 回收章节 |
|---|---|---|---|---|
| A | 天气预报 | 已知空气每一刻怎样变化,推出明天的天空 | 变化率 → 累积 | 第 10、13 章 |
| B | 地下勘测 | 从地面上测到的信号,反推地下的结构与年代 | 两者兼有 | 第 9、10、13 章 |
| C | 存款利息 | 利息拆得无限细,钱会累积到多少 | 累积 | 第 10、13 章 |
| D | 一日三次吃药 | 药物每一刻被代谢多少,体内一共剩多少 | 两者兼有 | 第 10、11、13 章 |
| E | 仓库进货 | 成本随进货量怎样变化,最低点在哪 | 变化率 | 第 6、13 章 |
| F | 火箭发射 | 一路减重、一路加速,最后速度累积到多少 | 累积 | 第 9、13 章 |
你会注意到,最有用的问题往往两类兼有:我们知道的是“每一刻怎样变”,想知道的是“最后会怎样”。天气预报就是典型:物理定律告诉我们空气在每一刻怎样流动、怎样升温,我们要的却是明天下午的天空。要从前者走到后者,必须同时用上放大和累加。这正是微积分被发明出来的原因。
所以,微积分是
- 研究“变化”的数学:变得多快(微分),攒了多少(积分)
- 一套把不均匀切成局部均匀、再用算术处理的方法
微积分不是
- 另一种更难的算术:它的每一小步都只是乘除加减
- 只处理曲线和面积的几何学:曲线和面积只是“变化”的画像
本章带走
微积分只回答两个问题:此刻变得多快?一共变了多少?
- 变化均匀时,小学算术就够;麻烦只来自不均匀。
- 放大:光滑曲线放大到足够细就是直线,它的坡度就是瞬时变化率(导数)。
- 切碎再加起来:把总量切成近似均匀的小块,逐块相乘再求和(积分)。
- 两者是同一件事的两面:里程表跳动的速度,就是速度表的读数。
- 六个日常伏笔,都是这两类问题或它们的组合。
于是,下一个问题这两个问题困扰了人类两千年。是谁、又是怎样一步步逼近答案的?
2Chapter 2 · The calculus wars
微积分恩仇录
微积分从何而来?牛顿与莱布尼茨之争的真相与结局是什么?
上一章留下的问题:这两个问题困扰了人类两千年。是谁、又是怎样一步步逼近答案的?
说“牛顿和莱布尼茨发明了微积分”,就像说“某某人发明了汽车”——没错,但漏掉了两千年的接力。本章先讲接力,再讲那场争吵:它为什么爆发、怎样收场、真相是什么,以及它留给后人的代价。
2.1第一棒:芝诺的难题,阿基米德的切片
公元前 5 世纪,古希腊哲学家芝诺提出了几个让人头疼的悖论。最有名的一个是“阿基里斯追乌龟”:飞毛腿阿基里斯让乌龟先跑 100 米。他跑完这 100 米时,乌龟又往前爬了一点;他追上这一点时,乌龟又往前爬了一点……如此无穷无尽,他似乎永远追不上。
谁都知道阿基里斯能追上,可说不清错在哪里。芝诺真正的问题是:无穷多段路程加起来,能不能是一个有限的数?这个问题要等到第 4 章才能被干净利落地回答。
比芝诺晚两百年的阿基米德没有纠缠哲学,而是动手去算。他想求抛物线围成的一块弓形面积,办法是往里面塞三角形:先塞一个大的,再在两边的缝隙里各塞一个小的,再往更小的缝隙里塞更小的……每一轮三角形的总面积是上一轮的 1/4。他证明了:这块弓形的面积,恰好是第一个三角形的 4/3。
他用同样的思路,拿正 96 边形去夹住圆,算出圆周率在 223/71 与 22/7 之间,也就是 3.1408 到 3.1429 之间。这种“用越来越细的已知图形去逼近未知图形”的方法,后人叫它穷竭法。它已经是切碎再加起来的雏形了。
πpi · 希腊字母第 16 个
怎么读:英文读 pi /paɪ/,中文近似“派”。(它在希腊语里读作 /pi/,类似“皮”;国内课堂一般用英文读法。)
从哪来:取自希腊语 περιφέρεια(periphery,“周长、圆周”)的首字母。1706 年英国数学家威廉·琼斯第一次用它专指“圆周长 ÷ 直径”,后来欧拉在著作里大量使用,才成为全世界的标准。
为什么选它:它是“圆周”这个词的第一个字母,而这个比值正是圆周与直径之比。阿基米德和刘徽的年代还没有这个符号,他们用文字描述这个数。
2.2东方的一棒:刘徽割圆,祖暅求积
公元 263 年,魏晋数学家刘徽为《九章算术》作注。为了求圆的面积和周长,他从圆内接正六边形开始,把边数一次次翻倍:12、24、48、96……他写下了一段后来常被引用的话:
割之弥细,所失弥少;割之又割,以至于不可割,则与圆周合体而无所失矣。——刘徽《九章算术注》
翻译成白话:切得越细,损失越少;一直切到不能再切,多边形就和圆合为一体,一点也不差了。这句话几乎就是“极限”思想的文学版。
图 2-1刘徽割圆术。边数每翻一倍,多边形与圆之间的绿色缝隙就大幅缩小,“周长 ÷ 直径”一步步逼近 π。两百年后,祖冲之把 π 算到了 3.1415926 与 3.1415927 之间。
又过了约两百年,祖冲之的儿子祖暅提出“幂势既同,则积不容异”:两个立体如果在每一个高度上的截面面积都相等,它们的体积就相等。这正是把立体切成无数薄片来比较体积。欧洲人直到 17 世纪才由意大利人卡瓦列里重新提出同样的原理。
2.317 世纪的前夜:万事俱备
既然古人早有切片思想,为什么微积分直到 17 世纪才诞生?
阿基米德和刘徽的方法,每换一个图形,要从头想一遍吗?
是的。抛物线有抛物线的巧妙塞法,圆有圆的割法,每道题都是一件手工艺品。
那缺的是什么?
缺一种通用的语言,能把所有曲线都写成同一种形式,再用同一套步骤去处理。
这种语言在 17 世纪出现了吗?
出现了。1637 年笛卡尔发表坐标几何,费马也独立做了同样的事:曲线可以写成方程,比如 y = x²。几何问题从此可以变成代数问题。
工具有了,需求也来了。远洋航行要算船的位置,炮兵要算炮弹的轨迹,天文学家要解释开普勒刚发现的行星椭圆轨道——这些都是关于“不断变化的运动”的问题。于是 17 世纪上半叶,一大批人各自摸到了微积分的边角:
- 开普勒在 1615 年研究酒桶的容积,把桶切成薄片来算;
- 卡瓦列里在 1635 年提出“不可分量”方法;
- 费马在 1630 年代找到了求曲线最高点、最低点的办法;
- 牛顿的老师、剑桥的巴罗,已经隐约看到了“求切线”与“求面积”之间的某种互逆关系。
拼图的碎片散落了一地。缺的是一个人,把它们拼成一套任何人照着做都能算出答案的通用算法。结果,出现了两个人。
2.4牛顿:乡间一年里的“流数”
序章只讲了两个年轻人的开头。现在把他们的故事讲完整。
1665 年,伦敦暴发大瘟疫,剑桥大学关闭。二十出头的牛顿回到林肯郡伍尔索普的农庄。在接下来一年多里,他独自发展出了三样改变世界的东西:光的颜色理论、万有引力的雏形,以及他称为“流数术”的新数学。1666 年 10 月,他写下了一份关于流数术的手稿。
牛顿是从运动出发的。他把一切变量都想象成随时间“流动”的量,叫作“流量”;流量变化的速度,叫作“流数”。求流数,就是我们说的求导数;从流数反推流量,就是求积分。
可他几乎不发表。1669 年他写了《分析学》,只在朋友之间传阅;1671 年写成的《流数法》,直到他去世后的 1736 年才出版。1687 年那部震动世界的《自然哲学的数学原理》,推导里处处用到微积分的思想,写出来的却几乎全是古典几何的样子。
为什么藏着?一个常被提到的原因是,他早年发表光学论文后遭到胡克等人的批评,从此对公开争论极度厌恶。数学家阿诺尔德有一句挖苦:在“不发表”和“为优先权不停争斗”之间,牛顿两样都选了。
2.5莱布尼茨:巴黎的符号大师
1672 年,二十六岁的莱布尼茨作为外交官来到巴黎。他此前主要学的是法律和哲学,数学相当薄弱。荷兰物理学家惠更斯成了他的老师。短短四年,他从数学门外汉变成了欧洲一流的数学家。1675 年 10 月 29 日,他在手稿里第一次写下了一个拉长的 S——∫,取自拉丁文 summa(总和);几周后,他又开始用 d 表示“差”(differentia)。
莱布尼茨是从求和与求差出发的。他在研究数列时注意到:一列数“逐项相减”与“逐项累加”是一对互逆的操作。把这个直觉推到无穷小,就有了 d 与 ∫ 这一对互逆的符号。
他对符号有近乎执念的追求。他一生都梦想发明一种“通用语言”,让推理像算术一样可以机械地进行。dy/dx 这个记号就体现了这种追求:它读起来像一个分数,而在很多计算里,它也真的可以像分数一样约分和移项。第 5 章讲链式法则时,你会亲眼看到这种记号有多聪明。
1684 年,他在莱比锡的《教师学报》上发表了第一篇微分论文,题目很长,意思是“一种求极大、极小和切线的新方法”;1686 年又发表了积分的论文。瑞士的伯努利兄弟读后迅速掌握并发扬了这套方法。1696 年,法国的洛必达出版了世界上第一本微积分教科书,用的是莱布尼茨的体系。在欧洲大陆,微积分从此传开了。
2.61676 年的两封信
两人其实有过直接的接触。莱布尼茨 1673 年和 1676 年两次访问伦敦,1676 年还在牛顿的朋友柯林斯那里看到过牛顿的部分手稿。同一年,通过皇家学会秘书奥尔登堡转交,牛顿给莱布尼茨写了两封长信,介绍自己关于无穷级数的成果。
在第二封信里,牛顿把流数术的核心藏进了一串字母密码:
6accdae13eff7i3l9n4o4qrr4s8t12ux意思是:有 6 个 a、2 个 c、1 个 d……把原句的字母按字母表顺序数出来。原句是拉丁文:“给定一个含有任意多个流量的方程,求出流数;以及反过来。”
这是当时常见的“时间戳”做法:先把发现藏起来,将来若有争议,再公布原文证明自己早就知道。可以想见,莱布尼茨不可能从这串字母里读出什么。1677 年他回信时,已经坦然地用自己的 d 记号展示了求切线的方法。
2.7战争:1699–1716
图 2-2微积分之争时间线。左侧是牛顿一方,右侧是莱布尼茨一方。粉色区间是公开争吵期:从 1699 年的剽窃指控,到 1716 年莱布尼茨去世。
头二十年相安无事。1696 年,洛必达在教科书序言里还承认,牛顿的《原理》“几乎全是这种演算”。
火药桶是 1699 年点着的。瑞士数学家法蒂奥(牛顿的密友)公开暗示:莱布尼茨是“第二发明人”,可能借用了牛顿的东西。1704 年,一篇匿名书评(后世普遍认为出自莱布尼茨之手)评论牛顿新发表的流数论文,字里行间暗示牛顿的流数不过是莱布尼茨微分的另一种写法。
这下轮到英国人愤怒了。1708 年,牛顿的门生凯尔在皇家学会的《哲学汇刊》上直指莱布尼茨剽窃。莱布尼茨向皇家学会申诉,要求主持公道。
学会成立了一个委员会。问题在于,学会会长正是牛顿本人。委员会从未听取莱布尼茨的陈述,1712 年便完成了报告,1713 年初以《通信集》为名出版,裁定牛顿是第一发明人。今天的研究者已经查明,这份报告的主体是牛顿亲自起草的。1715 年,皇家学会的刊物上又出现一篇为这份报告叫好的匿名长文,作者还是牛顿。
莱布尼茨一方也并不干净:他同样散发过匿名的攻击性传单,还曾试图否认自己是作者。直到 1716 年去世,他也没有接受那份裁决。
如果你是一名 18 世纪的英国数学家,你会用谁的记号?如果你是法国人呢?这种选择会带来什么后果?
英国人出于忠诚,坚持用牛顿的“点”记号;欧洲大陆的伯努利家族、欧拉、拉格朗日等人则用莱布尼茨的 d 与 ∫。
后果是:18 世纪微积分最辉煌的进展——微分方程、变分法、分析力学——几乎全部发生在欧洲大陆。英国数学在这门自己本国人参与开创的学科上,落后了约一个世纪。
2.8结局
结局有三层。
第一层,个人的结局。两人的晚年境遇截然不同。牛顿晚年声望如日中天,1727 年去世后获得国葬,成为第一位葬入威斯敏斯特教堂的科学家。莱布尼茨晚年失去了宫廷的青睐,1716 年在汉诺威去世时身后冷清,只有巴黎科学院为他致了悼词。
第二层,国家的结局。英国赢了优先权,却在记号和方法上把自己孤立起来。1812 年,剑桥的几个学生——包括后来设计出机械计算机的巴贝奇、天文学家赫歇尔和数学家皮科克——成立了“分析学会”,要把欧陆的数学引回英国。巴贝奇留下一句双关语:他们要推行“纯粹的 D 主义”,反对大学里的“点时代”(dot-age,谐音 dotage,“老糊涂”)。1817 年,剑桥考试终于开始使用莱布尼茨的 d 记号。
第三层,历史的结局。1849 年,德国学者格哈特在整理莱布尼茨的手稿时,发现了他亲手摘抄的牛顿《分析学》片段,但摘抄的时间无法确定。此后一百多年,科学史家反复比对两人的手稿与通信,得出了今天的共识。
2.9真相:同一座山的两条路
| 牛顿 | 莱布尼茨 | |
|---|---|---|
| 主要成果时间 | 1665–1666 年(手稿) | 1675 年(手稿) |
| 首次公开发表 | 1693 年部分、1704 年较完整 | 1684 年(微分)、1686 年(积分) |
| 出发点 | 运动:量随时间流动 | 数列:求和与求差 |
| 核心概念 | 流量、流数 | 微分 d、积分 ∫ |
| 导数记号 | ẋ(字母上加点) | dy/dx |
| 今日遗产 | 物理学中对时间求导仍用点记号 | 全世界教科书的标准记号 |
现代科学史的主流结论可以归纳为三句话:
- 牛顿先发现:他在 1665–1666 年就掌握了方法,比莱布尼茨早约十年。
- 莱布尼茨先发表:1684 年公开发表,比牛顿早约二十年,而且他的符号体系让这门学问得以迅速传播。
- 两人独立发明:他们的出发点、概念和记号截然不同,莱布尼茨的手稿显示了一条独立的思想路径。也有研究者指出,莱布尼茨事后修改过部分笔记的日期,这一点至今仍有争议。
两支登山队从南坡和北坡分别登顶同一座山。南坡的队伍先到,却没有插旗,只在日记里写下“我到过”;北坡的队伍晚到,却插了旗、画了详细的路线图,后来的登山者都沿着北坡的路线上山。多年后,两队为“谁先登顶”吵得不可开交——而山,一直都在那里。
“独立发明”的意思是
- 两人各自找到了通用算法,并且都看清了求导与求积互为逆运算
- 谁也不是简单地抄了对方
“独立发明”不意味着
- 两人对彼此的工作一无所知(他们通过信件有过交流)
- 微积分是凭空出现的(它站在阿基米德、刘徽、费马、巴罗的肩膀上)
2.10还没打牢的地基
故事还没完。牛顿和莱布尼茨的方法好用得出奇,但有一个致命的逻辑漏洞:他们都依赖“无穷小量”——一个比任何正数都小、却又不等于零的量。计算时先把它当成非零来做除法,算完再把它当成零扔掉。
1734 年,英国哲学家、主教贝克莱写了一本《分析学家》,辛辣地讥讽说:这些无穷小量,既不是有限的量,也不是零,那它们难道是“逝去的量的鬼魂”吗?
数学家们无言以对,但微积分实在太好用,大家便一边用一边等。这一等就是一百多年。直到 1821 年法国的柯西在《分析教程》里用“极限”重新定义一切,再到 1860 年代德国的魏尔斯特拉斯用严格的 ε-δ 语言把它说清,鬼魂才被彻底驱散。
这里的 ε 和 δ 是两个希腊字母,分别读作 epsilon /ˈɛpsɪlɒn/(中文近似“艾普西隆”)和 delta /ˈdɛltə/(中文近似“德尔塔”)。它们是什么意思、为什么偏偏选这两个字母,第 4 章会用一场“挑战游戏”细讲。
这段历史告诉我们一件重要的事:用好一件工具,和说清它为什么成立,是两回事。人类先会用、后说清,花了一百五十年。你不必重走这段弯路——接下来的几章,我们会按“说清”之后的顺序,一块一块搭积木。
| 年代 | 人物 | 贡献 |
|---|---|---|
| 约前 450 | 芝诺 | 无穷多段能否加成有限?(悖论) |
| 约前 250 | 阿基米德 | 穷竭法:抛物线弓形面积、π 的范围 |
| 263 | 刘徽 | 割圆术:“割之又割,以至于不可割” |
| 约 500 | 祖暅 | “幂势既同,则积不容异”:切片求体积 |
| 1615–1637 | 开普勒、卡瓦列里、费马、笛卡尔 | 切片求体积、不可分量、求极值、坐标几何 |
| 1665–1686 | 牛顿、莱布尼茨 | 通用算法与基本定理;符号体系 |
| 1696 | 洛必达 | 第一本微积分教科书 |
| 1734 | 贝克莱 | 批评无穷小是“逝去的量的鬼魂” |
| 1821–1860s | 柯西、魏尔斯特拉斯 | 用极限与 ε-δ 打牢地基 |
本章带走
微积分是两千年接力的终点:古人会切片,17 世纪的坐标语言让它变成通用算法,牛顿与莱布尼茨各自完成了最后一步。
- 牛顿先发现(1665–1666),莱布尼茨先发表(1684);现代共识是两人独立发明。
- 皇家学会的裁决由牛顿本人主导;莱布尼茨至死未能翻案。
- 代价:英国坚持牛顿记号,落后欧陆约一个世纪;今天全世界用的是莱布尼茨的 d 与 ∫。
- 早期微积分的“无穷小”逻辑有漏洞,直到 19 世纪才用极限补上。
于是,下一个问题故事讲完了。要亲手使用这件工具,第一块积木是什么?
3Chapter 3 · Functions and rates
第一块积木:函数与变化率
要谈论“变化”,我们先需要什么语言?
上一章留下的问题:故事讲完了。要亲手使用这件工具,第一块积木是什么?
第 2 章说过,古人早就会切片,微积分却要等到 17 世纪,因为那时才有了一种能把所有曲线写成同一种形式的语言。这种语言的核心,叫函数。本章只做两件事:说清函数是什么,说清怎样衡量它变得多快。
3.1变化总是“随着什么”在变
说“气温在变”,是随着什么在变?
随着时间。早上凉,中午热,夜里又凉下来。
出租车的车费呢?
随着里程。开得越远,表上的数越大。
血液里的药物浓度呢?
随着吃药后过去的时间。先升高,后慢慢降下去。
这三件事有什么共同点?
都有一个量跟着另一个量变:你给出一个时间或里程,就能对应出一个气温、车费或浓度。
这种“给一个,对应一个”的关系,就是函数。被你自由给出的那个量叫自变量,通常写作 x(或时间 t);跟着变的那个量叫因变量,通常写作 y。写成 y = f(x),读作“y 是 x 的函数”。
图 3-1函数是一台机器:放进一个输入,按固定规则加工,吐出一个输出。关键在于“固定”——同一个输入,永远得到同一个输出。
函数像一台自动售货机:按下 A3,永远掉出同一瓶饮料。它不会今天给你可乐、明天给你橙汁。反过来倒是可以:A3 和 B5 都可能是可乐——不同的输入可以对应同一个输出。
函数是
- 一条规则:每个输入对应唯一一个输出
- 可以用公式、表格、图像,甚至一段文字描述
函数不一定是
- 一个漂亮的公式(气象站的气温记录也是函数,但没有公式)
- 一一对应(两个输入可以得到同一个输出)
3.2把规则画出来:图像
函数最有力的表示法,是把它画出来:横轴放输入,纵轴放输出,每一对 (x, y) 画一个点,所有点连起来就是一条曲线。这正是笛卡尔的发明。
学会读图,你就从图像上一眼读出两样东西:
- 高度:某个输入对应的输出是多少。比如下午 2 点气温多少度。
- 陡峭程度:输出变得有多快。比如气温上午升得快,下午升得慢。
第一样东西,普通的查表就够了;第二样东西,才是微积分真正关心的。我们需要一把“量陡峭程度”的尺子。
3.3直线的陡峭程度:斜率
先从最简单的情况出发:直线。
假设出租车起步价 13 元,之后每公里 2.5 元。车费 y 与里程 x 的关系是 y = 13 + 2.5x。画出来是一条直线。多走 1 公里,车费多 2.5 元;多走 4 公里,多 10 元。无论从哪里开始数,“多出来的车费 ÷ 多走的里程”都是 2.5。
这个比值就是斜率:
斜率 = 输出的变化 ÷ 输入的变化 = Δy / ΔxΔx 读作“delta x”,意思是“x 变了多少”
Δdelta(大写)· 希腊字母第 4 个
怎么读:英文读 delta /ˈdɛltə/,中文近似“德尔塔”。Δx 读作“delta x”。
从哪来:它是希腊字母表的第四个字母,相当于拉丁字母的 D。形状像一个三角形——尼罗河口的三角洲英文叫 delta,就是因为长得像这个字母。
为什么选它:“差、变化”在拉丁文里是 differentia,英文是 difference,都以 d 开头;数学家便借用了希腊语里的“D”来表示“差值”。大写 Δ 表示一段看得见的、有限的变化,比如“4 分钟”“6.5 公里”。第 4 章还会遇到它的小写 δ。
请特别留意单位。车费斜率的单位是“元 / 公里”,速度的单位是“公里 / 小时”,气温升高的快慢是“度 / 小时”。任何变化率的单位都是“输出单位 每 输入单位”。这个“每”字,就是变化率的指纹。以后你在任何地方看到“每”,都可以想到:这里藏着一个变化率。
3.4曲线的陡峭程度:平均变化率
直线处处一样陡,所以一个斜率就够了。曲线不行:它有的地方陡,有的地方平。
我们能做的第一步,是在曲线上取两个点,连一条直线——这条线叫割线——用割线的斜率,代表这一段的平均变化率。
图 3-2一辆车先加速后减速,位置随时间画成一条 S 形曲线。取第 2 分钟和第 6 分钟两个点连成割线,它的斜率 Δs/Δt 就是这 4 分钟里的平均速度。
平均速度很有用,但它会“抹平”细节。这 4 分钟里,车可能一会儿快一会儿慢,平均值告诉不了你第 3 分钟那一刻有多快。要知道“那一刻”,只能把两个点靠得更近:把 4 分钟缩成 1 分钟,再缩成 1 秒……
3.5常见的函数家族
世界上的变化千姿百态,但大多数都能由几个基本家族拼出来。认识它们,就像认识乐器:每一种都有自己的“音色”——也就是自己的变化方式。
| 家族 | 例子 | 生活里的样子 | 变化性格 |
|---|---|---|---|
| 线性 | y = 13 + 2.5x | 出租车计费、匀速行驶 | 变化率处处相同 |
| 幂函数 | y = 4.9t² | 自由落体下落的距离(米) | 越往后变得越快 |
| 指数 | y = 2t | 细菌分裂、复利、病毒传播初期 | 变化率与自身大小成正比 |
| 对数 | y = log x | 地震震级、声音分贝、音阶 | 越往后变得越慢 |
| 三角 | y = sin t | 潮汐、交流电、一年四季的气温 | 周而复始,时快时慢 |
表里的 log x(对数)问的是:10 要自乘几次才得到 x?比如 log 1000 = 3。震级每高 1 级,地震释放的能量约增大 32 倍,所以用对数来“压缩”这种跨越好几个数量级的量。
表里最后一列“变化性格”,就是后面几章要精确计算的东西。第 5 章会给出每个家族的变化率公式;第 10 章会看到,指数家族“变化率与自身成正比”这个性格,几乎统治了金融、医药和人口的全部故事。
3.6撞上那堵墙:0 ÷ 0
现在,让我们正面撞一次序章里那堵墙。
一块石头从高处自由下落,t 秒后下落了 4.9t² 米。问:第 2 秒那一刻,它有多快?
按平均速度的思路,从第 2 秒到第 2 + Δt 秒:
平均速度 = [4.9(2 + Δt)² − 4.9 × 2²] ÷ Δt
取 Δt = 1 秒,得 24.5 米/秒;取 0.1 秒,得 20.09;取 0.01 秒,得 19.649;取 0.001 秒,得 19.6049。
这串数在往哪里走?如果直接令 Δt = 0,会得到什么?
这串数越来越接近 19.6。看起来,“第 2 秒那一刻的速度”就应该是 19.6 米/秒。
但如果直接令 Δt = 0,分子是 4.9 × 4 − 4.9 × 4 = 0,分母也是 0,又回到了 0 ÷ 0。我们明明“看见”了答案,却没法合法地“算出”它。
困难被压缩成了一句话:我们需要让 Δt 无限小,却又不能让它等于 0。牛顿和莱布尼茨靠“无穷小”绕过了这堵墙,却留下了贝克莱讥讽的“鬼魂”。下一章,我们用 19 世纪的办法正式拆掉它。
本章带走
函数描述“谁随着谁变”;斜率衡量“变得多快”,单位里总有一个“每”。
- 函数:每个输入对应唯一的输出,可用公式、表格或图像表示。
- 直线的斜率 = Δy/Δx,处处相同。
- 曲线上两点连成割线,其斜率是这一段的平均变化率。
- 想要“一瞬间”的变化率,就得让 Δt 缩到无限小——然后撞上 0 ÷ 0。
于是,下一个问题平均变化率一算就有;可一瞬间的变化率,Δt = 0 时成了 0/0。怎样让 Δt 无限小,却又不等于 0?
4Chapter 4 · Limits
第二块积木:极限
“无限接近”如何变成可以严格计算的东西?
上一章留下的问题:平均变化率一算就有;可一瞬间的变化率,Δt = 0 时成了 0/0。怎样让 Δt 无限小,却又不等于 0?
这一章是整座阶梯里最“哲学”的一级,也是人类花了一百五十年才迈上去的一级。好消息是,一旦换个问法,它就变得出奇地朴素。
4.1换一个问法
先把上一章的数据整理成一张表。
| Δt(秒) | 平均速度(米/秒) | 与 19.6 的差距 |
|---|---|---|
| 1 | 24.5 | 4.9 |
| 0.1 | 20.09 | 0.49 |
| 0.01 | 19.649 | 0.049 |
| 0.001 | 19.6049 | 0.0049 |
| → 0 | → 19.6 | → 0 |
表里每一行,Δt 都不是 0,对吗?
对。每一行都是正常的除法,没有 0 ÷ 0。
差距一栏有什么规律?
每次 Δt 缩小 10 倍,差距也缩小 10 倍,正好是 4.9 × Δt。
那我们何必非要算“Δt = 0 时等于多少”?我们能不能改问:当 Δt 越来越接近 0 时,平均速度越来越接近哪个数?
这个问题有明确的答案:19.6。而且回答它,从头到尾不需要让 Δt 等于 0。
这就是极限的全部秘密:不问“到了那里是多少”,只问“往那里去时,结果向哪里靠拢”。我们把它写成:
limΔt → 0(平均速度)= 19.6读作“当 Δt 趋于 0 时,平均速度的极限是 19.6”
limlimit · 极限记号
怎么读:英文读 limit /ˈlɪmɪt/,中文直接读“极限”。下方小字 Δt → 0 读作“delta t 趋于零”,箭头 → 读“趋于”(英文 approaches /əˈprəʊtʃɪz/)。
从哪来:lim 是拉丁文 limes(边界、界限)和英文 limit 的缩写。把“趋于”写在 lim 下方的排法,是 20 世纪初才流行起来的。
为什么选它:极限就是一个过程无法越过、只能不断靠近的“边界”,用“界限”这个词再贴切不过。
极限像一张机票上的目的地,而不是你此刻所在的位置。飞机一路向北京靠近,距离从 1000 公里缩到 100 公里、10 公里、1 公里……“目的地是北京”这件事,在飞机落地之前就已经完全确定了。极限问的就是目的地;至于最后那一刻飞机是否真的落地,与目的地是哪里无关。
极限是
- 一个过程“正在去往”的那个确定的数
- 只看“靠近时”的行为,永远不需要真的到达
极限不是
- “差不多”或“近似值”:19.6 是精确的,不是 19.6 左右
- 把 Δt 代成 0 算出来的值(那是 0 ÷ 0,没有意义)
4.2割线的去向:切线
把同样的想法画到图上。在曲线 y = x² 上固定一点 (1, 1),另一个点从远处向它滑过来。每个位置都连一条割线。
图 4-1割线的另一端从 x = 2 滑到 1.5、再到 1.2,斜率从 3 变成 2.5、2.2。另一端离 (1, 1) 为 h 时,割线斜率恰好是 2 + h。h 趋于 0,割线就转向了斜率为 2 的红色切线。
这就回答了第 1 章留下的疑问:“放大到足够大,曲线就变成直线”——那条直线到底是哪一条?它就是割线的极限,也就是切线。“放大”和“让两点无限靠近”,是同一件事的两种说法。
4.3芝诺的回答:无穷多项可以加成有限
极限不仅能处理“无限小”,也能处理“无限多”。回到第 2 章的阿基里斯。
设阿基里斯每秒跑 10 米,乌龟每秒爬 1 米,乌龟先跑 100 米。阿基里斯跑完 100 米用 10 秒,乌龟又前进 10 米;再追 10 米用 1 秒,乌龟又前进 1 米;再追 1 米用 0.1 秒……总时间是:
10 + 1 + 0.1 + 0.01 + … = 11.111… 秒
无穷多段时间,加起来只有约 11.1 秒。芝诺的错误在于默认了“无穷多个正数相加,一定是无穷大”。下面这张图说明它为什么不对。
图 4-2把一个正方形切下一半,再把剩下的切下一半……块数无穷多,但它们全在正方形里面,总面积永远不会超过 1;而没切到的部分每次减半,趋于 0。所以 1/2 + 1/4 + 1/8 + … 的极限恰好是 1。
“无穷多个数相加”在数学里叫级数。它的值被定义为“前 n 项之和”在 n 趋于无穷时的极限。第 11 章会看到,计算器算 sin 和 eˣ,靠的就是这种无穷的加法。
4.4把“无限接近”说严格:一场挑战游戏
“越来越接近”这种话,听起来还是有点虚。19 世纪的魏尔斯特拉斯把它变成了一场可以判输赢的游戏。
你说石头第 2 秒那一刻的速度是 19.6,我不信。我要求平均速度和 19.6 的差距小于 0.01,你做得到吗?
做得到。差距是 4.9 × Δt,只要 Δt 小于 0.01 ÷ 4.9,约 0.002 秒,差距就一定小于 0.01。
那我要求差距小于 0.000001 呢?
那我就让 Δt 小于 0.000001 ÷ 4.9。无论你提出多小的误差要求,我总能找到一个足够小的 Δt 范围来满足你。
所以,只要你永远能接招……
“极限是 19.6”就成立。
数学家习惯用希腊字母 ε 表示挑战者要求的误差,用 δ 表示应战者给出的范围。所以这个定义被称为 ε-δ 定义(读作“epsilon-delta 定义”)。
εepsilon · 希腊字母第 5 个
怎么读:英文读 epsilon,英式 /ˈɛpsɪlɒn/、美式 /ˈɛpsəlɑːn/,中文近似“艾普西隆”(也常听到“伊普西龙”)。重音在第一个音节。
从哪来:它就是希腊字母里的 e。名字的原意是“单纯的 e”(e psilon),用来和发音相同的字母组合区分开。
为什么选它:通常的解释是,它对应法语 erreur(误差)的首字母 e。法国数学家柯西在 1820 年代的著作里就用 ε 表示“任意小的误差”,这个习惯一直沿用至今。所以在数学里,看到 ε,几乎总可以把它理解为“一个很小的正数,代表允许的误差”。
δdelta(小写)· 希腊字母第 4 个
怎么读:和第 3 章的大写 Δ 同一个字母,英文读 delta /ˈdɛltə/,中文近似“德尔塔”。
从哪来:它是 Δ 的小写,相当于拉丁字母的 d。
为什么选它:通常认为它对应 différence(差)或 distance(距离)的首字母 d:它描述的是“Δt 离 0 有多近”这段距离。大写 Δ 常用于一段具体的变化,小写 δ 常用于一个很小的范围,正好搭配 ε 这个“很小的误差”。
用这两个符号,定义可以写成:
对任意 ε > 0,都存在 δ > 0,使得只要 0 < |Δt| < δ,就有 |平均速度 − 19.6| < ε
这很像工厂接订单。客户说:零件尺寸误差不能超过 0.01 毫米。工厂回答:只要把机床的进给控制在某个精度内,我就能保证。客户把要求提到 0.0001 毫米,工厂就把机床精度再提高。如果无论客户怎么提要求,工厂都有办法保证,我们就说这家工厂“能造出精确的 10 毫米”——尽管没有任何一个零件真的是“精确的 10 毫米”。
ε-δ 定义第一次读会觉得绕,这很正常。你只需要记住它的精神:“无限接近”被翻译成了“任何精度要求都能被满足”。这句话里没有任何“无穷小量”,也没有任何鬼魂。
4.5两个值得认识的极限
第一个:sin x / x。当 x(用弧度表示的角度;弧度就是“弧长 ÷ 半径”,180° 等于 π ≈ 3.14 弧度,0.1 弧度约 5.7°)趋于 0 时,分子分母都趋于 0,又是 0/0 的样子。数值实验会告诉你答案:
| x(弧度) | sin x / x |
|---|---|
| 1 | 0.841471 |
| 0.5 | 0.958851 |
| 0.1 | 0.998334 |
| 0.01 | 0.999983 |
| → 0 | → 1 |
它的意思是:角度很小时,sin x ≈ x。物理学家分析钟摆、工程师计算桥梁的微小形变、光学设计里处理近轴光线,都在大量使用这个近似。这正是“放大看,曲线就变直”的又一个例子:正弦曲线在原点附近,放大后就是直线 y = x。
严格证明它时,要用到一个很形象的工具——夹逼定理:如果一个量总是被夹在两个量中间,而这两个量都趋向同一个数,那么中间这个量也只能趋向那个数。就像一个人被两名警察一左一右押着走,警察走进了警局,他也只能跟着进去。
第二个:(1 + 1/n)n。当 n 越来越大,它依次是 2、2.25、2.594、2.705、2.717……最后趋向一个不再变化的数:2.71828…。这个数叫 e。它是伏笔 C(利息拆得无限细,钱会不会无限多)的答案所在,第 10 章再细说。
4.6连续:笔不离纸
有了极限,还能顺手说清另一个日常直觉:连续。
图 4-3左:连续的曲线,一笔画成。中:在一点处缺了个洞。右:在一点处突然跳了一级,比如快递按“每满 1 公斤”阶梯收费。
直觉上,连续就是“画的时候笔不离纸”。用极限的语言说:当 x 趋向 a 时,f(x) 的极限恰好等于 f(a)——往那里去的方向,和那里实际的值,没有错位。
大多数自然量是连续的:气温、身高、水位,不会从一个值瞬间跳到另一个值。连续有一个很有用的推论,叫介值定理:连续变化的量,不会跳过中间的任何值。你 10 岁时身高 1.4 米,15 岁时 1.7 米,那么在这之间必然有某一刻,你恰好是 1.5 米高。
早上 6 点你从山脚出发,傍晚 6 点到达山顶;第二天早上 6 点沿原路下山,傍晚 6 点回到山脚。两天里,是否一定存在某个时刻,你在同一钟点恰好处在同一个位置?
一定存在。想象两天的你在同一天出发:一个从山脚往上走,一个从山顶往下走。两人走的是同一条路,从两端相向而行,途中必然相遇。相遇的那个时刻、那个位置,就是答案。
用介值定理说:“上山者的位置 − 下山者的位置”这个量是连续变化的,早上 6 点它是负的,傍晚 6 点它是正的,所以中间某一刻它必然等于 0。
4.7鬼魂被驱散
回头看贝克莱的批评。牛顿的做法是:先用一个“无穷小”的 Δt 做除法,算完再把它当作 0 扔掉——前后矛盾。
极限的做法是:Δt 从头到尾都是普通的、不为零的数。我们合法地化简出 19.6 + 4.9Δt,然后只问一个问题:Δt 趋于 0 时,它去往哪里?答案 19.6 由 ε-δ 游戏担保。没有任何一步除以零,也没有任何一步“既是零又不是零”。
本章带走
极限把“让 Δt 等于 0”换成了“看 Δt 趋于 0 时结果去往哪里”,0 ÷ 0 的墙就此消失。
- 割线的极限是切线;“放大到变直”和“两点无限靠近”是同一件事。
- 无穷多个数可以加成有限:1/2 + 1/4 + … = 1,阿基里斯约 11.1 秒追上乌龟。
- ε-δ:无论要求多高的精度,总能满足——这就是“无限接近”的严格含义。
- 两个重要极限:sin x/x → 1(小角度 sin x ≈ x),(1 + 1/n)n → e。
- 连续 = 极限值等于实际值;连续量不会跳过中间值。
于是,下一个问题有了极限,终于可以正式定义“一瞬间的变化率”。它长什么样,又该怎么算?
5Chapter 5 · The derivative
导数:一瞬间的变化率
怎样算出任何一刻的变化速度?
上一章留下的问题:有了极限,终于可以正式定义“一瞬间的变化率”。它长什么样,又该怎么算?
前四章搭好了两块积木:函数(描述变化的语言)和极限(驯服“无限接近”的工具)。把它们叠在一起,就得到微积分的第一个主角——导数。
5.1导数的定义
把第 3 章的平均变化率和第 4 章的极限合起来,就是导数的定义:
f ′(x) = limh → 0 [f(x + h) − f(x)] / h分子:输出变了多少;分母:输入变了多少;lim:让输入的变化趋于 0
读法有三种,说的是同一件事:
- 代数上:平均变化率在区间缩成一点时的极限。
- 几何上:曲线在这一点的切线斜率。
- 物理上:这一瞬间的变化速度——位置的导数是速度,速度的导数是加速度。
序章里速度表的悖论到这里有了答案。“此刻 72 公里/小时”说的不是“一瞬间走了多少路”,而是:在那一刻前后取越来越短的时间段,平均速度去往的那个数是 72。它是一个极限,因此既有意义,又可以测量。实际的速度表和测速仪也无法真正测量“一瞬间”,它们是在极短时间内测出位置(或车轮转过的圈数)的变化,再用这个平均速度去逼近瞬时速度。
5.2亲手算第一个导数:正方形长大
我们来求 f(x) = x² 的导数。先不用公式,用一张图。
图 5-1边长为 x 的正方形,边长增加一点点 dx。新增的面积是两条细长条(各为 x·dx)加上角落里一个极小的正方形 (dx)²。dx 越小,角落那块越可以忽略。
新增面积 = 2x·dx + (dx)²。除以 dx,得到 2x + dx。让 dx 趋于 0,结果是 2x。
(x²)′ = 2x
这个结果和第 4 章对得上:在 x = 1 处,切线斜率是 2;石头下落 4.9t²,在第 2 秒的速度是 4.9 × 2 × 2 = 19.6。
请留意那个琥珀色的小角。它是“两个小量相乘”,比任何一个小量本身都小得多。导数的全部计算,本质上都是在做同一件事:保留和 dx 成正比的部分,扔掉比它更小的部分。
用同样的方法想一想:边长为 x 的正方体,每条边长长 dx,体积增加的主要部分是什么?由此猜出 x³ 的导数。
正方体有三个面朝外“长肉”,每个面新增一块 x² × dx 的薄板,一共 3x²·dx;其余是棱和角上的细条小块,都含 (dx)² 或 (dx)³,可以忽略。所以 (x³)′ = 3x²。
规律出来了:(x²)′ = 2x,(x³)′ = 3x²。一般地,(xn)′ = nxn−1,这叫幂法则。
5.3导数本身也是一个函数
曲线上每一点都有一个切线斜率。把“每一点的斜率”也画成一条曲线,就得到一个新函数:导函数,简称导数。
图 5-2上图是函数 f,下图是它的导数 f ′。下图每一点的高度,等于上图同一位置切线的坡度:上坡处 f ′ 为正,下坡处为负,山顶和谷底处恰好为 0。
学会看这对图,你就学会了导数最实用的读法:
- f ′ > 0:f 在上升;f ′ 越大,升得越猛。
- f ′ < 0:f 在下降。
- f ′ = 0:f 此刻不升不降,可能在山顶或谷底。第 6 章会把这一点变成“找最优解”的武器。
5.4求导的几条法则
如果每求一次导数都要从极限的定义出发,那就太慢了。好在只需几条法则,就能像搭积木一样求出绝大多数函数的导数。
| 函数 | 导数 | 一句话理解 |
|---|---|---|
| 常数 c | 0 | 不变的东西,变化率为零 |
| xn | nxn−1 | 幂法则:正方形、正方体“长肉” |
| ex | ex | 变化率等于自己(第 10 章主角) |
| ln x | 1/x | 越往后长得越慢 |
| sin x | cos x | 圆周运动:位置的“高度”变化率,是水平位置 |
| cos x | −sin x | 同上,差一个方向 |
| u + v | u′ + v′ | 和的变化率 = 变化率的和 |
| c · u | c · u′ | 放大 c 倍,变化率也放大 c 倍 |
| u · v | u′v + uv′ | 长方形两边都在长:两条新长条 |
| u / v | (u′v − uv′) / v² | 由乘积法则推出 |
表中的 e(约 2.718)和自然对数 ln 第 10 章才会正式登场,这里先记住结果即可。
乘积法则值得多看一眼,因为它就是图 5-1 的推广:一个长方形,长 u、宽 v 同时在长,新增面积是“宽方向长的那条” u′v 加上“长方向长的那条” uv′,角上那个“小乘小”照例忽略。
它在生活里也随处可见。一家店的收入 = 单价 × 销量。如果单价每月涨 2%,销量每月跌 1%,收入怎么变?按乘积法则,收入的变化率约为 2% − 1% = 1%。
5.5链式法则:一串齿轮
现实中的变化往往是一环套一环的。给气球打气:时间决定了打进多少气,气量决定了半径,半径决定了表面积。表面积对时间的变化率是多少?
图 5-3三个咬合的齿轮。x 每转 1 圈,u 转 3 圈;u 每转 1 圈,y 转 2 圈。所以 x 每转 1 圈,y 转 3 × 2 = 6 圈。变化率沿着链条相乘。
这就是链式法则:
dy/dx = (dy/du) × (du/dx)左边看起来就像右边把 du“约掉”了
第 2 章说莱布尼茨的记号“会替你思考”,指的就是这里:dy/dx 虽然严格说不是分数,但在链式法则中它表现得像分数一样可以约分。你几乎不用记公式,写下来它自己就对了。
举个例子:y = (3x + 1)⁵。令 u = 3x + 1,则 y = u⁵。外层对 u 求导得 5u⁴,内层对 x 求导得 3,相乘:dy/dx = 15(3x + 1)⁴。
链式法则的应用远不止课本习题。今天训练人工智能的核心算法“反向传播”,本质上就是在一个有上亿个齿轮的链条上,反复使用链式法则。第 12 章还会回来谈它。
5.6变化率的变化率:二阶导数
导数是一个函数,所以它也可以再求导。位置求一次导得到速度,再求一次导得到加速度。坐车时你感觉不到匀速,却能感到加速和刹车——你的身体对二阶导数敏感。
新闻里说:“本月物价涨幅收窄。”这意味着物价在下降吗?
不是。“涨幅”是物价的变化率(一阶导数),它仍然是正的,物价还在涨;“收窄”说的是涨幅在变小,也就是二阶导数为负。
同理,“新增病例增速放缓”“房价涨势趋缓”都只是二阶导数为负,一阶导数仍为正。把一阶导数和二阶导数混为一谈,是新闻解读里最常见的误会之一。
5.7三种记号,一个意思
你会在不同的书里看到不同的导数记号。它们是历史留下的“方言”:
- 牛顿记号 ẋ:头上一个点,专指对时间求导,物理学里常用;
- 拉格朗日记号 f ′(x):简洁,适合强调“导数也是函数”;
- 莱布尼茨记号 dy/dx:适合链式法则和换元,也最能提醒你导数是“两个微小变化之比”。
d ′d(微分)与 ′(撇)
怎么读:dy/dx 读作“d y 比 d x”,英文 “dee-y dee-x” /diː waɪ diː ɛks/,也可读“y 对 x 的导数”。f ′(x) 读作“f 撇 x”,英文 “f prime of x” /ɛf praɪm əv ɛks/。ẋ 读作“x 点”,英文 “x dot” /ɛks dɒt/。
从哪来:d 是拉丁文 differentia(差)的首字母,莱布尼茨 1675 年开始使用;它是第 3 章大写 Δ 的“无穷小版本”——Δ 表示看得见的变化,d 表示缩到无限小的变化。撇号 ′ 由拉格朗日在 18 世纪后期推广。
为什么选它:用拉丁字母 d 而不是希腊字母,是为了与有限差 Δ 区分开,同时一眼看出它和“差”的关系。
最后一个小技巧:有时 y 和 x 的关系不是写成 y = … 的形式,比如单位圆 x² + y² = 1。我们照样可以对等式两边同时求导(把 y 看作 x 的函数,用链式法则):2x + 2y·y′ = 0,于是 y′ = −x/y。这叫隐函数求导,它再次说明:只要曲线光滑,放大看就是直线,不管它的方程写成什么样。
本章带走
导数 = 平均变化率的极限 = 切线斜率 = 瞬时速度;只需几条法则,就能求出绝大多数函数的导数。
- (x²)′ = 2x:保留与 dx 成正比的部分,扔掉“小乘小”。
- 导数本身是函数:正则升、负则降、零则可能是山顶或谷底。
- 法则:和、常数倍、乘积、商;常用导数见表 5-1。
- 链式法则:变化率沿链条相乘,dy/dx = dy/du · du/dx。
- 二阶导数:变化率的变化率;“涨幅收窄”不等于“下降”。
于是,下一个问题会算导数了。可是,知道一个量每一刻变多快,到底有什么用?
6Chapter 6 · Using derivatives
导数的用武之地
知道了变化率,我们能做什么?
上一章留下的问题:会算导数了。可是,知道一个量每一刻变多快,到底有什么用?
导数至少能干五件实事:找最优、判断形状、从平均推断瞬间、用直线代替曲线做近似、解方程。本章一件一件看,还会顺手回收第一个伏笔。
6.1找最优:山顶的坡度为零
先做一个动手题。一张 30 厘米见方的纸板,四个角各剪掉一个边长为 x 的小正方形,把四边折起来,做成一个无盖的盒子。剪多大,盒子装得最多?
剪得很小,比如 x = 0.5 厘米,盒子怎么样?
底很大,但边太矮,像个托盘,装不了多少。
剪得很大,比如 x = 14 厘米呢?
边很高,但底只剩 2 厘米见方,像根细管子,也装不了多少。
所以体积先随 x 增大,后随 x 减小,中间某处有个最大值。在那个最高点上,体积的变化率是多少?
山顶上不升不降——导数为 0。
盒子底边长 30 − 2x,高 x,体积 V = x(30 − 2x)²。求导并化简:
V ′ = (30 − 2x)(30 − 6x)
令它等于 0,得 x = 15(纸板剪没了,舍去)或 x = 5。剪 5 厘米,体积 = 5 × 20 × 20 = 2000 立方厘米。
图 6-1左:四角剪去 x × x 后折成盒子。右:体积随 x 的变化。在 x = 5 处,曲线到达山顶,切线(红色)是水平的。
这套方法可以一般化成三步:第一,把目标写成一个变量的函数;第二,求导并令它为 0,解出候选点;第三,连同区间端点一起比较,挑出最好的那个。企业定价、工程设计、物流调度里的无数“最优化”问题,都以这三步为起点。
仓库一次该进多少货?设一年要卖出 D 件商品,每次订货的固定成本(运费、人工、手续)是 S 元,每件商品在仓库放一年的持有成本是 H 元。每次进 Q 件,一年要订 D/Q 次,平均库存约 Q/2 件。
年总成本 = 订货成本 DS/Q + 持有成本 HQ/2。进得少,前一项大;进得多,后一项大——又是一个“先降后升”的曲线。对 Q 求导并令其为 0,得到 Q* = √(2DS/H)。这就是 1913 年由哈里斯提出、今天仍写在每本供应链教材里的经济订货批量公式。
示例:一年卖 10,000 件,每次订货 200 元,每件年持有成本 4 元,则 Q* = √(2 × 10000 × 200 ÷ 4) = 1000 件,一年订 10 次。第 13 章会讲它在真实供应链里的样子和局限。
6.2判断形状:二阶导数与凹凸
导数为 0 的点不一定是山顶,也可能是谷底。怎么区分?看二阶导数。
- 在山顶,坡度从正变成负——坡度在减小,二阶导数 < 0,曲线像一顶帽子(向下弯)。
- 在谷底,坡度从负变成正——坡度在增大,二阶导数 > 0,曲线像一只碗(向上弯)。
盒子问题里,V ″(5) = −120 < 0,所以 x = 5 确实是山顶。二阶导数描述的“弯曲方向”在很多地方都有用:经济学家用它判断“边际收益递减”,工程师用它计算横梁的弯曲,公路设计师用它控制弯道的急缓。
6.3从平均推断瞬间:区间测速
高速公路上有一种测速方式叫区间测速:在一段路的两端各设一个抓拍点,用“路程 ÷ 用时”算你的平均速度。
一段 20 公里的区间,限速 100 公里/小时。你用了 10 分钟跑完,平均时速 120。你辩解说:“我每一刻都没超过 100,只是平均起来快。”这可能吗?
不可能。如果你每一刻都不超过 100 公里/小时,那么 10 分钟最多只能走 100 × 1/6 ≈ 16.7 公里,走不完 20 公里。
更进一步,数学能保证的不只是“某一刻超过了 100”,而是:一定有某一刻,你的瞬时速度恰好等于 120。这就是下面要讲的中值定理。
图 6-2把位置随时间画成曲线。起点到终点的连线(紫色割线)的斜率是平均速度。把这条割线平行移动,它总会在某处恰好“擦过”曲线,成为一条切线(红色)——那一刻的瞬时速度等于平均速度。
拉格朗日中值定理说:如果一个量在一段区间上连续、并且处处光滑(可导),那么区间里至少有一个时刻,它的瞬时变化率恰好等于整段的平均变化率。它是连接“平均”和“瞬间”的桥梁,也是后面证明微积分基本定理时的关键一步。
6.4用直线代替曲线:线性近似
“放大看,曲线就变直”不只是一个比喻,它可以直接拿来算数。
问:√4.1 约等于多少?我们知道 √4 = 2,而 √x 的导数是 1/(2√x),在 x = 4 处等于 1/4。意思是:在 4 附近,x 每增加 1,√x 大约增加 1/4。现在 x 增加了 0.1,所以:
√4.1 ≈ 2 + 0.1 × 1/4 = 2.025真值 2.02485…,误差不到万分之二
一般地,在已知点 a 附近,f(a + Δx) ≈ f(a) + f ′(a)·Δx。这叫线性近似。工程师每天都在用它:把复杂的非线性系统在工作点附近“拉直”,就能用简单得多的线性方法去分析和控制。飞机的自动驾驶、电网的稳定分析,很多都从这一步开始。
6.5解方程:牛顿法
你的计算器怎样算出 √2?一种经典的办法,是牛顿本人提出的。
求 √2,就是求方程 x² − 2 = 0 的根,也就是曲线 y = x² − 2 与横轴的交点。牛顿的想法是:先随便猜一个点,在那里用切线代替曲线,顺着切线滑到横轴上,得到一个更好的猜测;再重复。
图 6-3从 x = 3 出发,沿切线滑到 1.833;从 1.833 再做切线,滑到 1.462;再一步到 1.41500,第四步到 1.41421。每一步正确的位数大约翻一倍。
x新 = x旧 − f(x旧) / f ′(x旧)
牛顿法的收敛速度非常快:离答案足够近之后,每迭代一次,正确的小数位数大约翻一倍。今天的科学计算软件、工程仿真、金融定价里,到处是它和它的变体。
6.6化解 0/0:洛必达法则
第 4 章的 sin x / x 在 x → 0 时是 0/0 的样子。有了导数,可以换一个角度看:分子分母都从 0 出发,谁“跑得快”,比值就由谁决定。而“跑多快”正是导数:
lim sin x / x = lim cos x / 1 = 1
这就是洛必达法则:0/0 型的极限,可以换成分子分母各自导数之比的极限(在一定条件下)。一个小趣闻:这条法则以第 2 章那位写了第一本教科书的洛必达命名,但它实际上是约翰·伯努利发现的——洛必达付费请伯努利给自己讲课,并约定可以使用他的成果。
6.7一环扣一环:相关变化率
给气球打气,每秒打进 100 立方厘米。当半径是 10 厘米时,半径每秒长多少?
体积 V = (4/3)πr³。两边对时间求导(链式法则):dV/dt = 4πr²·dr/dt。代入 dV/dt = 100、r = 10:
dr/dt = 100 ÷ (4π × 100) ≈ 0.08 厘米/秒
这解释了一个你可能注意过的现象:刚开始吹气球时,它“噌”地鼓起来;越往后越吹不大。原因是同样的气量,要摊到越来越大的表面积 4πr² 上。
| 用法 | 核心想法 | 现实例子 |
|---|---|---|
| 找最优 | 最高点、最低点处导数为 0 | 剪纸盒、经济订货批量、定价 |
| 判断形状 | 二阶导数的正负决定弯曲方向 | 边际收益递减、横梁弯曲 |
| 从平均推断瞬间 | 中值定理 | 区间测速 |
| 近似计算 | 局部用切线代替曲线 | √4.1、小角度近似、系统线性化 |
| 解方程 | 沿切线逼近根 | 计算器开方、工程仿真 |
本章带走
导数是一把多用途的工具:它能找最优、判形状、连接平均与瞬间、化曲为直、逼近方程的根。
- 最优点处导数为 0;二阶导数判断是山顶还是谷底。
- 伏笔 E 的答案:经济订货批量 Q* = √(2DS/H)。
- 中值定理:平均速度 120,必有一刻恰好 120——区间测速的数学依据。
- 线性近似与牛顿法,都是“放大看,曲线就变直”的直接应用。
于是,下一个问题导数把整体拆成了每一刻的变化。反过来——已知每一刻的变化,能不能拼回整体?
7Chapter 7 · The integral
积分:切碎,再加起来
已知每一刻的变化,怎样求出总量?
上一章留下的问题:导数把整体拆成了每一刻的变化。反过来——已知每一刻的变化,能不能拼回整体?
从这一章开始,我们换到仪表盘的另一块表:里程表。前四章一直在做“放大”,这一章做“切碎,再加起来”。
7.1从速度回到路程
匀速每小时 60 公里,开 2 小时。把速度画成随时间变化的图,是什么形状?
一条水平线,高度 60。
这条线下方、从 0 到 2 小时的那块区域,面积是多少?
长方形,60 × 2 = 120。咦,正好是路程。
是巧合吗?
不是。长方形的面积是“高 × 宽”,这里高是速度、宽是时间,“速度 × 时间”本来就是路程。
那么速度在变的时候呢?
图像不再是长方形,而是一条曲线。但只要把它切成很多窄条,每一窄条都近似是个长方形……路程就应该是曲线下方的面积。
图 7-1速度-时间图下方的面积就是路程。匀速时是长方形,一次乘法就够;变速时是曲边形,需要“切碎再加起来”。
这个发现很重要:任何“变化率 × 时间”的累积,都可以画成“曲线下的面积”。于是,“求总量”这个物理问题,变成了“求面积”这个几何问题——正是阿基米德和刘徽研究了两千年的问题。
7.2切得越细,越准
我们用一个具体例子动手算。一辆车从静止附近起步,速度(米/秒)是 v(t) = 2 + 0.5t²。前 4 秒走了多远?
把 4 秒切成 4 段,每段 1 秒。用每段开头那一刻的速度代表整段:第 1 段 2 米/秒,第 2 段 2.5,第 3 段 4,第 4 段 6.5。路程 ≈ (2 + 2.5 + 4 + 6.5) × 1 = 15 米。
速度一直在增加,用“开头的速度”会系统性地低估。切得更细,低估就更少:
图 7-2同一块面积,切成 4 条、8 条、32 条。每条都用左端的高度,所以每条顶上都缺一个小三角;条越窄,小三角越小,总和越接近真值。
| 切成几条 | 左端点求和(米) | 中点求和(米) |
|---|---|---|
| 4 | 15.000 | 18.500 |
| 8 | 16.750 | 18.625 |
| 16 | 17.688 | 18.656 |
| 32 | 18.172 | 18.664 |
| 100 | 18.507 | 18.666 |
| 1000 | 18.651 | 18.667 |
| → ∞ | → 18.667 | → 18.667 |
两列数字从不同方向逼近同一个数,这又是第 4 章的极限。我们把这个极限值定义为曲线下的精确面积。取点方式(左端、中点、右端)不影响极限,只影响逼近得快慢——中点法快得多。
7.3积分号:一句话写下整个过程
上面的过程是:切成 n 条,每条宽 Δt,高 v(t),面积 v(t)·Δt,全部加起来,再让 n 趋于无穷。莱布尼茨把这整件事压缩成了一个符号:
∫04 v(t) dt∫ 是拉长的 S(summa,总和);v(t) dt 是一条细条的面积;下标 0、上标 4 是从哪里加到哪里
∫积分号 · integral sign
怎么读:中文读“积分”,∫04 v(t) dt 读作“v(t) 从 0 到 4 的积分”或“从 0 到 4 积分 v(t) d t”;英文 integral /ˈɪntɪɡrəl/,读作 “the integral from 0 to 4 of v of t, dee t”。
从哪来:它不是希腊字母,而是拉长的拉丁字母 s——17 世纪手写体里的“长 s”。莱布尼茨 1675 年 10 月 29 日在手稿中首次使用,取自拉丁文 summa(总和)。
为什么选它:积分就是“求和”的极限,所以用“和”的首字母。它和 d 是一对:d 表示“差”,∫ 表示“和”,一拆一合,正好对应第 8 章的基本定理。
这个符号可以当成一句话来读:“从 0 到 4,把每一条‘高 v(t)、宽 dt’的细条面积全部加起来。”它叫定积分。1854 年,德国数学家黎曼用极限给它下了严格的定义,所以“切成细条求和”也叫黎曼和。
积分像一台收银机的“小计”功能。顾客一件一件地扫商品:每件商品是“单价 × 数量”,收银机不停地累加。积分做的是同一件事,只不过它扫的“商品”是无穷多条无限窄的细条。∫ 就是那个不停累加的“小计”键。
积分是
- “变化率 × 微小区间”的无限细分之和
- 一切“累积”问题的通用写法:面积只是它最直观的画像
积分不只是
- “求面积”:它同样可以求路程、电量、药量、体积、功
- 近似值:极限是精确的;只有“切有限条”时才是近似
7.4面积也可以是负的
如果车开到一半开始倒车,速度变成负数,积分会怎样?
图 7-3速度先正后负。横轴上方(绿色)的面积记为正,代表前进;下方(红色)记为负,代表后退。积分把两者相加,得到的是净位移,而不是走过的总路程。
这正是积分“带符号”的含义:它算的是净累积。银行账户里,一天的净变化 = 收入 − 支出;一个月的余额变化 = 每天净变化的累加。水库、库存、碳排放的“净值”,都遵循同样的逻辑。如果想要“总共走了多少路”,就要对速度的绝对值积分。
7.5一切累积都是积分
“面积”只是积分的一种画像。只要一个量是“某个变化率在一段范围上的累积”,它就是一个积分:
| 变化率(被积函数) | × 微小区间 | 积分得到 |
|---|---|---|
| 速度(米/秒) | dt(秒) | 路程(米) |
| 用电功率(千瓦) | dt(小时) | 电量(千瓦时,即“度”) |
| 河水流量(立方米/秒) | dt(秒) | 水库蓄水量(立方米) |
| 截面积(平方米) | dx(米) | 体积(立方米) |
| 血药浓度(毫克/升) | dt(小时) | 药时曲线下面积 AUC,衡量药物“总暴露量” |
| 力(牛顿) | dx(米) | 功(焦耳) |
请注意单位:被积函数的单位 × 区间的单位 = 积分的单位。这是第 3 章“斜率单位里有个‘每’”的镜像:导数除以输入单位,积分乘以输入单位。第 8 章会说明,这种镜像关系不是巧合。
表中第五行的 AUC,就与伏笔 D(为什么一日三次吃药)有关:药物的疗效和毒性,很大程度上取决于血药浓度曲线下的面积。第 13 章会细讲。
7.6平均值:把起伏摊平
天气预报说“今天平均气温 22°C”,这个平均是怎么算的?如果只取最高温和最低温的平均,会忽略一天里气温停留在不同温度的时间长短。更精确的办法是:把一天的温度曲线积分,再除以 24 小时。
平均值 = ∫ab f(x) dx ÷ (b − a)
几何上,它是把曲线下起伏的面积“推平”成一个等面积的长方形,长方形的高就是平均值。前面那辆车 4 秒走了 18.667 米,平均速度就是 18.667 ÷ 4 ≈ 4.67 米/秒。
7.7一个令人疲惫的问题
为了得到 18.667,我们把面积切成了 1000 条,做了 1000 次乘法和 1000 次加法。如果每道积分题都要这样算,你还愿意学微积分吗?
多半不愿意。17 世纪以前的数学家正是困在这里:每个面积都要设计一套巧妙的切法,费时费力,而且常常算不出精确值。
但你也许已经从表 7-1 的最后一行里嗅到了一丝线索:18.667 = 56/3,一个很“整齐”的数。整齐的答案,往往意味着背后有一条捷径。
本章带走
积分 = 把变化率切成无数细条、每条乘以宽度、全部加起来的极限。
- 速度曲线下的面积就是路程;任何“变化率的累积”都能画成面积。
- 黎曼和:切得越细越准;极限值就是定积分 ∫ab f(x) dx。
- 积分带符号:横轴下方的面积为负,结果是“净”累积。
- 平均值 = 积分 ÷ 区间长度。
- 困难:按定义求和太慢,需要捷径。
于是,下一个问题用无穷多个小矩形求和,理论上可行,实际上累死人。有没有捷径?
8Chapter 8 · The fundamental theorem
基本定理:两个问题原是一个
为什么“求变化率”与“求总量”互为逆运算?
上一章留下的问题:用无穷多个小矩形求和,理论上可行,实际上累死人。有没有捷径?
这一章是全书的高峰。你已经搭好了所有需要的积木:函数、极限、导数、积分。现在只差最后一步——看清它们之间的一条隐秘通道。牛顿和莱布尼茨争了一辈子的,说到底就是“谁先看清了这条通道”。
8.1让面积“动”起来
第 7 章的积分都有固定的起点和终点,比如从 0 到 4。现在我们做一个小改动:固定起点,让终点变成一个可以移动的 x。
想象曲线下有一道幕布,从左边的起点一直拉到 x。幕布盖住的面积,记作 A(x)。你把幕布往右拉,A 就变大;往左推,A 就变小。A(x) 是一个新的函数,叫面积函数,也叫累积函数。
在汽车的例子里,f 是速度表的读数,A(x) 就是到时刻 x 为止里程表跳过的公里数。
8.2先下个注
现在提一个问题。请先别往下读,凭直觉下个注。
面积函数 A(x) 是一个函数,它当然也有导数,也就是“幕布往右拉时,面积增长的速度”。这个速度等于什么?(A)一个很复杂的式子;(B)与 f 无关;(C)就是 f(x) 本身。
答案是(C):A ′(x) = f(x)。面积此刻增长的速度,恰好等于曲线此刻的高度。
如果你选对了,很可能是想起了第 1 章的仪表盘:里程表跳动的速度,就是速度表的读数。下一节说明为什么。
8.3揭晓:细条的高度就是增长率
图 8-1上图:幕布从 0 拉到 x,面积为 A(x)。再往右拉一小步 h,面积多出一条细条(琥珀色),它的高约为 f(x)、宽为 h。下图:A(x) 的曲线;它在 x 处的切线斜率,恰好等于上图曲线在 x 处的高度。
推理只有三步,每一步你都已经会了:
- 幕布从 x 拉到 x + h,面积增加了 A(x + h) − A(x),就是那条琥珀色细条。
- 细条很窄,它的顶几乎是平的,高度约为 f(x),所以面积 ≈ f(x) × h。
- 于是 [A(x + h) − A(x)] / h ≈ f(x)。让 h 趋于 0,左边正是导数的定义,“约等于”变成了“等于”。
A ′(x) = f(x)对连续的 f 成立。严格证明时,细条的真实高度被夹在细条内 f 的最小值和最大值之间,h → 0 时两者都趋于 f(x)——这正是第 4 章的夹逼定理
这就是微积分基本定理的第一部分:对一个函数先积分、再求导,就回到了它自己。网页版封面的“微积分显微镜”一直在展示这件事:无论你把点移到哪里,“面积此刻增长的速度”总等于“曲线此刻的高度”。
8.4捷径:牛顿–莱布尼茨公式
这个发现立刻给出了第 7 章苦苦寻找的捷径。
我们要求 ∫04 (2 + 0.5t²) dt。与其切 1000 条,能不能换个问法?
基本定理说,面积函数的导数就是被积函数。那么只要找到一个函数 F,使它的导数恰好是 2 + 0.5t²……
这相当于把求导倒过来做。什么函数求导后得到 2?
2t。
什么函数求导后得到 0.5t²?
幂法则倒着用:t³ 求导得 3t²,所以 t³/6 求导得 0.5t²。合起来,F(t) = 2t + t³/6。
那面积呢?
面积 = F 在终点的值减去在起点的值:F(4) − F(0) = 8 + 64/6 − 0 = 56/3 ≈ 18.667。和切 1000 条的结果一致,而且是精确值。
这就是基本定理的第二部分,通常称为牛顿–莱布尼茨公式:
∫ab f(x) dx = F(b) − F(a),其中 F ′ = f求总量 = 找一个“导数是 f”的函数,再做一次减法
用汽车的话说:想知道这 4 秒走了多远,不必把每一瞬间的速度都加起来,只需看看里程表:结束时的读数减去开始时的读数。这句话几乎是废话;但把它翻译成数学,就把“无穷多项求和”变成了“一次减法”。
再试一个历史名题。阿基米德用无穷多个三角形求出了抛物线下的面积。现在,求 y = x² 在 0 到 1 之间的面积:x³/3 的导数是 x²,所以面积 = 1/3 − 0 = 1/3。一行字,就完成了阿基米德那部专著的核心计算。
8.5原函数与那个神秘的 +C
“导数是 f 的函数 F”叫作 f 的原函数。它不唯一:2t + t³/6 的导数是 2 + 0.5t²,2t + t³/6 + 100 的导数也是,因为常数的导数是 0。
两辆车在同一时刻以完全相同的速度曲线行驶,一辆的里程表从 0 开始,另一辆从 35,000 公里开始。它们的里程表读数永远差 35,000,但跳动的速度一模一样。速度表只能告诉你“跳了多少”,告诉不了你“从哪里开始跳”。
所以,所有原函数写在一起是 F(x) + C,C 是任意常数,这叫不定积分,记作 ∫f(x) dx。求定积分时做减法,C 会自动抵消,所以用哪个原函数都一样。而在后面的微分方程里,C 需要由“起点的读数”来确定,它有一个专门的名字:初始条件。
8.6两条路,原来是一条
图 8-2从总量到变化率是求导(放大看);从变化率回到总量是积分(切碎再加起来)。基本定理说:这两条路互为往返。
现在,回到第 1 章那张仪表盘:
- 从里程表推速度表,是求导:放大看,曲线就变直。
- 从速度表推里程表,是积分:切成碎片,再加起来。
- 二者互为逆运算:变化率与总量,是同一件事的两面。
三句口号,至此全部推导完毕。
基本定理说的是
- 积分再求导,回到原函数:A ′ = f
- 求定积分只需找一个原函数,再做减法
基本定理没说
- 原函数总能用公式写出来(很多写不出,第 9 章会遇到)
- “切碎求和”从此没用了(原函数写不出时,计算机依然靠求和)
8.7为什么这是人类思想的一座高峰
第 2 章说,阿基米德会求面积,费马会求切线,巴罗隐约看到两者有关。那牛顿和莱布尼茨的功劳到底在哪里?
答案就在这一章。他们第一次清楚地看到并证明了求切线与求面积是互逆的,并把它变成了一套任何人照着做都能算出答案的算法。从此,两千年里一个个需要天才灵感的“手工艺品”,变成了流水线上的标准件:会求导,就会求积分。
它的影响远远超出数学。自然规律大多以“变化率”的形式出现:牛顿第二定律说力决定加速度,热传导定律说温差决定热量流动的速率。人类能直接写下的是“每一刻怎么变”,而想知道的是“最后会怎样”。基本定理正是连接这两者的桥。没有它,就没有经典力学、没有天气预报,也没有下一章要讲的“用变化的规律预言未来”。
这也回答了序章的问题:“一瞬间有多快”为什么值得发明一门新数学?因为算出“一瞬间”只是第一步;一旦看清它和“总量”之间的这座桥,人类就握住了从自然规律推算整个世界的钥匙。难怪牛顿和莱布尼茨后来都那么在意“谁先看清了它”。
本章带走
微积分基本定理:积分与求导互为逆运算;求总量 = 找原函数、做一次减法。
- 面积函数 A(x) 的增长速度等于曲线此刻的高度:A ′(x) = f(x)。
- 牛顿–莱布尼茨公式:∫ab f dx = F(b) − F(a),里程表终点读数减起点读数。
- 原函数差一个常数 C;C 由起点(初始条件)决定。
- 牛顿与莱布尼茨的核心贡献:看清这座桥,并把它变成通用算法。
于是,下一个问题基本定理把积分变成了“找原函数”。可原函数不总是一眼看得出——怎么找?找到后又能算什么?
9Chapter 9 · Techniques and applications
积分的工具箱与应用
怎样真正算出积分,它又能算出什么?
上一章留下的问题:基本定理把积分变成了“找原函数”。可原函数不总是一眼看得出——怎么找?找到后又能算什么?
基本定理说,积分就是“求导倒过来”。那么,每一条求导法则倒过来,就是一件积分工具。本章前半部分打开工具箱,后半部分用它去算体积、算功,并回收两个伏笔:火箭能跑多快,以及怎样“看见”地下。
9.1换元法:链式法则倒着用
求 ∫ 2x cos(x²) dx。
这个被积函数像不像某个链式法则的结果?
像。sin(x²) 求导,外层得 cos(x²),内层 x² 求导得 2x,乘起来正是 2x cos(x²)。
所以原函数是?
sin(x²) + C。
系统的做法叫换元:令 u = x²,则 du = 2x dx,原式变成 ∫ cos u du = sin u + C。莱布尼茨的记号又一次替我们思考:du = 2x dx 这一步,看起来就像把 du/dx = 2x 两边同乘 dx。
9.2分部积分:乘积法则倒着用
乘积法则是 (uv)′ = u′v + uv′。两边积分再移项,得到:
∫ u dv = uv − ∫ v du把一个难积的式子,换成一个可能好积的式子
例:∫ xex dx。令 u = x、dv = ex dx,则 = xex − ∫ ex dx = (x − 1)ex + C。你可以求导验证:结果正是 xex。
| 求导法则 | 倒过来的积分工具 | 何时想到它 |
|---|---|---|
| 幂法则 (xn+1)′ = (n+1)xn | ∫xn dx = xn+1/(n+1) + C(n ≠ −1) | 多项式 |
| (ln x)′ = 1/x | ∫ dx/x = ln|x| + C | 幂法则唯一的例外 n = −1 |
| (ex)′ = ex | ∫ ex dx = ex + C | 增长、衰减 |
| 链式法则 | 换元法 | 被积函数里有“内层函数及其导数” |
| 乘积法则 | 分部积分 | 两类不同函数相乘 |
| — | 数值积分(切碎求和) | 找不到原函数时 |
最后一行不是凑数的。有些函数看起来很简单,原函数却无法用初等函数写出来。最著名的例子是 e−x²——统计学里的“钟形曲线”(正态分布)就是它。考试成绩、身高分布、测量误差都近似服从这条曲线,而计算“落在某个范围内的概率”就是求它下方的面积。对这种积分,人们只能回到第 7 章:切碎,再加起来,交给计算机去算。
9.3体积:把立体切成薄片
第 2 章的祖暅说:每一层截面相同,体积就相同。积分把这个思想变成了计算:体积 = 每一层截面积 × 厚度,全部加起来。
图 9-1把曲线 y = √x 绕 x 轴转一圈,得到一只碗状(旋转抛物面)的立体。切成薄圆片,每片是半径为 y、厚为 dx 的圆盘,体积 πy²dx = πx dx。从 0 加到 4:πx²/2 在 4 处的值减去在 0 处的值,等于 8π。
工厂计算储罐的容量、医院用 CT 断层图像估算肿瘤体积、开普勒当年计算酒桶的容积,用的都是这个办法。CT 本身更是积分的杰作:X 射线穿过人体时,衰减的总量是沿路径的积分;从成千上万个角度的积分反推出每一处的密度,是 1917 年拉东就解决了的数学问题,五十多年后才被做成机器,1979 年的诺贝尔生理学或医学奖授予了 CT 的两位开创者。
9.4功:力随位置变化时
把一个箱子推动 10 米,用力 50 牛,做功 50 × 10 = 500 焦耳。如果力是变化的呢?比如把卫星从地面送向太空,地球的引力随距离的平方减小:离地心越远,拉得越轻。
办法依然是切碎:把路程切成一小段一小段,每段里力几乎不变,功 ≈ 力 × 小段长度,再全部加起来。所以功 = ∫ 力 dx。
9.5无限长的路,有限的功:反常积分
要让一个物体彻底摆脱地球引力,需要把它从地面(离地心 R)一直推到无穷远。积分的上限是“∞”,这叫反常积分。它的值定义为:先积到一个很远的 b,再让 b 趋于无穷,看结果去往哪里——又是极限。
图 9-2两条曲线都向右无限延伸、都趋于 0。1/x² 下方从 1 到无穷远的面积恰好是 1;1/x 下方的面积却会无限增长。趋于 0 还不够,要趋于 0 得“足够快”。
引力正是按 1/x² 减弱的,所以把物体推到无穷远所需的功是有限的:∫R∞ GMm/x² dx = GMm/R。(G 是引力常数,M 是地球质量,m 是物体质量。)让物体的动能 ½mv² 等于这个功,就得到逃逸速度:
v = √(2GM/R) = √(2gR) ≈ √(2 × 9.8 × 6,371,000) ≈ 11.2 公里/秒即第二宇宙速度;g 为地表重力加速度,R 为地球半径(米)
11.2 公里/秒大约是步枪子弹速度的十几倍,从北京到上海只需不到两分钟。假如引力是按 1/x 减弱的,逃逸所需的功就是无穷大,任何火箭都飞不出地球。宇宙的几何,藏在一个反常积分是否收敛里。
火箭一路减重,最后能跑多快?火箭每喷出一小团燃气(质量 dm,相对火箭的喷射速度 ve),自己就获得一点点速度 dv。动量守恒给出:m·dv = −ve·dm,也就是 dv = −ve·dm/m。
这是一个“每一刻怎样变”的规律。把它从起飞质量 m0 积分到燃料烧完后的质量 mf,用上表 9-1 的 ∫dm/m = ln m:
Δv = ve · ln(m0 / mf)齐奥尔科夫斯基火箭方程,1903 年发表
示例:喷射速度约 3 公里/秒,起飞时燃料占总质量的 90%(m0/mf = 10),Δv = 3 × ln 10 ≈ 6.9 公里/秒。进入近地轨道需要约 7.8 公里/秒,加上克服空气阻力和重力的损耗,实际约需 9 公里/秒以上。对数长得很慢:质量比从 10 翻到 100,速度也只多出 6.9 公里/秒。这就是火箭要分级、要一路扔掉空壳的原因。第 13 章还会继续这个故事。
看不见地下,怎样知道那里有什么?方法之一是测重力。地下如果埋着一块密度较大的矿体,它会让正上方的重力略微变大(变化通常只在百万分之一量级)。地面上某一点感受到的额外引力,等于把地下切成无数小块,每一小块按“质量 ÷ 距离²”贡献一点点,再全部加起来——这是一个三维积分。
勘探者做的是反方向的事:在地面上测出一大片重力读数,反推地下的密度分布。第 13 章会讲另一种更强大的办法——听地震波的回声。
9.6找不到原函数时:数值积分
工程和科学里遇到的积分,多数没有漂亮的原函数;有时连被积函数本身都没有公式,只有一串传感器读数。这时,计算机回到最朴素的办法:切碎,再加起来。
不过它加得比左端点法聪明。梯形法把每条的顶连成斜线,辛普森法用一小段抛物线去贴合顶部。对光滑的曲线,同样切 100 条,辛普森法的误差往往比左端点法小好几个数量级。你手机里的计步器估算路程、电表累计度数、飞控计算机积算位置,都在做这件事。
本章带走
积分工具都是求导法则的倒影;找不到原函数时,就回到“切碎,再加起来”。
- 换元 = 链式法则倒用;分部积分 = 乘积法则倒用。
- 体积 = ∫ 截面积 dx;功 = ∫ 力 dx。
- 反常积分:积到无穷远也可能有限;逃逸速度约 11.2 公里/秒。
- 伏笔 F:火箭方程 Δv = ve ln(m0/mf),来自积分 dm/m。
- 伏笔 B:地下物体的重力效应是一个积分,勘探是在反推它。
于是,下一个问题到此为止都是已知函数去求导或积分。现实常常反过来:只知道变化的规律,不知道函数本身。
10Chapter 10 · e and differential equations
e 与微分方程:用变化的规律预言未来
只知道变化的规律,怎样推出未来?
上一章留下的问题:到此为止都是已知函数去求导或积分。现实常常反过来:只知道变化的规律,不知道函数本身。
牛顿说“力决定加速度”,没说物体下一秒在哪里;医生知道“药物每小时被代谢掉一定比例”,却想知道 12 小时后血液里还剩多少。自然界递给我们的,几乎总是变化的规律,而我们想要的是结果。把前者变成后者,就是本章的主题:微分方程。我们从一笔存款说起。
10.1利息拆得无限细:e 的诞生
1683 年,瑞士数学家雅各布·伯努利(第 2 章里那对兄弟中的哥哥)研究了一个问题:年利率 100%,存 1 元,如果把利息拆开、更频繁地计入本金,一年后能拿到多少?
一年结一次息呢?
1 × (1 + 1) = 2 元。
半年结一次,每次利率 50%,利息再生利息呢?
(1 + 0.5)² = 2.25 元,多了 0.25。
每月一次呢?每天一次呢?
(1 + 1/12)¹² ≈ 2.613,(1 + 1/365)³⁶⁵ ≈ 2.715。越拆越多……会不会无限多?
再看每小时:(1 + 1/8760)⁸⁷⁶⁰ ≈ 2.7181。你觉得呢?
增长越来越慢,好像被一堵看不见的墙挡住了。
图 10-1计息越频繁,一年后的金额越多,但增量越来越小,最终贴近一条水平线:e ≈ 2.71828。这是第 4 章那个极限 (1 + 1/n)n 的来历。
| 计息方式 | 年利率 100% | 年利率 3% |
|---|---|---|
| 每年一次 | 2.000000 | 1.030000 |
| 每月一次 | 2.613035 | 1.030416 |
| 每天一次 | 2.714567 | 1.030453 |
| 每小时一次 | 2.718127 | 1.030454 |
| 连续计息(无穷细) | e ≈ 2.718282 | e0.03 ≈ 1.030455 |
利息拆得无限细,钱会不会无限多?不会。拆得越细,利息确实越多,但多出来的部分越来越少,最终有一个上限:年利率为 r 时,连续计息一年后的本息是 er 倍。对年化 3% 的理财来说,“按日计息”和“按年计息”一年只差万分之四点五左右;1 万元一年多出约 4.5 元。按日计息的意义主要在于灵活——随存随取、按天计息——而不是让钱多出很多。
真正让钱“滚起来”的不是拆得细,而是时间长。第 13 章会讲复利与时间的关系,以及金融里另一个著名的微积分公式。
10.2e 为什么特别:导数等于自己
连续计息的钱有一个性质:此刻增长的速度,正比于此刻的金额。账户里有 1 万元,每年按 3% 的速度长;长到 2 万元,就按每年 600 元的速度长。
写成方程:y ′ = r · y。满足它的函数是 y = C·ert。特别地,当 r = 1 时,ex 的导数就是它自己——这是表 5-1 里那一行的来历,也是 e 在数学中无处不在的原因:凡是“增长速度正比于自身大小”的东西,都会长成 e 的指数形状。
e ln自然常数 e 与自然对数 ln
怎么读:e 读作字母 e,英文 /iː/,中文近似“衣”;也叫“自然常数”或“欧拉数”。ln x 读作“自然对数 x”,英文常读 “log of x” 或逐字母读 “L-N x” /ɛl ɛn ɛks/。
从哪来:伯努利 1683 年发现了这个数,但用字母 e 表示它是欧拉在 18 世纪开始的。ln 是拉丁文 logarithmus naturalis(自然对数)的缩写。
为什么选它:常见说法是 e 取自 exponential(指数)的首字母;也有人说欧拉只是按顺序取了一个还没被占用的元音字母。欧拉本人没有留下解释,所以这一点只能存疑。
e 的反函数叫自然对数 ln。它回答相反的问题:要长到原来的几倍,需要多久?比如年利率 3% 连续复利,翻倍需要 ln 2 ÷ 0.03 ≈ 23 年。金融界常用的“72 法则”(72 ÷ 年利率百分数 ≈ 翻倍年数,这里是 24 年)就是它的心算版。
10.3微分方程:只写规律,不写答案
y ′ = ry 这样的式子,叫微分方程:它不直接告诉你 y 是什么,只告诉你 y 每一刻怎样变化。解微分方程,就是从“变化的规律”反推出“函数本身”。
微分方程像一份导航指令:“在每个路口,都朝着离家最近的方向走一步。”它没有画出整条路线,但只要知道你从哪里出发(初始条件),每一步都照做,路线就完全确定了。第 8 章那个“+C”,就是起点。
微分方程是
- 一条描述“每一刻怎样变”的规律,外加一个起点
- 自然科学最常用的语言:运动、传热、电路、化学反应、人口
微分方程不是
- 总能写出公式解的方程:大多数只能靠计算机一步步算
- 对未来的保证:规律本身若不准,或结果对起点过于敏感,预言也会失准
10.4衰减:同一个方程,四种面孔
把 r 换成负数,y ′ = −ky,得到的是指数衰减:减少的速度正比于剩下的量。它的特征是半衰期——无论剩多少,减半所需的时间都一样,等于 ln 2 ÷ k。
图 10-2一种半衰期为 6 小时的药物(示例参数),血药浓度每过 6 小时减半。曲线任一点的下降速度(红色切线的斜率)都与当时的浓度成正比。
- 药物代谢:大多数药物在体内的清除近似遵循这个规律。医生根据半衰期决定服药间隔——这是伏笔 D 的前一半,后一半留给下一章。
- 放射性衰变:碳-14 的半衰期约为 5730 年。生物死后停止吸收碳-14,测出遗骸中碳-14 还剩多少,就能反推它死了多久。剩 1/2 约 5730 年,剩 1/4 约 11,460 年。这就是考古学家给古代遗址“断代”的依据,也是伏笔 B 中“地下的年代”那一半。
- 冷却:一杯热咖啡降温的速度,正比于它与室温的温差(牛顿冷却定律)。用它可以算出一杯 90°C 的茶,放多久才降到适合入口的温度。
- 电容放电:电路里的电容放电时,电压同样按指数衰减。
10.5增长总有天花板:logistic 曲线
指数增长不可能永远持续。细菌在培养皿里起初成倍分裂,但营养和空间有限,增长终会放缓。1838 年,比利时数学家韦吕勒在 y ′ = ry 上加了一个“刹车”:
y ′ = ry(1 − y/K)K 是环境容量。y 很小时,括号约等于 1,近似指数增长;y 接近 K 时,括号趋于 0,增长停止
图 10-3起初两条曲线几乎重合;随后指数曲线一飞冲天,logistic 曲线则在接近环境容量时放缓,形成 S 形。
S 形曲线随处可见:新产品的市场渗透、传染病的累计感染人数、一个人学一门技能的熟练度。它提醒我们:看到一段指数增长时,要问天花板在哪里。把早期的指数趋势直接外推,是预测里最常见的错误之一。
10.6解不出公式怎么办:一步一步走出未来
大多数微分方程写不出公式解。但这难不倒我们,因为方程本身就是一份“每一步怎么走”的说明书。
最朴素的走法叫欧拉法(由 18 世纪的欧拉提出):站在起点,用方程算出此刻的斜率;沿着这个斜率走一小步;到了新位置,再算斜率,再走一步……这就是“放大看,曲线就变直”的又一次应用:在一小步之内,把曲线当作直线。
图 10-4用欧拉法求解 y ′ = y、y(0) = 1。步长为 1 时,4 步后得到 16;步长为 0.25 时,16 步后得到约 39.4;真值 e⁴ ≈ 54.6。步子越小越准,但计算量越大。
实际工程中用的是更精巧的方法(比如龙格–库塔法),思想却完全一样:把未来切成小段,每段按当下的变化规律走一步,再把所有步子累加起来——先放大,再切碎求和。
明天的天空还没发生,计算机凭什么算出来?答案就是图 10-4 的放大版。大气的运动遵循几条物理定律:动量守恒(风怎样被气压差推动)、质量守恒、能量守恒、水汽的蒸发与凝结。它们都是微分方程,说的是“此刻的空气状态决定了下一刻怎样变”。
气象局先测出“此刻”全球的气温、气压、湿度、风(初始条件),再让超级计算机按方程一小步、一小步地往前推,推出明天、后天的天空。难点在于规模:要把整个大气切成数以亿计的小格子。第 13 章会讲这件事的历史与现状。
本章带走
微分方程只写“每一刻怎样变”;给定起点,一步步累加,就能推出未来。
- e ≈ 2.71828:利息拆得无限细的极限;伏笔 C:钱不会无限多,er 是上限。
- ex 的导数是自己:凡增长速度正比于自身的量,都长成指数形状。
- 衰减 y ′ = −ky:药物、碳-14、冷却、放电,半衰期 = ln 2 / k。
- logistic:增长有天花板,S 形曲线。
- 欧拉法:沿当前斜率走一小步,再重复——天气预报的原理。
于是,下一个问题计算器只会加减乘除,它是怎样算出 eˣ 和 sin x 的?
11Chapter 11 · Series
级数:用无穷个简单拼出复杂
计算器只会加减乘除,它怎样算出 sin x 和 eˣ?
上一章留下的问题:计算器只会加减乘除,它是怎样算出 eˣ 和 sin x 的?
计算器的芯片里只有加法器和乘法器,却能在一瞬间给出 sin 0.5 = 0.4794255…。它是怎么做到的?答案藏在第 4 章芝诺那个问题里:无穷多个数加起来,可以是一个有限的数。如果能把 sin x 写成无穷多个简单项之和,只取前几项,就能用加减乘除把它算到任意精度。
11.1几何级数:最听话的无穷加法
第 4 章的 1/2 + 1/4 + 1/8 + … = 1,是几何级数的一个例子:每一项都是前一项乘以同一个比 q。只要 |q| < 1,它就有一个整齐的和:
a + aq + aq² + aq³ + … = a / (1 − q)推导:设和为 S,则 qS 恰好是 S 去掉第一项,所以 S − qS = a
这个公式能解释一个让很多人不服气的等式:0.999… = 1。0.999… 就是 0.9 + 0.09 + 0.009 + …,首项 0.9,公比 0.1,和为 0.9 ÷ 0.9 = 1。它不是“无限接近 1”,而是等于 1——因为一个无穷级数的值,被定义为它的极限。
11.2每一项都趋于 0,和却可能无穷大
如果一个无穷级数的每一项都越来越小、趋于 0,它的和一定是有限的吗?
不一定。最著名的反例是调和级数:1 + 1/2 + 1/3 + 1/4 + …。每一项都趋于 0,但和会无限增大,只是增大得极慢。
| 项数 n | 前 n 项和 |
|---|---|
| 10 | 2.93 |
| 100 | 5.19 |
| 1,000 | 7.49 |
| 1,000,000 | 14.39 |
为什么会发散?把项分组看:1/3 + 1/4 > 1/2,1/5 + … + 1/8 > 1/2,1/9 + … + 1/16 > 1/2……可以分出无穷多组,每组都大于 1/2,加起来当然没有尽头。这和第 9 章的图 9-2 是同一个现象:1/x 下的面积无限,1/x² 下的面积有限。
教训是:各项趋于 0 只是必要条件,还要趋于 0 得足够快。数学家为此发明了许多“收敛判别法”,核心思路都是拿待判断的级数去和几何级数这样“已知听话”的级数比较:如果它的项最终缩小得比某个公比小于 1 的几何级数还快,它就一定收敛。
11.3泰勒级数:用多项式模仿任何光滑函数
多项式(a + bx + cx² + …)是计算器最擅长的东西:只需要乘法和加法。那么,能不能造一个多项式,让它在某点附近和 sin x 一模一样?
先只要求在 x = 0 处“值相同”。sin 0 等于多少?
0。所以常数项是 0。
再要求“斜率相同”。sin x 在 0 处的导数是 cos 0 = 1。
那就加一项 x,它在 0 处的斜率也是 1。这就是第 4 章的 sin x ≈ x——放大看,曲线就变直。
再要求“弯曲程度”也相同,也就是二阶导数、三阶导数……都相同呢?
那就一项一项往上加:每多匹配一阶导数,就多一项,模仿得就更像。
按这个思路一直做下去,得到的就是泰勒级数(英国数学家泰勒于 1715 年发表):
sin x = x − x³/3! + x⁵/5! − x⁷/7! + …
ex = 1 + x + x²/2! + x³/3! + x⁴/4! + …n!(读作 n 的阶乘)= 1 × 2 × … × n,增长极快,所以后面的项缩小得极快
图 11-1黑色是 sin x。只取 1 项(x)时,只在原点附近贴合;取到 3 次、5 次、7 次项时,贴合的范围一次比一次宽。只要项数足够多,在任何有限范围内都能贴到你想要的精度。
泰勒级数像一位模仿秀演员逐步学一个人:先学他站的位置(函数值),再学他走路的方向(一阶导数),再学他转弯的习惯(二阶导数),再学更细微的小动作……学得越细,越难分辨真假。
泰勒级数能做到
- 用加减乘除,把 sin、cos、eˣ 等算到任意精度
- 在展开点附近,用前几项给出很好的近似
泰勒级数不保证
- 对任何函数、在任何范围都收敛(例如 ln(1 + x) 的级数只在 −1 < x ≤ 1 内收敛)
- 离展开点很远时,前几项仍然准确
11.4亲手当一回计算器
算 sin 0.5,只取前三项:
0.5 − 0.125/6 + 0.03125/120 = 0.5 − 0.0208333 + 0.0002604 = 0.4794271真值 0.4794255…,只用三项,误差已不到百万分之二
算 e(即 e¹),取前 7 项:1 + 1 + 0.5 + 0.16667 + 0.04167 + 0.00833 + 0.00139 = 2.71806;取前 11 项,得到 2.7182818,已经准确到小数点后 7 位。
实际的计算器和电脑芯片还会配合其他技巧:先利用周期性把角度缩到很小的范围(小角度时级数收敛得最快),再用专门优化过的多项式;有些芯片用一种叫 CORDIC 的“旋转逼近”算法。但核心思想始终是同一个:用有限次的加减乘除,去逼近一个无穷过程的极限。
11.5误差:知道自己错多少,才敢用
工程师从不追求“精确”,而是追求“误差已知且足够小”。泰勒级数的好处在于,截断之后的误差可以估计:对于正负交替、项越来越小的级数(比如 sin),误差不超过第一个被扔掉的项。上面算 sin 0.5 时,扔掉的第一项是 0.5⁷/5040 ≈ 0.0000016,实际误差正在这个范围内。
“够用就好”是微积分思维的重要一面:GPS 定位、飞行控制、股票期权定价,所用的都不是精确值,而是误差被严格控制的近似值。
11.6一日三次:药物的几何级数
现在回到伏笔 D 的后一半。
图 11-2每 8 小时服一剂,药物半衰期也是 8 小时(示例参数)。下一剂服下时,上一剂还剩一半,于是浓度锯齿状上升:每次服药后的峰值为 1、1.5、1.75、1.875……逐渐稳定在 2。
服下第 n 剂后的峰值是 1 + 1/2 + 1/4 + … + 1/2n−1,一个几何级数。服药次数趋于无穷时,峰值趋于 1 ÷ (1 − 1/2) = 2。药量不会无限累积,而是停在一个稳态上。几次服药后,离稳态就不远了:4 个半衰期后达到稳态的约 94%,5 个半衰期后约 97%。这就是为什么很多药要“连续服用几天才起效”。
为什么一日三次,而不是一次吃三片?比较两种服法(半衰期 8 小时,每天总量 3 片,示例参数):
| 服法 | 稳态峰值 | 稳态谷值 | 峰谷比 |
|---|---|---|---|
| 每 8 小时 1 片 | 2.0 | 1.0 | 2 倍 |
| 每 24 小时 3 片 | 3.43 | 0.43 | 8 倍 |
一次吃三片,峰值高出七成以上,更容易越过“中毒线”;到下一次服药前又跌到很低,可能掉出“有效线”。分三次服,浓度就被稳定在有效和安全之间的“治疗窗”里。稳态峰值来自几何级数:每 24 小时 3 片时,一天后只剩 1/8,峰值 = 3 ÷ (1 − 1/8) ≈ 3.43。第 13 章会讲药厂怎样用积分评估一种药。
11.7另一种无穷拼图:傅里叶级数
泰勒用多项式拼函数。1807 年前后,法国的傅里叶在研究热传导时提出了另一种拼法:任何周期性的信号,都可以拆成许多不同频率的正弦波之和。
这个想法后来无处不在:音乐播放器把声音拆成频率,扔掉人耳听不见的成分来压缩文件;降噪耳机测出噪声的频率,再发出反相的声波去抵消;图片压缩格式 JPEG 用的是它的近亲(离散余弦变换);Wi-Fi 和 5G 同时在许多频率上传输数据。它们都在做同一件事:把复杂的东西拆成无穷多个简单的东西,只保留需要的那些。
本章带走
无穷多个简单项可以拼出一个复杂函数;截取前几项,就能用加减乘除把它算到需要的精度。
- 几何级数 a/(1 − q);0.999… = 1。
- 调和级数发散:各项趋于 0 还不够,要足够快。
- 泰勒级数:逐阶匹配导数,用多项式模仿函数;计算器由此算出 sin 与 eˣ。
- 伏笔 D:药量按几何级数趋于稳态;分次服用让浓度留在治疗窗内。
- 傅里叶级数:把信号拆成正弦波,现代音频、图像、通信都依赖它。
于是,下一个问题到目前为止,变化只沿一个方向。气温却同时随经度、纬度、高度和时间变化——怎么办?
12Chapter 12 · Many variables
走向多维:偏导数、梯度与重积分
当变化来自多个方向,微积分如何扩展?
上一章留下的问题:到目前为止,变化只沿一个方向。气温却同时随经度、纬度、高度和时间变化——怎么办?
好消息是:多元微积分没有新思想。它只是把“放大”和“切碎再加起来”搬到了更多的方向上。这一章是大一微积分的最后一块积木,也是通往天气预报、人工智能和工程优化的门。
12.1多元函数:一张等高线地图
地面上每一点都有一个海拔。给出经度和纬度两个输入,得到一个输出——这是一个二元函数 h(x, y)。
它的图像是一片起伏的曲面,很难画在纸上。地图绘制者早就找到了办法:把海拔相同的点连成线,画成等高线地图。你在徒步地图上见过它:线越密的地方,坡越陡。天气图上的等压线、等温线,也是同一回事。
12.2偏导数:一次只动一个
你站在山坡上,问“这里有多陡”,能给出一个数吗?
不能。朝东走可能很陡,朝北走可能是平的。坡度取决于方向。
那先简化一下:只朝正东走,坡度是多少?
只动 x、把 y 当常数,这就回到了一元函数,照常求导就行。
再只朝正北走呢?
只动 y、把 x 当常数,再求一次导。
“只让一个变量动、其他变量冻住”时求出的导数,叫偏导数,记作 ∂h/∂x 和 ∂h/∂y。例如 h = x² + 3xy:∂h/∂x = 2x + 3y,∂h/∂y = 3x。
∂偏微分号 · partial
怎么读:中文读“偏”,∂h/∂x 读作“h 对 x 的偏导数”或“偏 h 偏 x”;英文 partial /ˈpɑːʃəl/(美式 /ˈpɑːrʃəl/),读作 “partial h, partial x”。也有人读作 “del”,但容易和下面的 ∇ 混淆。
从哪来:它不是希腊字母,而是手写体小写 d 的一种弯曲写法。法国数学家勒让德 1786 年首先用它,后来被放弃;1841 年德国数学家雅可比重新启用,从此固定下来。
为什么选它:它仍然是一个“d”,提醒你这是导数;只是故意写弯,告诉你“只对这一个变量求导,其他变量不动”,和普通的 d 区分开。
偏导数是经济学家最爱的工具之一。“其他条件不变的情况下,价格每涨 1 元,销量减少多少”——这句经济学里的套话,说的正是一个偏导数。
12.3梯度:最陡的上坡
把两个偏导数排成一对,(∂h/∂x, ∂h/∂y),就得到一个箭头,叫梯度,记作 ∇h。它有两个性质:
- 方向:指向该点上坡最陡的方向,且总是与等高线垂直。
- 长度:就是那个最陡方向上的坡度。
∇nabla(纳布拉)· 梯度算子
怎么读:英文读 nabla /ˈnæblə/,中文近似“纳布拉”;也常读作 del /dɛl/。∇h 读作 “nabla h” 或 “grad h”(梯度 h,grad /ɡræd/ 是 gradient 的缩写)。
从哪来:它的形状是一个倒过来的大写 Δ。19 世纪英国和爱尔兰的数学物理学家开始用它;“nabla”这个名字来自一种形状相似的古代竖琴(希腊语 νάβλα),最初带点玩笑意味。
为什么选它:Δ 表示“变化”,把它倒过来,表示把各个方向上的变化率(偏导数)收集到一起,组成一个指向最陡上坡的箭头。
图 12-1两座山丘的等高线地图。每个红色箭头是该点的梯度:它垂直于等高线、指向上坡;等高线越密,箭头越长。沿任何其他方向的坡度,都等于梯度在那个方向上的投影,这叫方向导数。
为什么一对偏导数就能决定所有方向的坡度?还是“放大看,曲线就变直”:光滑的曲面放大到足够细,局部就是一块平面(切平面)。平面的倾斜只需要两个数来描述——东西方向的坡度和南北方向的坡度。一元时是“曲线局部是直线”,二元时是“曲面局部是平面”,思想完全一样。
12.4梯度下降:人工智能怎样学习
反过来走,沿负梯度方向,就是最陡的下坡。这一点支撑着今天整个人工智能行业。
训练一个 AI 模型,本质是在找一组参数,让“预测误差”最小。误差是参数的函数——只不过参数不是 2 个,而可能是几十亿、上千亿个。你无法画出这座“误差地形”,但可以站在当前位置,算出梯度,然后朝下坡方向迈一小步;再算梯度,再迈一步……
图 12-2在一只椭圆形的“误差碗”里做梯度下降。每一步都沿当前最陡的下坡方向走一小段,折线逐渐落到碗底。碗越扁,路线越容易左右摇摆,这正是工程师要调节“步长”(学习率)的原因。
那么梯度怎么算?模型是一层套一层的函数,参数的影响要穿过许多层才能传到最终误差上——这正是第 5 章的链式法则。把链式法则从输出端往输入端系统地倒推一遍,就能高效地算出误差对每个参数的偏导数,这个算法叫反向传播。一个大语言模型的训练,就是在一个维度极高的曲面上,反复执行“链式法则求梯度、沿负梯度走一步”。
梯度下降能做到
- 在无法画出、维度极高的地形上找到低处
- 只需要知道“此处”的坡度,不需要看到全局
梯度下降不保证
- 找到全局最低点:它可能停在某个局部的小坑里
- 走得快:步子太大会来回震荡,太小又慢
12.5重积分:切成小方柱
一元积分把区间切成小段;二元积分就把平面区域切成小方格。求一座山的土方量:把地图切成许多小方格,每格上方的土柱体积 ≈ 海拔 × 方格面积,全部加起来。
体积 = ∬ h(x, y) dx dy两个积分号:在两个方向上切碎,再加起来
实际计算时,常常一次只积一个方向:先把每一条东西向的“切片”积出面积,再把所有切片沿南北方向积起来。这正是祖暅“切片求体积”思想的直接推广。三重积分同理:第 9 章说的地下矿体产生的重力,就是在三维空间里把每一小块的贡献加起来。
12.6有约束的最优:拉格朗日一瞥
现实中的优化几乎总有约束:预算有限、材料有限、时间有限。比如要在“成本不超过 100 万”的前提下让产量最大。
拉格朗日在 18 世纪给出了一个几何上很漂亮的答案:在最优点,目标函数的等高线恰好与约束曲线相切——两者的梯度指向同一条直线。如果不相切,沿着约束线再挪一点,目标还能更好。这个方法叫拉格朗日乘子法,是经济学、工程设计、机器学习中约束优化的起点。
12.7偏微分方程:天气、热与波
第 10 章的微分方程只有一个自变量(时间)。当一个量同时随空间和时间变化——比如一块铁板上各点的温度、大气中各处的风速——描述它的规律就要用偏导数写成,叫偏微分方程。
- 热传导方程:某点温度升高的速度,取决于它比周围平均温度低多少。热量总是从热处流向冷处,把起伏抹平。
- 波动方程:描述声波、地震波、光波怎样传播。第 13 章的地震勘探靠的就是它。
- 纳维–斯托克斯方程:描述流体(空气、水)的运动,是天气预报和飞机设计的核心。
这些方程大多没有公式解,只能用第 10 章的思路:把空间切成网格、把时间切成小步,让计算机一格一格、一步一步地推。
| 一元微积分 | 多元微积分 | 不变的思想 |
|---|---|---|
| 导数 dy/dx | 偏导数、梯度 ∇f | 放大看:曲线变直线,曲面变平面 |
| 导数为 0 找极值 | 梯度为 0 找极值;梯度下降 | 山顶与谷底处不升不降 |
| 定积分 ∫ | 二重、三重积分 ∬、∭ | 切碎再加起来 |
| 常微分方程 | 偏微分方程 | 只写每一刻、每一处怎样变 |
本章带走
多元微积分没有新思想:放大看,曲面就变平;切成小方柱,再加起来。
- 偏导数:一次只动一个变量;梯度:最陡上坡的方向与坡度。
- 梯度下降 + 链式法则(反向传播)= 今天训练人工智能的核心。
- 重积分:在多个方向上切碎求和;土方量、质量、重力都这样算。
- 拉格朗日乘子:约束下的最优点,等高线与约束线相切。
- 偏微分方程描述热、波和流体;天气预报就是求解它们。
于是,下一个问题工具已经齐全。走出教室,看它们在真实世界里怎样工作。
13Chapter 13 · Calculus at work
微积分在现实世界
天气、地质、复利、制药、供应链、航天……微积分在其中做了什么?
上一章留下的问题:工具已经齐全。走出教室,看它们在真实世界里怎样工作。
第 1 章在你的一天里埋下了六个伏笔。一路走来,每个伏笔都被回收了一部分。现在,所有工具都已在手,我们逐一把它们讲完。每一节都从当初那个问题开始。
13.1天气预报:把明天算出来
07:30 出门前看天气
明天的天空还没有发生,计算机凭什么把它算出来?
第一次世界大战期间,英国气象学家理查森在法国前线当救护车司机。他在战斗间隙做了一件前无古人的事:只用纸笔和计算尺,按照大气物理的微分方程,从 1910 年 5 月 20 日早上 7 点的观测数据出发,手算未来 6 小时的天气。
结果是一次惨败:他算出的气压在 6 小时内变化了 145 百帕,而实际气压几乎没变。几十年后,气象学家林奇重新检查他的计算,发现方法本身是对的,问题出在初始数据里的“噪声”没有被平滑掉;加上平滑后,理查森的结果基本准确。
1922 年,理查森把这项工作写成《用数值方法预报天气》出版,并在书中畅想了一座“预报工厂”:一座巨大的球形大厅,墙上画着世界地图,64,000 名计算员分坐各处,每人负责一小块区域,在指挥者的协调下同步计算,才能让计算速度赶上天气变化的速度。
理查森的梦想,是在 1950 年才第一次实现的。那一年,查尼、冯·诺伊曼等人用电子计算机 ENIAC 完成了第一次数值天气预报:算出 24 小时后的天气,大约也用了 24 小时。今天的做法与理查森一脉相承:
图 13-1数值天气预报的三步:把大气切成三维网格;每个格子记录气温、气压、湿度和风;按物理方程算出每格此刻的变化率,乘以一小段时间,得到下一刻的状态,再一步步推向明天。这就是第 10 章欧拉法的全球版。
- 放大:物理定律都写成偏微分方程(第 12 章),告诉我们每个格子“此刻”怎样变化。
- 切碎,再加起来:时间切成几分钟一步,每一步把变化率乘以步长、累加到当前状态上(第 10 章)。
- 规模:欧洲中期天气预报中心(ECMWF)的全球模式,水平格距约 9 公里,垂直方向分为 137 层。粗略算一下:地球表面约 5.1 亿平方公里,每格约 81 平方公里,约 630 万个“气柱”,再乘以 137 层,约 8.6 亿个格点——理查森的 64,000 人即使算上一辈子也跟不上。
进步是实实在在的。据气象学家鲍尔等人 2015 年在《自然》杂志上的综述(估算),数值预报的准确度大约每十年提前一天:今天的 5 天预报,和几十年前的 3 天预报差不多准。
那“降水概率 70%”又是什么意思?1963 年,气象学家洛伦茨发现,大气对初始条件高度敏感,初值里微小的误差会随时间放大——这就是“蝴蝶效应”,也是第 10 章说的“微分方程不是对未来的保证”。于是气象中心会把初始状态做几十种微小扰动,各算一遍,得到一组“集合预报”;再结合统计校正,给出概率。它的含义接近于:在类似的条件下,大约 10 次里有 7 次会下雨。
13.2地质勘测:听地下的回声
08:10 地铁穿过城市地下
看不见地下,怎样知道几公里深处是什么?
第 9 章讲了重力勘探,第 10 章讲了碳-14 测年。地质学家手里最强大的工具,是第三种:地震勘探。
图 13-2在地面用炸药或可控震源车制造一次“人工地震”,声波向地下传播,在不同岩层的分界面上反射回来,被一排检波器记录下来。界面越深,回波到得越晚。
最简单的情形里,深度 ≈ 波速 × 回波时间 ÷ 2。可是岩层的波速随深度变化,界面也高低起伏。真正的计算要用到第 12 章的波动方程:它描述声波在每一点怎样随时间变化。勘探公司做的是一个巨大的反问题——先猜一个地下结构,用波动方程模拟出“应该听到的回声”,与实际记录比较,再用第 12 章的梯度下降去修改猜测,直到模拟与实测吻合。这种方法叫“全波形反演”,计算量之大,让石油勘探长期是超级计算机的大用户。
同样的数学也在保护城市。地铁和高楼动工前,工程师用浅层地震和钻孔资料判断地下有没有溶洞、流沙;地震预警系统则利用两种地震波的速度差:纵波(P 波)每秒约 6 公里,横波(S 波)约 3.5 公里且破坏性更强。离震中 100 公里的城市,P 波约 17 秒到达,S 波约 29 秒到达,中间十来秒就是逃生时间。
13.3投资复利:时间才是指数的燃料
12:00 午休时看一眼银行 App
如果把计息拆得无限细,钱会不会变得无限多?
第 10 章已经回答:不会,上限是 er。拆细带来的差别很小,真正让复利显出威力的是时间。连续复利下,本金 P 在 t 年后变成 Pert,t 在指数上。
| 年数 | 年化 3% | 年化 7% |
|---|---|---|
| 10 | 13,499 | 20,138 |
| 20 | 18,221 | 40,552 |
| 30 | 24,596 | 81,662 |
| 40 | 33,201 | 164,446 |
年化 7% 时约每 10 年翻一倍(ln 2 ÷ 0.07 ≈ 9.9 年)。示例不代表任何产品的收益承诺。
表里有两个值得反思的地方。第一,利率从 3% 到 7%,差距看似只有 4 个百分点,40 年后结果却相差约 5 倍——因为差距在指数上被放大。第二,前 10 年的增长看起来平淡无奇,后 10 年才“起飞”。指数增长的曲线在早期几乎是平的,这让很多人过早放弃。
金融里另一个著名的微积分成果是 1973 年的布莱克–斯科尔斯公式,用来给期权定价。它把股价看作随机波动的量,推导出一个偏微分方程——形式上和第 12 章的热传导方程是近亲。1997 年,斯科尔斯和默顿因此获得诺贝尔经济学奖(布莱克已于 1995 年去世)。
微积分在金融里能做
- 精确计算复利、折现、按揭月供
- 在给定假设下为风险定价、衡量敏感度
微积分不能做
- 预测明天的股价
- 保证模型的假设(比如“波动率不变”)在真实市场里成立
13.4生物制药:一条曲线下的面积
13:00 饭后吃药
为什么是分三次,而不是早上一次吃三片?天天吃,药会不会在身体里越积越多?
第 11 章用几何级数回答了:药量会趋于稳态,不会无限累积;分次服用让浓度留在治疗窗里。现在看药厂怎样用微积分评价一种药。
图 13-3口服一剂药后的“药时曲线”(示例参数):药物先被吸收,浓度上升到峰值 Cmax,随后按半衰期衰减。三个关键数字:峰浓度 Cmax、达峰时间 Tmax,以及曲线下面积 AUC。
这条曲线本身来自微分方程。药理学家把人体简化为几个“房室”(比如胃肠道和血液),写出药物在房室之间转移、被清除的速率方程:吸收的速度正比于胃肠道里剩下的药,清除的速度正比于血液里的药。解出来就是图中先升后降的曲线。
AUC 是一个积分:∫ C(t) dt,衡量身体在整个过程中“总共暴露于”多少药物(第 7 章表 7-2)。它在药品审批中举足轻重。仿制药要上市,必须证明与原研药生物等效:在健康受试者身上测量两者的 AUC 和 Cmax,其比值的 90% 置信区间必须落在 80% 到 125% 之间。你在药店买到的每一盒仿制药背后,都有一次这样的积分比较。
13.5供应链:平坦的谷底
18:30 外卖与快递
一次进多少货最划算?这个“最划算”的点在哪里?
第 6 章已经求出经济订货批量 Q* = √(2DS/H)。把成本曲线画出来,还能看到一个公式里看不到的道理。
图 13-4第 6 章的示例:年需求 10,000 件、每次订货 200 元、每件年持有成本 4 元。订货成本随订货量增大而下降,持有成本随之上升,总成本在 Q = 1000 处最低,为 4000 元。注意谷底非常平坦。
如果仓库经理算错了,每次订 800 件或 1250 件,而不是 1000 件,总成本会高出多少?
只高出 2.5%。订 800 件:2500 + 1600 = 4100 元;订 1250 件:1600 + 2500 = 4100 元。订货量偏离最优值 20%–25%,成本只多 2.5%。
原因在于最优点处导数为 0:谷底的切线是水平的,“放大看,曲线就变直”,而且变成了一条平线。离最优点不远时,成本几乎不变。这给了管理者一个重要的启示:在最优点附近,不必追求精确,把精力放在防止大偏差上更划算。
真实的供应链比 EOQ 复杂得多:需求在波动,运输有延迟,一个仓库要为上千种商品同时决策。这时,导数的另一面开始发挥作用。著名的牛鞭效应说的是:零售端需求的一点小波动,传到批发商、厂家、原料商那里会越放越大。原因之一是每一级都在对下游订单的变化率作出反应,而且总想多备一点以防万一,于是每经过一级,波动都被放大一次。理解这一点的公司会共享终端销售数据,让上游看到真实的需求,而不是被放大过的订单。
13.6航空航天:从火箭方程到轨道
21:00 新闻里的火箭发射
一枚火箭装多少燃料,最后才能跑到足够快、进入太空?
图 13-5火箭方程 Δv = ve ln(m0/mf),喷射速度取 3 公里/秒(示例)。质量比为 10 时只有 6.9 公里/秒;要达到入轨所需的约 9.4 公里/秒(含重力与空气阻力损耗,估算),质量比要约 23,即 96% 的起飞质量都是燃料。
第 9 章从 dv = −ve dm/m 积分得到了火箭方程。对数增长得太慢,单级火箭几乎不可能把有效载荷送入轨道,于是工程师想出了多级火箭:第一级燃料烧完就把沉重的空壳扔掉,第二级从一个更轻的起点重新开始“对数增长”。每一级的 Δv 相加,就能达到单级做不到的速度。
火箭进入太空后,它的运动由牛顿第二定律决定:加速度 = 引力 ÷ 质量。这是一个微分方程,轨道计算就是一步步对它积分。1962 年,美国宇航员格伦执行首次环绕地球轨道飞行前,坚持要求 NASA 的数学家凯瑟琳·约翰逊用手算核对电子计算机给出的轨道数据——她的故事后来被拍成了电影《隐藏人物》。今天,空间站的轨道维持、探测器的借力飞行、卫星星座的调度,依然是这件事的延续。
在大气层里,飞机的升力等于机翼表面每一处压力的积分;飞控计算机每秒数百次地读取加速度计,把加速度积分成速度、再积分成位置。每一次平稳的起降背后,都有无数次“切碎,再加起来”。
13.7更多:同一套思想,无数种面孔
- 医学影像:CT 从成千上万个角度的积分反推人体各处的密度(第 9 章)。
- 流行病:1927 年克马克和麦肯德里克提出 SIR 模型,用三个微分方程描述易感者、感染者、康复者之间的转移。它给出了“基本再生数” R0 的概念:R0 > 1 时疫情扩散,< 1 时消退;群体免疫的门槛约为 1 − 1/R0。
- 人工智能:梯度下降与反向传播(第 12 章)。
- 手机导航:芯片把加速度和角速度不断积分,在隧道里暂时没有卫星信号时推算你的位置。
- 新能源:电池管理系统对电流积分,估算“还剩多少电”。
| 伏笔 | 领域 | 核心问题 | 微积分工具 | 章节 |
|---|---|---|---|---|
| A | 天气预报 | 从此刻推出明天 | 偏微分方程、欧拉法(数值积分) | 10、12 |
| B | 地质勘测 | 从地面信号反推地下 | 重力积分、指数衰减、波动方程、梯度下降 | 9、10、12 |
| C | 投资复利 | 拆细与时间的效应 | 极限 e、指数函数、偏微分方程 | 4、10 |
| D | 生物制药 | 给药方案与药物评价 | 微分方程、几何级数、积分 AUC | 7、10、11 |
| E | 供应链 | 最优订货与波动放大 | 导数为 0 求最优、变化率 | 6 |
| F | 航空航天 | 速度与轨道 | 积分、对数、微分方程 | 9、10 |
回头看这张表,你会发现一个共同的结构:人们能直接写下的,是“每一刻、每一处怎样变化”;人们想知道的,是“整体会怎样”。放大,是为了写下局部的规律;切碎再加起来,是为了从局部拼出整体;而基本定理保证了这两者可以互相转换。
本章带走
六个日常伏笔背后是同一个结构:已知局部的变化规律,求整体的结果。
- 天气预报:偏微分方程 + 一步步数值积分;蝴蝶效应让预报只能给出概率。
- 地质勘测:用波动方程模拟回声,再反推地下结构。
- 复利:拆细有上限 er,时间才是指数的燃料。
- 制药:药时曲线来自微分方程,AUC 是积分,仿制药要过 80%–125% 这道关。
- 供应链:最优点附近的成本曲线很平坦;牛鞭效应是变化率被逐级放大。
- 航天:火箭方程来自积分,对数增长太慢,所以要分级。
于是,下一个问题工具可以借用,思维却要自己长出来。拥有与缺乏“微积分思维”,差别在哪里?
14Epilogue · Thinking in calculus
微积分思维:回到速度表上的 72
微积分思维是什么?读完你该带走什么?
上一章留下的问题:工具可以借用,思维却要自己长出来。拥有与缺乏“微积分思维”,差别在哪里?
你也许永远不会亲手去解一个偏微分方程。天气预报有气象局,药物剂量有医生,火箭有工程师。那么,读完这本书,你的生活会有什么不同?
本章的回答是:微积分真正值得带走的,是一种看世界的方式。它由四个习惯组成。
14.1习惯一:放大看——复杂的东西,局部往往简单
面对一个复杂的问题,先问:在足够小的范围里,它像什么简单的东西?
一个大项目看起来无从下手,但它的下一周往往是清楚的;一个非线性的系统难以预测,但在工作点附近可以当作线性处理。这是“放大看,曲线就变直”的日常版本。
它同时带着一条警告:局部的直线不能无限延长。把过去三个月的趋势画成直线外推十年,就是把切线当成了曲线。线性近似的价值,恰恰在于你知道它在哪里失效。
14.2习惯二:看变化率,而不只看数值
缺乏这个习惯的人看“水平”:今天多少钱,这个月多少人。拥有它的人还会看变化率和变化率的变化率:它在涨还是在跌?涨得越来越快还是越来越慢?
经济学里的“边际”就是导数:再多生产一件,成本多多少;再多学一小时,成绩多多少。很多决策的关键不在于总量,而在于边际——当边际收益降到边际成本以下,就该停了。
14.3习惯三:区分“流量”和“存量”——总量是累积出来的
浴缸里的水量是存量,水龙头的流速和下水口的流速是流量。存量是净流量的积分。这个区分简单,却常常被忽视。
一个国家的碳排放量今年比去年减少了 5%,大气中的二氧化碳浓度会下降吗?
不一定,而且在短期内通常不会。排放量是流量(往浴缸里放水的速度),大气中的浓度是存量(浴缸里的水)。只要排放的速度仍然大于海洋和植被吸收的速度,浴缸里的水就会继续上涨,只是涨得慢一点。
要让浓度下降,必须让净流量变成负数。混淆流量和存量,是公共讨论里最常见的误解之一。同样的道理适用于国债与赤字、体重与热量、知识与每日学习。
积分思维还提醒我们:微小的流量,经过足够长的时间,会累积成巨大的存量。每天多读 20 页书,一年约 7300 页,二三十本书;第 13 章的复利表里,40 年的差距大部分出现在最后十几年。
14.4习惯四:逼近与误差——够用,并且知道差多少
极限教会我们:无法一步到达的东西,可以通过无穷多个小步逼近;而逼近的每一步,都应当知道自己离目标还差多少。
这个习惯让人既不完美主义,也不草率。第 13 章的订货问题里,最优点附近的成本曲线很平:偏离 20%,成本只多 2.5%。许多决策都是如此,在最优点附近不必苛求,要防的是大偏差。第 11 章的泰勒级数则说明:一个好的近似,一定附带一个误差估计。
微积分思维是
- 放大看局部、盯住变化率、区分流量与存量、带着误差去逼近
- 从“每一刻怎样变”推出“整体会怎样”的习惯
微积分思维不是
- 会背公式、会做习题
- 认为一切都能算准:蝴蝶效应和模型假设都在提醒我们谦逊
14.5有与没有的差别
| 情境 | 缺乏微积分思维 | 拥有微积分思维 |
|---|---|---|
| 新闻:“物价涨幅收窄” | 物价要降了 | 物价仍在涨,只是涨得慢了(二阶导数为负) |
| 碳排放下降 5% | 问题开始解决了 | 存量仍在增加,除非净流量转负 |
| 某指标连续三个月翻倍 | 照这个速度,一年后涨 4000 倍 | 指数增长必有天花板,S 形曲线的拐点在哪? |
| 区间测速:平均 120,限速 100 | 我每一刻都没超速 | 平均 120,必有一刻恰好 120(中值定理) |
| 理财产品“按日计息” | 拆得越细收益越高 | 拆细有上限 er,时间和利率才是关键 |
| 一日三次服药 | 一次吃三片更省事 | 分次服用,浓度才留在治疗窗里 |
| 纠结方案是否最优 | 必须找到唯一最佳 | 最优点附近很平坦,先排除大偏差 |
| 天气预报说 70% 降水 | 预报又不准 | 初值敏感的系统只能给出概率 |
14.6回到速度表上的 72
现在,让我们回到本书的第一页:速度表上那个“此刻 72 公里/小时”。
开篇时,它是一个悖论:一瞬间走 0 米、用 0 秒,0 ÷ 0 没有意义。现在你可以这样解释它:在那一刻前后取越来越短的时间段,平均速度去往的那个数是 72——它是一个极限,是位置曲线在那一点的切线斜率,是导数。你还知道,把这块表每一刻的读数“切碎再加起来”,就得到里程表上的数字;而这两块表之间的关系,就是微积分基本定理。
再回想那两个年轻人。一个在英格兰乡间从运动出发,一个在巴黎从数学新手起步;走的路不同,看到的却是同一座山。他们后来为“谁先登顶”争论了多年,可站在三百年后回看,更值得记住的是另一件事:微积分本身,就是一个积分。芝诺提出问题,阿基米德和刘徽切片逼近,开普勒、卡瓦列里、费马、巴罗各自摸到边角,牛顿和莱布尼茨看清了那座桥,柯西和魏尔斯特拉斯打牢了地基——无数人的微小贡献,在两千年里一点一点累加成了今天的总量。
1675 年,牛顿在给胡克的信里写下那句名言:“如果说我看得更远,那是因为我站在巨人的肩膀上。”这句话,正是积分的精神。读完这本书,你也站到了这些巨人的肩膀上。
图 14-1全书认知阶梯总图。每一级是一块积木,配一个隐喻和一句可以复述的话。如果你能从下往上把这十一句话讲给别人听,你就已经理解了大一微积分的骨架。
14.7核心贡献
- 微积分只回答两个问题。此刻变得多快(导数)?一共变了多少(积分)?麻烦只来自“不均匀”。
- 放大看,曲线就变直。光滑的变化在足够小的尺度上是线性的;导数就是那条直线的斜率,极限让“一瞬间”有了严格的意义。
- 切成碎片,再加起来。不均匀的总量,切成近似均匀的小块,逐块相乘再求和;积分就是这个过程的极限。
- 变化率与总量,是同一件事的两面。基本定理把无穷求和变成一次减法,把两千年的难题变成标准算法。
- 从规律推出未来。微分方程只写“每一刻怎样变”,给定起点,就能一步步算出天气、药量、轨道。
- 它是一种思维。看局部、看变化率、分清流量与存量、带着误差逼近——这四个习惯,在读完这本书之后仍然有用。
14.8留给你的问题
- 你的工作或生活里,哪一个指标你一直只看“数值”,却从没看过它的“变化率”?如果开始看,你的判断会变吗?
- 找一个你关心的“存量”(存款、体重、技能、信任)。它的流入和流出分别是什么?净流量现在是正还是负?
- 最近一次你把短期趋势直线外推,结果错了吗?那条“切线”在哪里开始偏离了曲线?
- 你正在纠结的某个决定,最优点附近是平坦的还是陡峭的?如果是平坦的,你是否在为一点点差距付出过多的精力?
- 莱布尼茨的符号让千千万万后来者更轻松地思考。在你的领域里,你能做的哪件小事,能像一个好符号那样,让更多人用上一个好想法?
14.9术语小词典
- 函数
- 每个输入对应唯一输出的规则(第 3 章)
- 斜率 / 变化率
- 输出的变化 ÷ 输入的变化,单位里有个“每”(第 3 章)
- 极限
- 一个过程“去往”的确定的数,不要求真的到达(第 4 章)
- 连续
- 极限值等于实际值;笔不离纸(第 4 章)
- 导数
- 平均变化率的极限;切线斜率;瞬时速度(第 5 章)
- 链式法则
- 变化率沿链条相乘:dy/dx = dy/du · du/dx(第 5 章)
- 中值定理
- 必有一刻的瞬时变化率等于平均变化率(第 6 章)
- 定积分
- 切成细条、逐条相乘、全部相加的极限(第 7 章)
- 基本定理
- 求导与积分互为逆运算;∫ab f = F(b) − F(a)(第 8 章)
- 原函数
- 导数等于 f 的函数,彼此相差常数 C(第 8 章)
- 反常积分
- 积分区间无限长或函数无界时,用极限定义的积分(第 9 章)
- e
- (1 + 1/n)n 的极限,约 2.71828;eˣ 的导数是它自己(第 10 章)
- 微分方程
- 描述“每一刻怎样变”的方程;加上起点即可推出未来(第 10 章)
- 泰勒级数
- 逐阶匹配导数,用多项式逼近函数(第 11 章)
- 偏导数 / 梯度
- 只动一个变量时的导数;最陡上坡的方向与坡度(第 12 章)
14.10符号读音表
本书用到的希腊字母与数学符号都汇总在这里。读音以国内课堂通行的英文读法为准,音标为英式;中文近似读音只是帮助记忆,和原音并不完全一样。
| 符号 | 英文名 | 音标 | 中文近似 | 来源 | 在本书中的意思 | 首次细讲 |
|---|---|---|---|---|---|---|
| Δ / δ | delta | /ˈdɛltə/ | 德尔塔 | 希腊字母第 4 个(相当于 D) | Δ:一段有限的变化;δ:很小的范围 | 3、4 |
| ε | epsilon | /ˈɛpsɪlɒn/ | 艾普西隆 | 希腊字母第 5 个(单纯的 e) | 很小的误差(法语 erreur) | 4 |
| π | pi | /paɪ/ | 派 | 希腊字母第 16 个 | 圆周 ÷ 直径(periphery 首字母) | 2 |
| lim | limit | /ˈlɪmɪt/ | 极限 | 拉丁文 limes:界限 | 极限 | 4 |
| → | approaches | /əˈprəʊtʃɪz/ | 趋于 | 箭头 | 无限接近 | 4 |
| d | dee | /diː/ | d | 拉丁文 differentia:差 | 无穷小的变化 | 5 |
| ′ | prime | /praɪm/ | 撇 | 拉格朗日推广 | 导数:f ′ 读 f 撇 | 5 |
| ∫ | integral | /ˈɪntɪɡrəl/ | 积分 | 拉长的 s,summa:总和 | 积分 | 7 |
| e | e | /iː/ | 衣 | 欧拉采用 | 自然常数 2.71828… | 10 |
| ln | L-N / log | /ɛl ɛn/ | 自然对数 | logarithmus naturalis | 以 e 为底的对数 | 10 |
| ∂ | partial | /ˈpɑːʃəl/ | 偏 | 弯曲的 d(勒让德、雅可比) | 偏导数 | 12 |
| ∇ | nabla / del | /ˈnæblə/ | 纳布拉 | 倒置的 Δ,名取自古竖琴 | 梯度 | 12 |
全书带走
放大看,曲线就变直;切成碎片,再加起来;变化率与总量,是同一件事的两面。
- 微积分是人类用来描述“变化”的语言,也是两千年接力的结果。
- 它让我们从“每一刻怎样变”推出“整体会怎样”:天气、药量、利息、轨道。
- 它留给每个人的,是四个思考习惯:放大、看变化率、分清流量与存量、带着误差逼近。