集合、映射与函数:一切数学对象的「容器」与「对应规则」
先把这些基础概念补全,后面所有课都用统一的表述:集合运算、区间邻域、映射的单射满射双射、函数定义域值域与复合/反函数,还有指数对数这对互为反函数的基础工具。
- 掌握集合的并交差补运算,以及区间、邻域、去心邻域的写法
- 区分单射、满射、双射,理解反函数存在的条件
- 把函数的定义域、值域、对应法则讲清楚,会求复合函数,注意复合的顺序。
- 把指数和对数的互化、运算法则练熟,搞懂自然对数和 e 是怎么来的
先统一「装东西的容器」和「把一个变成另一个的规则」
后面线性代数讲向量集合、微积分讲区间与邻域、概率讲样本空间,用的都是同一套集合语言;而「函数/映射」描述输入如何决定输出,神经网络本身就是一个高度复合的函数。这一节把这些最基础、却最容易因为「以为会了」而卡住后续的概念一次夯实。
1.1 集合与其运算
集合就是一堆确定对象凑成的整体,里面的每个对象叫元素。a 属于 A 记成 a∈A。常用数集得记到条件反射的程度:ℕ 是自然数、ℤ 是整数、ℚ 是有理数、ℝ 是实数。描述集合有两种写法:列举法直接写 {1,2,3},描述法用 {x : x 满足的条件}。
四种运算:并 A∪B(属于 A 或 B)、交 A∩B(同时属于)、差 A−B(属于 A 不属于 B)、补集 Aᶜ(在全集 U 中不在 A 里的部分)。两个分配/对偶关系在概率里会反复用:A∩(B∪C)=(A∩B)∪(A∩C);(A∪B)ᶜ=Aᶜ∩Bᶜ、(A∩B)ᶜ=Aᶜ∪Bᶜ(德摩根律:并补变交、交补变并)。
1.2 区间与邻域:微积分的「地点语言」
实数区间一共四种,前提是a<b:闭区间 [a,b]={x:a≤x≤b}、开区间 (a,b)={x:a<x<b}、半开区间 (a,b]={x:a<x≤b};还有无穷区间,比如 (a,∞)={x:x>a}。微积分里说「x 趋近 a」,得用邻域的概念:a 的 δ 邻域是 (a−δ,a+δ),就是所有和 a 的距离小于 δ 的点;去心邻域就是把 a 本身挖掉,满足 0<|x−a|<δ——求极限、定义导数的时候,只关心 a「附近」的点,不关心 a 这一点本身,所以用的是去心邻域。
1.3 映射:单射、满射、双射
映射 f:A→B 是一条规则,给 A 中每个元素指定 B 中唯一元素。A 叫定义域,输出全体 f(A)={f(a):a∈A} 叫像(值域是像的集合,是 B 的子集)。三种性质:
单射(一一):不同输入必有不同输出,f(x₁)=f(x₂)⟹x₁=x₂,不会「两个输入挤一个输出」。满射:B 中每个元素都被射到,即 f(A)=B,没有「空着的输出」。双射:既单又满,A、B 元素一一对应,此时才存在逆映射 f⁻¹(反函数)。
这套语言直接决定「反函数/可逆」的判断:stage12 反函数求导公式 (f⁻¹)′=1/f′ 成立的前提正是局部双射(严格单调);线性代数里矩阵可逆等价于它表示的线性映射是双射。
函数 f(x)=x² 在整个实数域 ℝ→[0,∞) 上不是单射,原因是?
1.4 函数:定义域、值域、复合
函数是数集到数集的映射。写函数先搞清楚定义域——就是让表达式有意义的x的范围,核心就三条:分母不为0、偶次根号内非负、对数真数为正。举个例子,f(x)=√(x−1)+1/(x−3)的定义域要同时满足x−1≥0和x−3≠0,结果是[1,3)∪(3,∞)。
复合函数 (g∘f)(x)=g(f(x)):先作用 f 再作用 g,顺序不能换。举个例子,f(x)=x²、g(x)=x+1,那 g(f(x))=x²+1,f(g(x))=(x+1)²,这俩结果不一样——跟矩阵乘法 AB≠BA、链式法则「从外向内分层」是同一个「顺序敏感」的思路。判断复合函数的定义域时,x 得同时满足两个条件:一是让内层的 f 有意义,二是让 f(x) 落在 g 的定义域里。
1.5 指数与对数:一对互为反函数的工具
指数 aˣ(a>0,a≠1)和对数 logₐ x 互为反函数,满足两个恒等式:logₐ(aˣ)=x、alogₐ x=x。以 e≈2.71828 为底的指数 eˣ,和自然对数 ln x(也就是 loge),在微积分里地位最特殊——因为 (eˣ)′=eˣ、(lnx)′=1/x,导数形式最简。
这些法则必须滚瓜烂熟,是后面 softmax、交叉熵、对数求导的运算基础:
指数:aᵐ·aⁿ=aᵐ⁺ⁿ,aᵐ/aⁿ=aᵐ⁻ⁿ,(aᵐ)ⁿ=aᵐⁿ,(ab)ⁿ=aⁿbⁿ。对数:log(xy)=logx+logy,log(x/y)=logx−logy,log(xⁿ)=n logx;换底公式 logₐb=lnb/lna。特别:ln1=0、lne=1、a⁰=1、a−n=1/aⁿ、a1/n=ⁿ√a。
概率连乘会下溢且难算,取对数把「乘」变「加」:ln(∏pᵢ)=Σlnpᵢ,交叉熵、最大似然、对数几率(logit)都建立在这之上。log 是严格递增函数,最大化乘积等价于最大化对数和,且不改变最优解位置。
求 f(x)=ln(x−2) 的定义域,并用反函数关系说明它的值域。本节小结
集合靠并、交、差、补和德摩根律来组织对象;区间和(去心)邻域是描述「附近」的标准说法;映射分单射、满射、双射,只有双射可逆,这是反函数和可逆矩阵的共同前提;函数先确定定义域再谈运算,复合的时候顺序不能乱;指数和对数互为反函数,核心法则是「指数相加对应对数相加、幂次对应倍数」,自然对数 ln 是 AI 损失函数的运算底座。下一节补代数变形和求和符号。
资深工程师加餐
底层原理 · 大厂视角 · 工程经验,点卡片展开
一条样本是一个特征向量,一批样本堆成矩阵,神经网络一层的变换本质就是矩阵乘法加激活。换基/特征值分解相当于找数据的主要方向(PCA 降维),GPU 之所以适合深度学习,正是因为它能大规模并行做矩阵运算。把「向量=对象、矩阵=变换」建立起直觉,后面公式就不再抽象。