6 年级
集合与集合运算
集合是若干对象组成的、边界明确的集体,其中每个对象称为元素; 表示 属于 。当 的每个元素都属于 时,称为子集,记作 。由两个集合可以构造新的集合:并集 (属于 或 的元素)、交集 (同时属于两者的元素)、差集 (属于 但不属于 的元素)。这些运算满足类似代数的定律,例如分配律 ,而并集元素个数的计算遵循容斥原理 ;本文将严格证明这两条定律,并用于问卷调查数据与搜索引擎过滤器的实际场景。
直观装物品的盒子:什么东西属于哪里
设想两个部分重叠的玩具箱:盒子 装着积木,盒子 装着小汽车。有些玩具是"汽车积木",同时出现在两个盒子里。问"?"就是问某个具体的玩具 是否在盒子 里。问"?"就是问盒子 里的每一件玩具是否都能在盒子 的某处找到。把两个盒子合成一堆,得到并集 ;只留下两个盒子都有的玩具,得到交集 ;从盒子 中拿走那些盒子 里也有的玩具,得到差集 。下面的网络小工具可以让你在两个圆之间拖动元素,实时观察这四种运算的结果。
中学形式化定义与对照表
定义: 集合、元素、子集
集合 是由互不相同的对象组成的集体;满足 的每个对象 称为 的元素。当 的每个元素也是 的元素时,称 是 的子集,记作 ;两个集合相等当且仅当 且 同时成立。
并集 收集了所有至少属于两个集合之一的元素。相对地,交集只保留同时属于两个集合的元素。
| 运算 | 定义 | 结果 |
|---|---|---|
| 并集 | ||
| 交集 | ||
| 差集 | ||
| 子集 | 的每个元素都属于 | 假 () |
大学两条关键定理及完整证明
对任意三个集合 、、:。
为什么成立?
正如普通代数中乘法对加法满足分配律一样,集合代数中交集对并集也满足分配律。这使得像"属于类别 ,且(正在促销 或新品 )"这样的过滤条件,可以改写成两个更易处理、再用并集合并的过滤条件,这正是数据库与搜索引擎的查询规划器化简布尔过滤条件的方式。
证明
我们通过证明双向包含关系来说明两个集合相等,方法是取任意元素 进行"元素追踪"。
(正向,) 设 。由交集的定义,这意味着 且 。由并集的定义, 意味着 或 。分两种情形讨论。情形1:。结合 ,得到 。情形2:。结合 ,得到 。无论哪种情形, 都属于 或属于 ,因此 。
(反向,) 设 。由并集的定义,这意味着 或 。若 ,则 且 ,从而 (因为 属于 ,故属于 或 ),于是 。若 ,则 且 ,从而 ,同样得到 。
由于左边的每个元素都属于右边,反之亦然,两个集合含有完全相同的元素,故 成立,证明完毕。
对任意两个有限集合 与 :,其中 、、、 分别表示各集合的元素个数。
为什么成立?
简单地把 与 相加,会把同时属于两个集合的元素重复计算一次,因此再减去 一次就纠正了这次重复计算。这正是从问卷调查数据中读取双圆维恩图背后的算术:在询问至少喜欢咖啡或茶其中一种的人数时,同时喜欢两者的人不能被重复计算。
证明
关键思路是把 拆成三个两两不相交的部分,再各计数一次。
首先,用另一个集合来划分每个集合: 与 。在这两个等式中,右边的两部分互不相交,因为 (不在 中的元素不可能同时在 中),同理 。由于有限集合的大小等于其两两不相交划分各部分大小之和,由此得到 与 。
接下来注意到 本身可以拆成三个两两不相交的部分:。事实上 、、 两两不相交(属于 的元素不属于 ,因而也不属于 或 ;其余情形同理),且它们的并集恰好就是属于 或属于 的全部元素。按此划分计数即得 。
最后代入:由 得 ,由 得 。将两者代入 得 ,这正是 。证明完毕。
大学实际应用与典型例题
集合运算是两种日常工具的支柱。在问卷调查分析中,喜欢产品 与产品 的受访者的双圆维恩图要用 来解读:总关注人数并非简单相加,因为属于 的人会被重复计算。在搜索引擎与电商过滤器中,组合"类别 "与"正在促销 "(用 AND)正是交集 ,用 OR 组合正是并集 ,用 NOT 排除某标签正是差集 ;分配律 正是查询规划器能把" 且( 或 )"改写成"( 且 )或( 且 )"而不改变结果的原因。
例题: 用容斥原理解读问卷调查
某学校对 名学生进行问卷调查。 人说会踢足球, 人说会打篮球, 人说两项都会。请问至少会一项运动的学生有多少人?两项都不会的学生有多少人?
解答
设 为踢足球的学生集合, 为打篮球的学生集合,则 ,,。
由上面证明的容斥定理,。代入数值:。所以至少会一项运动的学生有 人。
由于调查总数为 ,两项都不会的学生数就是 在全体 名学生中的补集:。
注意常见错误是直接相加 :这会把两项都会的 人重复计算,这正是定理要减去一次 的原因。
例题: 用分配律化简搜索过滤器
某在线商店的商品目录是一个产品集合 。设 为"属于鞋类类别", 为"正在促销", 为"新品上架"。顾客的过滤条件是"属于鞋类,且(正在促销或新品上架)",即 。请说明这与分别运行两个更简单的过滤器再合并结果得到的产品列表相同,并解释为什么搜索引擎更偏好后一种形式。
解答
由上面证明的分配律,。这里取 鞋类、 促销、 新品,应用得到:。
左边 描述一个合并后的单一过滤器:先构造由所有促销或新品组成的集合 ,再与鞋类求交。右边描述两个独立的简单过滤器,"促销鞋类"()与"新品鞋类"(),再用并集合并结果。
由于定理保证两边列出的产品完全相同,查询规划器可以自由选择更快的执行方式。运行两个简单的单条件过滤器(各自可使用针对某一类别预先建好的快速索引)再用并集合并,通常比直接求值"与中嵌或"的表达式更便宜,因此实际的搜索引擎会在执行前把查询改写成右边的形式。
具体来说,若鞋类 、促销 、新品 ,则 且 ;分别地 、,其并集同样是 ,确认两种算法结果一致。
设 。下列哪个说法正确?
某班有 名学生; 人喜欢数学, 人喜欢物理, 人两者都喜欢。至少喜欢其中一门的学生有多少人?
某购物网站可以按"品牌 " OR "低于50美元()"过滤。计算显示结果的是哪种集合运算?
设 、、,等式 是否成立,公共值是多少?
参考文献
- Paul R. Halmos (1960). Naive Set Theory
- Kenneth H. Rosen (2019). Discrete Mathematics and Its Applications