第1讲 媒体与认知概述
媒体与认知
媒体、信息及其载体
媒体是信息的载体。印刷品、电子文档、电话、电视、互联网,以及新闻、微博等传播方式都属于媒体。载体本身又有层次:文字承载语义内容,电子文本承载文字,网络传输时的数据包又承载电子文本。
媒体技术的创新是人类社会发展的重要标志。语言和文字使交流与文化传承成为可能;文字的载体也从岩石、甲骨、竹简等自然物,发展到纸张、造纸术和活字印刷术,再发展到电子出版、移动通信等信息设备。
青蒿素的发现说明,旧媒体中保存的信息仍可能直接推动新的认知。20世纪60年代,氯喹抗疟逐渐失效;屠呦呦于1969年担任中药抗疟组组长。1971年,东晋葛洪《肘后备急方》中“青蒿一握,以水二升渍,绞取汁,尽服之”的记载使她注意到“绞取汁”不同于中药常见的煎熬法,因而改用低沸点乙醚提取青蒿素。她于2015年10月获诺贝尔生理学或医学奖,并获2016年度国家最高科学技术奖。
人的感知和认知能力都有边界,媒体技术可以:
- 用传感器扩展声波、光波频率与强度的感知范围,例如获取红外图像;
- 通过大数据关联分析发现规律,提升认知能力;
- 代替重复性脑力劳动;
- 辅助决策,例如具有增强现实与实时翻译功能的眼镜。
媒体的表现形式会影响信息感知,同一信息也可以在不同形式之间转换。各类信息都能转换成电学形式,其载体是电荷、电磁场或光子;人类视听系统最终感知的则是光波、声波等模拟信号。典型的信息处理链是“声光等模拟信号—数字信号—数字媒体—以人可感知的形式呈现”。
数字媒体有三个主要特征:
- 数字化:数字信号多次中继不易累积失真,便于信道编码、计算机处理和加密;代价是数据量大、数码率高,知识产权保护也更困难。
- 集成化:把多种数字媒体信息以及相应硬件、软件组织到一起。
- 交互式:通过人机接口形成双向交互。
数字媒体可分为视觉类与听觉类,常见形式包括文本、图像、视频、图形、动画和声音。文字本身也有多种表示:
- 文字图像;
- 文本代码,例如字符“A”的 ASCII 单字节编码为 0x41,汉字“啊”的 GB 双字节编码为 0xB0A1,汉字“一”的 Unicode 编码为 0x4E00;Unicode 的传输编码包括 UTF-16、UTF-8;
- TrueType 字体所描述的图形;
- 联机手写笔迹的坐标序列。
早期计算机并不支持中文等多文种文字。中文信息处理的基础工作包括 GB 2312-80 等字符编码标准、五笔字型等输入法、汉字字体与北大方正激光照排,以及汉字识别。汉字识别可看成激光照排的逆过程,清华电子系曾研制 TH-OCR 文字识别与车牌识别软件。
文字识别把扫描或拍摄的文档图像、联机手写笔迹转换为文本代码。其处理环节和方法包括:
| 环节 | 传统方法 | 深度学习方法 |
|---|---|---|
| 版面分析 | 自顶向下投影法、自底向上连通域分析法等 | 基于 FCN、Faster R-CNN、DETR 等方法,与下两行共用 |
| 文字检测 | 最大稳定极值区域 MSER、笔画宽度变换 SWT 等 | 同上 |
| 字符切分 | 投影分析、连通域分析、字符轮廓分析、笔画分析等 | 同上 |
| 字符识别,如大字符集古籍汉字识别 | 特征工程,包括特征提取、特征降维,以及统计模式识别 | 卷积神经网络 |
| 文本行识别 | 基于字符切分和识别的方法;基于序列建模的隐含马尔可夫模型 | 循环神经网络、Transformer |
从流程看,输入图像先经过版面分析或文字检测,再做文字识别;识别结果还要经过后处理,最后输出文本代码。课件把 FCN、Faster R-CNN、DETR 的深度学习单元纵向跨在版面分析、文字检测和字符切分三行,因此这里保留为三项技术共用,不能只放在其中一行。
利用人工智能实现媒体形式转换,本质是信息的提取与转化。例如中文文本经机器翻译变成英文文本,中文文本图像经文字识别变成中文文本,中文文本又可经图像合成形成文本图像。
本课程把信息定义为:物质相互作用中反映出的事物状态与属性;这里的“事物”既包括客观世界的物质现象,也包括主观世界的意识现象。香农在1948年用信息计算公式把信息描述为“熵的减少”,也就是消除不确定性的内容。若离散随机变量 \(X\) 取 \(x_i\) 的概率为 \(p(x_i)\),其信息熵为
通信系统由信源、发送器、信道、接收器和信宿组成,噪声作用于信道。信息还要与信号、数据和知识区分:
- 信号是信息在物理层次的载体。
- 数据是客观事物运动状态经感觉器官或观测仪器感知后形成的数字、文本、图像等原始记录;对数据加工、建立数据之间的联系,才能提取信息。
- 知识是人在改造世界的实践中形成的认识和经验,不是数据和信息的简单堆积,而是能够指导实践的信息。
认知与人工智能
认知是个体认识客观世界的信息加工过程。人的感官在长期进化中逐步与媒体相适应,并形成大脑等中枢神经系统;大脑加工视觉、听觉等感官输入并形成理解。认知过程包括感知、注意、记忆、学习、思维、意识和情绪等。若把认知系统类比为信息系统,可以对应为传感器输入、运算器和记忆器处理与存储、通信网络传输,以及控制器输出并作用于环境。
媒体技术也用于研究人的认知规律,例如心理学实验中的脑电图、计算机辅助脑成像、眼动分析仪和核磁共振成像 MRI。
卡尼曼在《思考,快与慢》中把人的思维分成两个系统:
- 快思考(系统1)依赖直觉,在无意识状态下快速完成;
- 慢思考(系统2)需要主动控制,是有意识的思考。
二者应合理分工:快思考提供洞察与直觉,集体讨论等方式则能促进慢思考和理性决策。
图灵测试给出一种判断机器是否具有智能的操作性准则:如果机器通过电传设备与人对话,而人无法辨别对方的机器身份,就称机器表现出智能。课件以2022年11月推出、基于 GPT-3 并经监督学习和强化学习后训练的 ChatGPT 为例,说明“能够完成问答、翻译和文本生成”不等于已经具有人类式的理解、感知和思考能力。
Searle 在20世纪80年代初提出“中文房间”思想实验:一个不懂中文、母语为英语的人只按英文手册处理房外传入的中文问题,也能给出中文回答。房外的人相当于程序员,房内的人相当于计算机,手册相当于程序;房内的人能够执行符号规则却不理解中文,由此质疑“执行程序本身就产生理解力”的观点。
人工智能作为研究方向起源于1956年8月的达特茅斯夏季人工智能研究计划,John McCarthy 等人提出研究七个领域:可编程的自动计算机、让计算机使用语言、神经网络、计算规模理论、自我改进即机器学习、抽象、随机性与创造性。
人工智能发展史上,多位图灵奖获得者的工作与该领域直接相关:Marvin Minsky(1969)推动人工智能领域形成与发展;John McCarthy(1971)研究人工智能;Herbert Simon 与 Allen Newell(1975)贡献于人工智能、人类认知心理学和表处理;Edward Feigenbaum 与 Raj Reddy(1994)开创大规模人工智能系统;Leslie Valiant(2010)提出 PAC 学习等计算理论;Judea Pearl(2011)发展概率与因果推理。Yoshua Bengio、Geoffrey Hinton、Yann LeCun 因使深度神经网络成为计算关键组成部分而获2018年图灵奖。2024年,Hinton 与 Hopfield 因人工神经网络和机器学习工作获诺贝尔物理学奖;David Baker、Demis Hassabis、John Jumper 因蛋白质结构设计与预测相关成果获诺贝尔化学奖。
按能力范围,人工智能可分为三个阶段:
- 狭义人工智能 ANI,也称弱人工智能,只执行特定任务,如 Siri、AlphaGo;
- 通用人工智能 AGI,也称强人工智能,目标是具有类似人的思考和决策能力;
- 超级人工智能 ASI,设想其计算能力超过人类。
人工智能还有三条典型技术路线:
- 符号主义:以符号为认知基元,通过符号操作实现智能。Robinson 的归结原理、Lisp、Prolog 是代表;重点研究启发式搜索与推理,在自动定理证明、专家系统中取得成功。吴文俊于1977年提出平面几何问题的机械化证明理论“吴方法”。
- 连接主义:以神经元及其连接为思维基元,把智能看成神经元竞争与协作的结果。代表包括 Hopfield 网络和用误差反向传播训练的神经网络;研究重点是神经元特征、网络拓扑、学习规则、非线性动力学与自适应协同行为。大数据和并行计算推动了深度学习与大语言模型的发展。
- 行为主义:以 Rodney Brooks 为代表,把反馈看作控制论基石,强调智能系统从环境中感知信息,再以行为影响环境;智能体现在系统与环境的持续交互中。
机器学习基础
基本概念与流程
监督学习用有标签样本建模输入输出关系。回归的输出是随输入标量或向量连续变化的数值,如由降水量预测水果产量;分类或模式识别的输出是类别标签,如由水果图像判断类别。非监督学习不使用人工标签,聚类把样本划分为若干属性相近的子集;自监督学习从数据自身构造监督信号,例如大语言模型用“预测下一个单词”进行预训练。强化学习中,智能体在与环境的交互中根据行动回报决定下一步行为。
数据集通常分为训练集、验证集和测试集。训练阶段由训练样本经过预处理与学习得到模型参数;验证集用于训练期间比较模型和决定何时停止;测试阶段只对新样本预处理并预测,用测试集评价最终性能。
机器学习有三个基本要素:
- 模型:给定训练集 \(D=\{(x_i,y_i)\mid i=1,\ldots,N\}\),模型给出映射 \(y=f(x)\);线性情形也可写成 \(Y=A^TX\)。
- 策略:用目标函数衡量预测 \(f(x)\) 与真值 \(y=g(x)\) 的差异,目标函数也称损失函数或代价函数。
- 算法:优化模型参数 \(\theta\),即
常见机器学习方法包括:监督学习中的线性模型、支持向量机、贝叶斯分类器、隐含马尔可夫模型、决策树、K近邻,以及 MLP、CNN、RNN、Transformer 等神经网络;非监督学习中的 K 均值、PCA、t-SNE 与自监督学习;强化学习中的 Q-learning、DQN、PPO。
线性回归
回归用于描述一个或多个自变量与因变量的关系。一元线性回归的输入是标量,例如学习成绩与投入时间;多元线性回归的输入是向量,例如房价与工资、贷款利率。线性回归假设因变量是自变量各元素的加权和,并假设观测噪声服从正态分布:
给定 \(m\) 个样本 \((x_i,y_i)\),其中 \(x_i=(x_{i1},\ldots,x_{id})^T\),参数为 \(w=(w_1,\ldots,w_d)^T\) 和 \(b\)。把 \(x_{i0}=1\) 加入增广向量,并令 \(w_0=b\),可写成
最小二乘法寻找使均方误差最小的超平面:
其梯度与闭式解分别是
这一写法要求 \(X^TX\) 可逆,也就是 \(X\) 满列秩;若条件不满足,应使用 Moore--Penrose 伪逆写成 \(\hat w^\ast=X^+y\)。
线性回归还有一个直接的几何解释。一元情形中,无噪声目标满足 \(t=wx+b\),观测为
其中 \(\epsilon\) 是观测噪声,模型给出预测 \(\hat y\)。课件左图的横、纵轴是输入 \(x\) 和输出 \(y\):红线表示真实关系 \(t\),紫色样本相对红线的竖直偏移是 \(\epsilon\),绿色直线及其上的点表示拟合模型和预测值 \(\hat y\)。把两个样本的输出写成二维向量后,\(t,y,\hat y\) 都可看作从原点出发的向量,并有
因此预测误差由模型相对无噪声目标的偏差和观测噪声共同构成。右图坐标轴是 \(y_1,y_2\),表示输出空间中的两个分量,不是左图的 \(x,y\)。
无法或不宜直接求闭式解时,可用梯度下降:
线性回归可以看成无激活函数的单层单节点网络。训练时每次选取 \(m\) 个样本:\(m=1\) 是原始随机梯度下降,梯度波动较大;\(m=N\) 每步使用全部数据,不适合大数据;实际常取 \(32\) 等 \(2\) 的幂,每轮约迭代 \(\lceil N/m\rceil\) 次。完整流程是:
- 初始化参数 \(\theta\);
- 每轮先随机打乱训练集;
- 依次取小批量样本,前向计算预测与损失;
- 反向传播求 \(\partial L/\partial\theta\);
- 按梯度下降更新参数;
- 重复到验证集误差不再下降,输出参数。
课件的水果产量例题使用如下数据:
| 地区 | 平均气温/℉ | 降雨量/mm | 湿度/% | 苹果产量/(吨/公顷) | 橙子产量/(吨/公顷) |
|---|---|---|---|---|---|
| 1 | 73 | 67 | 43 | 56 | 70 |
| 2 | 91 | 88 | 64 | 81 | 101 |
| 3 | 87 | 134 | 58 | 119 | 133 |
| 4 | 102 | 43 | 37 | 22 | 37 |
| 5 | 69 | 96 | 70 | 103 | 119 |
先只考虑降雨量 \(x\) 与苹果产量 \(y\) 的一元线性关系。初始化 \(w=1.0,b=2.0\),预测为
均方误差是
由链式法则,
学习率取 \(\eta=10^{-4}\),一次更新得到
之后继续迭代,直到达到迭代次数或收敛条件。
线性回归可以通过基函数增加非线性描述能力:
也可以在目标函数中加入正则项。岭回归使用参数的 \(L_2\) 范数平方,LASSO 使用 \(L_1\) 范数:
\(\lambda\ge 0\)。正则化能减轻过拟合,却也可能降低模型灵活性。不能把 \(\lambda\) 与普通模型参数一起学习,否则模型会倾向于令其为零;应在训练集上分别训练不同 \(\lambda\) 的模型,再由验证集比较,选择偏差与方差较平衡的取值。
偏差—方差分解用于分析预测误差。设真实模型为 \(y=t+\epsilon\),其中 \(t=Xw\)、\(\epsilon\sim\mathcal N(0,\sigma^2)\);对训练集的一次抽样 \(D\) 得到模型 \(\hat y_D\),多次抽样的期望预测为 \(\bar{\hat y}=E_D[\hat y_D]\)。则
从而,对训练集抽样和观测噪声同时取期望,
课件把左端简写成 \(E_D\);严格地说,出现 \(\sigma^2\) 时还对独立噪声 \(\epsilon\) 取了期望。方差反映训练数据变化对预测的影响,偏差反映期望预测与真实值的偏离,噪声方差是问题本身造成的误差下界。偏差与方差往往冲突,这就是偏差—方差窘境。
课件的岭回归实验采用真实关系
生成 \(L=100\) 组数据,每组 \(N=25\) 个点。对每组拟合 \(\hat y_l(x)\),并定义
偏差平方与方差之和最小时对应最优正则化系数 \(\lambda^\ast\)。
水果例题的多元闭式解给出
对新观测 \((75,63,44)\),闭式解预测苹果和橙子产量为 \((53.4227,67.1172)\)。PyTorch 的两种迭代实现分别得到 \((50.8773,67.4407)\) 和 \((54.5475,68.4272)\)。
思考与探究
- 若线性回归观测噪声服从 \(p(\epsilon)=\frac12e^{-|\epsilon|}\),目标函数应如何调整?课件称它为“指数分布”,但这个关于 0 对称的密度实际是 Laplace 分布;最大似然对应最小化绝对误差,即 \(L_1\) 损失。
- 若 \(x\) 与 \(y\) 的关系为 \(y=ae^{bx}\),其中 \(a>0,b\ne0\),应怎样变换为线性回归问题?
