我的 AI 学习地图 学习笔记 / 01

沿着我的学习路径,认识 AI

先认识 AI,再看它从哪里来。

从熟悉的智能能力出发,理解模型怎样运作,再走进技术的历史。

横向看技术演化点击节点,向下读解释

01 / 总体概念

AI,是模拟部分人类智能能力的工具。

人工智能(AI)让计算机完成一些通常需要智能的任务:识别图像、理解语言、学习规律、进行推理,以及选择行动。我们可以从人熟悉的能力入手,理解它能帮我们做什么。

比如,你说:“帮我找一篇论文,再总结它。”一个 AI 工具需要接收你的话、查找资料、处理内容,再给出回答。这一次任务,可能需要多种能力共同配合。

从熟悉的人类能力,看 AI 能做什么

能力生活中的理解AI 中的实现方式举例
记忆记住所学知识,保留眼前的信息模型参数保存学到的规律;上下文容纳当前信息;外部资料可通过检索(RAG)引入
感知看见、听见,接收环境信号把图像、声音或传感器数据转换为数字,再提取特征
学习通过练习与反馈,积累经验训练时调整模型参数;强化学习通过奖励反馈改进策略
推理结合线索,逐步得出结论生成中间步骤、进行概率推断,或使用符号规则
决策比较选项,选择下一步行动使用搜索、规划算法或策略模型选择行动

这是功能上的类比,方便我们入门。人类的这些能力会相互配合;AI 中的参数、上下文和外部资料也有各自不同的机制,不能与人脑中的记忆直接画等号。

这些能力,具体怎么实现?

一种方法是把规则、搜索和规划过程写进程序;另一种方法是让系统从数据和反馈中学习。现代神经网络属于后者:先设计计算结构,再用训练得到参数。

我们平时使用的 AI 工具,往往由模型 + 资料 + 工具调用组成。下面先从其中的“模型”讲起。

图解:和人类智能的对应展开你的原始学习图

读图提示:这张表展示功能类比。思维链不保证推理正确;上下文和 RAG 也不意味着模型参数发生了学习。

学习笔记:记忆、感知、学习、推理、决策与 AI 实现方式的对照表
你的学习图解 · 点击图片查看原尺寸

02 / 通用解释

一个模型,可以先看成一个函数。

以神经网络为例:它接收数字形式的输入,按照计算结构和参数进行运算,再给出预测。结构规定“怎样算”,参数决定“具体算出什么”。

xfθ模型ŷ
x · 输入
用数字表示的文字、图像或其他数据。
θ · 参数
模型中的数值,通常通过训练从数据中学习。
ŷ · 预测
可能是类别得分、下一个 token 的得分、特征或噪声预测。

从一张图片、一句话,到可读的结果

  1. 01 / 输入表示

    把内容变成数字

    图片可以表示为像素数组或图像块;文字先分成 token,再映射到向量。

  2. 02 / 模型计算

    用参数处理信息

    卷积或注意力等模块,结合矩阵运算、非线性变换和归一化,逐层处理特征。

  3. 03 / 输出映射

    得到任务所需预测

    例如,图像分类模型输出类别得分;语言模型输出下一个 token 的得分。

  4. 04 / 结果处理

    变成人能使用的结果

    选择类别、采样 token,或将生成的表示解码成图像,供人阅读和使用。

这四步是理解流程的框架。输入编码和输出映射也可能属于模型本身;生成文字或图像通常需要反复调用模型,并结合采样等步骤。

训练:让参数逐渐学会任务

给模型数据,比较预测与训练目标,用损失衡量差距。神经网络通常通过反向传播计算梯度,再用梯度下降等方法调整参数;多次重复,学到可用于预测的规律。

推理:用学到的参数处理新输入

使用模型时,通常保持参数固定,执行前向计算。语言生成会逐个 token 重复这个过程;加入新的上下文或检索资料,并不等于更新了模型参数。

同一个框架,不同的任务

识别图片:猫的照片 → 提取特征 → 类别得分 → “猫”。

生成文字:当前上下文 → 下一个 token 的得分 → 选择一个 token → 加入上下文,继续生成。

生成图片:提示词和噪声 → 反复预测并更新 → 解码为图像。具体过程取决于模型与生成方法。

把概念放回我的学习图解

先读上面的通用解释,再按兴趣展开细节。原图保留学习过程,旁边的说明补充适用范围。

图解一:数字怎样连接到“理解”?表示学习 · 编码与解码

读图提示:token ID 是编号;模型学到的向量才承担特征表示。不同模型的表示空间不一定共享;向量接近也不保证语义理解正确。图中的类比算式是直观示意。

表示学习图解:将物理与语义内容编码为数字表示,再得到可读输出
你的学习图解 · 点击图片查看原尺寸
图解二:模型从输入到输出纵向深入内部机制

读图提示:这是一张概念总览,各种模型不会都按“卷积 → 注意力 → 矩阵乘法”排列。矩阵运算本身就在许多模块内部;不同任务也会使用不同的输入表示与输出方式。

模型工作流程图:编码、模型处理、输出映射与后处理,以及训练和推理的区别
你的学习图解 · 点击图片查看原尺寸
图解三:参数在哪里,有什么作用?语言模型与 CNN 对照

读图提示:这是架构示例,归一化方式、偏置和参数比例会随模型变化。RoPE 通常在注意力中对 Q、K 应用位置相关旋转,并不是加到词向量上的一层位置嵌入。图中参数比例不能当作所有模型的固定比例。

语言模型与 CNN 的计算结构、参数形状及作用对照
你的学习图解 · 点击图片查看原尺寸

03 / 横向历史

这些能力,是怎样一步步发展出来的?

横向看技术演化,点击节点向下读解释:它解决了什么问题,又有哪些能力边界。

现代 AI 的历史地图

左右滑动,浏览完整地图
01 视觉与行动02 生成与预测03 推理与工具
2017 之前 积累
2017 转折
2018—2020 规模化
2021 起 三条能力路线

不同任务,各有积累

这些路线在 2017 年后
仍然继续发展。

一条时间分界线

通用能力逐步积累

架构、训练方法与规模
共同推动后续发展。

01

视觉、语言与行动

图文对应 · 看图对话 · 机器人动作

02

图像、视频与环境预测

图像生成 · 视频生成 · 世界模型

03

推理、工具与反馈

分步推理 · 工具调用 · 经验与学习

连接表示学习顺序,各路线会交叉,并非严格的模型继承关系。

虚线节点:拓展问题,另有历史来源

2017 · 关键架构节点

Transformer

用注意力机制,让序列中的不同位置交换信息。

处理一句话时,模型可以根据当前内容,对不同位置的信息赋予不同权重。Transformer 最初用于机器翻译,后来逐步进入语言、视觉和生成等领域。

用一个例子理解

读到“我把苹果放进袋子,因为它很大”时,理解“它”需要结合其他词的信息。注意力提供了建立这种关联的一种计算方式。

记住这个边界

注意力是计算机制;模型能建立词语关联,并不保证每次都理解正确。

历史图解 · 对照阅读

横向地图给出主要节点,下面保留原始学习图,并补充需要修正的历史表述。

总览:感知理解与决策行动两条早期路线与后来的交叉

读图提示:2017 年 Transformer 是重要时间标记,各条路线仍按自己的节奏发展。感知与决策在 DQN 等早期系统中就有结合。早期 Stable Diffusion 使用 U-Net;不能将其视为 Transformer 统一架构下的直接后代。

原始历史总览:感知理解与决策行动两条路线的技术节点
你的原始学习图解 · 历史关系以网页地图与说明为准
视觉路线的早期积累从神经网络到 CNN

读图提示:1980 年应排在 1986 年之前。1986 年是反向传播推广的重要节点,并不是多层感知机的诞生年份;“1998 年 CNN 全面超越 MLP”也过于绝对,不同任务的适用性需要分别讨论。

视觉学习历史表:生物启发、反向传播、LeNet、ImageNet 与 AlexNet
你的原始学习图解 · 点击图片查看原尺寸
语言路线的早期积累从统计方法到 Transformer

读图提示:ELMo 通常以 2018 年论文为节点,图中的 2015 年需要修正。Transformer 在 2017 年提出,之后逐步进入更多领域,并非当年就统一了所有模型。

语言学习历史表:统计语言模型、词向量、序列模型、ELMo 与 Transformer
你的原始学习图解 · 点击图片查看原尺寸