Microsoft AI for Beginners — 学习资料总结

课程来源:microsoft/AI-For-Beginners 12 周 · 24 节课 · 涵盖符号 AI、神经网络、计算机视觉、NLP、强化学习与伦理 核心框架:TensorFlow / PyTorch · 辅助工具:OpenCV、Keras、NetLogo、OpenAI Gym


课程总览

这门课程由微软开源,面向 AI 初学者,采用「理论 + Jupyter Notebook 实操 + 实验室练习」三位一体的教学模式。整个课程从 AI 的历史与哲学出发,先建立符号推理的经典视角,再系统进入神经网络与深度学习,随后分两条主线深入——计算机视觉和自然语言处理——最后以遗传算法、强化学习、多智能体系统和 AI 伦理收尾。

课程刻意不覆盖传统机器学习(如 SVM、决策树)和云端认知服务,而是聚焦于深度学习范式符号 AI 的对立统一,帮助学习者建立对 AI 全貌的结构化理解。


第一部分:AI 导论(第 1 课)

核心问题:什么是智能?机器能否思考?

课程从图灵测试切入,回顾了 AI 的两次浪潮:第一次是基于符号逻辑的规则系统(1950s–1980s),专家系统曾一度繁荣但因知识获取瓶颈和扩展性差而遭遇「AI 寒冬」;第二次是数据驱动的连接主义(2010s 至今),廉价算力与海量数据的结合催生了深度学习革命。

关键概念:窄 AI(专用任务)vs. 通用 AI(AGI,尚未实现);符号推理 vs. 神经网络;从 Eliza 到 GPT-3 的对话系统演化史。


第二部分:符号 AI(第 2 课)

核心思想:用形式化逻辑编码世界知识

在深度学习统治之前,符号 AI 是主流范式。本课介绍了知识的层次模型——DIKW 金字塔(数据 → 信息 → 知识 → 智慧),以及多种知识表示方法:语义网络、框架、产生式规则、形式逻辑。

专家系统是符号 AI 的典型产物,由知识库(存储规则)和推理引擎(前向链 / 后向链)组成。一个看起来「智能」的系统大约需要 200 条以上规则,其最大优势是决策过程完全可解释。

课程还涉及语义网技术栈:RDF(资源描述框架)、OWL(本体语言)、SPARQL 查询语言,以及 WikiData、DBpedia 等大规模开放知识图谱。

动手练习:用 Prolog 构建简单知识推理系统,用 Protege 编辑本体。


第三部分:神经网络基础(第 3–5 课)

从单个神经元到深度学习框架

第 3 课从生物神经元类比出发,介绍人工神经元(权重 + 激活函数)、感知机(二分类线性模型),以及多层感知机的反向传播训练。核心概念:张量(多维数组)、损失函数、梯度下降、过拟合与正则化。

第 4 课正式引入 PyTorch 和 TensorFlow 两大框架,学习如何搭建、训练和评估神经网络。重点讨论过拟合问题及其应对策略(Dropout、数据增强、早停法)。

第 5 课是承上启下的实践课,强调「不要从零造轮子」——学会使用成熟框架的 API,理解计算图、自动微分和 GPU 加速的原理。


第四部分:计算机视觉(第 6–12 课)

让机器「看懂」图像

这是课程中篇幅最大的模块,共 7 课,覆盖了计算机视觉的完整技术栈。

基础层(第 6 课):OpenCV 入门,学习图像的矩阵表示、滤波、边缘检测、形态学操作等基本操作。

核心架构(第 7 课):卷积神经网络(CNN)。卷积层提取局部特征,池化层降低维度,全连接层做最终分类。从 LeNet-5 到 AlexNet、VGG、ResNet(残差连接解决梯度消失),理解架构演化的内在逻辑。

实战技巧(第 8 课):迁移学习——用 ImageNet 预训练模型微调到自己的数据集,大幅降低训练成本。同时介绍数据增强、学习率调度等训练技巧。

生成模型(第 9–10 课):自编码器(Autoencoder)将图像压缩到低维隐空间再重建;变分自编码器(VAE)引入概率分布使隐空间连续可采样。生成对抗网络(GAN)通过生成器与判别器的博弈产生逼真图像。还有风格迁移(Style Transfer)——用 CNN 将一张照片变成梵高风格。

感知任务(第 11–12 课):目标检测(不仅分类还要定位,YOLO / SSD 系列架构)和语义分割(逐像素分类,U-Net 架构在医学影像中的经典应用)。


第五部分:自然语言处理(第 13–20 课)

让机器「读懂」语言

NLP 模块共 8 课,从最朴素的文本表示一路讲到当代大语言模型。

文本表示(第 13–14 课):词袋模型(BoW)和 TF-IDF 将文本转为数值向量,但丢失了语义信息。Word2Vec 和 GloVe 通过分布式假设(上下文相似的词语义相近)学习稠密词向量,实现了「国王 - 男人 + 女人 ≈ 女王」这样的语义运算。

语言建模(第 15 课):训练自己的词嵌入,理解语言模型的核心任务——给定上文预测下一个词。

序列建模(第 16–17 课):循环神经网络(RNN)通过隐藏状态处理变长序列,但面临长距离依赖问题。LSTM / GRU 通过门控机制缓解这一问题。生成式 RNN 可用于文本生成、机器翻译等任务。

Transformer 革命(第 18 课):注意力机制(Attention)让模型直接关注输入中最相关的部分,彻底取代了 RNN 的序列处理方式。BERT(双向编码器)擅长理解任务,GPT(自回归解码器)擅长生成任务。这一架构是当前所有大模型的基石。

应用层(第 19–20 课):命名实体识别(NER)从文本中提取人名、地名等结构化信息。大语言模型(LLM)与提示工程(Prompt Engineering)——如何通过精心设计的 prompt 让 GPT 类模型完成分类、摘要、推理等任务,无需微调即可实现少样本学习。


第六部分:其他 AI 技术(第 21–23 课)

超越深度学习的多元范式

遗传算法(第 21 课):模拟生物进化——将候选解编码为「基因」,通过选择、交叉、变异迭代优化。适用于传统方法难以处理的组合优化问题,如旅行商问题、函数优化。核心概念:适应度函数、种群多样性、局部最优陷阱。

深度强化学习(第 22 课):智能体在环境中通过试错学习最优策略。核心框架:状态 → 动作 → 奖励。算法从 Policy Gradients(直接优化策略)到 Actor-Critic(双网络架构,Actor 选动作、Critic 评价值)。经典实验:CartPole 平衡问题。应用场景:游戏 AI(AlphaGo)、机器人控制、自动驾驶。

多智能体系统(第 23 课):复杂群体行为如何从简单个体规则中涌现?鸟群没有领导者却能整齐飞行——对齐、凝聚、分离三条规则即可模拟。BDI 架构(信念-愿望-意图)为智能体赋予理性决策能力。工具:NetLogo(可视化仿真)、JADE 平台。


第七部分:AI 伦理(第 24 课)

技术之外的责任

课程以微软的六大负责任 AI 原则收尾:

  1. 公平性(Fairness):训练数据的偏见会被模型放大,需主动检测和缓解
  2. 可靠性与安全性(Reliability & Safety):算法输出的是概率,不是真理
  3. 隐私与安全(Privacy & Security):模型可能记忆并泄露训练数据中的敏感信息
  4. 包容性(Inclusiveness):AI 应增强人类能力而非取代人类
  5. 透明性(Transparency):用户有权知道决策由算法做出,优先选择可解释的模型
  6. 问责制(Accountability):关键决策必须保留人类在环(human-in-the-loop)

工具推荐:FairLearn(公平性评估)、InterpretML(模型可解释性)、DiCE(反事实解释)。


附加内容(第 25 课)

多模态网络、CLIP 与 VQGAN

作为课程的拓展,介绍了视觉-语言多模态模型。CLIP 通过对比学习将图像和文本映射到同一嵌入空间,实现零样本图像分类。VQGAN 结合向量量化与 GAN,用于高质量图像生成。这些是当前 AI 最前沿的方向。


学习建议

先修知识:Python 编程基础、线性代数和微积分的基本概念。课程不要求机器学习经验。

环境准备:安装 Anaconda 或 Miniconda,配置 Jupyter Notebook 环境。GPU 加速推荐使用 Google Colab(免费 TPU)或本地 CUDA 环境。

学习节奏:建议每周 2 课,12 周完成全部。每课先阅读理论材料,再跑通 Notebook,最后尝试 Lab 练习。

延伸阅读:课程不包含传统机器学习,建议搭配 Andrew Ng 的 Machine Learning 课程补充。商业 AI 应用可参考 Microsoft Azure AI 文档。

课程链接