4 篇文章带有标签 “microsoft”

Microsoft AI for Beginners — 学习资料总结

课程来源:microsoft/AI-For-Beginners 12 周 · 24 节课 · 涵盖符号 AI、神经网络、计算机视觉、NLP、强化学习与伦理 核心框架:TensorFlow / PyTorch · 辅助工具:OpenCV、Keras、NetLogo、OpenAI Gym

课程总览

这门课程由微软开源,面向 AI 初学者,采用「理论 + Jupyter Notebook 实操 + 实验室练习」三位一体的教学模式。整个课程从 AI 的历史与哲学出发,先建立符号推理的经典视角,再系统进入神经网络与深度学习,随后分两条主线深入——计算机视觉和自然语言处理——最后以遗传算法、强化学习、多智能体系统和 AI 伦理收尾。

课程刻意不覆盖传统机器学习(如 SVM、决策树)和云端认知服务,而是聚焦于深度学习范式符号 AI 的对立统一,帮助学习者建立对 AI 全貌的结构化理解。

第一部分:AI 导论(第 1 课)

核心问题:什么是智能?机器能否思考?

课程从图灵测试切入,回顾了 AI 的两次浪潮:第一次是基于符号逻辑的规则系统(1950s–1980s),专家系统曾一度繁荣但因知识获取瓶颈和扩展性差而遭遇「AI 寒冬」;第二次是数据驱动的连接主义(2010s 至今),廉价算力与海量数据的结合催生了深度学习革命。

关键概念:窄 AI(专用任务)vs. 通用 AI(AGI,尚未实现);符号推理 vs.

Phi-3-vision-128k-instruct 微软开源多模态大模型

Phi-3-vision-128k-instruct

Phi-3 Vision 是一个轻量级、最先进的开放多模态模型,基于数据集构建,其中包括合成数据和经过过滤的公开网站,重点关注文本和视觉方面的高质量推理密集数据。该模型属于 Phi-3 模型系列,多模式版本可支持 128K 上下文长度(以 Token 为单位)。该模型经历了严格的增强过程,结合了监督微调和直接偏好优化,以确保精确的指令遵守和稳健的安全措施。

模型参数 4B。

预期用途

主要用例

该模型旨在广泛用于英语商业和研究用途。该模型为通用人工智能系统和应用程序提供了视觉和文本输入功能,这些系统和应用程序需要

  1. 内存/计算受限的环境;
  2. 延迟限制场景;
  3. 一般图像理解;
  4. 光学字符识别;
  5. 图表和表格的理解。

我们的模型旨在加速对高效语言和多模态模型的研究,作为生成人工智能驱动功能的构建块。

用例注意事项

我们的模型并非针对所有下游目的而专门设计或评估。开发人员在选择用例时应考虑语言模型的常见限制,并在特定下游用例中使用之前评估和减轻准确性、安全性和公平性,特别是对于高风险场景。开发人员应了解并遵守与其用例相关的适用法律或法规(包括隐私、贸易合规法等)。

手写文字识别

提示词:对图像文字进行识别

这段文字是一个人的自己写作,表达了对学生在学校和家庭生活中的看法。

提示词:这张图片上写了什么?

Microsoft Phi-2

Phi-2: The surprising power of small language models

microsoft/phi-2

创建虚拟环境

conda create -n huggingface python==3.10.9
conda activate huggingface

安装依赖包

conda install pytorch torchvision -c pytorch
pip install transformers
pip install einops

下载模型

huggingface-cli download microsoft/phi-2 --local-dir microsoft/phi-2 --local-dir-use-symlinks False

代码 import torch from transformers import AutoModelForCausalLM, AutoTokenizer torch.set_default_device("mps") model = AutoModelForCausalLM.