腾讯具身智能全栈技术解析

WAIC 2026 腾讯 AI 应用创新论坛 · 首次系统性打通「感知—身体—行动」闭环

资料来源:腾讯官方发布稿、腾讯云开发者社区技术文章、Robotics X 实验室 & 福田实验室 & 腾讯混元联合发布内容(2026-07)

核心理念

腾讯首席科学家张正友提出:今天最聪明的人工智能本质是「缸中之脑」——善于逻辑、文本与问答,却缺少与物理世界直接互动的闭环。真正的智能要让 语言、视觉、空间认知、身体控制和环境反馈 在「感知—身体—行动」闭环里接受验证。

本次发布的五项成果,体现了腾讯「从离身走向具身、从分裂模块走向整体闭环」的探索思路:三个基座模型 + 一个智能体框架 + 一个 Always-on 智能体 + 升级的开源平台 + 云端 EaaS 服务。

一、全栈四层架构总览

整套方案贯穿四个层级,从下到上分别是 云底座 → 模型层 → 智能体框架层 → 平台层,最上层是零售导览、养老照护、工厂作业等真实应用,形成「数据/算力 → 模型 → 调度 → 本体 → 反馈」的完整链路。

graph TD
  A[应用层 · 真实场景落地<br/>零售导览/文旅导览/养老照护/工厂作业/按摩服务] --> B
  B[平台层 · Tairos 钛螺丝开放平台<br/>开源模型/智能体/工具 · RoboFusion · HAL · Isaac Sim 仿真] --> C
  C[智能体框架层 · TairosAgent + Apexio Always-on<br/>调度左右脑/大脑/小脑/身体 整合为闭环整体] --> D
  D[模型层 · 混元基座之上的具身模型矩阵<br/>VLM-1.0 右脑 / RxBrain-1.0 大脑 / VLA-0.5 小脑+身体] --> E
  E[云底座 · EaaS 三层体系<br/>算力底座 / 模型服务 / 感知交互]

云底座 EaaS 三层体系明细:

蚂蚁灵波(Robbyant)具身智能深度研究报告

研究对象:上海蚂蚁灵波科技有限公司(Shanghai Ant Lingbo Technology Co., Ltd.),对外品牌 Robbyant,模型系列 LingBot

方法说明:本报告基于公开信息(官网、arXiv、GitHub、工商登记、媒体报道、第三方论文)交叉验证撰写。全文严格区分「已核实事实」「厂商宣传口径」「媒体传闻」三类信息,并在关键处标注冲突口径。

一、核心结论(TL;DR)

  1. 它是一家"模型公司",不是"机器人公司"——但立场并不纯粹。灵波的战略主张是"不做本体、只做通用大脑",对标 Physical Intelligence;可它同时推出了自研本体 R1(2025.09)与 R2(2026.07)。官方解释是本体用于"定义参考构型、暴露软硬件问题、支撑数据采集",但客观上使其处于软件叙事不够纯粹、硬件能力不足以对抗本体厂的中间态。
  1. 技术体系的完整度是国内第一梯队,且明显超出同体量公司。7 个模型家族、11 个已发布版本,覆盖深度补全 → 空间视觉基座 → 3D 重建 → VLA 操作 → 世界模型 → 视频生成 → 世界动作模型。同时押注 VLA 与"世界动作模型(WAM)"双线,在国内属少数派,等价于对两条尚未收敛的技术路线做了对冲。

「图像工作台」市场调研与产品规划报告

调研日期:2026-08-04 | 调研方式:公开网络检索(知乎、少数派、V2EX、App Store、Reddit、Hacker News、掘金、博客园、Product Hunt 索引、官方博客等),小红书/抖音/微博等平台因站内封闭,以搜索引擎收录内容与第三方转述间接佐证。

产品现状:纯前端单文件 HTML 图像工具,支持多图水平/垂直拼接、裁剪、条带移除(整行/整列删除后自动拼合)、旋转翻转、撤销重做、PNG/JPEG 导出。定位目标:发布为正式产品

一、摘要:五个核心结论

  1. 需求真实且常青。「长图拼接 / 截图拼接」是一个持续十年以上的稳定需求:知乎 2015 年的提问至今仍有新回答,App Store 2025 年仍在密集上架新品,Reddit 上 2016–2025 年持续出现求助帖。它"低频但广泛",几乎人人偶尔需要。
  2. 现有供给口碑普遍差。头部 App(Tailor 仅 3.1 分)、在线工具(限 2 张、要上传、广告多)、综合修图 App(拼图入口难找、订阅套路)都有明显缺口;用户对"画质压缩、水印、广告、注册墙、先做后收费"怨声载道。
  3. 你的两大天然优势恰好命中行业最痛的点:① 纯前端、图片不上传(隐私是 HN/Reddit 反复验证的好感点,Photopea、Squoosh、Upscayl 都靠它出圈);② 「条带移除」功能在全网没有发现任何同名竞品,是差异化杀手锏。
  4. 最该优先补齐的不是 AI,而是「自动重叠对齐拼接」。这是滚动截图场景的核心痛点,已被 MeTool、LongPic、Stiiitch 验证为付费卖点,且用纯 JS 传统算法即可实现,零成本、零隐私负担。
  5. 变现走「核心免费 + 一次性买断 Pro」(建议 ¥28–48 / <span class="katex-error" title="ParseError: KaTeX parse error: Unexpected character: '&#x27; at position 78: …ch ¥68、Upscayl \̲" style="color:#cc0000">6–10),避开订阅制与注册墙——国内外社区证据都强烈反感订阅,买断制在该品类有大量成功先例(Picsew ¥15、Stitch ¥68、Upscayl </span>25)。

基于 Strix 的 JavaSecLab 源代码深度渗透测试报告

本文档基于Strix 多智能体网络安全渗透测试工具,对开源 Java 漏洞实训平台 JavaSecLab 开展深度白盒代码审计与系统性安全渗透测试。依托 Strix 多智能体协同检测能力,本次测试覆盖项目全部源代码、框架配置、业务逻辑及第三方依赖组件,完整挖掘、归类、验证项目内置的各类安全漏洞。

JavaSecLab 作为面向安全学习、代码审计、安全开发与工具测评的综合型 Java 漏洞靶场,集中复现了 Web 安全、代码缺陷、组件漏洞、业务逻辑风险等大量典型安全问题。本次通过 Strix 深度扫描模式,完成全量代码静态分析、漏洞溯源、数据流审计、风险定级与攻击路径复盘,累计检出严重、高危、中危、低危多维度安全漏洞,覆盖反序列化 RCE、SQL 注入、认证绕过、SSRF、XXE、XSS、模板注入、文件操作漏洞及第三方依赖高危 CVE 等核心风险场景。

Strix 命令行帮助文档

OpenClaw 架构设计与核心模块深度研究

一、项目定位与设计哲学

OpenClaw 不是 AI 模型,而是一个开源(MIT)的 AI Agent 运行时框架(Runtime Framework)——它坐在 AI 模型与外部世界之间,作为一个常驻运行的单体运行时网关(Gateway),负责把自然语言指令转化为真实的系统操作。

定位公式:

OpenClaw = Gateway(网关) + Agent Runtime(运行时) + Skills(技能) + Memory(记忆)

五项核心设计哲学:

理念 说明
Local-first(本地优先) 数据不离开用户设备,记忆为本地 Markdown,配置为 JSON;使用 Ollama/vLLM 本地模型时内容永不外传
网关而非框架 不是 SDK/库,而是独立运行的控制平面进程
模型无关(Model-Agnostic) 一行配置切换 Claude/GPT/Gemini/DeepSeek 等,按任务路由不同模型
插件化内核 Skills、Channels、Providers 均可热插拔(v2026.3.22+ 全面插件化)
工程化 Agent 从聊天机器人升级为任务调度执行系统,强默认不阉割能力,危险路径暴露为操作者可控开关

命名含义: Claw(龙虾钳子)= 抓取/操控/执行能力;Open = 完全开源、社区驱动。

2026 年主流原型设计工具调研与对比

调研时间:2026 年 7 月 | 覆盖国际 / 国产 / AI 新势力共 16 款工具 | 数据综合自多份 2026 行业榜单与厂商官网

一句话结论

2026 年原型设计市场已形成「Figma 一超多强 + 国产工具快速追赶 + AI 生成式原型崛起」的格局。通用团队首选 Figma(或国产 MasterGo / Pixso);复杂业务逻辑仍离不开 Axure;追求「原型即可上线」可看 Framer / v0 / Bolt;Adobe XD 已于 2024 年停止主动开发,不建议新项目选用

1. 市场格局速览

原型设计已从「单机绘图」走向「云端实时协作 + 设计系统 + 研发交付」一体化。

指标 说明
Figma 市场份额 ~45–62%(来源口径不一,均居首)
Figma 月活设计师 4M+;2025 年已于纳斯达克上市(FIG)
Sketch 市场份额 ~18–25%,多为 macOS 存量用户
本报告对比工具数 16+(国际 8 + 国产 6 + AI 新势力)

⚠️ 关键变化:Adobe 收购 Figma 的交易于 2023 年被监管叫停后,Adobe 在 2024 年停止了 XD 的主动开发,转入维护模式。

Strix 部署 · 架构 · 实践完整指南

基于 strix 1.3.1 源码(https://github.com/usestrix/strix)逐行核对 CLI 与运行逻辑编写。所有命令参数对应真实代码位置,可直接复制使用。

⚠️ 合规前提:Strix 是自动化渗透测试工具,仅可用于你拥有或已获书面授权的应用/资产。未经授权扫描他人系统属于违法行为。本指南所有示例目标均假设你拥有测试权限。

一、项目定位

Strix 是一个开源 AI 渗透测试工具,部署自主 AI agent 团队对应用进行漏洞发现与验证。核心区别于静态扫描器(SAST):agent 像真实红队一样动态运行代码、构造 PoC、验证可利用性,产出可复现的漏洞报告而非误报堆积。面向开发与安全团队,支持 CI/CD 集成。

仓库:https://github.com/usestrix/strix | 版本:1.3.1 | License:Apache-2.0

二、技术栈

游戏引擎对比分析

覆盖 8 款主流引擎,从开发语言、授权费用、2D/3D 能力、目标平台、学习曲线到生态资源全面对比。评分基于公开资料与社区共识,含主观判断,仅供选型参考。

一、选型看哪些维度

  • ① 开发语言:JS/TS 适合网页派;C# 门槛适中;C++ 性能强但陡峭;无代码更适合零基础。
  • ② 授权与费用:开源免费(Godot / Phaser)最省心;Unity 订阅、Unreal 抽成,上线后都要算账。
  • ③ 2D / 3D 能力:2D 多数引擎都强;3D 差距大,Unreal / Unity 领跑,Godot 4 进步明显。
  • ④ 目标平台:纯网页 H5、微信小游戏、PC、手机 App、主机——覆盖度直接影响发行。
  • ⑤ 学习曲线:无代码与 GDScript 上手快;C++ / 蓝图体系需要时间沉淀。
  • ⑥ 生态与资源:教程、插件、素材商店的多寡,决定你卡壳时能不能自救。

二、综合对比表

AI OS:智能体操作系统的范式革命 —— 巨头布局、核心本质与架构设计深度调研

多智能体深度调研成果

一句话结论:六家科技巨头已全部下场做 AI OS,2025–2026 年集中爆发;学界与产业界对其核心要素(记忆 / 决策 / 行动 / 安全四大系统原语)的定义高度收敛——AI OS 已从营销概念变成架构共识,竞争焦点转向「协议路线 vs GUI 路线」与「重构 vs 叠加」。

Section 01 · 新闻背景

2026-07-13:阶跃星辰「四件套」发布,AI OS 之争进入白热化

上海「阶跃终端品牌暨新一代智能体战略发布会」上,大模型公司阶跃星辰一口气发布四件产品,宣称构建「模、软、硬」三位一体闭环,并提出智能体落地的「三堵墙」理论。[1][2]

  • 品牌STEPX —— 大模型原生 AI 终端品牌。阶跃公式:「Step 模型矩阵 × Step Agentic-native OS」。[3]
  • 操作系统Step AOS —— 「全球首个智能体原生操作系统」。官方口径为在 Android/Linux/RTOS 之上重构的智能体原生中间层,向下兼容。[4]
  • 个人智能体阶跃Amoo —— 拥有操作系统级身份:跨应用调度、端云协同、多设备任务接续,「越用越懂用户」。
  • 硬件STEPX Neo —— 大模型原生智能体手机,背部点阵 LED 像素副屏,华勤技术代工;WAIC 2026 首秀即获「镇馆之宝」。[5][6]

OfficeCLI 研究与实践总结

对象:iOfficeAI/OfficeCLIhttps://github.com/iOfficeAI/OfficeCLI) 时间线:研究 → 安装到 WorkBuddy → 能力验证 → 三格式展示文档 文档性质:将「深度研究」与「本机实践」合并沉淀,既含结论也含可复现的操作记录

〇、一句话结论

OfficeCLI 是面向 AI Agent 的 Office 自动化套件:一个单文件二进制(内嵌 .NET 运行时,零安装、零外部依赖),提供对 Word / Excel / PowerPoint 的读、改、建能力,并用「高保真渲染 + 确定性 JSON 路径寻址」让 Agent 既能算、也能看见自己生成的排版(render → look → fix 闭环)。经本机实测,README 宣称的核心能力全部成立。它当前仅作为 WorkBuddy 用户级技能 安装在本机(~/.workbuddy/skills/officecli/),可被本 WorkBuddy 实例直接调用。

一、项目研究结论(深度)

1.1 定位与本质 类别:面向 AI Agent 的 Office 文档自动化工具 / AI 中间件(Agent 与 .docx/.xlsx/.pptx 之间的适配层,本身不是聊天机器人)。 技术本质: 单文件二进制:内嵌 .

MinerU 使用指南

面向 LLM · RAG · Agent 的高精度文档解析引擎 | 实测版本 3.4.4 | 含本地真实跑通经验与踩坑实录

一、介绍:MinerU 是什么

MinerUopendatalab/MinerU)是一个面向 LLM · RAG · Agent 工作流 的高精度文档解析引擎。它把 PDF / 图片 / DOCX / PPTX / XLSX / 网页转换为机器可读的 Markdown / JSON,供下游检索、抽取与处理。它的起源是 InternLM 预训练过程中的科学文献符号(公式、表格)转换需求,因此对公式和表格的处理是强项。

一句话定位:把"人类看的文档"变成"模型能吃的干净结构化数据"——这是任何 RAG / 知识库 / 文档智能产品的第一道摄入层。

1.1 能力矩阵

MarkItDown 使用指南(实战版)

基于本地实测(markitdown v0.1.6 · Python 3.13)编写,输出均为真实命令捕获,非示意。 项目:https://github.com/microsoft/markitdown | 许可证:MIT(可商用)| 维护:Microsoft AutoGen 团队

验证进度:9 种格式中,Excel / Word / HTML / ZIP / Image(EXIF) / Audio(容器元数据) 已在本地用真实文件跑通;PPT / PDF 表现与直觉有出入(已标注);YouTube 因本环境代理重置其 TLS 而未在本机跑通,命令与用法见第 5 节,可在能直连 YouTube 的机器上验证。

1. 它到底是什么

一句话:把任意文件(PDF / Office / 图片 / 音频 / 网页 / 压缩包…)转换成对 LLM 友好的 Markdown 的轻量 Python 工具。

本质定位:AI 应用链路里「模型前面的数据入口」——在喂给 RAG / 知识库 / 检索之前,先把杂乱格式洗干净。 设计哲学不追求高保真排版还原,只保留对机器有用的结构(标题、列表、表格、链接),输出给文本分析工具消费。

⚠️ 它不是排版转换工具。如果你要的是「合同归档 / 视觉一致的 PDF 重排」,它不合适。

2. 30 秒上手

企业 AI 助手安全使用完整方案

面向已部署 / 计划部署 AI 助手(如 WorkBuddy、ChatGPT Enterprise、Claude、内部 Copilot 等)的企业 覆盖:治理 · 部署架构 · 数据防护 · 访问控制 · 合规审计 · 落地路线图

  • 原则:把发给 AI 的每句话当公开
  • 分级 · 脱敏 · 最小权限 · 审计可追溯
  • 贴合《个人信息保护法》《数据安全法》

1. 总体原则与定位

企业用 AI 不是"禁不禁"的问题,而是"在哪里用、用什么数据、谁能看"的问题。

核心结论(来自社区实践与一线技术文章共识):企业用 AI 确实存在数据泄露风险,但风险主要源于架构选型与治理缺失,而非 AI 技术本身。通过私有化部署、RAG 权限隔离、严密的脱敏与审计,可构建"数据不出域"的安全闭环。

📌 四条铁律:

  1. 假设公开:发给 AI 的内容视为可能公开,绝不粘贴凭证 / 完整 PII / 未脱敏商业机密。
  2. 最小必要:只发送完成任务所需的最少数据,敏感字段在发送前脱敏或剔除。
  3. 越敏感越本地:敏感度越高,处理越应留在内网 / 自托管模型。
  4. 可审计:每一次 AI 调用、数据交互、工具执行都可溯源。

2. 组织治理框架

技术只占三分之一,治理决定成败。建议建立三层治理结构:

2.1 组织

  • AI 治理委员会:由 IT、安全、法务、业务负责人组成,制定并监督 AI 使用安全标准。
  • 数据保护官(DPO)/ 合规负责人:对接《个人信息保护法》义务,处理违规与事件上报。
  • 部门 AI 管理员:负责本部门知识库权限、账号开通与日常培训。

社交平台用户需求扫描与创业机会研究报告

——基于国内外主流社交平台(Reddit / Hacker News / Product Hunt / X / 小红书 / B站 / 知乎 / 即刻 / 微博)的需求信号挖掘、机会评估与技术验证路线图

报告日期:2026 年 7 月 25 日

摘要

本报告通过系统扫描国内外主流社交平台上用户的真实抱怨、许愿帖("I wish there was an app…"类内容)、趋势报告与创业社区讨论,提炼出十大高频未被满足的需求信号,并构建六维加权评估模型筛选出五个最值得优先进行技术验证的创业方向

排名 方向 加权得分(满分5) 一句话逻辑
1 垂直行业 AI 工作流 Agent(法律/会计/医疗/跨境电商等文档与流程自动化) 4.05 B 端付费意愿最强,"窄而痛"是 2026 年最确定的变现路径
2 适老化数字助手 / 亲情远程协助 4.05 2.8 亿老年网民 vs "教不会"的子女,竞争极稀疏
3 内容真实性与"去 AI 味"工具(B2B 营销侧) 3.85 AI slop 反弹下,"证明你是真人做的"成为新预算项
4 情绪陪伴 / 心理健康轻应用 3.75 孤独经济高速增长,但需严控合规与伦理
5 垂直窄教育 AI(出海优先) 3.75 已被中国小团队反复验证的现金牛模式

图标工具开发最佳实践与经验总结

项目:icon-tool/(Next.js 16 + React 19 + Tailwind v4) 面向设计师的公开图标工具:浏览 + 检索 + 一键导出(SVG / Sprite / 多尺寸 PNG)

一、项目背景与目标

一个给设计师用的图标工具,要解决的核心痛点是:跨库统一搜索 + 一键导出多格式。首版定位为「游客可用的公开原型」——聚合精选开源库、强搜索、一键导出,账号/云端与 AI 生成推迟到后续阶段。

首版交付范围(Phase 0–3):

  • 内置 Lucide、Tabler、Phosphor 三库共 10134 个图标(构建时抽成 public/icons.json,约 7MB)
  • 关键词搜索 + 按图标集 / 风格筛选(客户端)
  • 悬停快操作、多选、批量导出 SVG 压缩包与 SVG Sprite
  • 图标详情页 + 多尺寸 PNG 导出与复制
  • 上传 SVG、收藏(均存 localStorage

二、开发过程时间线

timeline
    title 图标工具开发时间线
    需求沟通 : 4 轮结构化提问收敛方向<br/>核心=浏览+检索+导出,技术栈/库/视觉/范围敲定
    Phase 0-1 : 脚手架 + 三库索引脚本<br/>10134 图标入仓,网格渲染 + 悬停快操作
    Phase 2-3 : 客户端搜索筛选 + 上传 + 多选批量导出
    设计升级 : 用 /前端开发 技能重做 UI<br/>暖中性画廊色 + 玻璃态 + Framer Motion
    体验迭代 : 放大图标 + 操作条移底 + 详情页 + 多尺寸 PNG
    沉淀 : 流程固化为 icon-library-bundler 技能 + 本文档

三、系统架构

graph TB
    subgraph 构建时["构建时 (CI / npm run build:icons)"]
        L["lucide-static"]
        T["@tabler/icons (outline)"]
        P["@phosphor-icons/core<br/>(regular + duotone)"]
        S["scripts/build-icons.mjs<br/>读 SVG→压缩→分类 style→索引"]
        L --> S
        T --> S
        P --> S
        S --> JSON[("public/icons.json<br/>10134 图标 · 7MB")]
    end

    subgraph 运行时["运行时 (Next.js App Router · 纯客户端)"]
        PG["app/page.tsx<br/>状态编排"]
        TB["TopBar<br/>批量操作条"]
        SB["Sidebar<br/>搜索/筛选/上传"]
        IG["IconGrid<br/>网格+骨架+空态"]
        IC["IconCard<br/>图标卡+底部操作条"]
        DP["app/icon/page.tsx<br/>详情页"]
        LD["lib/iconData.ts<br/>loadIcons / findIconById (缓存)"]
        EX["lib/export.ts<br/>SVG / Sprite / PNG"]
        LS[("localStorage<br/>收藏 / 上传")]
    end

    JSON -. "fetch 一次" .-> LD
    LD --> PG
    PG --> TB
    PG --> SB
    PG --> IG
    IG --> IC
    IC -. "双击 / 打开详情" .-> DP
    DP --> EX
    TB --> EX
    PG <--> LS

    style JSON fill:#faf9f5,stroke:#d97757,color:#141413
    style LS fill:#faf9f5,stroke:#a8a29e,color:#141413

关键架构决策:索引前置 + 纯客户端。

三库的 SVG 在构建时被抽成一份统一 JSON,前端加载后做客户端搜索与渲染,无需后端查询、无数据库、可静态部署。几千~上万个图标的规模下,fetch 一次 JSON + 内存过滤足够快。

四、关键技术流程

4.1 图标索引构建

flowchart LR
    A[扫描 node_modules<br/>各库 SVG 目录] --> B[读取每个 .svg 文本]
    B --> C[SVG 压缩<br/>去注释/多余空格/统一 currentColor]
    C --> D[归类 style<br/>line / filled / duotone]
    D --> E[组装统一记录<br/>id, set, name, style, tags, license, svg]
    E --> F[写入 public/icons.json]

统一记录结构(lib/types.ts):

OfficeCLI 命令行工具完整使用手册(Skill)

名称:officecli

描述:通过 officecli 命令行工具创建、分析、校对、修改 Office 文档(.docx、.xlsx、.pptx)。适用于用户需要新建文档、查看内容、检查格式、排查问题、插入图表或修改 Office 文件的场景。

officecli

适配AI使用的命令行工具,支持 .docx、.xlsx、.pptx。单二进制文件,无外部依赖,无需预先安装 Office

安装

若未安装 officecli

# macOS / Linux
curl -fsSL https://d.officecli.ai/install.sh | bash

# Windows(PowerShell)
irm https://d.officecli.ai/install.ps1 | iex

执行 officecli --version 验证安装。安装完成仍提示命令不存在时,请打开新终端重试。

使用层级策略

L1(读取操作) → L2(文档DOM编辑) → L3(原始XML) 优先使用更高层级接口。添加参数 --json 可输出结构化数据。

处理文档前,请查阅【专用技能模块】(文档底部) 融资演示文稿、学术论文、财务模型、数据看板、平滑切换(Morph)动画需要先加载对应专用技能——执行一次 load_skill 后再执行操作。

帮助系统(重要)

不清楚属性名称、取值格式、命令语法时,务必查看帮助文档,不

智会 T1 (SmartMeet T1) 硬件结构设计(Kimi K3 ✚ FreeCAD)

——写给完全不懂硬件的软件工程师的硬件设计入门读本

这份文档假设你从未接触过硬件设计。它一边讲这个项目做了什么、怎么做的, 一边把理解每个环节所需的硬件基础知识讲清楚。 读完后你应该能:看懂这套设计文件、知道每个文件是干什么的、 并能自己动手改一个尺寸、重新生成模型、拿去 3D 打印。

1. 这个项目是什么

我们团队做了一套「AI 智能会议系统」软件:开会时实时把语音转成文字、 区分是谁在说话(说话人分离)、会后自动生成会议纪要。这套软件完全离线 跑在一台 NVIDIA Jetson AGX Thor 开发套件上(一块带强大 AI 算力的卡片式电脑, 可以粗略理解为"一台浓缩到巴掌大、专门跑 AI 的小型工作站")。

软件跑在芯片上,但芯片不能裸着摆在会议桌上。这个项目要做的, 就是给这套软件造一个 "身体":一台放在公司会议室(20 人以内)桌上的 硬件终端——它有外壳、有麦克风阵列、有扬声器、有状态屏、有摄像头, 内部把 Thor 开发套件和这些器件安排得井井有条。

这台终端叫 智会 T1 (SmartMeet T1),长这样:

智会 T1 等轴测前视图

需要说明的是:本项目交付的是结构设计与工程文档(外壳和内部布局怎么设计、 怎么装配、买什么零件),不包括电路设计和软件代码。

智能自动脱敏工具 · 全景指南(规则 / 边界 / 流程 / 图像)

技能image-text-desensitization(别名"智能自动脱敏工具")v3.0.0 主类SmartDesensitizer 能力:覆盖文本 / JSON / 图像三类对象的隐私脱敏,全程本地运行,不联网 安全背书:经腾讯云安全 cloudsec.tencent.com 与腾讯内部 tix.qq.com 扫描,状态均为"安全无风险(benign)"

颜色图例(贯穿全文)

颜色 类型
🟣 紫 手机号
🟠 橙 身份证
🩵 青 邮箱
🟢 绿 银行卡
🔴 红 IP 地址

① 能力总览

该技能是一个被动库——需要显式调用才生效,不会自动拦截对话。它提供三个入口方法:

入口 方法 说明
📝 文本脱敏 desensitize_text(text) 基于 5 条正则逐类替换。已验证可用,纯 Python 即可。
🧾 JSON 脱敏 desensitize_json(json_str) 按字段名命中 + 按值形态智能遮蔽。已验证可用。
🖼️ 图像脱敏 desensitize_image_base64(b64) OCR 文字框 + 人脸检测后高斯模糊。需额外依赖(本地未装)。

② 文本脱敏规则 desensitize_text

源码写死 5 条正则,按固定顺序执行:手机 → 身份证 → 邮箱 → 银行卡 → IP。

语音识别及说话人分离模型(MOSS-Transcribe-Diarize)本地部署最佳实践

基于一次真实落地经历整理:在 Apple M2 Max(64GB 统一内存)上部署 OpenMOSS/MOSS-Transcribe-Diarize(0.9B 端到端音频转写 + 说话人分离),并构建 Web 应用。过程中解决了长音频(30 分钟 / 1–2 小时)在 MPS 上 OOM / 静默卡死的问题。

本文不重复项目能力说明,只讲"怎么把它跑稳、跑长"。能力研究与部署步骤见 README.md,Web 后端实现见 webapp/app.py

0. 一句话结论

不要在 Apple Silicon 上一次性推理超长音频。 端到端音频模型会把整段音频堆叠成一个巨型张量送编码器,自注意力矩阵大小 ∝ 音频长度²,几分钟可以、30 分钟必炸。正确做法是按 ≤300s 分块推理、块间重叠、时间戳偏移拼接、每块后释放 MPS 缓存

1. 部署:把"能跑"变成"稳定跑"

1.1 固定依赖版本,杜绝解析回溯

torch>=2.8 + 未固定版本的 pip install -e . 会让 uv 陷入 version-resolution 回溯死循环(解析到 2.13、多个 transformers 版本,半小时不收敛)。

M2 Max 本地部署 MOSS-Transcribe-Diarize:离线多说话人音频转写 Web 应用完整实战

基于 OpenMOSS/MOSS-Transcribe-Diarize 的本地部署,并构建了一个 Web 应用:用户上传音频/视频,模型自动完成 转写 + 说话人分离(Diarization)+ 时间戳 + 声学事件感知,返回带说话人标签的结构化字幕。

mindmap
  root((MOSS-Transcribe-Diarize<br>本地部署与Web应用))
    模型与能力
      端到端音频理解(0.9B)
      联合ASR与说话人分离
      输出Sxx标签与时间戳
      声学事件感知
      支持50+语言
    部署环境
      Apple Silicon M2 Max
      Python 3.12 + venv
      PyTorch 2.11 + Transformers 5.10
      HF镜像下载
      FastAPI后端 + 静态前端
    长音频处理策略
      自动分块(默认300秒)
      块间重叠(15秒)
      绝对时间偏移与去重
      逐块释放MPS缓存
      跨块标签不对齐(需外部聚类)
    Web应用功能
      拖拽上传音视频
      异步任务轮询
      彩色说话人标签与时间轴
      点击段落定位播放
      导出SRT/JSON/TXT
      一键复制全文
    性能与边界
      RTF小于1(MPS加速)
      单块小于等于300秒稳定
      需注意MPS OOM风险
      支持环境变量调参

一、项目能力研究

定位

MOSS-Transcribe-Diarize 是 OpenMOSS 团队开源的 端到端(end-to-end)音频理解模型,当前版本 0.9B(2026-07-09 开源)。它一次性联合完成「语音识别 + 说话人分离」,而非传统 pipeline(ASR + 独立的 speaker diarization 再对齐)。

  • 2026-07-14 获 INTERSPEECH 2026 第二届 MLC-SLM 挑战赛第一名(覆盖 14 种语言)。
  • 更强版本 MOSS-Transcribe-Diarize Pro 即将以 API 形式提供。

核心能力

能力 说明
长音频多说话人转写 面向会议、电话、播客、访谈、讲座、视频等杂乱多说话人录音
说话人分离(Diarization) 输出一致的说话人标签 [S01] [S02]
时间戳 秒级对齐,格式 [start][Sxx]text[end]
声学事件感知 可选输出,标注非语音声学事件
多语言 支持 50+ 种语言