M2 Max 本地部署 MOSS-Transcribe-Diarize:离线多说话人音频转写 Web 应用完整实战
基于 OpenMOSS/MOSS-Transcribe-Diarize 的本地部署,并构建了一个 Web 应用:用户上传音频/视频,模型自动完成 转写 + 说话人分离(Diarization)+ 时间戳 + 声学事件感知,返回带说话人标签的结构化字幕。
mindmap
root((MOSS-Transcribe-Diarize<br>本地部署与Web应用))
模型与能力
端到端音频理解(0.9B)
联合ASR与说话人分离
输出Sxx标签与时间戳
声学事件感知
支持50+语言
部署环境
Apple Silicon M2 Max
Python 3.12 + venv
PyTorch 2.11 + Transformers 5.10
HF镜像下载
FastAPI后端 + 静态前端
长音频处理策略
自动分块(默认300秒)
块间重叠(15秒)
绝对时间偏移与去重
逐块释放MPS缓存
跨块标签不对齐(需外部聚类)
Web应用功能
拖拽上传音视频
异步任务轮询
彩色说话人标签与时间轴
点击段落定位播放
导出SRT/JSON/TXT
一键复制全文
性能与边界
RTF小于1(MPS加速)
单块小于等于300秒稳定
需注意MPS OOM风险
支持环境变量调参
一、项目能力研究
定位
MOSS-Transcribe-Diarize 是 OpenMOSS 团队开源的 端到端(end-to-end)音频理解模型,当前版本 0.9B(2026-07-09 开源)。它一次性联合完成「语音识别 + 说话人分离」,而非传统 pipeline(ASR + 独立的 speaker diarization 再对齐)。
- 2026-07-14 获 INTERSPEECH 2026 第二届 MLC-SLM 挑战赛第一名(覆盖 14 种语言)。
- 更强版本
MOSS-Transcribe-Diarize Pro即将以 API 形式提供。
核心能力
| 能力 | 说明 |
|---|---|
| 长音频多说话人转写 | 面向会议、电话、播客、访谈、讲座、视频等杂乱多说话人录音 |
| 说话人分离(Diarization) | 输出一致的说话人标签 [S01] [S02] … |
| 时间戳 | 秒级对齐,格式 [start][Sxx]text[end] |
| 声学事件感知 | 可选输出,标注非语音声学事件 |
| 多语言 | 支持 50+ 种语言 |

