位置:首页 > 技术资讯 > 本地离线语音转文字整合包分享:区分说话人带时间戳

本地离线语音转文字整合包分享:区分说话人带时间戳

时间:2026-08-21  |  作者:半糖攻略君  |  阅读:0

MOSS-Transcribe-Diarize整合包:本地离线语音转文字的绝佳之选,能一步实现区分说话人并添加时间戳,非常适合会议、录音等场景!

核心要点

  • 语音转文字旧方案存在的问题:对配置要求高、难以区分说话人、没有webui界面
  • 整合包的核心功能:端到端一体化处理,可区分说话人、带有时间戳、支持热词设置
  • 本地部署的优势:一键启动,适配低配置,支持多种格式导出

大家好,我是小二黑。

之前我一直有个需求,就是找一个语音转文字工具。它得满足几个条件:配置要求低、中文识别准确率高、带时间戳、还能区分说话人

比如在电话录音、会议纪要这些场景中,区分说话人就特别重要。

当时我找了市面上很多开源项目,像FunASR、SenseVoice、Qwen-audio,还有Whisper,也都研究了本地部署,但都或多或少有些问题。

  • 要么不是原生就能区分说话人
  • 要么配置要求高
  • 要么没有webui界面

折腾了半天,最后我都放弃了,觉得这个需求短期内实现不了了。

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

MOSS-Transcribe-Diarize 0.9B的出现

直到2026年7月6日,Moss家族开源了一个项目MOSS-Transcribe-Diarize 0.9B。

这个音频理解模型支持区分说话人、带时间戳,主打中英文,简直完美适配我的需求。

先说说它的功能。MOSS-Transcribe-Diarize官方自带webui界面,上传音频就能直接转文字,还能区分说话人。

我实测3人对话完全没问题;时间戳精准对应;还有热词设置,像专业领域里的冷门词汇,填上后就能直接识别,一劳永逸;还支持字幕调节并添加到视频等。

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

官方资料与核心优势

为了验证一下效果,我仔细研究了官方文档,确定是不是我理解的那样:

  • 技术报告:https://arxiv.org/pdf/2601.01554
  • 模型主页:https://mosi.cn/models/moss-transcribe-diarize
  • 官方仓库:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize

它和以往常见方案最大的不同在于,它属于端到端一体化模型

很多开源方案都是语音识别、说话人区分两套模型分开运行,步骤繁琐,还容易出现时间戳错位、发言人匹配混乱的情况。

而MOSS-Transcribe-Diarize只需要一次推理,就能同步完成转写、人声区分、时序标注,在重叠发言、多人交替对话场景中的稳定性要好很多。

不过,项目虽然好,本地部署肯定还是有门槛的。为了方便咱们小白用户,我已经把项目的环境、依赖、模型都打包制作了一键整合包。

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

整合包有什么优势

整合包内置了完整的虚拟运行环境、适配好的CUDA组件与FFmpeg工具,不需要大家单独安装Python,断网环境下也能正常使用。

双击启动.BAT文件,就能自动拉起WebUI网页。显卡会自动启用GPU加速,没有独立显卡也可以用CPU模式运行。

同时我预设好了长音频参数,支持批量导入音视频,结果可以直接导出TXT、SRT、ASS多种字幕文件。

自媒体剪辑、整理会议文档都能直接用上。

实测配置表现

然后我个人实测了一下,有独立显卡的情况下,峰值显存占用是3GB左右,内存11GB左右,我觉得低于这个配置应该也能运行。

CPU模式下,我I5 - 8400cpu + 16GB内存无显卡能正常运行,速度也能接受,这应该就是一般办公电脑的配置了,完美适配会议纪要转写场景。

操作流程

1.双击启动.bat

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

然后等一会儿就会自动弹窗到浏览器。

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

2.进入正常操作页面后,点开高级

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

3.高级设置很重要

主要就是设置这里能提升效率。重点说几个:

  • 红叉子不要动,这是官方系统提示词,除非你懂,否则别动!
  • 热词框:比如有冷门词汇但在这段音频里总出现,你就写在这里,它就不会转写错误,每个热词之间用逗号隔开就行。
  • 输出tokens框:这里可以理解为输出文字数量,不一定是1:1对应,长文本你就加个0在后面,20分钟以内的音频就不用管,如果太长可能就会不完整,到数量上限就不转写了。
本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

4.生成结束后的操作

生成结束后就是这样,可以继续操作,右边能下载文件,有4种格式,一点击就下载。

说话人根据音频里面人数生成,3人就有S03。然后你根据人物声音判断是谁写上,字幕就同步了,可以直接给视频加上字幕。

下面还有字号、字位置、显示人名、说话人字幕带颜色,都根据自己需求填写就行。

本地离线语音转文字整合包分享:区分说话人带时间戳_wishdown.com

使用提醒

最后提醒一句,如果您想在局域网开服务给大家用,目前的情况是生成任务都能看见。

比如张三用你服务转写了一个,李四打开页面能看到任务记录。所以如果想开网络服务,记得删除任务或者想办法做用户隔离。

如果自己用,就可以忽略。

好了,如果您对这个项目感兴趣,有这方面的需求,可私信我数字006跟我要整合包来体验一下,或者咱们互相学习互相分享经验,当然了,资源仅限个人非商用研究。

登录查看剩余 70% 内容

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多