位置:首页 > 产业资讯 > 火山引擎豆包音频模型1.0 一句话生成影视级音频 角色10分钟不串戏

火山引擎豆包音频模型1.0 一句话生成影视级音频 角色10分钟不串戏

时间:2026-07-28  |  作者:穿越地图的猫  |  阅读:0

豆包音频生成模型1.0发布:一条Prompt搞定完整音频

昨日,火山引擎正式发布了豆包音频生成模型1.0(Doubao-Seed-Audio 1.0)

这款产品最直接的意义在于:它把文本或音频任一模态作为输入,直接端到端生成完整的音频作品。

换句话说,你给它一段文本,或者随便哼一段音频,它都能直接上手干活。

核心突破其实就一句话——过去你得分别处理对白、音效、背景音乐,然后人工对齐剪辑;现在,一条Prompt就能搞定这些,彻底告别那个多轨混音的繁琐时代。

image.png

一条Prompt,省去所有后期

以前,做一段成片级的音频作品意味着什么?

  • 对白要一条条生成
  • 音效要单独找素材
  • 背景音乐得另外挑
  • 然后手动对齐、多轨混音

流程繁琐到离谱,而且高度依赖后期技术。但豆包音频生成模型1.0把这一切压缩成一条指令。

你在单条提示词里就能定义多个角色的台词、语气和情绪节奏,里面还可以嵌入笑声、叹息、停顿甚至方言口音。背景音乐、环境音效……都一并生成,输出即成品。

创作者敲一段描述,直接收工——一部有声剧、一期播客节目或一个品牌音频,就这么出来了。

长音频不“串戏”,角色声音始终如一

长音频创作最让创作者头疼的,其实是前后一致性。你想想,角色在第1分钟和第10分钟听起来是不是同一个人?这可是个大问题。

豆包音频生成模型1.0实现了文生音频与参考音频的深度联动,在长音频中能保持音色高度统一。创作者不用再逐段比对、反复修音了。

当前模型单次支持2分钟音频创作,还能通过多次延长功能,在长程生成中保持音色一致,轻松应对有声书、播客、长剧集这些场景。

另外,模型还支持音色与风格的解耦控制。什么意思?就是同一音色可以适配不同情绪和语境,甚至能做到“一声多角”——同一个声音,在不同角色设定下呈现差异化表达。这对角色配音和创意音频生产来说,灵活性直接拉满。

目前火山方舟已开启API邀测,个人用户可以在体验中心享受30分钟创作额度。而且,豆包音频生成模型1.0很快也会上线剪映、即梦、番茄等产品,到时候大家都能用上了。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多