位置:首页 > 热点资讯 > 可灵AI照片说话视频生成教程

可灵AI照片说话视频生成教程

时间:2026-07-25  |  作者:318050  |  阅读:0

可灵AI的数字人功能,本质上就是用静态人像图配合文本或音频,生成一段口型同步的1080p短视频。

整个过程不需要你掌握任何视频拍摄或剪辑技巧。只需一张清晰的人像照片,再加一段文案或一段录音,几分钟内就能产出一段符合短视频平台播放标准的“说话视频”。

可灵AI照片说话视频怎么生成

确认是否满足基础条件

版本要求

这项功能目前只在电脑端v3.0.2及以上版本中开放。手机App和网页版暂时还不支持。

如果用的是旧版客户端,必须卸载重装最新版。否则点击“人物驱动”按钮后,界面会直接报错或出现空白。

照片要求

整个功能依赖对人脸结构的完整识别。上传的照片必须满足几个硬性条件:

  • 正面或微侧脸(左右偏转不超过30度)
  • 双眼清晰可见
  • 无口罩或墨镜等大面积遮挡
  • 背景干净不杂乱

侧脸过大或人脸被局部遮挡,系统不会给出任何提示,只会生成一段静止画面——口型驱动直接失败。

准备驱动源:文本还是音频?

方法一:用文字生成语音并驱动口型

这适合口播稿、产品介绍这类场景。在「输入文本」框中粘贴已校对好的口语化文案即可。

例如:“大家好,这是我们新上线的夏日限定芒果冰,采用当季台农芒现打,奶香浓郁不腻口。”

需要注意:文案里所有括号注释、英文缩写和顿号分隔的并列短语最好都删掉。AI对这些标点的理解不太稳定,容易导致口型卡顿。

方法二:用真人录音驱动口型

这适合复刻声音、方言播报等场景。上传的音频文件必须满足以下条件:

  • 格式为WAV或MP3
  • 时长严格控制在10到60秒之间
  • 音频开头必须留有至少0.3秒的静音段,否则系统会截断首字发音
  • 采样率建议设定为44.1kHz,低于32kHz会导致唇形出现明显抖动

执行人物驱动操作

第一步:进入「创建作品」页面,点击右上角齿轮图标,开启「高级模式」。

第二步:在编辑区左侧工具栏找到并点击「人物驱动」按钮,界面会自动跳转至配置面板。

第三步:上传照片。拖入一张1024×1024像素的PNG或JPG格式人像图,系统会在3秒内完成面部关键点定位并显示绿色锚点框。

第四步:切换到对应标签页(「输入文本」或「上传音频」),填入或导入驱动源。

第五步:点击「生成视频」,等待约70到120秒,预览画布会逐帧渲染出带口型动作的视频流。

来源:整理自互联网
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多