输入口播文案
最多输入 1,000 个字符,选择合适音色,还可以补充说话方式和动作要求。
不用出镜,也不用重新拍摄。上传一张人物照片,再配上文案或录音,就能让照片中的人物自然开口,生成可下载的口播片段。
人物正对镜头、五官无遮挡、光线均匀,生成后的嘴型和表情会更自然。
想快速出片就直接写文案;在意语气、停顿或发音时,可以上传自己的录音。
成片会保存在 History 中,方便预览、下载,再加入字幕、音乐或其他画面。

需要快速测试内容时,可以输入文案并选择音色;需要保留真人语气时,就上传现成录音。两种方式都能直接驱动同一张照片开口。
最多输入 1,000 个字符,选择合适音色,还可以补充说话方式和动作要求。
支持 MP3、WAV、M4A,文件最大 15 MB。人声越清楚、背景噪声越少,口型越容易跟准。
短句和自然停顿更适合短视频开场、产品卖点、活动通知和知识讲解。
当你需要一个人物或角色快速讲清主题,却不方便真人出镜时,可以先生成口播片段,再放进竖屏剪辑里搭配字幕、产品画面、录屏或 B-roll。
先用一句话点题、抛出问题或给出看下去的理由,再接教程、清单或故事正文。
让肖像、品牌吉祥物、插画角色或已获授权的人物图像讲段子、做反应、介绍产品。
快速制作功能介绍、上新预告、创作者动态、行动号召,或同一内容的不同语言版本。
这里负责生成人物口播;发布前可在剪辑软件中补充竖屏构图、字幕、转场、音乐和安全边距。
照片、声音和画质都在同一个页面设置,点击生成前就能看到预计时长和所需积分。
上传 JPG、PNG 或 WEBP,也可以从素材库和预设人像中选择。
输入文案并选择音色,或者切换到上传音频,使用自己的录音。
720p 适合低成本试做,1080p 能保留更多面部细节。生成后可在 History 中查看和下载。
只要画面里需要一个明确的讲述者,口播片段就能单独使用,也能成为完整视频中的一段。
用品牌人物介绍一项功能、一个卖点,或衔接不同的产品镜头。
先由讲述者做简短开场,再切到课件、案例或屏幕录制。
用有授权的照片和声音制作生日祝福、欢迎语、感谢视频或活动寄语。
让原创插画、品牌吉祥物和 AI 角色说出台词,为剧情和旁白增加人物感。
从选照片、配声音到查看成片,都在一个页面里完成,素材和生成记录也更好找。
同一张照片既能搭配 AI 音色,也能使用你的真人录音。
根据发布场景选择画质,生成前先确认时长和积分。
可以参考示例,也能随时回来查看处理中和已完成的视频。
还可以继续使用视频生成、声音生成和视频帧提取等创作工具。
照片口播容易被当成真人实拍。请只使用你有权使用的人像和声音;如果内容可能让观众误解,也要明确标注为 AI 合成。
使用自己的照片和声音、正版素材,或已获得明确许可的内容。
不要让真实人物看起来支持、承认或说出他们从未表达过的内容。
发布前检查 YouTube、TikTok 以及广告、版权和 AI 内容标注要求。
它能把一张静态人物照片变成会开口说话的视频。你只要输入文案或上传录音,系统就会根据声音生成对应的嘴型和面部动作。
添加一张清晰人像,输入口播文案或上传录音,选择 720p 或 1080p,确认预计积分后点击“生成口播视频”即可。
可以。切换到“上传音频”,选择不超过 15 MB 的 MP3、WAV 或 M4A 文件。人声清楚、背景安静的录音效果更稳。
建议使用光线均匀、人物正对镜头、只有一张清晰面孔的照片。侧脸、遮挡、模糊或人物太小,都会影响嘴型和表情。
目前最长支持 60 秒。输入文案时会根据字数估算时长;上传录音时会读取音频长度,超过 60 秒则无法生成。
720p 更适合试做和低成本测试;需要更多面部细节,或准备放进高清成片时,可以选择 1080p。
720p 每秒消耗 5 积分,1080p 每秒消耗 9 积分。点击生成前,页面会显示预计时长和总积分。
不需要。选照片、添加声音、设置画质、生成、查看 History 和下载成片,都可以直接在浏览器中完成。
只有在你拥有合法使用权并获得当事人适当许可时才可以。请勿用来冒充、欺骗、骚扰他人,或把虚构言论安到真实人物身上。
选好照片,写下文案或上传录音,确认预计时长和积分后即可生成。