作品2026年6月1日声音克隆:让 AI 开口唱歌(GPT-SoVITS + RVC)
一支完整的影像作品,画面只解决了一半——另一半是声音。为了让 AI 视频拥有真实可信的人声与歌声,我系统学习了声音克隆技术,打通了 AI 影像的「听觉」环节。
- 人声克隆 · GPT-SoVITS:采集数分钟的语音素材,完成降噪切片后训练语音模型,实现任意文本的克隆朗读,音色还原度与语气自然度极佳
- 歌声转换 · RVC:使用 RVC(Retrieval-based Voice Conversion)对原始歌声做音色迁移,让同一段旋律唱出目标音色
- 工程细节:素材的切片对齐、音高提取、训练轮次与过拟合的平衡,都是影响最终效果的胜负手
- AI 短片配音:为 AI 生成的角色配上稳定音色的人声
- 歌声翻唱:把喜欢的旋律转成目标音色演唱
- 内容创作:配音工作流直接嵌入我的视频生产管线,替代传统配音环节
声音克隆的伦理边界与版权问题同样重要。我在实践中始终坚持:只使用授权素材,不做伤害他人权益的应用。技术能力与使用底线,是一个创作者的一体两面。相关作品
「红头巾」AI 角色短片系列
围绕固定虚拟角色创作的多场景 AI 短片:从泳池到健身房,通过自训 LoRA 保证跨镜头角色一致性,再用图生视频完成动态叙事。 《丧尸肉鸽》:Godot 像素风肉鸽游戏
使用 Godot 4 独立开发的俯视角像素肉鸽生存游戏:实现战斗、商店、随机词条、等级成长等完整核心循环。 《酸黄瓜别吃》:风格化 AI 动画短片
以自训画风 LoRA 生成的美式动画风格短片,从风格训练、镜头生成到配音配乐与剪辑,全流程一个人完成,发布到视频平台。