克隆自己的三种方式
“用 AI 克隆你自己”可以复制三样东西之一:你怎么写、你的声音或你的样子。有些服务会把其中两三样结合起来,但每一部分都是单独打造的,用的素材也不同。
| 文字克隆 | 声音克隆 | 视频虚拟形象 | |
|---|---|---|---|
| 复制的内容 | 你的用词、措辞、幽默感、昵称和记忆 | 你声音的特质:音色、口音、节奏 | 你在屏幕上的面容、表情和手势 |
| 你需要提供的 | 你自己的聊天导出文件和书面笔记 | 你说话的清晰录音 | 一段你面对镜头的短视频 |
| 它对你的了解 | 你消息中的真实事件(前提是它有记忆索引) | 一无所知;它只朗读给它的任何文字 | 一无所知;它只呈现你或另一个 AI 写好的脚本 |
| 典型用途 | 对话、反思、为家人留下的记录 | 旁白配音、无障碍辅助、用你的声音制作的内容 | 演示、培训视频、社交媒体内容 |
| 主要风险 | 你聊天记录中涉及他人的私密信息 | 电话诈骗和冒充身份 | 深度伪造和误导性视频 |
一个像你一样思考、记忆和做决定的完整“数字版你”并不存在。如果你对那些更宏大的承诺感到好奇,我们关于什么是 AI 克隆的文章会直白地讲清楚其中的局限。
开始之前:目的、知情同意与安全
- 先想清楚克隆是用来做什么的。和另一个版本的自己聊天、给家人留下点什么、制作营销视频,需要走不同的路。
- 只克隆你自己,或明确表示同意的人。大多数语音和视频服务会要求你确认已获得同意,其中一些还会加以核验。
- 了解你的资料会去哪里。查看录音或聊天记录是否存储在服务器上、保存多久,以及是否会被用来训练模型。
- 想好如何标识它。你的克隆生成的任何内容,都应以 AI 的身份呈现,而不是冒充你本人。
途径一:根据你的消息打造文字克隆
文字克隆最能体现你的个性,因为多年的消息里有你的用词、你的玩笑,以及你生活中的人。打造文字克隆有两种方式。
快捷的方法是把你写的一些内容粘贴到通用聊天机器人中,让它模仿你。它可能在几次回复中抓住你的语气,但它看不到你的完整历史,而且把私密聊天粘贴到云服务中本身也有代价。尝试之前,请先阅读把聊天记录上传给 AI 是否安全。
周全的方法是使用一款能导入你的聊天导出文件、为其建立索引并学习你风格的工具。主要步骤如下:
- 导出你自己的聊天记录下载那些你写得比较多的对话,例如来自 WhatsApp、Messenger、Instagram 或 Discord 的对话。
- 添加笔记为聊天中从未出现的事实写一些简短的笔记:你在哪里长大、对你重要的人、你常讲的故事。
- 导入并确认谁是谁把导出文件载入工具,并告诉它哪个发送者是你。
- 诚实地测试它让它回答你收到过的真实消息,然后把它的回复和你当时实际写的内容作比较。
我们的完整教程如何创建你自己的 AI 克隆详细介绍了每个步骤。
途径二:声音克隆
声音克隆是一个针对你的声音调校过的文本转语音模型。你输入文字,它就用听起来像你的声音说出来。许多服务既提供用短样本快速生成的版本,也提供用更长录音生成、效果更好的版本。
ElevenLabs 是一个知名的例子。它的文档建议,“即时声音克隆”(Instant Voice Cloning)需要约一到两分钟的清晰音频。对于“专业声音克隆”(Professional Voice Cloning),它建议至少三十分钟,最好是两到三个小时,之后还有一个声音验证步骤:你需要朗读一段简短文字,以便服务核实这个声音确实属于你。Apple 则采取了不同的做法:它内置于较新 iPhone、iPad 和 Mac 系统中的“个人声音”(Personal Voice)功能,会让你朗读一系列句子,并在设备上处理声音,仅供个人和非商业用途。
- 选一个安静的房间软质家具能减少回声。关掉风扇、音乐和通知。
- 使用一支像样的麦克风保持稳定的距离,自然地说话,用你希望克隆使用的语气。
- 录制并上传遵循该服务对录音时长和格式的要求,并确认这是你自己的声音。
- 完成验证许多服务会要求你现场朗读一段话,以便与你的样本进行比对。
- 保护好成果除非有明确的理由要分享,否则不要公开这个声音。
单靠声音克隆没有个性;给它什么文字,它就读什么。我们对声音克隆与文字克隆的比较,解释了两者各自能保留什么。
途径三:视频数字人
视频数字人是你的动画版本,可以在屏幕上演绎一段脚本,通常还配有克隆的声音。两项广泛使用的服务展示了典型流程。HeyGen 表示,定制数字人从一段你自己的短视频开始(它宣传的时长约为十五秒),还需要一段对着镜头念出的同意验证码来核实你的身份。Synthesia 的个人数字人可以用网络摄像头或手机录制,需要录一段表示同意的视频,并附带你的声音克隆。
- 布置灯光和取景在均匀的光线下面对镜头,背景简洁,脸部清晰可见。
- 录制你的视频素材按照服务要求的时长,自然地说话和做手势。
- 录下同意环节由出现在视频中的同一个人,对着镜头朗读同意声明或验证码。
- 编写脚本并生成输入数字人要说的话,检查生成结果,并修正任何看起来或听起来不对的地方。
视频数字人是为演示讲解而打造的。除了脚本之外,它们对你一无所知。
安全:语音诈骗与深度伪造
声音和面容被用来证明身份,这让这类克隆对犯罪分子很有吸引力。美国联邦贸易委员会警告说,诈骗者可能只需要一小段音频(也许取自网上发布的视频),就能在“家人遇到紧急情况”的电话中伪造亲人的声音。
- 和关系亲近的家人约定一个私密暗号;遇到紧急要钱的请求时,先拨打你熟知的号码回电确认,再采取行动。
- 如果没有必要,尽量不要公开发布你声音的长段清晰录音。
- 清楚地标明 AI 生成的音频和视频。在欧盟,《人工智能法案》要求深度伪造内容必须标明为人工生成或经过篡改。
关于声音、肖像和 AI 的法律因国家而异;以上为一般信息,不构成法律建议。我们关于AI 克隆的法律与伦理问题的指南更深入地讨论了知情同意;如果涉及其他人,克隆他人之前的伦理清单会对你有所帮助。
用你的克隆做什么
有了克隆之后,真正有用的是你如何使用它。文字克隆可以成为一面用于反思的镜子:参阅如何与 AI 版本的自己对话,试试给过去的自己发消息,或者用 AI 写一封来自未来自己的信。无论你构建什么,它都可能出错,可能讨好你,也不能替代身边的人或专业支持。
Memory Clone 的定位
Memory Clone 只涵盖文字这一种途径。它是一款目前处于 Alpha 阶段的 Windows 桌面应用,可根据你亲自导出的聊天记录(WhatsApp、Messenger、Instagram 和 Discord)以及你的笔记,构建私密的 AI 模拟。它会针对每段关系分别学习你的风格,并将导入的原始文件和记忆索引保留在你的电脑上。
- 云端处理默认关闭,直到你为某个克隆开启它;开启后,会发送一部分有限的摘录用于撰写回复。你的内容不会被用来训练模型。
- 它目前不使用语音消息、照片或视频,也不克隆声音。音频和视频支持已在计划中,声音克隆则是一个研究项目。
- 你必须年满 18 周岁;根据我们的可接受使用政策,克隆另一位在世的人需要征得其同意。
常见问题
用 AI 克隆自己最简单的方法是什么?
用你自己的消息打造文字克隆,不需要任何录音设备,只需要导出聊天记录。语音和视频样本也很快就能准备好,但它们只能复制你的声音或外貌。
我能把文字克隆和我的声音、面孔结合起来吗?
有些服务会把聊天机器人与克隆的声音或数字人结合起来。各个部分仍是分别构建的,而组合在一起会增加以假乱真的冒充风险。
声音克隆需要多少音频?
这取决于具体服务。以 ElevenLabs 为例,它建议即时克隆使用一到两分钟音频,专业克隆至少使用三十分钟。
克隆自己的声音或面孔合法吗?
克隆你自己是最明确的情形,但用克隆去欺骗他人可能是违法的。各国法律不同,请查阅当地规定。
我的 AI 克隆会像我一样思考吗?
不是。它模仿的是你的言辞、声音或外貌中的模式,没有自己的经历或判断,还可能说出你绝不会说的话。
资料来源
核实于 。第三方产品和帮助页面经常变化,请点击链接查看最新详情。
- Professional Voice Cloning (documentation) (ElevenLabs)
- Instant Voice Cloning (documentation) (ElevenLabs)
- Create a Personal Voice on your iPhone, iPad or Mac (Apple Support)
- Custom avatar (HeyGen)
- Instant Avatar FAQ (HeyGen Help Center)
- Custom AI avatars (Synthesia)
- Scammers use AI to enhance their family emergency schemes (2023) (US Federal Trade Commission)
- Article 50: Transparency obligations for providers and deployers of certain AI systems (EU Artificial Intelligence Act (unofficial reference site))
本文为一般性信息,不构成医疗、法律或财务建议。Memory Clone 根据你提供的资料创建 AI 模拟;它不是那个人本身。