DC娱乐网

30秒,就能克隆一个声音 谷歌刚发布了新的语音合成模型:Gemini 3.8 F

30秒,就能克隆一个声音
谷歌刚发布了新的语音合成模型:Gemini 3.8 Flash TTS。
其中一个能力值得所有人注意:
只要有 30 秒的音频样本,就能复刻一个人的声音。
具体是怎么回事?
▪ 可以用一段文字描述,设计一个全新的音色
▪ 也可以从 2000 多个预设音色里挑
▪ 用 30 秒样本克隆声音时,必须先通过"同意检查"
▪ 支持百余种语言、定制音色、音频混音
▪ 生成的音频自带 SynthID 溯源水印
在 Hume AI 的音色设计基准上,它拿了 71.4 分;两个模型在质量指数上分列第一、第二。首批接入的包括 Figma、HeyGen 等一批创作工具。
为什么这件事值得警惕?
因为"30 秒"这个门槛,已经低到几乎不存在了。
一段微信语音、一段朋友圈视频、一次通话录音——都可能成为素材。
而声音和脸不一样:脸可以靠眼睛判断,声音很难。
想想这些场景:
▫ 亲人打来电话说"我出事了,快转钱"
▫ 老板发来语音让你处理一笔付款
▫ 一段"名人讲话"的音频在网上流传
这些事,过去需要专业设备和技术,现在只需要 30 秒素材 + 一个API。
好消息是,防护也在同步做:
✅ 同意检查——用样本克隆时必须通过授权验证
✅ SynthID 水印——生成音频内嵌不可见标识,可溯源
✅ 平台侧加强识别合成语音
但防护的前提是"平台愿意做"。而攻击者不会遵守规则。
普通人能做的三件事:
1️⃣ 给家人定一个"暗号"——遇到涉及转账的紧急语音,先问只有你们知道的事
2️⃣ 别随便发长语音到公开平台——你的声音就是你的生物信息
3️⃣ 遇到"紧急转账",挂掉再打回去——用你熟悉的号码主动拨回去核实
一句话总结:
技术让"伪装成你"变得极其便宜。而防御的第一道防线,不是技术,是习惯——任何涉及钱的事,都必须用另一条渠道二次确认。
AI 科技 声音克隆 安全