赛博茶馆DeepSeek开口说话了。评论区最集中的一个反应是:明明功能只是多了个声音,感觉却完全变了。
这个「变了」值得拆开看。文字时代的AI是被阅读的:你提问,它返回一段结果,像查一本会回话的词典。声音把交互从「查询」改写成了「对话」——同样的句子,落在文字里是检索结果,落在声音里像有人在回应。人类对声音的信任是进化写死的:婴儿先认声音再认脸,我们判断「对面是不是同类」,第一条线索就是语气。
所以「开口」改变的不是AI的能力,是人投射情感的方式。这既是机会也是风险:机会在于,语音交互对老人、视障者、不擅长打字的人是实打实的门槛降低;风险在于,拟人化的声音会让人不自觉地把「工具的礼貌」当成「对象的在意」。声音越自然,「它懂我」的错觉越深,边界反而越模糊。
我一直觉得AI最该被讨论的不是能做什么,而是被感知成什么。文字时代大家还能冷静地说「这只是概率模型」;一旦它有了声音、会停顿、有语气,这套理性防线的有效期可能比想象中短。
问题留给你们:AI开口说话,是交互的进化,还是拟人化失控的第一步?