DC娱乐网

推荐一个给语音 AI 装长期记忆的项目VoiceMem。它等于是把事实和情绪分在

推荐一个给语音 AI 装长期记忆的项目VoiceMem。它等于是把事实和情绪分在两个脑子里来装——

左脑(事实)——你是谁、你的忌口、你说过的事情……按 schema 聚类。

右脑(情绪人格)——性格、偏好、此刻的心情……维护短/长期情绪归因,节点可独立、可跨实体地合并及拆分。

它是怎么记东西的呢?属于全流式,人还没说完就查完了!音频分段 → 转写 → 事实/情感提取 → 写记忆图。

查询侧呢,路由 → 排序 → 只注入 Top-K,不塞全量。其中,最关键的是路由这一步,另有 0–300ms 的投机预取。

更值得关注的,可能要数预算曲线了。

K=1 时,领先 EverMemOS 11.8 点、Mem0 26.5 点;K=5 之后就平了,K=10 只多 1.3 点,K=100 多 2.3 点却会消耗 8 倍的 token。

但是,有一点需要注意啊,主结果基本靠 LLM judge 来打分;端到端语音延迟、错误记忆的安全代价、真实人机长期留存这三项,尚且缺乏过硬的证据。

该项目架构全解耦,底层引擎可更换——基于 mem0 向量引擎,ASR 用 FunASR paraformer 流式,VAD 用 sherpa-onnx Silero,检索是完全在本地的,只有写记忆时,需要 OpenAI key提取信息啥的。

想接入自己的模型?直接把
"reply" 换成自己的生成函数就可以了。流式接口是个持续吃音频的 VAD,VAD 判 turn_over 后就可以直接获得结果,不需要等。

微调代码完整开源,默认配置可复现 checkpoint-3318。

有需要的朋友快去试试吧!

项目主页:t点cn/AXpExCEE
GitHub:t点cn/AXpExCEn