学术发现 · 模型与推理精选
长期记忆不必全塞进模型参数:Memory Decoder 扩展到 69 亿参数
30 秒速览
Memory Decoder 将长期记忆拆成可独立扩展的参数化模块,本次工作把规模推进到 6.9B 参数,并使用 300B token 预训练。为支撑大规模记忆
完整摘要
Memory Decoder 将长期记忆拆成可独立扩展的参数化模块,本次工作把规模推进到 6.9B 参数,并使用 300B token 预训练。为支撑大规模记忆检索,作者还构建了分布式 Faiss 索引与稀疏批量加载流程。
怎么做的 / 核心机制
将长期记忆做成可独立扩展的参数化 Memory Decoder,与主推理模型解耦;本次把记忆模块扩展到 6.9B 参数,并以 300B token 预训练,同时用分布式 Faiss 索引和稀疏批量加载支撑检索。
关键结果 / 已披露进展
工作表明参数化记忆模块可以扩展到十亿级,并给出相应的大规模索引工程路径。它是否在准确率、更新速度和总体成本上全面优于外部 RAG,仍需看论文中的完整对照实验。
为什么值得看
它直接挑战“记忆和推理必须共享同一套参数”的默认设计,让模型的记忆容量可以单独扩展,也把记忆模型真正落地时的索引与检索成本摆到了台面上。
局限与判断
参数化记忆的更新、删除和纠错通常比外部数据库困难,训练与索引成本也很高。对动态知识、隐私删除和事实冲突的处理仍是落地关键。
精选理由
把长期记忆从主模型参数中解耦并扩展到 6.9B,兼具架构新意和大规模系统实现价值。
原始标题:Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory
编辑:GPT · 2026-08-02 · 质量评分 91/100
编辑:GPT · 2026-08-02 · 质量评分 91/100