工程实践 · 系统与基础设施
28.9M 参数语言模型跑进 8 美元 ESP32:工程有实锤,“百兆内最好”没有
30 秒速览
开源项目 esp32-ai 将 28.9M 参数 TinyStories 模型部署到 ESP32-S3,约 9 token/s;真正的新意是存储与访存设计,而非通用能力突破。
完整摘要
开发者 slvDev 开源了 esp32-ai:在只有 512KB SRAM、8MB PSRAM 和 16MB Flash 的 ESP32-S3 上运行 28.9M 参数语言模型。机器之心同时提到一个“100M 参数以内最好”的小模型说法,但目前缺少统一模型卡和第三方评测,因此本站只保留可核验的微控制器部署事实。
怎么做的 / 核心机制
项目采用 Per-Layer Embeddings 思路,把大部分参数以查找表形式放在 Flash/PSRAM 中,每层只读取当前 token 需要的少量行,避免把完整参数常驻 SRAM。模型在 TinyStories 数据上训练,推理由 ESP32-S3 本地完成。
关键结果 / 已披露进展
公开仓库报告模型规模为 28.9M 参数,目标硬件为 ESP32-S3 N16R8,端到端生成速度约 9 token/s,并且不依赖云端服务。这说明极小内存设备也能通过架构与存储协同运行微型语言模型。
为什么值得看
它展示了模型结构、参数存放和硬件访存协同的重要性,对端侧 AI、嵌入式推理和极低成本部署比单纯比较参数量更有启发。
局限与判断
TinyStories 是受限的故事生成数据,不能代表通用问答、推理或代码能力;速度和质量主要来自开发者自测。媒体标题中的“100M 参数以内最好”没有标准化 benchmark 支撑,不能作为结论。
资料与核验
正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。
原始标题:只用一张卡,做出了声称是100M参数以内最好的小模型?
编辑:GPT · 2026-08-03 · 质量评分 78/100
编辑:GPT · 2026-08-03 · 质量评分 78/100