公司动态

为什么esp32-ai能颠覆边缘计算?揭秘25M参数存储在Flash中的创新方案

📅 2026/8/6 22:09:41
为什么esp32-ai能颠覆边缘计算?揭秘25M参数存储在Flash中的创新方案
为什么esp32-ai能颠覆边缘计算揭秘25M参数存储在Flash中的创新方案【免费下载链接】esp32-ai项目地址: https://gitcode.com/gh_mirrors/esp/esp32-aiesp32-ai是一个能在ESP32-S3微控制器上运行28.9M参数语言模型的开源项目它通过创新的存储方案将25M参数存储在Flash中实现了无需服务器支持的本地文本生成为边缘计算领域带来了突破性进展。边缘计算的巨大挑战内存限制微控制器的内存资源极其有限以ESP32-S3为例仅配备512KB SRAM、8MB PSRAM和16MB flash。传统的AI模型部署往往需要大量快速内存来存储参数和中间计算结果这使得在边缘设备上运行大型语言模型成为几乎不可能的任务。创新的三级存储架构esp32-ai采用了创新的三级存储架构根据数据访问频率将模型参数分配到不同类型的存储器中SRAM快速容量小存储激活值和归一化权重这些数据在每个token处理过程中会被多次访问PSRAM中等速度和容量存放核心和输出头每个位置读取一次FLASH容量大速度慢存储25M参数的查找表每个token大约读取6行约450字节这种架构设计充分利用了不同存储介质的特性将大部分参数存储在Flash中只在需要时读取必要的数据大大降低了对快速内存的需求。25M参数如何存储在Flash中该项目的核心创新在于采用了Google Gemma 3n中的Per-Layer Embeddings理念并针对微控制器的内存布局进行了优化。模型的大部分参数位于嵌入表中这些参数不需要进行复杂计算只需读取即可。因此2500万参数的表可以留在慢速的flash中只有每个token需要的少数行约450字节被读取。图28.9M参数LLM在ESP32-S3上运行演示展示了边缘设备上的本地文本生成能力令人印象深刻的性能表现尽管受到硬件限制esp32-ai仍然实现了令人瞩目的性能速度端到端9.88 tokens/秒计算时间为94.9 ms/token模型大小4位量化下仅14.9MB连接性无需网络连接所有操作都在设备上完成实际应用与部署esp32-ai提供了两个预训练模型Barista - 咖啡相关问题回答TinyStories - 故事生成要在自己的ESP32-S3设备上运行该模型只需执行以下命令git clone https://gitcode.com/gh_mirrors/esp/esp32-ai cd esp32-ai scripts/fetch_model.sh tinystories|barista # 下载、验证、安装到artifacts/ scripts/deploy.sh tinystories|barista # 生成头文件、运行门控、编译、烧录未来展望esp32-ai展示的创新存储方案为边缘计算开辟了新的可能性。通过将大部分参数存储在Flash中我们可以在资源受限的微控制器上运行更大规模的AI模型。这一技术不仅适用于语言模型还可以扩展到其他类型的AI应用如计算机视觉、语音识别等。随着技术的不断进步我们有理由相信未来会有更多创新方案突破边缘设备的性能限制让AI真正无处不在。详细的测量数据和消融实验记录在RESULTS.md中固件细节和启动输出预期可在firmware/esp32_tinystories/README.md中找到。可重用的架构位于src/目录重现已发布数据的训练、消融和量化代码位于research/tinystories/目录。【免费下载链接】esp32-ai项目地址: https://gitcode.com/gh_mirrors/esp/esp32-ai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考