公司动态

超详细!用OpenGlass从零搭建AI智能眼镜:不到25美元实现人物识别与实时翻译

📅 2026/8/15 18:34:19
超详细!用OpenGlass从零搭建AI智能眼镜:不到25美元实现人物识别与实时翻译
超详细用OpenGlass从零搭建AI智能眼镜不到25美元实现人物识别与实时翻译【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass想象这样一个画面你戴着普通眼镜走进一家咖啡馆刚坐下手机屏幕上已经自动弹出对面这位是上周三在发布会上交换过名片的产品经理菜单上的法文也在一瞬间变成了中文——这不是科幻片而是OpenGlass这个开源项目正在做的事。OpenGlass的核心使命只有一句话把任何一副普通眼镜变成AI智能眼镜全套零件不到25美元整个搭建过程一个周末就能完成。 它凭什么值得动手两个真实的周末故事故事一电子爱好者的3小时快感小张花了3小时完成全部硬件组装把一块Seeed Studio XIAO ESP32 S3 Sense模块固定在3D打印的镜架卡槽里接上一块250mAh的锂电池用Arduino IDE上传固件再戴上眼镜出门。当他看向街道路牌时手机里的AI识别结果几乎同步刷新——这一切的成本还不到两杯精品咖啡的价钱。故事二开发者的二次开发乐趣程序员小李并不满足于能用。他发现firmware/firmware.ino里图像采集的逻辑可以调优于是修改了采集频率又用prompts/generate.ts脚本一次性跑完几十张测试图对比不同视觉模型的人物识别效果最终把识别延迟压低了40%。OpenGlass的模块化设计让这种折腾变得异常顺手。 这两个故事想说明同一件事OpenGlass的定位不是买来即用的产品而是一套可以拆开、看懂、改动的智能眼镜方案。25美元买到的不是成品而是掌控权。️ 原理讲透但不说教眼镜、手机和AI的接力赛OpenGlass整套系统其实是一场三方接力赛三个选手各司其职第一棒ESP32 S3硬件大脑固件文件firmware/firmware.ino相当于眼镜的脑干负责初始化摄像头和麦克风、采集画面、并通过低功耗蓝牙把照片实时传给手机。你可以把它理解成一个随身相机对讲机自己不做任何AI判断只负责把看到的、听到的快递出去。第二棒手机/浏览器调度中心前端是一个Expo应用入口在App.tsx它通过Web蓝牙找到名为OpenGlass的设备并连接。sources/modules/useDevice.ts里定义了连接逻辑连接成功后sources/agent/Agent.ts这个管家开始接管收到照片就调用AI生成文字描述攒成一叠记忆卡片。第三棒本地云端模型判断大脑这是最妙的设计——识别分两步走先用本地的视觉模型默认moondream:1.8b-v2-fp16通过Ollama运行把每张照片变成一段文字描述比如画面中有两个人左侧穿蓝色外套的人在喝咖啡当你提问时再用Groq上的Llama3把所有这些描述综合起来回答问题最后甚至通过OpenAI的语音服务把答案念出来。这样分工的好处是视觉识别不烧钱本地跑语言理解用云端又快又聪明。照片→描述→问答数据就这样一级级接力完成。图OpenGlass摄像头捕捉的真实第一视角画面——AI会把它转化成场景描述再供语言模型回答你的问题。 上手前必须知道的3件事第一件事先认人——核心文件速查表文件职责新手要不要动README.md项目总览与完整上手流程✅ 必读firmware/firmware.ino摄像头/麦克风初始化、照片采集、BLE传输❌ 默认可用sources/keys.tsGroq、OpenAI、Ollama的密钥/地址配置✅ 必须配置App.tsx前端入口负责连接设备与显示结果❌ 基础使用不用改package.json依赖与启动脚本yarn start等❌ 自动处理第二件事密钥到底填在哪source/keys.ts的源码默认从环境变量读取密钥也支持直接写字符串export const keys { groq: process.env.EXPO_PUBLIC_GROQ_API_KEY ?? , ollama: process.env.EXPO_PUBLIC_OLLAMA_API_URL ?? , openai: process.env.EXPO_PUBLIC_OPENAI_API_KEY ?? , };最省事的方式直接把你的密钥字符串填进引号里比如groq: gsk_你的密钥。Ollama那行填http://localhost:11434/api/chat即可。第三件事三个高频坑及解法坑1固件上传后疯狂重启/崩溃→ 原因99%是PSRAM没设对。上传固件前务必在Arduino IDE的工具→PSRAM里选OPI PSRAM否则内存不足直接罢工。坑2报错端口未找到→ 三步排查先确认USB线不是只充电不传数据的线再用arduino-cli board list看看设备是否被识别最后在设备管理器里确认COM口编号Windows用户重点看。坑3图像识别又卡又慢→ 优先使用轻量级模型moondream:1.8b-v2-fp16用ollama pull下载后在sources/agent/imageDescription.ts里确认默认模型名就是它。重型模型如llava:34b-v1.6只在评测时用日常佩戴别开。 动手实操照做就能跑通第一步克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass npm install✅ 你会看到终端里滚动安装几十个npm包最后没有红色报错。用yarn也行yarn install。第二步准备本地视觉模型Ollamaollama pull moondream:1.8b-v2-fp16✅ 你会看到进度条走到100%显示success。这是本地识别的眼睛必须先就位。第三步配置密钥编辑sources/keys.ts填入Groq密钥用于问答和OpenAI密钥用于语音播报并把Ollama地址设为本地服务。没有Groq/OpenAI账号也能玩——纯本地问答依然可用只是语音功能会受限。第四步上传固件二选一方式AArduino IDE—— 打开firmware/firmware.ino在工具里选择板子XIAO_ESP32S3和正确端口务必把PSRAM设为OPI PSRAM然后点击上传。方式B命令行arduino-cli参考firmware/readme.mdarduino-cli board list arduino-cli compile --build-path build --output-dir dist -e -u -p COM5 -b esp32:esp32:XIAO_ESP32S3:PSRAMopi✅ 你会看到编译进度条滚动最后显示Done uploading。此时眼镜侧已就绪。第五步启动应用并连接npm start✅ 你会看到Expo启动后输出一个localhost链接用Chrome打开目前最稳的是Web版。页面中央出现一个 Connect to the device 按钮点击后在弹窗里选择名为OpenGlass的设备完成蓝牙配对。第六步戴上眼镜见证魔法配对成功后把眼镜朝向一个物体或人物稍等一两秒屏幕上的lastDescription就会刷新出AI对眼前画面的文字描述。向它提问语音答案会直接放出来。图另一段OpenGlass第一视角画面人物与场景结构清晰正是验证识别效果的典型样本。 进阶玩法与高频疑问三个值得一试的深度定制方向1. 用prompts/generate.ts做模型选型评测仓库里prompts/series_1/下放了60张真实佩戴视角的测试图。运行npm run prompts脚本会依次用moondream:1.8b-v2-fp16、llava-llama3、llava:34b-v1.6等模型跑完全部图片并把结果写进对应的.md文件。对比后挑出又快又准的模型改一行默认配置即可。2. 调整固件的采集节奏与音频编码firmware/firmware.ino顶部有音频编码开关CODEC_OPUS/CODEC_MULAW/CODEC_PCM想改采集频率和BLE传输细节也都在这个文件里。如果要启用Opus按firmware/readme.md提示把arduino-libopus和arduino-audio-tools两个库放进Arduino的libraries目录。3. 换掉AI大脑接入自己的服务ollamaInference把图片转base64后发给Ollama的/api/chat接口imageDescription.ts里的系统提示词、模型名都是可改的。想接私有推理服务改这一个模块就够了其余代码完全不用动。社区高频疑问Q没有3D打印机镜架怎么办A仓库提供了开源的3D打印镜架模型可以找网上的代打印服务花几块钱打一个动手能力强的直接用扎带、胶水把模块固定在普通眼镜腿上也能跑通。Q识别结果都存在哪里会不会隐私泄露AAgent.ts把每张照片连同描述存在内存数组中问答只基于这些文字描述。数据不出你的手机和本地Ollama除非你主动接入云端API否则隐私是可控的。Q这个项目还在更新吗A官方已把项目迁移合并到Omi仓库继续迭代本仓库的代码与文档仍完整可用作为学习、二次开发的基础依然非常扎实。 写在最后你的眼镜你说了算从一块25美元的开发板到一副能看懂世界的AI智能眼镜OpenGlass最迷人的地方在于它把价格打下来了也把门打开了。你可以只按教程跑通全流程享受乐趣也可以深入固件、模型、交互的每一层把它改造成完全属于自己的智能终端。项目完全开源遇到问题翻翻源码、提个PR说不定下一个让识别提速40%的优化就出自你的手。周末到了动手吧。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考