公司动态
一副普通眼镜如何变成AI助手?OpenGlass 25元开源改造方案全解析
一副普通眼镜如何变成AI助手OpenGlass 25元开源改造方案全解析【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlassOpenGlass 是一个把任意眼镜变成 AI 智能眼镜的开源项目硬件成本不到 25 元。这篇文章不打算按先看硬件、再看软件的老套路介绍它而是换一条更实用的路径带你读完先从一个真实场景出发理解它到底能帮你做什么再顺着一条数据流看懂照片和声音是怎么从镜腿走到 AI 模型里的最后用一份清单让你今晚就能开始动手。整个过程大约十分钟。先讲一个看了又忘的场景想象你站在火车站候车厅面前一块大屏滚动着车次信息你掏出手机拍下来、放大、反复确认最后还是怕记错。又或者你在会议室里白板上的架构图画完就擦掉了之后怎么也想不起细节。OpenGlass 想解决的正是这类时刻——它让眼前的东西自动变成可检索的记录。项目的思路很直接眼镜负责拍照和收音手机 App 负责接收数据AI 模型负责理解和回答。测试目录里存了大量真实场景的识别结果比如下面这张室内测试图多个 AI 模型都对它输出了结构化的场景描述而不是简单的有人、有椅子。这套能力听起来不复杂但真正的难点在于怎么用最少的硬件把这套流程跑通。一条从镜腿到模型的数据链整个系统的数据流可以拆成四步每一步都对应项目里一个具体的目录采集摄像头按指令抓拍 JPEG 帧麦克风以 16kHz 采样录音这部分逻辑在 firmware/firmware.ino 里传输数据不走 Wi-Fi而是通过 BLE 蓝牙特征值characteristic分包推送到手机固件里用photoDataCharacteristic每包 200 字节地推照片解析React Native 应用在 sources/app/ 中接收数据useDevice.ts负责与名为 OpenGlass 的蓝牙设备建立连接推理sources/agent/imageDescription.ts 把图片交给视觉模型生成文字描述再由 Agent 汇总回答你的提问有个细节值得留意固件里音频编码用宏开关切换三种方案注释写得很清楚——Opus 用于高质量语音、Mu-law 给 Web 应用、PCM 给原生应用。一个 25 元的设备留了三套编码方案这是典型的模块化优先设计你在 firmware/firmware.ino 顶部就能看到这几行开关// 三选一改宏即换编码方案 // #define CODEC_OPUS // 高质量语音编码 // #define CODEC_MULAW // Web 应用使用 #define CODEC_PCM // 原生应用使用硬件清单四样东西加起来不到 25 元拆开成本看这个项目对够用的把握相当克制组件成本选择理由Seeed XIAO ESP32 S3 开发板约 15 元双核 240MHz自带摄像头与麦克风接口、PSRAM250mAh 锂电池约 3 元体积小可全天待机、随时更换3D 打印镜架挂载件约 2 元开源 STL 文件适配不同镜框线材与焊接件约 5 元按需裁剪为什么选 ESP32 S3 而不是更便宜的方案因为它同时满足三个硬指标内置 PSRAM 能直接缓存相机帧固件里CAMERA_FB_IN_PSRAM就是这么用的、BLE 与 Wi-Fi 双模、且整个生态文档开源。它把能跑的门槛降到了最低。摄像头只选 30 万像素的 OV2640这并非妥协——AI 识别物体和文字30 万像素绰绰有余反而低分辨率意味着更小的 BLE 传输压力和更低的功耗。数字背后的逻辑是在智能眼镜上像素不是越高越好够用且省电才是。换脑自由同一个镜头四种 AI 轮流出场OpenGlass 最值得玩的一点是它把大脑做成了可插拔的。imageDescription函数接受一个模型参数默认用moondream:1.8b-v2-fp16但你完全可以换成llava-llama3或llava:34b-v1.6。项目还分别接入了 Groq 和 OpenAI 的接口加上本地 Ollama一共四条推理通道// sources/agent/imageDescription.ts export async function imageDescription( src: Uint8Array, model: KnownModel moondream:1.8b-v2-fp16 ): Promisestring { return ollamaInference({ model, messages: [/* 系统提示 图片 */] }); }同样的输入不同模型输出的风格差别很大小模型三句话讲完场景大模型会补上环境细节和人物状态。这意味着你可以按场景挑模型——赶时间用轻量模型秒回写日记用大模型补全细节。如果想要私有化部署Ollama 方案支持全程本地推理数据不出设备。项目还内置了一个批处理脚本 prompts/generate.ts能把一批测试图自动喂给多个模型、把结果写进 markdown 文件。想对比模型效果跑一遍脚本答案就有了。三十分钟从零跑通上手流程比想象中短分两条线烧固件Arduino IDE 装好 ESP32 开发板包打开 firmware/firmware.ino记得在 Tools 里把 PSRAM 设为 OPI PSRAM否则内存不够用跑应用克隆仓库并安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass npm install然后在 sources/keys.ts 填入你的 API 密钥用EXPO_PUBLIC_*环境变量注入本地 Ollama 则执行ollama pull moondream:1.8b-v2-fp16。最后npm start启动 Expo 开发服务器浏览器打开后点连接设备眼镜里的画面就会开始流入 AI 了。整套东西是 MIT 协议固件、App、测试脚本全部开放。想在 modules 目录下加一个新 AI 服务商照葫芦画瓢写一个文件即可。下一步你的眼镜由你定义OpenGlass 现在只能识别场景、记录对话但它的接口已经把可能性铺开了给固件加一个传感器、给 App 加一个处理函数、给 Agent 加一个技能都是顺着现有结构就能完成的改动。社区里已经有人把心率传感器接进来做健康记录也有人把它改造成扫码巡检工具。如果你想试试今晚就能做第一步把仓库克隆下来先不碰硬件跑一遍npm run prompts脚本看看它如何用四个模型描述同一批图片。等你看懂了这条数据链再下单那 25 元的零件也不迟。技术民主化的下一步往往就从一次动手开始。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考