ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从零搭建AI智能眼镜OpenGlass:25美元硬件与代码实战指南

2026/8/14 11:20:48 拓冰建站 浏览量
从零搭建AI智能眼镜OpenGlass:25美元硬件与代码实战指南 从零搭建AI智能眼镜OpenGlass25美元硬件与代码实战指南【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlassOpenGlass 是一个把任意普通眼镜改装成 AI 智能眼镜的开源项目用不到 25 美元的现成零件加上一套开源固件与软件就能实现识别人物、物体识别、文本翻译和实时问答。这篇文章会从硬件选型、固件烧录、软件配置到模型评测带你完整跑通整个 DIY 流程。你有没有过这样的想法戴上一副眼镜它替你记下见过的人、帮你翻译路牌上的文字、甚至在你提问时回答刚才那个人是谁OpenGlass 把科幻片里的场景变成了一个周末就能完成的 DIY 项目。它不做复杂的定制硬件而是用一块 ESP32 S3 开发板加一个 3D 打印支架直接挂在任何普通眼镜上剩下的事情交给开源代码和云端 AI。这个项目适合谁如果你是电子爱好者3 小时就能拼出一台可佩戴的智能设备如果你是开发者它的模块化代码结构摄像头、BLE 传输、视觉模型、问答 Agent 完全解耦让你能轻松定制和优化。无论哪种角色接下来这份指南都能让你少踩一半的坑。OpenGlass 能做什么四个核心能力戴上 OpenGlass 后你能获得这些实用功能生活记录眼镜上的摄像头按设定间隔自动拍照AI 会把每张照片转成文字描述存档相当于一本自动生成的视觉日记。人物记忆通过识别并描述画面中的人物特征下次再见到对方时AI 能帮你回忆在哪里见过。物体识别看到不认识的物体或路牌直接向它提问AI 基于已描述的画面内容给出答案。实时翻译与问答对着街道路牌或菜单拍照问一句这是什么意思答案会以文字甚至语音的形式返回。图OpenGlass 摄像头捕捉的真实场景照片这类画面正是 AI 视觉模型要看懂并转成文字描述的内容工作原理解密一条看见→理解→回答的流水线OpenGlass 的智能不是靠眼镜本身而是一条清晰的数据流水线看见ESP32 S3 上的摄像头采集图像通过低功耗蓝牙BLE把照片传给手机或浏览器端的 Expo 应用。理解前端应用调用本地 Ollama 服务让moondream:1.8b-v2-fp16这类轻量视觉模型把图片翻译成一段文字描述描述会缓存起来形成记忆库。回答当你提问时Agent 把记忆库里的所有描述拼接后交给 Groq 平台的llama3-70b-8192大模型推理出答案再通过 OpenAI 的语音接口念给你听。这条流水线在代码里对应三个清晰的分层firmware/firmware.ino负责看见硬件采集sources/agent/Agent.ts是调度中枢维护描述缓存、处理问答状态机sources/modules/下则是各家 AI 服务的适配器ollama.ts、groq-llama3.ts、openai.ts。想换模型或改逻辑只需替换对应模块互不影响。硬件清单25 美元凑齐全部零件OpenGlass 的硬件非常克制全部来自市售标准件零件型号/规格作用主控开发板Seeed Studio XIAO ESP32 S3 Sense集成了摄像头和麦克风是眼镜的大脑电池EEMB LP502030 3.7V 250mAh供电体积小巧可藏进镜腿外壳3D 打印眼镜支架STL 文件把开发板固定在普通眼镜上如果 ESP32 S3 是大脑那么firmware/firmware.ino就是脑干——它负责初始化摄像头、麦克风、蓝牙服务并控制拍照频率和音频编码默认用 PCM切换 Web 应用时改用 MuLaw 编码注释里都有说明。组装流程很简单3D 打印支架 → 把开发板卡进支架 → 接上电池 → 挂到眼镜上一台基础智能眼镜就完成了。固件烧录最容易翻车的一步烧录固件前有一个必须提前做对的设置否则开发板会因内存不足直接崩溃⚠️重要提醒在 Arduino IDE 的工具菜单中把PSRAM设置为OPI PSRAM。这是整个项目报错率最高的一步务必先设再烧。烧录步骤如下在 Arduino IDE 的首选项中添加 ESP32 开发板管理器地址https://raw.githubusercontent.com/espressif/arduino-esp32/gh-pages/package_esp32_index.json通过工具 → 开发板管理器搜索并安装esp32板卡包。选择开发板XIAO_ESP32S3和正确的串口端口。打开 firmware/firmware.ino 并点击上传。如果你更习惯命令行也可以用arduino-cli完成同样的操作关键是编译参数里带上 PSRAM 选项arduino-cli compile --build-path build --output-dir dist -e -u -p COM5 \ -b esp32:esp32:XIAO_ESP32S3:PSRAMopi软件配置三把钥匙开三扇门克隆代码库并安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass yarn install整个软件栈的关键配置都集中在 sources/keys.ts 这一个文件里它相当于项目的保险柜export const keys { groq: process.env.EXPO_PUBLIC_GROQ_API_KEY ?? , ollama: process.env.EXPO_PUBLIC_OLLAMA_API_URL ?? , openai: process.env.EXPO_PUBLIC_OPENAI_API_KEY ?? , };三个服务的分工很明确Groq提供大模型推理回答问题、Ollama提供本地视觉模型描述图片、OpenAI提供语音合成把答案念出来。配置好密钥后还需要拉取本地视觉模型并启动应用ollama pull moondream:1.8b-v2-fp16 yarn start启动后浏览器会自动打开 Expo 的本地链接眼镜通过蓝牙连上页面识别结果和问答界面就实时显示在眼前了。进阶玩法用脚本批量评测多个视觉模型OpenGlass 附带了一个很多项目没有的隐藏福利prompts/generate.ts 批量评测脚本。它会读取prompts/series_1/目录下的所有测试照片依次用 4 种视觉模型跑一遍描述任务并把结果写进同名.md文件方便对比。运行一次yarn prompts跑完后打开任意结果文件如 prompts/series_1/img_1.md你能看到同一个场景下不同模型的描述风格差异有的模型侧重人物动作有的擅长还原环境细节有的描述最精简。想让人物识别更快就用更轻量的模型想理解更细腻的画面就换大参数模型——这为二次开发提供了实打实的数据依据。图同一空间另一角度的测试照片用于评估不同视觉模型在复杂背景下的识别表现核心文件速查表文件路径作用新手需要修改吗firmware/firmware.ino硬件初始化与拍照/传输调度否除非优化逻辑sources/keys.ts三个 AI 服务的密钥与地址配置是必改sources/agent/Agent.ts描述缓存与问答状态管理否sources/modules/Ollama/Groq/OpenAI 接口适配进阶改App.tsxExpo 前端入口否prompts/generate.ts视觉模型批量评测脚本进阶玩新手避坑清单PSRAM 没开 OPI烧录必崩先检查工具菜单里的 PSRAM 设置。ollama pull没执行视觉模型缺失会导致图片描述一直失败先确认本地模型就绪。密钥遗漏keys.ts里三个 key 缺一不可缺失的接口会静默失败代码里做了空值容错但你只会看到没反应。端口找不到换根数据线有些线只能充电不能传数据或用arduino-cli board list确认端口号。下一步行动现在轮到你了。按照上面的路径先 3D 打印支架、再烧固件、配好三把钥匙一个下午就能戴上自己的 AI 眼镜。跑通基础流程后试着改改firmware.ino里的拍照间隔、用yarn prompts对比不同模型或者给 Agent 加个新指令——这个项目完全开源欢迎提交 PR 一起完善它。另外项目已迁移到 Omi 仓库持续维护想追踪最新进展记得关注后续更新。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考