一套可自行制作和复现的实验性 AR 辅助眼镜原型,面向听障场景提供实时字幕、环境声音提醒和固定手势表达。
观看完整演示视频(6 分 06 秒,GitHub Release)
聆眸采用分体式结构:眼镜端承载摄像头、近眼显示和光学组件,胸前控制盒承载 T5AI-Board、按键和震动模块,PC 负责计算机视觉、语音识别和环境音推理。PC 与控制盒默认通过 USB 串口通信,不需要云服务即可运行核心功能。
Important
这是用于学习、研究和原型验证的项目,不是医疗器械,也不应作为火灾、交通或人身安全场景中的唯一告警设备。当前中文语音会在 PC 端输出,板端 OLED 使用 ASCII 字体显示英文短句。
| 输入 | PC 端处理 | 眼镜/控制盒反馈 |
|---|---|---|
| 麦克风语音 | faster-whisper 语音转文字、关键词映射 | OLED 字幕;危险词触发震动 |
| 环境声音 | YAMNet、DSP 或本机校准模板 | 门铃、敲门、车辆和警报提醒 |
| 摄像头手势 | MediaPipe Hands + SVM | PC 播放常用语,OLED 显示短句 |
| 三个实体按键 | 板端直接处理 | 清屏、回看、求助 |
当前手势模型识别 hello、repeat、help、ok、stop、thanks、no 和 yes 八类固定手势。模型只使用手部 21 个关键点,不包含原始人脸或视频训练数据。
USB 摄像头 / 麦克风
|
v
PC 端 Python 推理
手势 / STT / 环境音
|
v
USB 串口,115200 baud
|
v
T5AI-Board
OLED / 震动马达 / 三个按键
项目当前是功能原型,而不是一体化消费级眼镜。PC 推理、外接线缆和近眼光学模块都是复现时需要接受的设计边界。
已验证环境为 Windows 和 Python 3.11。先克隆仓库并创建虚拟环境:
git clone https://github.com/siiri0817/LingMou_Project.git
cd LingMou_Project
py -3.11 -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install --upgrade pip
python -m pip install -r requirements.txt
python scripts\verify_checkout.py不接开发板时,可以先检查命令链路:
python pc\main_demo.py --transport print --sound-hotkeys测试摄像头和手势识别:
python pc\gesture_demo.py --camera 0 --max-hands 2
python pc\main_demo.py --transport print --camera 0 --gesture --pc-voice接入 T5AI-Board 后,将 COM8 和麦克风编号替换为本机实际值:
python -m serial.tools.list_ports
python pc\subtitle\list_devices.py
python pc\main_demo.py --port COM8 --camera 0 --device 1 --gesture --stt --sound-ai --pc-voice首次启用 STT 时,faster-whisper 会联网下载模型。依赖较多时也可以按功能分别安装 requirements-gesture.txt、requirements-stt.txt 或 requirements-sound.txt。
完整的环境、固件和验收步骤见 复现指南。
主要硬件包括 T5AI-Board、I2C OLED、震动马达模块、三个按键、USB 摄像头、麦克风、近眼光学组件和 3D 打印结构件。接线、建议物料和装配注意事项见 硬件指南。
仓库提供可直接切片的 STL、可编辑的 SolidWorks 文件和控制盒 STEP 总装:
hardware/cad/
├─ glasses-frame-v1.stl / .sldprt
├─ controller-top.stl / .sldprt
├─ controller-bottom.stl / .sldprt
└─ controller-assembly.step
这些模型对应当前原型,孔位和光学件尺寸可能需要按你购买的器件调整。
board/ T5AI-Board 固件与硬件测试程序
pc/ PC 端手势、字幕、环境音和串口程序
models/ 手势模型、标签映射和 YAMNet 资源
data/ 手势关键点训练数据
audio/ 可重新生成的测试音频
hardware/ 3D 打印与可编辑 CAD 文件
assets/ 已脱敏的实物图片和短视频
docs/ 硬件、复现及隐私安全说明
scripts/ 仓库检查、素材生成和配置生成脚本
tests/ 无硬件单元测试
- 摄像头和麦克风默认只用于实时推理,程序不会主动保存原始流。
data/gesture_keypoints.csv只包含归一化手部关键点和标签,不包含照片、姓名或设备账号。- Tuya/GLM 云端功能是可选项。真实配置只应写入被
.gitignore排除的secrets/lingmou_local_config.json,或通过环境变量提供。 - 提交前运行
python scripts/check_public_repo.py,检查内部活动资料、常见密钥格式、私有配置和超大文件。
更多说明见 隐私与安全。
- OLED 固件当前使用 ASCII 字体,完整中文字幕仍显示在 PC 终端。
- 固定手势分类不是连续手语翻译,不应把八类标签理解为标准手语词典。
- 环境音识别受麦克风、房间反射和阈值影响;部署前必须用目标设备重新测试和校准。
- CAD 是原型结构,尚未进行长期佩戴、跌落、防水、温升或量产公差验证。
本项目原创代码、文档、CAD、图片、视频、训练数据和自训练手势模型采用 MIT License。仓库包含的 YAMNet 模型与类别表保留各自上游许可证,详见 THIRD_PARTY_NOTICES.md。

