Skip to content

Repository files navigation

聆眸 LingMou

一套可自行制作和复现的实验性 AR 辅助眼镜原型,面向听障场景提供实时字幕、环境声音提醒和固定手势表达。

聆眸原型正面

观看 7 秒实物预览(MP4)

观看完整演示视频(6 分 06 秒,GitHub Release)

聆眸采用分体式结构:眼镜端承载摄像头、近眼显示和光学组件,胸前控制盒承载 T5AI-Board、按键和震动模块,PC 负责计算机视觉、语音识别和环境音推理。PC 与控制盒默认通过 USB 串口通信,不需要云服务即可运行核心功能。

Important

这是用于学习、研究和原型验证的项目,不是医疗器械,也不应作为火灾、交通或人身安全场景中的唯一告警设备。当前中文语音会在 PC 端输出,板端 OLED 使用 ASCII 字体显示英文短句。

功能

输入 PC 端处理 眼镜/控制盒反馈
麦克风语音 faster-whisper 语音转文字、关键词映射 OLED 字幕;危险词触发震动
环境声音 YAMNet、DSP 或本机校准模板 门铃、敲门、车辆和警报提醒
摄像头手势 MediaPipe Hands + SVM PC 播放常用语,OLED 显示短句
三个实体按键 板端直接处理 清屏、回看、求助

当前手势模型识别 hellorepeathelpokstopthanksnoyes 八类固定手势。模型只使用手部 21 个关键点,不包含原始人脸或视频训练数据。

系统结构

USB 摄像头 / 麦克风
          |
          v
  PC 端 Python 推理
  手势 / STT / 环境音
          |
          v
 USB 串口,115200 baud
          |
          v
      T5AI-Board
 OLED / 震动马达 / 三个按键

项目当前是功能原型,而不是一体化消费级眼镜。PC 推理、外接线缆和近眼光学模块都是复现时需要接受的设计边界。

快速开始

已验证环境为 Windows 和 Python 3.11。先克隆仓库并创建虚拟环境:

git clone https://github.com/siiri0817/LingMou_Project.git
cd LingMou_Project
py -3.11 -m venv .venv
.\.venv\Scripts\Activate.ps1
python -m pip install --upgrade pip
python -m pip install -r requirements.txt
python scripts\verify_checkout.py

不接开发板时,可以先检查命令链路:

python pc\main_demo.py --transport print --sound-hotkeys

测试摄像头和手势识别:

python pc\gesture_demo.py --camera 0 --max-hands 2
python pc\main_demo.py --transport print --camera 0 --gesture --pc-voice

接入 T5AI-Board 后,将 COM8 和麦克风编号替换为本机实际值:

python -m serial.tools.list_ports
python pc\subtitle\list_devices.py
python pc\main_demo.py --port COM8 --camera 0 --device 1 --gesture --stt --sound-ai --pc-voice

首次启用 STT 时,faster-whisper 会联网下载模型。依赖较多时也可以按功能分别安装 requirements-gesture.txtrequirements-stt.txtrequirements-sound.txt

完整的环境、固件和验收步骤见 复现指南

硬件与 3D 模型

主要硬件包括 T5AI-Board、I2C OLED、震动马达模块、三个按键、USB 摄像头、麦克风、近眼光学组件和 3D 打印结构件。接线、建议物料和装配注意事项见 硬件指南

仓库提供可直接切片的 STL、可编辑的 SolidWorks 文件和控制盒 STEP 总装:

hardware/cad/
├─ glasses-frame-v1.stl / .sldprt
├─ controller-top.stl / .sldprt
├─ controller-bottom.stl / .sldprt
└─ controller-assembly.step

这些模型对应当前原型,孔位和光学件尺寸可能需要按你购买的器件调整。

聆眸眼镜与控制盒

仓库目录

board/       T5AI-Board 固件与硬件测试程序
pc/          PC 端手势、字幕、环境音和串口程序
models/      手势模型、标签映射和 YAMNet 资源
data/        手势关键点训练数据
audio/       可重新生成的测试音频
hardware/    3D 打印与可编辑 CAD 文件
assets/      已脱敏的实物图片和短视频
docs/        硬件、复现及隐私安全说明
scripts/     仓库检查、素材生成和配置生成脚本
tests/       无硬件单元测试

数据、密钥与隐私

  • 摄像头和麦克风默认只用于实时推理,程序不会主动保存原始流。
  • data/gesture_keypoints.csv 只包含归一化手部关键点和标签,不包含照片、姓名或设备账号。
  • Tuya/GLM 云端功能是可选项。真实配置只应写入被 .gitignore 排除的 secrets/lingmou_local_config.json,或通过环境变量提供。
  • 提交前运行 python scripts/check_public_repo.py,检查内部活动资料、常见密钥格式、私有配置和超大文件。

更多说明见 隐私与安全

已知限制

  • OLED 固件当前使用 ASCII 字体,完整中文字幕仍显示在 PC 终端。
  • 固定手势分类不是连续手语翻译,不应把八类标签理解为标准手语词典。
  • 环境音识别受麦克风、房间反射和阈值影响;部署前必须用目标设备重新测试和校准。
  • CAD 是原型结构,尚未进行长期佩戴、跌落、防水、温升或量产公差验证。

许可证

本项目原创代码、文档、CAD、图片、视频、训练数据和自训练手势模型采用 MIT License。仓库包含的 YAMNet 模型与类别表保留各自上游许可证,详见 THIRD_PARTY_NOTICES.md

About

可复现的开源 AR 辅助眼镜原型:实时字幕、环境声音提醒与固定手势表达

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages