- SignalDesk3小时前
本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容: 我的帖子已经打上 开源推广 标签: 是 我的开源项目完整开源,无未开源部分: 是 我的开源项目已链接认可 LINUX DO 社区: 是 我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是 以上选择我承诺是永久有效的,接受社区和佬友监督: 是 GestureScreen 的核心是将 int8 量化的六分类 MobileNetV1 0.25× 模型部署到STM32F429IGT6芯片 上,在微控制器上完成离线手势推理。OV2640 采集的图像经板端预处理后转换为 96×96 RGB 输入;模型输出再经过时序判定,驱动选书、进入和翻页操作。阅读界面显示于 800×480 RGB 屏。图像采集、模型推理和交互控制均在板端完成,运行时无需电脑或云端。 系统实现 摄像头输出的 RGB565 图像经 DCMI 和 DMA 写入 SDRAM 帧缓冲。固件从帧中心裁取 192×192 区域,缩放并转换为 96×96 RGB int8 输入,供 MobileNetV1 0.25× 模型推理。模型采用人工标注数据进行监督训练,未使用教师模型或知识蒸馏。 为避免单帧误分类直接引起页面跳转,系统在模型输出后加入时序判定:页面操作要求分类分数达到 90%、领先第二类至少 20%,并持续约 400 ms/3 帧。Windows 端的 Gesture Studio 用于图像采集与检查,不参与板端运行。 实验结果与测量边界 冻结的部署版 int8 模型在私人数据集上的离线单帧分类结果为:验证集 293/361(81.16%) ,测试集 294/350(84.00%) 。部分样本中的手势较小或存在歧义,但目前没有系统性的实际使用准确率测量,因此不据此推算交互准确率。 在最终固件上记录的 72 次完整实板推理 中,单次推理墙钟耗时为 153–182 ms ,中位数为 158 ms ;图像预处理另需 25–40 ms 。原定的 100 ms 推理目标尚未达到。上述准确率属于离线单帧分类指标,耗时属于板端推理测量,两者均不等同于端到端手势操作成功率。 开源与复现范围 github.com GitHub - Geruyang/GestureScreen: Offline STM32F429 gesture-controlled reader with... Offline STM32F429 gesture-controlled reader with OV2640, on-device AI, and Windows USB/Ethernet capture studio geruyang.github.io GestureScreen 演示视频 仓库公开固件源码、CubeMX/Keil 工程、部署模型、最终固件、采集工具及验证脚本。训练数据由项目作者录制,包含个人影像,因此原始图像和标注不公开;其他开发者可使用自行采集且有授权的数据复现训练与部署流程,但无法凭公开仓库复算上述私人数据集上的准确率。 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:商业与市场研究
- 分类依据:内容涉及商业、投资或市场动态
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/9 14:37:35
- 暂无回复