本发明涉及智能可穿戴设备和人机交互,尤其涉及一种基于智能手套的手语识别方法。
背景技术:
1、在当代社会中,随着信息技术的迅猛发展,智能化的人机交互技术成为了研究的热点之一,尤其是在手势识别领域。手势识别技术允许用户通过简单的手势与设备进行非接触式的交互,大大增强了交互的自然性和便捷性。现有的手势识别技术主要可分为三个方向:基于视觉的手势识别、基于无线感知的手势识别和基于传感器的手势识别。
2、基于视觉的手势识别技术依赖摄像头捕获手势动态数据,结合图像处理和深度学习算法来识别手势。尽管这种方法在人机交互中表现出强大的潜力,但它对环境光照和背景高度敏感,且仅依赖二维信息进行识别可能导致信息损失,从而影响系统的识别精度和稳定性。基于立体视觉系统提供了较高的识别精确度,但在复杂或变化的背景下仍面临挑战,而且技术实现的难度和成本较高。此外,这种技术需要处理隐私安全问题,因为持续的视频监控可能侵犯个人隐私。
3、基于无线感知的手势识别利用无线信号变化来识别手势,具有穿透遮挡物的能力,适用于不方便使用视觉传感器的环境。然而,这些技术仍面临环境干扰和识别精度的挑战。例如,基于wi-fi的手势识别和基于雷达的手势识别技术,尽管展示了在人机交互中的应用潜力,但识别复杂手势的能力仍需改进。
4、基于传感器的手势识别方法通过各种传感器实时记录手势数据,通过模型驱动或数据驱动的方式进行识别。这些方法使用的传感器种类繁多,如电容传感器、肌电传感器、加速度计和陀螺仪等,可以提供更精确的手势识别。不过传感器技术的应用也需要解决与设备便携性和用户舒适度相关的问题。
5、因此,尽管现有技术在手势识别领域已经取得了一定的进展,但仍面临隐私侵犯、设备成本高以及识别精度不足等问题和挑战,导致不能大范围推广开来。
技术实现思路
1、本发明目的就是为了弥补已有技术的缺陷,提供一种基于智能手套的手语识别方法,本发明为聋哑人群提供一个更精确、自然、便宜的手势识别方案,显著改善他们的社会交流能力和生活质量;本发明打破现有技术的局限,为需要特殊交流方式的人群带来实质性的生活改善。
2、本发明是通过以下技术方案实现的:
3、一种基于智能手套的手语识别方法,具体包括如下步骤:
4、(1)制作智能手套设备;
5、(2)收集开源手语视频数据集及预处理:结合多个开源手语视频数据集提取相关手语词汇视频作为数据集,使用real-esrgan深度网络对提取的视频进行预处理;
6、(3)手部深度模型定位关节信息:使用mediapine深度网络识别手部21个节点的骨架信息,然后计算弯曲度数据以及imu模拟数据,重构手部三维坐标轴;通过结合dtw距离的dbscan算法识别由于视频质量导致的异常数据;
7、(4)模型训练及数据验证:将智能手套设备捕捉到的手部数据实时传输至数据处理中心,并将数据输入多维高斯模型以及时间序列模型进行训练,结合模型和智能手套设备构建实时的手势识别方法,输出识别到的手势;
8、(5)构建端到端手语识别框架:最后完成平台搭建,构建端到端的手语识别框架,并实时采集手套数据和实时输出预测结果,并转换为语音或者文字。
9、步骤(1)所述的制作智能手套设备,具体如下:配备flex sensor设备于手套每个手指,并在手套的手背上分别配备imu传感器、arduino板子及蓝牙模块的stm板。
10、步骤(3)所述的使用mediapine深度网络识别手部21个节点的骨架信息,具体如下:从开源手语视频中识别并定位手部的关节点,所述关节点包括手腕、拇指、食指、中指、无名指和小指的各个关节,总共标记21个关键点。
11、步骤(3)所述的计算弯曲度数据,具体如下:
12、使用mediapipe模型处理视频获得每帧手部关节点数据后,定位手指的四个关键点即指掌关节mcp、近节指关节pip、远节指关节dip以及指尖tip,然后构建两个向量来描述手指的主要部分:
13、向量从mcp到pip
14、向量从dip到tip
15、然后计算向量间夹角θ作为手指的弯曲度:
16、
17、按该公式应用每帧的关节点数据计算手指弯曲度,并且保存。
18、步骤(3)所述的计算imu模拟数据,具体如下:
19、通过在手部21个节点数据的基础上,以手掌为中心,构建新的三维坐标系,并且该坐标系指向符合imu传感器三轴指向;首先y轴通过手腕节点和掌心节点并指向掌心节点,x轴位于手掌平面并垂直y轴,z轴则通过这两个轴的叉积计算得来并指向手掌背面,获得这三个轴向量后,为了确保x,y,z轴是正交的,使用gram-schmidt方法对三个轴向量进行正交化处理,先将三轴作为列向量构成矩阵a=(ax,ay,az),最后通过如下计算获得单位化和正交化的轴向量ex、ey、ez,其中代表ay在ux上的投影,以此类推,而ux、uy、uz为未单位化的轴向量;
20、
21、由于拍摄镜头是垂直于人体,并且mediapipe hands的坐标系为以图像右上角为原点,x轴从左到右,y轴从上到下,z轴指向远离摄像头的方向,所以使用向量g=(0,-1,0)*当地重力加速度大小,模拟实际重力,然后将该加速度投影到重构的三维坐标轴上;
22、首先构造新坐标系的矩阵a=(ax,ay,az),然后求其逆矩阵a-1,最后计算向量g在这三个轴上的投影:
23、g′=a-1g
24、综上,模拟imu实际测得的重力加速度在三个轴的分量,并以此来确定手的朝向。
25、步骤(3)所述的通过结合dtw距离的dbscan算法识别由于视频质量导致的异常数据,具体如下:
26、给定两组时间序列数据x=(x1,x2,…,xn)和y=(y1,y2,…,ym),首先计算它们之间的距离矩阵d,其中d(i,j)=d(xi,yj),d为向量间的距离度量方法,使用欧氏距离;接着计算累积距离矩阵c,通过距离矩阵d计算,距离矩阵中的每个元素表示从起点到点c(i,j)的最小累计距离,其中i、j分别代表时间序列x、y中第i、j条数据,即xi,yj,计算公式为:
27、c(i,j)=d(i,j)+min(c(i-1,j),c(i,j-1),c(i-1,j-1))
28、其中,边界条件为c(1,1)=d(1,1);
29、最后从累积距离矩阵c的终点c(n,m)回溯到起点c(1,1),找到一条路径,使得路径上的累计距离最小,这条路径就是两个时间序列之间的最佳匹配路径,该路径的累计距离除以对齐路径长度获得每一步对齐的平均距离,即作为不同长度的时间序列对之间的相似度,依次求得不同文件间的相似度矩阵,接着使用dbscan聚类算法查找异常数据,并对每一类手语使用自适应的异常半径。
30、步骤(4)中在输出识别到的手势之前,应用基于上下文校准的自然语言处理技术进行校验,从而获得更准确的结果。
31、本发明的优点是:(1)设备制造简单且成本低廉
32、本发明中使用的智能手套设计简便,成本较低,易于大规模生产。这种轻便的手套对用户的日常活动影响较小,便于长时间佩戴,从而提升用户体验。
33、(2)多模态数据采集
34、使用公开手语视频数据集作为训练集,通过深度手部模型提取手语视频手部节点数据,再通过算法转换为传感器数据,降低了传统数据采集方法的复杂性,无需依赖志愿者进行重复的数据录入实验。这种方法提高了数据采集的便捷性和训练模型的数据收集效率,降低了成本。
35、(3)创新的数据转换算法
36、本发明实现了从视频提取类似传感器数据的高效算法,该算法能够生成与真实传感器数据相似的数据集。
37、(4)增量学习方法
38、模型设计基于增量学习方法,使得当扩充数据集手语数量后不再需要对全部数据进行重新训练,而且随着新数据的到来,增量学习模型能够适应潜在的数据分布变化,这使得模型在面对非静态环境时表现更为鲁棒。总之,降低了模型训练和更新成本,能更方便地在使用中学习适应用户独特手语动作特性。
1.一种基于智能手套的手语识别方法,其特征在于:具体包括如下步骤:
2.根据权利要求1所述的一种基于智能手套的手语识别方法,其特征在于:步骤(1)所述的制作智能手套设备,具体如下:配备flex sensor设备于手套每个手指,并在手套的手背上分别配备imu传感器、arduino板子及蓝牙模块的stm板。
3.根据权利要求2所述的一种基于智能手套的手语识别方法,其特征在于:步骤(3)所述的使用mediapine深度网络识别手部21个节点的骨架信息,具体如下:从开源手语视频中识别并定位手部的关节点,所述关节点包括手腕、拇指、食指、中指、无名指和小指的各个关节,总共标记21个关键点。
4.根据权利要求3所述的一种基于智能手套的手语识别方法,其特征在于:步骤(3)所述的计算弯曲度数据,具体如下:
5.根据权利要求4所述的一种基于智能手套的手语识别方法,其特征在于:步骤(3)所述的计算imu模拟数据,具体如下:
6.根据权利要求5所述的一种基于智能手套的手语识别方法,其特征在于:步骤(3)所述的通过结合dtw距离的dbscan算法识别由于视频质量导致的异常数据,具体如下:
7.根据权利要求1所述的一种基于智能手套的手语识别方法,其特征在于:步骤(4)中在输出识别到的手势之前,应用基于上下文校准的自然语言处理技术进行校验,从而获得更准确的结果。
