本发明涉及医疗数据处理,具体涉及基于机器学习的脓毒症预测方法及系统。
背景技术:
1、脓毒症预测方法是近年来医学领域的一个重要研究方向,旨在通过早期识别和预测脓毒症,从而实现及时、有效的治疗,降低脓毒症的死亡率。针对脓毒症的高发病率和不良预后情况,己经有多种结合机器学习用于评估重症监护病房患者风险的模型。这些模型通过分析大量的临床数据,帮助识别脓毒症的早期迹象,从而实现预测。但是在训练模型的过程中,由于目前缺少脓毒症相关的数据集,需要在其他icu数据集中对相关数据进行筛选。
2、通过当前的dbscan聚类算法,从icu数据集中筛选出脓毒症相关的数据集时,对每一数据使用相同的聚类半径,且数量阈值是预设的;使得聚类过程中,将表现脓毒症特征的数据与不表现脓毒症特征的数据聚为一类,使得基于聚类结果得到的模型不准确;造成通过机器学习构建的脓毒症预测模型,不能帮助识别脓毒症的早期迹象。
技术实现思路
1、本发明提供基于机器学习的脓毒症预测方法及系统,以解决现有的问题。
2、本发明的基于机器学习的脓毒症预测方法及系统采用如下技术方案:
3、本发明提出了基于机器学习的脓毒症预测方法,该方法包括以下步骤:
4、根据icu医疗数据集,得到多个维度的一维数据集与每个维度的临界值,对维度进行分类;将一个病人在同一采集时间上获取的多个维度的数据,记为一个数据序列;将一个病人在一次治疗过程中产生的多个数据序列,记为同次治疗过程中的数据序列;所述一维数据集中,每个数据对应一个采集时间;
5、对同次治疗过程的数据序列中每个维度的所有数据进行拟合,得到每个维度的一维数据集内每个数据的拟合斜率;根据每个维度的临界值、每个维度的一维数据集内每个数据的拟合斜率与数值,得到每个维度的一维数据集内每个数据的异常系数;根据每个维度的一维数据集中每个数据的数值及异常系数,得到每个维度数据的脓毒症表现因子;
6、根据每个维度数据的脓毒症表现因子及每个数据序列与其他数据序列在同一维度上的数据差异,得到每个数据序列与其他数据序列的距离;
7、根据每次治疗过程中每个数据序列与其他数据序列的距离、每个维度数据的脓毒症表现因子以及每个数据序列中每个数据的异常系数,得到每个数据序列的聚类半径;
8、根据每个数据序列的聚类半径、每个数据序列与其他数据序列的距离,得到数据序列的数量阈值,将所有次治疗过程的所有数据序列聚为多个类簇;
9、对不同类簇进行分析,筛选出用于训练脓毒症预测模型的数据序列,得到脓毒症预测模型。
10、进一步地,所述根据icu医疗数据集,得到多个维度的一维数据集与每个维度的临界值,对维度进行分类,包括的具体方法为:
11、获取存在于sepsis-3标准中的维度数据,得到个维度的一维数据集,表示sepsis-3标准中所含有的维度个数;
12、sepsis-3标准对于不同维度具有不同的标准范围,当第个维度的数据小于第个维度的标准范围的下限时,患者感染脓毒症,将第个维度记为第一类维度,将第个维度的标准范围的下限记为第个维度的最小临界值;
13、当第个维度的数据大于第个维度的标准范围的上限时,患者感染脓毒症,将第个维度记为第二类维度,将第个维度的标准范围的上限记为第个维度的最大临界值;
14、当第个维度的数据大于第个维度的标准范围的上限或小于第个维度的标准范围的下限时,患者感染脓毒症,将第个维度,记为第三类维度,将第个维度的标准范围的上限记为第个维度的最大临界值,将第个维度的标准范围的下限记为第个维度的最小临界值;将各维度的最大临界值与最小临界值,记为各维度的临界值。
15、进一步地,所述对同次治疗过程的数据序列中每个维度的所有数据进行拟合,得到每个维度的一维数据集内每个数据的拟合斜率,包括的具体方法为:
16、将第个维度的一维数据集中第个数据所处的治疗过程中所有第个维度上的数据,映射到横坐标为采集时间,纵坐标为数据的数值的二维坐标系中;
17、对二维坐标系中的数据点通过最小二乘法进行曲线拟合,得到第个维度的一维数据集中第个数据所处的治疗过程中所有第个维度上的数据的拟合曲线,记为第个维度中第个拟合曲线;
18、将第个维度的一维数据集中第个数据在第个维度中第个拟合曲线上的对应数据点的拟合斜率,记为第个维度的一维数据集中第个数据的拟合斜率。
19、进一步地,所述根据每个维度的临界值、每个维度的一维数据集内每个数据的拟合斜率与数值,得到每个维度的一维数据集内每个数据的异常系数,包括的具体公式为:
20、当第个维度为第一类维度时:
21、;
22、当第个维度为第二类维度时:
23、;
24、当第个维度为第三类维度时:
25、;
26、式中,表示第个维度的一维数据集中第个数据的异常系数,表示第个维度的一维数据集中第个数据的数值,表示第个维度的最小临界值,表示第个维度的一维数据集中第个数据的拟合斜率,表示第个维度的最大临界值,表示sigmoid函数,表示双曲正切函数。
27、进一步地,所述根据每个维度的一维数据集中每个数据的数值及异常系数,得到每个维度数据的脓毒症表现因子,包括的具体方法为:
28、将第个维度的一维数据集中第个数据的数值与第个维度的一维数据集中所有数据的均值作差后的平方,记为第个维度中第个数据的差异因子;
29、将第个维度中第个数据的差异因子与第个维度的一维数据集中第个数据的异常系数的乘积,记为第个维度中第个数据的表现因子;
30、将第个维度中所有数据的表现因子的均值的归一化值,记为第个维度数据的脓毒症表现因子。
31、进一步地,所述根据每个维度数据的脓毒症表现因子及每个数据序列与其他数据序列在同一维度上的数据差异,得到每个数据序列与其他数据序列的距离,包括的具体方法为:
32、;
33、式中,表示第个数据序列与第个数据序列的距离,表示sepsis-3标准中所含有的维度个数,表示第个数据序列中第个维度数据的数值,表示第个数据序列中第个维度数据的数值,表示第个维度数据的脓毒症表现因子。
34、进一步地,所述根据每次治疗过程中每个数据序列与其他数据序列的距离、每个维度数据的脓毒症表现因子以及每个数据序列中每个数据的异常系数,得到每个数据序列的聚类半径,包括的具体方法为:
35、计算第个数据序列与第个数据序列所在的治疗过程中每个数据序列的采集时间的差异,将在第个数据序列所在的治疗过程中与第个数据序列的采集时间的差异最大的数据序列,记为第个数据序列的对应数据序列;
36、第个数据序列的聚类半径的具体计算公式如下:
37、;
38、式中,第个数据序列的聚类半径,表示第个数据序列与其对应数据序列的距离,表示第个维度数据的脓毒症表现因子,表示sepsis-3标准中所含有的维度个数,表示第个数据序列中第个维度数据的异常系数。
39、进一步地,所述根据每个数据序列的聚类半径、每个数据序列与其他数据序列的距离,得到数据序列的数量阈值,包括的具体方法为:
40、;
41、式中,表示数据序列的数量阈值,表示每个一维数据集中所含数据的个数,表示第个数据序列的聚类半径内所含数据序列的数量,表示第个数据序列的聚类半径,表示第个数据序列的聚类半径内第个数据序列的聚类半径,表示第个数据序列与其聚类半径内第个数据序列的距离,为以自然常数为底的指数函数,表示归一化函数。
42、进一步地,所述对不同类簇进行分析,筛选出用于训练脓毒症预测模型的数据序列,包括的具体方法为:
43、将任意一个数据序列中所有数据的异常系数均值,记为该数据序列的局部异常因子,将任意一个类簇中所有数据序列的局部异常因子的均值,记为该类簇的平均异常度;
44、根据每一类簇的平均异常度,筛选出用于训练脓毒症预测模型的类簇,筛选过程如下:
45、;
46、式中,表示聚类结果中的类簇数量,表示选取的类簇数量,表示聚类结果中第个类簇的平均异常度,表示预设的选取数量阈值;在选取类簇时,按照平均异常度从大到小的顺序进行选取;
47、当第一次大于或等于时,将此时选取的若干类簇作为筛选后的数据。
48、本发明还提出了基于机器学习的脓毒症预测系统,包括存储器、处理器以及存储在存储器上并可在处理器上运行的计算机程序,所述处理器执行所述存储器存储的计算机程序,以实现前述所述的基于机器学习的脓毒症预测方法的步骤。
49、本发明的技术方案的有益效果是:本发明通过对脓毒症相关的icu数据集中多维数据进行分析,得到多个维度的一维数据集;在计算每个维度的一维数据集内每个数据的异常系数时,不仅依据每个数据与其对应临界值的差异,还结合了每个数据向临界值的发展趋势,保证了训练模型的预测能力;依据每个维度的一维数据集内数据的波动越大,则此维度下感染脓毒症与未感染脓毒症的差异越明显的特征,得到每个维度数据的脓毒症表现因子,对每一数据序列与其他数据序列的距离的获取作出了铺垫;依据数据序列的脓毒症特征的表现程度,获取数据序列的聚类半径,使得表现脓毒症特征的数据序列的聚类半径大于不表现脓毒症特征的数据序列的聚类半径,使得聚类过程中,表现脓毒症特征的数据序列聚为一类,不表现脓毒症特征的数据序列聚为一类,使得依据聚类结果筛选出的数据序列更可靠,提高了脓毒症预测模型的预测结果的准确率。
1.基于机器学习的脓毒症预测方法,其特征在于,该方法包括以下步骤:
2.根据权利要求1所述的基于机器学习的脓毒症预测方法,其特征在于,所述根据icu医疗数据集,得到多个维度的一维数据集与每个维度的临界值,对维度进行分类,包括的具体方法为:
3.根据权利要求1所述的基于机器学习的脓毒症预测方法,其特征在于,所述对同次治疗过程的数据序列中每个维度的所有数据进行拟合,得到每个维度的一维数据集内每个数据的拟合斜率,包括的具体方法为:
4.根据权利要求2所述的基于机器学习的脓毒症预测方法,其特征在于,所述根据每个维度的临界值、每个维度的一维数据集内每个数据的拟合斜率与数值,得到每个维度的一维数据集内每个数据的异常系数,包括的具体公式为:
5.根据权利要求1所述的基于机器学习的脓毒症预测方法,其特征在于,所述根据每个维度的一维数据集中每个数据的数值及异常系数,得到每个维度数据的脓毒症表现因子,包括的具体方法为:
6.根据权利要求2所述的基于机器学习的脓毒症预测方法,其特征在于,所述根据每个维度数据的脓毒症表现因子及每个数据序列与其他数据序列在同一维度上的数据差异,得到每个数据序列与其他数据序列的距离,包括的具体方法为:
7.根据权利要求2所述的基于机器学习的脓毒症预测方法,其特征在于,所述根据每次治疗过程中每个数据序列与其他数据序列的距离、每个维度数据的脓毒症表现因子以及每个数据序列中每个数据的异常系数,得到每个数据序列的聚类半径,包括的具体方法为:
8.根据权利要求1所述的基于机器学习的脓毒症预测方法,其特征在于,所述根据每个数据序列的聚类半径、每个数据序列与其他数据序列的距离,得到数据序列的数量阈值,包括的具体方法为:
9.根据权利要求1所述的基于机器学习的脓毒症预测方法,其特征在于,所述对不同类簇进行分析,筛选出用于训练脓毒症预测模型的数据序列,包括的具体方法为:
10.基于机器学习的脓毒症预测系统,包括存储器、处理器以及存储在所述存储器中并在所述处理器上运行的计算机程序,其特征在于,所述处理器执行所述计算机程序时实现如权利要求1-9任意一项所述基于机器学习的脓毒症预测方法的步骤。
