一种基于深度学习的产业图谱建模方法及系统与流程

    专利查询2026-07-19  14


    本发明涉及数据收集,特别是指一种基于深度学习的产业图谱建模方法及系统。


    背景技术:

    1、产业图谱作为展示产业链结构、市场动态、科研成果和政策信息的工具,在企业决策、政府监管和科研分析中具有重要作用。

    2、现有的产业图谱构建模型在智能化程度上存在不足,现有技术主要依赖于人工或简单的规则算法进行数据处理,难以应对海量异构数据和复杂的产业链结构。这导致图谱构建时,生成结果容易出现不准确或片面的现象。


    技术实现思路

    1、本发明的目的在于提供一种基于深度学习的产业图谱建模方法及系统,旨在解决背景技术中所提到的问题。

    2、为解决上述技术问题,本发明的技术方案如下:

    3、第一方面,一种基于深度学习的产业图谱建模方法,所述方法包括:

    4、获取产业链的第一数据集,所述第一数据集包括企业数据、市场动态数据、科研成果数据和政策数据;

    5、对获取的第一数据集进行预处理,得到第二数据集,所述预处理步骤包括数据清洗、自然语言处理、标准化处理、结构化处理及缺失数据填补;

    6、将第二数据集依照时间顺序分为训练集和验证集;

    7、构建第一深度学习模型,第一深度学习模型包括输入层、文本数据提取层、时间序列数据提取层、结构化数据提取层和融合输出层;

    8、配置输入层,输入层用于接受第二数据集,并对其进行处理,得到词向量矩阵、时间序列数据集、结构化数据集;

    9、配置文本数据提取层,文本数据提取层用于从词向量矩阵中提取文本特征向量;

    10、配置时间序列数据提取层,时间序列数据提取层用于从时间序列数据集中提取时间序列特征向量;

    11、配置结构化数据提取层,结构化数据提取层用于从结构化数据集中提取结构化特征向量;

    12、配置融合输出层,融合输出层用于将文本特征向量、时间序列特征向量和结构化特征向量拼接,得到拼接特征向量,并对拼接特征向量进行聚类分析,生成产业图谱;

    13、根据训练集数据和验证集数据,对第一深度学习模型进行训练和验证,得到产业图谱生成模型;

    14、对产业图谱生成模型进行部署,并将产业图谱生成模型结构和权重保存为特定格式。

    15、进一步的,配置输入层,输入层用于接受第二数据集,并对其进行处理,得到词向量矩阵、时间序列数据集、结构化数据集,包括:

    16、接受经过预处理的第二数据集,并根据数据类型将其分为三类,得到文本数据、时间序列数据和结构化数据;

    17、通过对文本数据进行词向量化处理,得到词向量矩阵;

    18、通过对时间序列数据进行时间排序,得到时间序列数据集;

    19、通过对结构化数据进行字段顺序排序,得到结构化数据集。

    20、进一步的,配置文本数据提取层,文本数据提取层用于从词向量矩阵中提取文本特征向量,包括:

    21、通过滑动窗口的方式对词向量矩阵进行卷积操作,得到特征图;

    22、对特征图进行最大池化操作,缩小特征图维度,生成文本特征向量。

    23、进一步的,配置时间序列数据提取层,时间序列数据提取层用于从时间序列数据集中提取时间序列特征向量,包括:

    24、将时间序列数据集按照时间顺序分为t个时间步数据;

    25、输入门对当前时间步数据处理,得到当前时间步数据对细胞状态的第一信息影响;

    26、遗忘门对前一时刻的时间步数据处理,得到前一时刻时间步数据对细胞状态的第二信息影响;

    27、细胞状态是长期记忆数据的存储器,根据输入门和遗忘门的信息影响,更新细胞状态,生成新的记忆信息数据;

    28、将所有时间步数据处理完之后,最终获得的记忆信息数据反应了整个时间序列数据集,表示为全局信息数据;

    29、输出门将全局信息数据进行向量化处理,生成时间序列特征向量。

    30、进一步的,配置结构化数据提取层,结构化数据提取层用于从结构化数据集中提取结构化特征向量,包括:

    31、通过多层感知器的第一层对结构化数据集进行非线性映射处理,生成非线性映射数据;

    32、第一层之后,中间层通过激活函数对非线性映射数据进行处理,在第层,输入来自前一层的输出,得到第层的输出,激活函数计算公式为:

    33、,

    34、其中,为第层的输出,为第层的第一权重矩阵,为第层的第一偏置向量,为前一层的输出,为激活函数,为正则化项系数,为权重矩阵的二范数,为双曲正切激活函数,为第层的第二权重矩阵,为第层的第二偏置向量;

    35、对每一层输出进行堆叠得到最后一层输出,提取高维特征,生成结构化特征向量。

    36、进一步的,配置融合输出层,融合输出层用于将文本特征向量、时间序列特征向量和结构化特征向量拼接,得到拼接特征向量,并对拼接特征向量进行聚类分析,生成初步产业图谱,包括:

    37、将生成的文本特征向量、时间序列特征向量和结构化特征向量进行拼接处理,得到拼接特征向量;

    38、将拼接特征向量分为个簇,并随机选择其中个特征向量作为初始簇中心,使用距离划分聚类算法计算出每个特征向量到初始簇中心的距离,并将其分配给最近的初始簇中心,从而构成初始簇,计算特征向量到初始簇中心的距离公式为:

    39、,

    40、其中,为特征向量到初始簇中心的距离,为第个簇的初始簌中心,为第个簇的权重,为簇的数量,为正则化系数,为簇中心的二范数;

    41、计算出每个初始簇中所有特征向量的平均值,将其更新为新簇中心,计算每个初始簇中所有特征向量的平均值公式为:

    42、,

    43、其中,为每个初始簇中所有特征向量的平均值,为初始簇中所有特征向量的数量,为初始簇中的特征向量;

    44、重复随机选择特征向量作为初始簇中心和更新簇中心的步骤,直至簇中心的变化范围小于预设面积,特征向量构成的簇即为最终簇;

    45、将每个最终簇表示为产业中的一个节点,并将所有最终簇连接,生成产业图谱。

    46、进一步的,根据训练集数据和验证集数据,对深度学习模型进行训练、验证,包括:

    47、将训练集数据输入第一级深度学习模型,通过前向传播算法,计算训练集数据的输出,得到预测训练产业图谱;

    48、使用损失函数计算实际训练产业图谱与预测训练产业图谱之间的训练损失值,损失函数计算公式为:

    49、,

    50、其中为训练损失值,为训练产业图谱,为预测训练产业图谱,为该轮训练输入的数据量,为该轮训练输入的数据,为该数据的权重,为l1正则化项的系数,为l1范数,为l2正则化项的系数,为l2范数,为非线性函数;

    51、应用反向传播算法,根据损失函数值计算出模型每个参数的梯度;

    52、通过梯度下降或adam优化算法,调整每个参数的权重,以最小化训练损失值,逐步优化第一级深度学习模型,直到损失值收敛或达到设定的阈值,得到第二深度学习模型;

    53、将验证集数据输入第二深度学习模型,计算得到验证产业图谱;

    54、通过前向传播算法对验证集数据进行计算,得到预测验证产业图谱;

    55、使用损失函数计算验证产业图谱与预测验证产业图谱之间的误差,得到验证损失值;

    56、比较验证损失值与训练损失值的差值,若差值处于预设范围,且两者均呈现下降趋势,则继续训练;

    57、若验证损失值开始上升,而训练损失值继续下降,则基于l1/l2正则化对第二深度学习模型进行正则化处理;

    58、直至验证损失值与训练损失值差值处于预设范围,且下降趋势的变化率满足预设变化时,则停止训练,得到产业图谱生成模型。

    59、第二方面,一种基于深度学习的产业图谱建模系统,所述系统包括:

    60、数据获取模块,用于获取产业链的第一数据集,所述第一数据集包括企业数据、市场动态数据、科研成果数据和政策数据;

    61、数据处理模块,用于对获取的第一数据集进行预处理,得到第二数据集,所述预处理步骤包括数据清洗、自然语言处理、标准化处理、结构化处理及缺失数据填补;

    62、数据输入模块,用于配置输入层,输入层用于接受第二数据集,并对其进行处理,得到词向量矩阵、时间序列数据集、结构化数据集;

    63、文本数据提取模块,配置文本数据提取层,文本数据提取层用于从词向量矩阵中提取文本特征向量;

    64、时间序列数据提取模块,用于配置时间序列数据提取层,时间序列数据提取层用于从时间序列数据集中提取时间序列特征向量;

    65、结构化数据提取模块,用于配置结构化数据提取层,结构化数据提取层用于从结构化数据集中提取结构化特征向量;

    66、融合输出模块,用于配置融合输出层,融合输出层用于将文本特征向量、时间序列特征向量和结构化特征向量拼接,得到拼接特征向量,并对拼接特征向量进行聚类分析,生成产业图谱;

    67、模型训练模块,用于根据训练集数据和验证集数据,对第一深度学习模型进行训练和验证,得到产业图谱生成模型;

    68、模型部署模块,用于部署产业图谱生成模型,并将产业图谱生成模型结构和权重保存为特定格式。

    69、本发明的上述方案至少包括以下有益效果:

    70、通过深度学习模型的引入,替代了传统产业图谱构建中依赖人工或简单规则算法的方式。该方法通过输入层对复杂多样的企业数据、市场动态数据、科研成果数据和政策数据进行自动处理,避免了传统方法中依赖人工筛选和处理的弊端,提高了模型的自动化程度。文本、时间序列和结构化数据特征的自动提取及融合分析大大减少了人工干预,提升了智能化水平,使产业图谱的构建更加高效和精准。

    71、现有技术难以处理复杂的异构数据,而本发明通过将产业链的第一数据集进行预处理,包括数据清洗、自然语言处理、标准化处理、结构化处理及缺失数据填补,从而实现对不同类型和格式数据的统一处理。随后,依托文本数据提取层、时间序列数据提取层和结构化数据提取层,分别针对不同类型的数据进行特征提取,并通过融合输出层将多模态数据有效整合,生成高精度的产业图谱。这种处理能力使得系统能够应对海量异构数据,并从中提取出有效信息。

    72、本发明通过深度学习模型的训练和验证,对不同数据源(如企业数据、市场动态数据、科研成果数据和政策数据)的复杂关联关系进行深入挖掘和学习。通过构建文本、时间序列和结构化数据的特征向量,并在融合输出层进行拼接与聚类分析,能够更全面地反映产业链中的关键节点及其关系。相比于依赖人工判断或简单规则匹配的方法,深度学习能够更精准地预测产业链的变化趋势,生成的图谱更加全面、准确,减少了结果片面或失真现象。

    73、通过对模型结构和权重的存储与部署,系统可以在不同场景下快速加载和应用产业图谱生成模型。通过使用经过训练和验证的模型,用户可以在大规模产业数据实时变化的场景中快速生成产业图谱,保证了系统的灵活性和高效性,且具备较强的可扩展性。此外,模型可以随数据的更新进行再训练,持续优化图谱生成效果,使系统能够长期适应动态变化的市场环境。

    74、本发明通过深度学习模型中的多层特征提取和聚类分析,能够自动识别并构建复杂产业链结构。通过融合多源数据的特征向量,并进行聚类分析生成图谱,能够发现产业链中的隐性关系和潜在趋势。这种方法大大提升了产业图谱构建的智能化水平,能够有效应对产业链关系复杂、多变的挑战,帮助用户在决策时获得更为精准的产业信息支持。

    75、综上所述,本发明通过深度学习技术,实现了对复杂异构数据的自动化处理,并且大幅提升了产业图谱的构建效率、精确性和全面性,克服了现有技术中智能化不足、难以应对复杂数据处理的缺陷,具有显著的技术优势。


    技术特征:

    1.一种基于深度学习的产业图谱建模方法,其特征在于,所述方法包括:

    2.根据权利要求1所述的一种基于深度学习的产业图谱建模方法,其特征在于,配置输入层,输入层用于接受第二数据集,并对其进行处理,得到词向量矩阵、时间序列数据集、结构化数据集,包括:

    3.根据权利要求2所述的一种基于深度学习的产业图谱建模方法,其特征在于,配置文本数据提取层,文本数据提取层用于从词向量矩阵中提取文本特征向量,包括:

    4.根据权利要求3所述的一种基于深度学习的产业图谱建模方法,其特征在于,配置时间序列数据提取层,时间序列数据提取层用于从时间序列数据集中提取时间序列特征向量,包括:

    5.根据权利要求4所述的一种基于深度学习的产业图谱建模方法,其特征在于,配置结构化数据提取层,结构化数据提取层用于从结构化数据集中提取结构化特征向量,包括:

    6.根据权利要求5所述的一种基于深度学习的产业图谱建模方法,其特征在于,配置融合输出层,融合输出层用于将文本特征向量、时间序列特征向量和结构化特征向量拼接,得到拼接特征向量,并对拼接特征向量进行聚类分析,生成初步产业图谱,包括:

    7.根据权利要求6所述的一种基于深度学习的产业图谱建模方法,其特征在于,根据训练集数据和验证集数据,对第一深度学习模型进行训练、验证,构建产业图谱生成模型,包括:

    8.一种基于深度学习的产业图谱建模系统,其特征在于,应用于如权利要求1至7任一项所述的方法中,包括:

    9.一种计算设备,其特征在于,包括:

    10.一种计算机可读存储介质,其特征在于,所述计算机可读存储介质中存储有程序,该程序被处理器执行时实现如权利要求1至7中任一项所述的方法。


    技术总结
    本发明提供一种基于深度学习的产业图谱建模方法及系统,涉及产业图谱建模技术领域,所述方法包括:从多个数据源获取数据,生成第一数据集;对第一数据集进行预处理,生成第二数据集;构建深度学习模型,该模型包含输入层、文本数据提取层、时间序列数据提取层、结构化数据提取层和融合输出层;将第二数据集输入深度学习模型,生成词向量矩阵、时间序列数据集和结构化数据集;文本数据提取层从词向量中提取文本特征向量;时间序列数据提取层从时间序列数据中提取时间特征向量;结构化数据提取层从结构化数据中提取结构化特征向量;融合输出层将这些特征向量拼接,进行聚类分析生成初步产业图谱;本发明提高了产业图谱建模的智能化程度。

    技术研发人员:华东,李铨,李建平,唐立丹,余浩,黄朝雅,吴伟国,黄乾,柳海滨,黄卓越,闻辉
    受保护的技术使用者:莆田市数字城市互联网信息服务有限公司
    技术研发日:
    技术公布日:2024/11/26
    转载请注明原文地址:https://tc.8miu.com/read-37275.html

    最新回复(0)