本公开涉及人工智能领域,更具体地,涉及一种数据处理方法、装置、设备、计算机程序产品和存储介质。
背景技术:
1、近年来,基于transformer架构的大语言模型在自然语言处理领域广受关注和应用。这类模型通过强大的理解和生成能力,在诸如机器翻译、问答系统、文本摘要等任务中取得了卓越的成绩。然而,当面对生成长序列文本的任务时,这些模型却面临着显著的挑战。
2、具体地,基于transformer架构的语言模型需要编码并存储每个历史词元(token),并在每个历史词元上计算注意力权重。这种机制导致了模型在生成长文本时需要处理大量的历史信息,从而产生了巨大的显存需求和计算开销,这与历史词元的数量成正比。以机器翻译为例,当生成一个较长的句子时,模型需要记住并处理所有先前生成的单词,这对于显存和计算资源造成了巨大的压力。同样的问题也存在于其他需要生成长文本的任务中,诸如文本摘要、对话系统等。
3、因此,需要一种有效的数据处理方法,使得可以准确可靠地生成长文本序列,同时减少显存需求和计算开销。
技术实现思路
1、为了解决上述问题,本公开提出了一种文本序列生成方法,其结合文本序列的场景需求,根据文本序列的数据结构分别计算多个维度的隐藏状态,以对历史词元序列进行编码,从而减少显存需求和计算开销,并且准确可靠地生成长文本序列。
2、本公开的实施例提供了一种数据处理方法、装置、设备、计算机程序产品和计算机可读存储介质。
3、本公开的实施例提供了一种数据处理方法,包括:获取文本序列的当前生成词元,其中,所述当前生成词元为所述文本序列中最新生成的词元;获取与所述文本序列相关联的多个隐藏状态的先前状态,其中,所述多个隐藏状态中的每个隐藏状态用于表征所述文本序列的与不同类别相关的文本信息,并且所述多个隐藏状态的先前状态用于表征所述文本序列的在所述当前生成词元之前生成的词元的与不同类别相关的文本信息,所述不同类别与所述文本序列的场景类别相关联;基于所述文本序列的所述当前生成词元,针对所述多个隐藏状态中的每个隐藏状态,利用所述当前生成词元的与和所述隐藏状态相对应的类别相关的文本信息,对所述隐藏状态的先前状态进行编码,以生成所述隐藏状态的当前状态,所述隐藏状态的当前状态用于表征所述文本序列的包括所述当前生成词元的词元的与所述类别相关的文本信息;基于多个隐藏状态中的每个隐藏状态的当前状态,生成所述文本序列的下一生成词元。
4、根据本公开的实施例,基于所述文本序列的所述当前生成词元,针对所述多个隐藏状态中的每个隐藏状态,利用所述当前生成词元的与和所述隐藏状态相对应的类别相关的文本信息,对所述隐藏状态的先前状态进行编码,以生成所述隐藏状态的当前状态包括:通过状态空间模型,利用所述当前生成词元的与和所述隐藏状态相对应的类别相关的文本信息,对所述隐藏状态的先前状态进行编码,以生成所述多个隐藏状态的当前状态;基于多个隐藏状态中的每个隐藏状态的当前状态,生成所述文本序列的下一生成词元包括:通过所述状态空间模型,基于多个隐藏状态中的每个隐藏状态的当前状态的组合,生成所述文本序列的下一生成词元;其中,所述状态空间模型以所述文本序列的所述当前生成词元为输入,以所述文本序列的所述下一生成词元为输出。
5、根据本公开的实施例,所述数据处理方法还包括:利用预先训练的大语言模型作为教师模型,所述状态空间模型作为学生模型,通过模型蒸馏和多任务学习来对所述状态空间模型进行训练。
6、根据本公开的实施例,通过模型蒸馏和多任务学习来对所述状态空间模型进行训练包括:通过最小化所述预先训练的大语言模型与所述状态空间模型针对生成下一生成词元的预测概率分布之间的差异、并且最大化所述状态空间模型通过自回归方式生成下一生成词元的概率,来对所述状态空间模型进行训练。
7、根据本公开的实施例,基于多个隐藏状态中的每个隐藏状态的当前状态,生成所述文本序列的下一生成词元包括:基于多个隐藏状态中的每个隐藏状态的当前状态的组合,通过所述状态空间模型确定针对生成下一生成词元的预测概率分布;基于所确定的针对生成下一生成词元的预测概率分布,生成所述文本序列的下一生成词元。
8、根据本公开的实施例,所述数据处理方法还包括:基于与所述文本序列相对应的输入文本,确定所述文本序列的场景类别;基于所述文本序列的场景类别,确定与所述文本序列相关联的所述多个隐藏状态;基于所述输入文本,确定所述多个隐藏状态的初始状态。
9、根据本公开的实施例,所述文本序列的场景类别为医疗场景;其中,与所述文本序列相关联的所述多个隐藏状态包括以下中的至少一项:与所述文本序列相对应的输入文本中的提示部分的隐藏状态;患者的入院记录的隐藏状态;患者的病程管理的隐藏状态。
10、本公开的实施例提供了一种数据处理装置,包括:数据获取模块,被配置为获取文本序列的当前生成词元,并且获取与所述文本序列相关联的多个隐藏状态的先前状态,其中,所述当前生成词元为所述文本序列中最新生成的词元,所述多个隐藏状态中的每个隐藏状态用于表征所述文本序列的与不同类别相关的文本信息,并且所述多个隐藏状态的先前状态用于表征所述文本序列的在所述当前生成词元之前生成的词元的与不同类别相关的文本信息,所述不同类别与所述文本序列的场景类别相关联;状态更新模块,被配置为基于所述文本序列的所述当前生成词元,针对所述多个隐藏状态中的每个隐藏状态,利用所述当前生成词元的与和所述隐藏状态相对应的类别相关的文本信息,对所述隐藏状态的先前状态进行编码,以生成所述隐藏状态的当前状态,所述隐藏状态的当前状态用于表征所述文本序列的包括所述当前生成词元的词元的与所述类别相关的文本信息;以及词元生成模块,被配置为基于多个隐藏状态中的每个隐藏状态的当前状态,生成所述文本序列的下一生成词元。
11、本公开的实施例提供了一种数据处理设备,包括:一个或多个处理器;以及一个或多个存储器,其中,所述一个或多个存储器中存储有计算机可执行程序,当由所述处理器执行所述计算机可执行程序时,执行如上所述的数据处理方法。
12、本公开的实施例提供了一种计算机可读存储介质,其上存储有计算机可执行指令,所述指令在被处理器执行时用于实现如上所述的数据处理方法。
13、本公开的实施例提供了一种计算机程序产品或计算机程序,该计算机程序产品或计算机程序包括计算机指令,该计算机指令存储在计算机可读存储介质中。计算机设备的处理器从计算机可读存储介质读取该计算机指令,处理器执行该计算机指令,使得该计算机设备执行根据本公开的实施例的数据处理方法。
14、本公开的实施例所提供的方法结合文本序列的具体场景类别和需求,利用与该场景类别相关联的不同类别的多个隐藏状态来对文本序列的历史词元序列进行编码,基于新生成的词元对多个隐藏状态进行实时更新,从而基于更新的多个隐藏状态来生成新的词元。通过本公开的实施例的方法能够利用多个隐藏状态来编码历史词元序列,使得能够通过其数据压缩能力来高效生成长文本序列,减少了显存需求和计算开销,同时避免了因数据过度压缩而可能导致的生成质量下降的问题。此外,通过结合文本序列的具体场景类别和需求来编码多个隐藏状态,使得模型能够提升对于文本数据的结构和逻辑关系的理解,从而实现更准确和可靠的模型推理。
1.一种数据处理方法,包括:
2.如权利要求1所述的方法,基于所述文本序列的所述当前生成词元,针对所述多个隐藏状态中的每个隐藏状态,利用所述当前生成词元的与和所述隐藏状态相对应的类别相关的文本信息,对所述隐藏状态的先前状态进行编码,以生成所述隐藏状态的当前状态包括:
3.如权利要求2所述的方法,还包括:
4.如权利要求3所述的方法,其中,通过模型蒸馏和多任务学习来对所述状态空间模型进行训练包括:
5.如权利要求4所述的方法,其中,基于多个隐藏状态中的每个隐藏状态的当前状态,生成所述文本序列的下一生成词元包括:
6.如权利要求1所述的方法,还包括:
7.如权利要求1所述的方法,其中,所述文本序列的场景类别为医疗场景;
8.一种数据处理装置,包括:
9.一种数据处理设备,包括:
10.一种计算机程序产品,所述计算机程序产品存储在计算机可读存储介质上,并且包括计算机指令,所述计算机指令在由处理器运行时使得计算机设备执行权利要求1-7中任一项所述的方法。
11.一种计算机可读存储介质,其上存储有计算机可执行指令,所述指令在被处理器执行时用于实现权利要求1-7中任一项所述的方法。
