本说明书一个或多个实施例涉及大语言模型训练与长文本扩展领域,尤其涉及一种基于长文本训练大语言模型的方法及装置。
背景技术:
1、近年来,大语言模型(large language model,llm)展现出令人瞩目的性能表现,引发了学术界和产业界的极大关注。这主要得益于llm在多个应用领域表现出的广泛适用性,涵盖了通用语言理解、医疗保健服务、个性化教学以及推荐系统等多个方面。
2、然而,随着llm逐步迈向长文本处理时代,如何有效地建模和分析具有长文本特征的上下文成为了一个关键的研究课题,目标是让llm能够精确识别、深入理解并针对长文本中的关键语义作出恰当响应。在一些应用场景中,对长文本理解的这一挑战尤为突出,例如,用户通过问-答互动的形式指令llm来概括长篇报告内容,或是从书籍中提炼关键信息时,llm的长文本处理能力显得尤为重要。
3、因此,希望能有一种方案,可以通过技术手段,提升llm的长文本处理能力,使其能够高效、准确地理解长文本上下文。
技术实现思路
1、本说明书的一个或多个实施例描述了一种基于长文本训练大语言模型的方法及装置,在具有解码器的大语言模型中,引入小型编码器对长文本输入序列的分块(下文中也称为文本块)进行并行处理,并引入无监督的训练机制,通过自编码(auto-encoder)任务与下游任务,增强编码器保留文本块原始信息的能力和促进下游任务执行的效果。如此,通过并行处理文本块,提高了对长文本的处理效率,通过无监督的训练,提升模型对长文本上下文理解的准确度,保障了下游任务的执行效果。
2、根据第一方面,提供了一种基于长文本训练大语言模型的方法,所述大语言模型包括预训练的目标解码器,所述方法包括:
3、对目标长文本进行文本分割,得到多个文本块。
4、将各个文本块输入文本编码器进行编码,得到各文本块对应的编码表征。
5、将各个编码表征输入映射网络进行处理,得到映射至所述目标解码器的嵌入空间的映射表征。
6、将所述多个文本块的映射表征,以及第一提示文本对应的文本表征,输入所述目标解码器,得到第一答案文本,其中所述第一提示文本用于指示所述大语言模型,根据所述映射表征,重述所述目标长文本。
7、根据所述第一答案文本与目标长文本,确定第一损失。
8、根据预测损失,更新所述文本编码器和所述映射网络,其中所述预测损失包含所述第一损失。
9、在一种实现方式中,根据所述预测损失,微调所述目标解码器。
10、在一种实现方式中,所述预测损失还包括第二损失,所述方法还包括:
11、还将第二文本对应的文本表征输入所述目标解码器,得到第二答案文本,其中所述第二文本包括第二提示文本和第二自然语言问题,所述第二提示文本用于指示所述大语言模型,以所述多个文本块为背景资料,回答所述第二自然语言问题;
12、根据所述第二自然语言问题对应的标签答案文本与所述第二答案文本,确定所述第二损失。
13、在上述实现方式的一个场景中,所述预测损失为所述第一损失与第二损失的加权求和。
14、在一种实现方式中,所述对目标长文本进行文本分割,包括:
15、以预设的文本长度作为单位分割长度,将所述目标长文本分割为多个文本块。
16、在一种实现方式中,所述对目标长文本进行文本分割,包括:
17、以预设的文本分隔符作为分割点,将所述目标长文本分割为多个文本块,所述文本分隔符包括以下中的至少一种:逗号、句号、分号、换行。
18、在上述实现方式的一个场景中,所述文本表征通过以下步骤获得:
19、对于任意自然语言文本,使用所述大语言模型包含的嵌入层进行编码操作,得到对应的文本表征。
20、在一种实现方式中,所述第一答案文本通过以下步骤获得:
21、将所述多个文本块划分为各自包含连续文本块的若干份子文本。
22、对于任意子文本,将其对应的若干映射表征,输入所述目标解码器进行重述,得到重述子文本。
23、根据所述若干份子文本对应的重述子文本的拼接,确定第一答案文本。
24、在一种实现方式中,所述将各个文本块输入文本编码器进行编码,包括:通过所述文本编码器,对输入的文本块以并行处理的方式进行编码。
25、根据第二方面,提供了一种基于长文本训练大语言模型的装置,所述大语言模型包括预训练的目标解码器,所述装置包括:
26、文本分割模块,配置为对目标长文本进行文本分割,得到多个文本块。
27、编码模块,配置为将各个文本块输入文本编码器进行编码,得到各文本块对应的编码表征。
28、映射模块,配置为将各个编码表征输入映射网络进行处理,得到映射至所述目标解码器的嵌入空间的映射表征。
29、重述模块,配置为将所述多个文本块的映射表征,以及第一提示文本对应的文本表征,输入所述目标解码器,得到第一答案文本,其中所述第一提示文本用于指示所述大语言模型,根据所述映射表征,重述所述目标长文本。
30、损失确定模块,配置为根据所述第一答案文本与目标长文本,确定第一损失。
31、更新模块,配置为根据预测损失,更新所述文本编码器和所述映射网络,其中所述预测损失包含所述第一损失。
32、根据第三方面,提供了一种计算机程序产品,包括计算机程序/指令,该计算机程序/指令被处理器执行时实现第一方面所述方法的步骤。
33、根据第四方面,提供了一种计算设备,包括存储器和处理器,其特征在于,所述存储器中存储有可执行代码,所述处理器执行所述可执行代码时,实现第一方面所述的方法。
34、在本说明书的实施例提供的方法及装置中,首先将长文本上下文划分为多个文本块,并利用编码器将每个文本块对应的编码为文本块表征。接着,通过一个适配器模块(映射网络),将编码器输出的文本块表征与llm中的解码器的输入嵌入空间进行对齐。在此基础上,通过设定双重训练目标,使用无监督的学习策略,端到端更新编码器、适配器和解码器,提升llm的长文本处理性能。设定的双重训练目标,一方面可以增强解码器对长文本中语义的捕捉能力,另一方面可以提高llm中解码器对文本块表征的解读能力,从而实现扩展llm上下文处理窗口的目标。
1.一种基于长文本训练大语言模型的方法,所述大语言模型包括预训练的目标解码器,所述方法包括:
2.根据权利要求1所述的方法,还包括:
3.根据权利要求1所述的方法,所述预测损失还包括第二损失,所述方法还包括:
4.根据权利要求3所述的方法,其中,所述预测损失为所述第一损失与第二损失的加权求和。
5.根据权利要求1所述的方法,其中,所述对目标长文本进行文本分割,包括:
6.根据权利要求1所述的方法,其中,所述对目标长文本进行文本分割,包括:
7.根据权利要求1或3所述的方法,其中,所述文本表征通过以下步骤获得:
8.根据权利要求1所述的方法,其中,所述第一答案文本通过以下步骤获得:
9.根据权利要求1所述的方法,其中,所述将各个文本块输入文本编码器进行编码,包括:通过所述文本编码器,对输入的文本块以并行处理的方式进行编码。
10.一种基于长文本训练大语言模型的装置,所述大语言模型包括预训练的目标解码器,所述装置包括:
11.一种计算机程序产品,包括计算机程序/指令,该计算机程序/指令被处理器执行时实现权利要求1-9中任一项所述方法的步骤。
12.一种计算设备,包括存储器和处理器,其特征在于,所述存储器中存储有可执行代码,所述处理器执行所述可执行代码时,实现权利要求1-9中任一项所述的方法。
