基于OCR和大模型结构化PDF文件的方法与流程

    专利查询2026-07-25  14


    本申请涉及大模型,尤其涉及一种基于ocr和大模型结构化pdf文件的方法。


    背景技术:

    1、rag(retrieval-augmented generation,即检索增强生成)技术是一种创新的结合信息检索与生成模型的方法,旨在提升文本生成的精确度和相关性。具体而言,rag模型首先通过检索组件,从庞大的文档集合中筛选出与输入查询紧密相关的文档,随后,这些文档被用作生成模型(如gpt-3)的输入,以产生高质量、针对性的回答。此方法在处理需要深厚背景知识或详尽上下文信息的生成任务时,展现出显著的优势。

    2、1. 检索阶段:rag模型的核心功能之一,即通过其内置的检索组件,在预先构建的知识库中精准地选取出与特定查询相匹配的文档。这些文档不仅为生成模型提供了丰富的背景素材和具体细节,还显著增强了模型对查询内容的理解深度。

    3、2. 生成阶段:在成功检索到相关文档后,rag模型随即启动其生成组件(如大型语言模型gpt),基于这些文档的内容进行回答的创作。生成模型巧妙地融合了检索到的信息与自身的语言生成能力,最终输出既准确又连贯的文本。

    4、值得注意的是,知识库的质量对于rag模型生成回答的质量具有至关重要的影响。在当前的技术实践中,知识库通常是通过解析多种类型的文档(如pdf文件等),并识别其中的内容以构建结构化数据而形成的。然而,pdf文件由于其内容的复杂性(包括纯文本、表格型图片、纯图片等多种形式),使得其结构化的难度相对较大,进而可能导致最终得到的结构化数据质量不高,从而间接影响了知识库的整体质量。


    技术实现思路

    1、本申请的目的在于提出一种基于ocr和大模型结构化pdf文件的方法,用于解决或者缓解现有技术中存在的技术问题。

    2、一种基于ocr和大模型结构化pdf文件的方法,包括:

    3、遍历所述pdf文件中的单页pdf,并基于ocr模型对所述单页pdf进行版面分析和内容识别,确定出所述单页pdf的嵌入式图片、所有的纯文本块;

    4、基于多模态大预言模型对所述嵌入式图片进行增强处理以针对性的生成增强文本内容;

    5、计算所述增强文本内容与所述纯文本块之间的位置关联关系;

    6、对所述嵌入式图片及对应的所述增强文本内容、所述纯文本块及对应的文本内容分别进行向量化,得到嵌入式图片描述向量以及纯文本块描述向量;

    7、基于所述嵌入式图片描述向量、所述位置关联关系、所述纯文本块描述向量,生成所述单页pd的结构化数据;

    8、基于所述pdf文件中的所有页pdf的结构化数据,生成所述pdf文件的结构化数据。

    9、本申请实施例的方案具有如下技术好处:

    10、(1)首先通过ocr(光学字符识别)模型对pdf文件中的每一页进行详细的版面分析,准确识别出嵌入式图片和纯文本块。ocr模型能够处理复杂的版面布局,包括不同字体、字号和排列方式的文本,从而确保了对pdf内容的全面且准确的识别。

    11、(2)对于pdf中的嵌入式图片,特别是那些包含表格、图表或复杂图形的图片,传统的ocr方法可能无法有效识别。该方案引入多模态大预言模型,利用其对图像内容的深度理解能力,生成与图片内容相关的增强文本内容。这大大提高了对图片信息的提取率,使得原本难以结构化的图片内容得以被有效利用。

    12、(3)通过计算增强文本内容与纯文本块之间的位置关联关系,该方案确保了结构化数据的空间一致性。这有助于在后续的知识库构建中,保持原始pdf文件的逻辑结构和信息完整性,从而提高知识库的整体质量。

    13、(4)向量化是将非结构化数据转换为结构化数据的关键步骤。该方案对识别出的所有内容(包括图片、增强文本和纯文本)进行向量化处理,生成描述向量。这些向量不仅便于存储和检索,还为后续的结构化数据生成提供了基础。

    14、(5)利用前面步骤生成的描述向量和位置关联关系,将单页pdf的内容整合为结构化的数据。这种结构化的表示方式使得信息更加清晰、易于查询和利用。

    15、(6)最后将各页的结构化数据整合起来,形成整个pdf文件的结构化数据。这样,原本复杂且难以处理的pdf文件就被转换为了高质量、易于利用的结构化数据,为rag模型提供了更加丰富和准确的背景知识库。



    技术特征:

    1.一种基于ocr和大模型结构化pdf文件的方法,其特征在于,包括:

    2.根据权利要求1所述的方法,其特征在于,所述基于多模态大预言模型对所述嵌入式图片进行增强处理以针对性的生成增强文本内容之前,包括:针对所述单页pdf进行全局文本提取,以将得到的所有文本内容作为第一文本内容;

    3.根据权利要求2所述的方法,其特征在于,所述基于多模态大预言模型对所述嵌入式图片进行增强处理以针对性的生成增强文本内容时,若所述嵌入式图片为纯图片,则对所述纯图片进行语义解析,以生成所述纯图片的描述文本并作为第二文本内容,所述增强文本内容还包括所述第二文本内容。

    4.根据权利要求3所述的方法,其特征在于,所述针对所述单页pdf进行全局文本提取,以将得到的所有文本内容作为第一文本内容,包括:

    5.根据权利要求4所述的方法,其特征在于,所述基于ocr模型对所述单页pdf进行版面分析和内容识别,确定出所述单页pdf的嵌入式图片、所有的纯文本块,包括:

    6.根据权利要求5所述的方法,其特征在于,所述基于多模态大预言模型对所述嵌入式图片进行增强处理以针对性的生成增强文本内容时,包括如下步骤:

    7.根据权利要求6所述的方法,其特征在于,所述计算所述空间特征和层次特征的语义依赖关系,得到语义特征向量,包括:

    8.根据权利要求7所述的方法,其特征在于,基于图卷积网络使用如下公式确定所述语义依赖元图的邻接矩阵和节点特征,以基于所述邻接矩阵和节点特征,计算所述语义特征向量,包括:

    9.根据权利要求8所述的方法,其特征在于,所述基于所述语义特征向量,对所述嵌入式图片进行增强处理,包括:基于所述语义特征向量,计算所述嵌入式图片的流形描述特征,以基于所述流形描述特征对所述嵌入式图片进行增强处理以得到所述增强文本内容。

    10.根据权利要求9所述的方法,其特征在于,按照如下公式,计算所述第一文本内容和所述第三文本内容中字符之间的编辑距离,以把最后一次迭代得到编辑距离作为所述第一文本内容和所述第三文本内容中字符之间的编辑距离,是第一文本内容的长度,是第三文本内容的长度:


    技术总结
    本申请提供基于OCR和大模型结构化PDF文件的方法,其包括:遍历所述PDF文件中的单页PDF,并基于OCR模型对所述单页PDF进行版面分析和内容识别,确定出所述单页PDF的嵌入式图片、所有的纯文本块;基于多模态大预言模型对所述嵌入式图片进行增强处理以针对性的生成增强文本内容;计算所述增强文本内容与所述纯文本块之间的位置关联关系;对所述嵌入式图片及对应的所述增强文本内容、所述纯文本块及对应的文本内容分别进行向量化,得到嵌入式图片描述向量以及纯文本块描述向量;基于所述嵌入式图片描述向量、所述位置关联关系、所述纯文本块描述向量,生成所述单页PD的结构化数据;基于所述PDF文件中的所有页PDF的结构化数据,生成所述PDF文件的结构化数据。

    技术研发人员:邓海勤,高志勇,王强,鄢楚威
    受保护的技术使用者:爱动超越人工智能科技(北京)有限责任公司
    技术研发日:
    技术公布日:2024/11/26
    转载请注明原文地址:https://tc.8miu.com/read-37490.html

    最新回复(0)