一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法

    专利查询2026-08-27  5


    本发明涉及点云数据编码,尤其是一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法。


    背景技术:

    1、点云数据因其高精度和高分辨率,在自动驾驶、机器人技术和3d制图等领域中得到了快速发展和广泛应用。然而,这种高精度的点云数据量庞大,给存储和传输带来了巨大挑战。面对如此庞大的数据处理任务,如何降低计算复杂度并提高压缩率成为了关键技术问题。而且由于点云数据具有无序和稀疏的特点,传统的图像和视频压缩方法难以直接应用于点云数据压缩。

    2、现有技术主要上通过基于体素、图像和树的算法对点云进行压缩处理。其中,基于体素的方法将点云数据网格化,再对网格数据进行压缩;通过将点云组织成体素,然后使用3d卷积预测每个体素的占用情况。然而,这些方法对点云分辨率的鲁棒性较差,并且在固定大小的体素中只能获得有限的邻域信息感受野。此外,引入体素编码带来了大量计算,特别是对于更高分辨率的点云。

    3、其次,基于图像的方法是通过将点云数据投影到深度图上,然后对深度图进行压缩来实现点云数据的压缩,此方法虽然压缩速度快,但在处理非平面点云数据时,可能导致信息丢失。

    4、再者,基于树结构的方法包括kd树、预测树、四叉树和八叉树等,其中,基于八叉树的方法由于其压缩效率高,压缩速度快,适应点云稀疏性等优点脱颖而出,进而广泛应用于点云数据的压缩。但是,其主要是基于笛卡尔坐标构建八叉树结构,这忽略了lidar旋转扫描所带来的方位角不变性以及点云中的多圆形特征,导致模型未能充分利用点云的冗余信息,同时增加了额外的计算开销,同时降低了对局部特征的学习能力。

    5、因此,亟需要提供一种如何在节约计算资源的同时,充分挖掘几何特征,找出节点间的细粒度预测差异,以获得更紧凑、更高质量的点云压缩方法。


    技术实现思路

    1、针对现有技术的不足,本发明提供一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,本发明能够提高点云数据的编码效率和特征提取精度,从而实现高效、精准的点云数据处理。

    2、本发明的技术方案为:一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,包括:

    3、s1)、使用基于多级球坐标的八叉树熵模型对点云数据进行编码;

    4、s2)、利用八叉树结构和点云的球坐标表示构建父图和距离图的邻接矩阵;

    5、s3)、构建基于图驱动注意力的熵编码模型;

    6、s4)、使用图卷积网络模块利用邻接矩阵辅助上下文信息嵌入;

    7、s5)、使用分组图注意力模块和交叉注意力模块以学习父节点上下文和同级节点上下文的相关性;

    8、s6)、基于熵编码模型预测每个八叉树节点的占位符号的概率;

    9、s7)、采用算术编码将八叉树节点的占位符号序列压缩为二进制浮点数序列;

    10、s8)、将二进制浮点数序列转化为比特流;

    11、s9)、利用算术解码将比特流转化为八叉树的占位符号序列,并重构为八叉树并还原点云数据。

    12、作为优选的,步骤s1)中,构建多级球坐标八叉树具体包括如下步骤:

    13、s11)、引入球坐标八叉树的量化步长;在球坐标所述的球坐标(ρ,θ,φ)下的量化步长qρ、qθ、分别表示为:

    14、qρ=q;

    15、

    16、其中,b表示量化步长qρ下,ρ坐标的总分箱数,具体表示为ρ为球坐标通过原点到点的径向距离;θ为从正z轴向下测量的极角;φ为从正x轴开始沿xy平面的投影测量的方位角;q为基于笛卡尔坐标系下的八叉树量化步长;ρmax为径向距离的最大值;

    17、s12)、引入球坐标八叉树的重建误差εs;即:

    18、

    19、式中,pi为原始点云坐标;为体素的中心坐标;

    20、s13)、获得原始点云数据,将数据中的笛卡尔坐标系(x,y,z)转换为球坐标系计算坐标转化后的最大的径向距离ρmax;

    21、根据步骤s11)的公式计算量化步长,并对转换后的点云数据进行归一化处理;再次计算点云数据中归一化后的最大径向距离rmax,使用最大径向距离rmax和处理后的点云构建八叉树;

    22、s14)、根据rmax计算点云的边界范围,随后计算包围整个点云的边界框的中心和最大范围;从八叉树的根节点开始,根据预设树的最大深度决定是将当前的八分体节点继续划分为子节点,还是将其保持为叶节点;如果当前八分体节点未达到最大深度,则将其递归地分割成八个子节点,划分依据是该节点的中心点;每个子节点覆盖父节点空间的特定子区域;

    23、对于每个八叉树节点,为其添加节点特征,包括中心球坐标象限(octant)、所在树深度(depth)、占用符号(occupancy);递归构建直到最大深度,获得一棵含有节点特征的八叉树。

    24、作为优选的,在步骤s11)中,将点云划分为n级,并为每级分配不同数量的附加量化级别;每级的附加量化级别数量为n,取值范围为{0,1,...,n-1},每级的ρn在区间[tnρmax,tn+1ρmax)内,其中tn是分区的临界值,满足0≤tn<tn+1<1,t0=0,tn=1;附加量化等级表示为量化步长的减小,具体体现为qn=q/2n。

    25、作为优选的,在步骤s12)中,将重建误差εs的上限控制在小于或等于笛卡尔坐标系下的八叉树重建误差εc的上限,引入多级概念的球坐标八叉树,其重建误差εn表示为:

    26、

    27、作为优选的,步骤s2)中,构建父图和距离图的邻接矩阵,具体包括如下步骤:

    28、s21)、根据步骤s1)构建的多级球坐标八叉树的层次关系获取父图的邻接矩阵;

    29、s22)、基于点云的几何距离关系构建距离图的邻接矩阵。

    30、作为优选的,步骤s21)中,通过遍历多级球坐标八叉树的多个层级的祖先节点来构建父图;并且对于共享相同祖先的上下文节点,赋予单位边权重。

    31、作为优选的,步骤s21)中,对于同一上下文中的节点oi和oj,父图中节点的边权重edgep(oi,oj)的计算公式为:

    32、

    33、

    34、式中,m表示搜索节点oi和oj的祖先节点时当前八叉树的深度;分别代表当前八叉树深度m下,节点oi和oj的祖先节点。

    35、作为优选的,步骤s22)中,对于球坐标八叉树的节点oi和oj,两者间的距离d(oi,oj)表示为:

    36、

    37、式中,分别代表节点oi和oj的球坐标径向长度ρ;分别代表节点oi和oj的球坐标的极角θ;分别代表节点oi和oj的球坐标的方位角φ。

    38、作为优选的,步骤s22)中,对于球坐标八叉树的节点oi和oj之间的单位边权重表示为:

    39、

    40、式中,dmax、dmin分别代表节点oi和oj之间距离的最大值和最小值;上述正则化操作可以将最终的单位边权重限制在[0,1]之间。

    41、所述的基于图驱动注意力的熵编码模型包括图卷积网络模块、分组图注意力模块和交叉注意力模块;

    42、作为优选的,步骤s3)中,所述的分组图注意力模块用于学习父节点的上下文信息,通过减少对远距离点的计算降低计算复杂度,增强了局部上下文学习能力,并在组间共享信息以捕捉全局特征;

    43、所述的交叉注意力模块通过在编码后的邻居节点上下文和父节点上下文之间进行学习来增强特征提取。

    44、作为优选的,步骤s4)中,所述的图卷积网络模块包括多个线性层linear、多层感知机mlp。

    45、作为优选的,步骤s4)中,使用图卷积网络模块为邻接矩阵嵌入上下文信息,具体包括:所述的图卷积网络模块通过线性层linear将待嵌入的上下文信息映射到目标维度上,然后将其与邻接矩阵相乘;得到的特征再经过另一个线性层linear后再与邻接矩阵相乘;并将得到的特征进行归一化操作layernorm处理;最后通过一个多层感知机mlp和残差连接将卷积输出映射到目标输出维度,从而得到嵌入上下文信息的邻接矩阵。

    46、作为优选的,步骤s5)中,所述的分组图注意力模块用于学习父节点的上下文信息,通过减少对远距离点的计算降低计算复杂度,增强了局部上下文学习能力,并在组间共享信息以捕捉全局特征;

    47、所述的分组图注意力模块根据嵌入上下文信息的邻接矩阵的边权重将长序列上下文拆分成组,具体包括如下步骤:

    48、s511)、交替输入父图/距离图的邻接矩阵,并据此将输入为(batch_size,n,in_feature)的张量变换为(batch_size*n,n/n,in_feature);其中n为组数,in_feature为输入张量的特征维度;

    49、s512)、通过一个线性层将上下文信息的特征映射到目标维度out_feature;

    50、s513)、随后经过一次横向复制与拼接,将数据维度从(batch_size*n,n/n,out_feature)扩展为(batch_size*n,n/n,n/n,out_feature);

    51、s514)、再经历一次纵向复制与拼接,将数据维度从(batch_size*n,n/n,n/n,out_feature)扩展为(batch_size*n,n/n,n/n,2*out_feature);其中,n表示输入序列长度;

    52、s515)、然后使用对应部分的邻接矩阵进行掩码处理;提取节点间的注意力权重;

    53、s516)、将注意力权重与先前经过线性变换映射到目标维度的值向量相乘获得注意力输出,最后通过多层感知机mlp捕获组间信息,实现更加精细的特征学习,并重塑reshape数据维度,将分组合并复原,得到分组图注意力模块的最终输出结果。

    54、作为优选的,步骤s5)中,所述的交叉注意力模块通过在编码后的邻居节点上下文和父节点上下文之间进行学习来增强特征提取,具体如下:

    55、首先,将父节点上下文通过两层线性层投影到相同特征维度,生成键k和值v向量;

    56、然后,将邻居节点上下文通过线性层压缩特征维度,生成查询q向量;

    57、接着,通过邻居节点上下文向父节点上下文进行查询,即将邻居节点上下文的查询q向量与父节点上下文的键k向量相乘;并通过softmax激活函数进行归一化,以获得注意力权重;

    58、最后,将注意力权重与父节点上下文的值v向量相乘,得到最终结果。

    59、作为优选的,步骤s6)中,通过所述的熵编码模型对每个八叉树节点的占位符号的概率分布进行预测,即:

    60、

    61、式中,代表熵编码模型在给定点a上的概率值;na表示编码节点的占用情况;fa、fa′分别代表当前特征和参考特征的嵌入;ω为上下文窗口长度,w为熵模型的权重。

    62、作为优选的,步骤s6)中,所述的熵编码模型的目标是通过最小化估计分布与真实分布q(n)之间的交叉熵来提高精度;因此,所述的熵编码模型的目标函数为:

    63、en~q[-logn q(n)];

    64、式中,e表示在节点符号n服从分布q的情况下,熵编码模型预测分布q对节点符号n的预测值的对数损失的期望;q(n)表示由实际数据生成的节点占位符号n的真实概率分布;n表示八叉树的节点占位符号。

    65、作为优选的,步骤s7)中,采用算术编码将八叉树节点的占位符号序列压缩为二进制浮点数序列,具体包括如下步骤:

    66、s71)、建立频率表;

    67、s72)、以φk(xi)=(b,v)形式创建一系列嵌套区间,其中,φk(xi)表示数轴映射区间;b表示嵌套区间起点,v表示嵌套区间长度,xi表示节点i的占位符号;最初的区间φ0(xi)是[0,1),在每一步中,区间被进一步划分;具体如下式所示:

    68、φ0(xi)=(b0,v0)=(0,1);

    69、φk(xi)=(bk,vk)=(bk-1+c(sk)lk-1,p(sk)lk-1);k=1,2,…,256;

    70、式中,sk表示节点i的占位符号xi的第k种格式,p(sk)表示格式sk的概率;c(sk)表示累计概率;lk-1为是前一个区间的长度;bk-1是前一个区间的起点;

    71、s73)、将节点i的占位符号xi映射到实数区间[0,1)上的某一值y,并将y的二进制展开作为压缩编码结果;在要编码的节点占位符号xi对应的数轴映射区间φk(xi)内,选择一个浮点数来表示节点i的占位符号xi。

    72、作为优选的,步骤s8)中,将二进制浮点数序列转化为比特流,具体包括:

    73、s81)、选择在指定范围内使用有限浮点数来表示节点的占位符号,并将每个浮点数转换为二进制形式,再转换为字节流;

    74、s82)、根据区间间隔长度vk,动态选择二进制位数最少的浮点数来表示每个节点;

    75、s83)、将每个节点的动态浮点数二进制位进行存储并转换为比特流;

    76、s84)、使用广度优先搜索将所有八叉树内节点的比特流并连接成一个具有一定长度的比特流;

    77、s85)、通过算术解码建立节点占位符号的预测概率频率表,并将其映射到实数区间[0,1)上,映射到对于区间的序号被转换为二进制形式,从而得到解码后的节点占位符号。

    78、作为优选的,步骤s9)中,利用算术解码将比特流转化为八叉树的占位符号序列,并重构为八叉树并还原点云数据,具体包括:

    79、s91)、获取解码所需的信息,包括比特流数据、根节点的坐标及边长;

    80、s92)、构建八叉树的根节点,并将根节点特征输入熵编码模型中,以获取根节点的占位符号的概率分布后作为算术解码的频率表;

    81、s93)、从比特流中截取根节点所在层的部分并利用频率表解析为浮点数,

    82、得到8位占位符号,其表示根节点的子节点分布情况;

    83、s94)、根据步骤s93)得到的根节点的子节点分布情况重构下一层节点,具体表现为对当前根节点,为每个占用符号为1的子节点创建八叉树节点,生成节点特征;并将其输入到熵编码模型中,获取新一层的占位符号的概率分布生成多个算术解码的频率表;

    84、s95)、从比特流中截取新一层的部分,并利用新的解码的频率表解析为新一层的符号序列,然后继续重构八叉树的下一层,重复上述过程直至完成八叉树的重构;

    85、s96)、通过遍历重构的八叉树结构,提取所有子叶节点的中心点,完成八叉树编码的点云数据还原。

    86、本发明的有益效果为:

    87、1、本发明通过多级球坐标八叉树结构、图卷积、分组图注意力模块和交叉注意力模块的结合,减少了量化误差,提高了压缩效率,平衡了计算复杂度和压缩效果,并显著增强了对高分辨率点云数据的适应性;

    88、2、本发明采用基于多级球坐标的八叉树结构,解决了笛卡尔坐标系下点云冗余信息无法充分利用的问题;通过球坐标系统构建八叉树,并依据距离对点云数据进行分级处理,使同一激光束获取的点更容易被分配到同一体素中,从而更容易学习到局部特征,减少冗余信息处理,实现更高质量和高效的编码;

    89、3、本发明通过图卷积嵌入上下文信息的方法,以解决现有方法未能有效利用八叉树结构中节点内在相关性的问题;通过构建父图和距离图的邻接矩阵,利用图卷积嵌入上下文信息,使注意力机制能够引入更多语义细节,增强上下文理解和预测准确性;

    90、4、本发明采用分组图注意力模块来解决注意力机制计算复杂度高且未能充分捕捉局部特征的问题;分组图注意力模块通过减少对远距离点的计算,降低计算复杂度,同时增强局部上下文学习能力,并在组间共享信息以捕捉全局特征,从而提高效率和特征提取能力;

    91、5、本发明通过交叉注意力模块以解决现有方法未能有效利用八叉树高分辨率信息表达的问题;通过交叉注意力模块,学习父节点和邻居节点上下文之间的相关性,扩大模型的感受野,丰富信息表达,提高特征表示能力。


    技术特征:

    1.一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于,包括以下步骤:

    2.根据权利要求1所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s1)中,所述的多级球坐标八叉树的重建误差εn表示为:

    3.根据权利要求1所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s2)中,构建父图和距离图的邻接矩阵,具体包括如下步骤:

    4.根据权利要求3所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s21)中,通过遍历多级球坐标八叉树的多个层级的祖先节点来构建父图;并且对于共享相同祖先的上下文节点,赋予单位边权重;对于同一上下文中的节点oi和oj,父图中节点的边权重edgep(oi,oj)的计算公式为:

    5.根据权利要求4所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s22)中,对于球坐标八叉树的节点oi和oj,两者间的距离d(oi,oj)表示为:

    6.根据权利要求5所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s22)中,对于球坐标八叉树的节点oi和oj之间的单位边权重表示为:

    7.根据权利要求1所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:所述的基于图驱动注意力的熵编码模型包括图卷积网络模块、分组图注意力模块和交叉注意力模块;

    8.根据权利要求7所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s4)中,所述的图卷积网络模块包括多个线性层linear、多层感知机mlp;所述的图卷积网络模块通过线性层linear将待嵌入的上下文信息映射到目标维度上,然后将其与邻接矩阵相乘;得到的特征再经过另一个线性层linear后再与邻接矩阵相乘;并将得到的特征进行归一化操作layernorm处理;最后通过一个多层感知机mlp和残差连接将卷积输出映射到目标输出维度,从而得到嵌入后的上下文信息。

    9.根据权利要求7所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s5)中,所述的分组图注意力模块根据嵌入上下文信息的邻接矩阵的边权重将长序列上下文拆分成组,具体包括如下步骤:

    10.根据权利要求7所述的一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,其特征在于:步骤s5)中,所述的交叉注意力模块通过在编码后的邻居节点上下文和父节点上下文之间进行学习来增强特征提取,具体如下:


    技术总结
    本发明提供一种基于多级球八叉树和图驱动注意力熵模型的点云编码方法,包括使用基于多级球坐标的八叉树熵模型对点云数据进行编码;构建父图和距离图的邻接矩阵;使用图卷积网络模块利用邻接矩阵辅助上下文信息嵌入;构建分组图注意力模块和交叉注意力模块以学习父节点上下文和同级节点上下文的相关性;预测每个八叉树节点的占位符号的概率;将占位符号序列压缩为二进制浮点数序列并转化为比特流;将比特流转化为八叉树的占位符号序列,重构八叉树并还原点云。本发明通过多级球坐标八叉树结构、图卷积、分组图注意力模块和交叉注意力模块的结合,减少了量化误差,提高了压缩效率,平衡了计算复杂度和压缩效果,并显著增强了对高分辨率点云数据的适应性。

    技术研发人员:崔明月,陶俊成,钟予阳,冯明健,黄凯
    受保护的技术使用者:中山大学
    技术研发日:
    技术公布日:2024/11/26
    转载请注明原文地址:https://tc.8miu.com/read-38530.html

    最新回复(0)