本申请涉及智慧家庭,例如涉及一种场景生成方案的控制方法及装置、电子设备。
背景技术:
1、目前,随着人工智能和物联网的发展,智能场景服务成为生活中一个重要的趋势。然而,目前的场景管理复杂,需要用户手动设定,这导致很多用户难以有效利用这些服务。
2、为了实现智能场景的自动生成,相关技术公开了一种基于预设规则和监督学习模型的方法,依赖预设规则或简单的算法进行决策。通过定义一系列的规则来处理特定场景。通过监督学习模型训练数据学习输入和输出之间的映射关系。
3、在实现本公开实施例的过程中,发现相关技术中至少存在如下问题:
4、在相关技术中预设规则需要人工创建和维护,用户需要花费大量时间去理解和设定规则,导致许多用户难以操作,使用体验不佳。并且,监督学习模型依赖大量标注数据进行训练,在实际应用中,面对日常环境变化时无法自我学习,从而无法满足每个用户独特的需求和偏好。
5、需要说明的是,在上述背景技术部分公开的信息仅用于加强对本申请的背景的理解,因此可以包括不构成对本领域普通技术人员已知的现有技术的信息。
技术实现思路
1、为了对披露的实施例的一些方面有基本的理解,下面给出了简单的概括。所述概括不是泛泛评述,也不是要确定关键/重要组成元素或描绘这些实施例的保护范围,而是作为后面的详细说明的序言。
2、本公开实施例提供了一种场景生成方案的控制方法及装置、电子设备,能够根据环境变化自我学习并自动生成智能场景。
3、在一些实施例中,所述场景生成方案的控制方法包括:选取与用户的输入信息相对应的场景的策略参数;将知识向量库中与策略参数相对应的知识向量进行线性处理,以使不同类型的知识向量的处理规则一致;将用户行为感知数据、环境感知数据、策略参数和经过线性处理的知识向量进行组合,获得当前场景的场景状态描述数据;基于强化学习算法,计算与场景状态描述数据相对应的场景控制方案;其中,场景控制方案包括家居设备和家居设备的执行动作。
4、可选地,将知识向量库中与策略参数相对应的知识向量进行线性处理,包括:将知识向量库中与策略参数相对应的知识向量进行数据预处理;从经过数据预处理的知识向量中提取特征向量。
5、可选地,基于强化学习算法,计算与场景状态描述数据相对应的场景控制方案,包括:根据知识向量库中与策略参数相对应的知识向量,确定奖励函数;通过奖励函数计算多个场景方案的预期奖励值;其中,多个场景方案根据不同的策略参数确定;将最大的预期奖励值对应的场景方案作为场景控制方案。
6、可选地,按照如下方式获得多个场景方案:计算更新策略的目标函数;按照梯度上升方式更新策略参数,获得新的策略参数,以使目标函数最大化;根据新的策略参数获取新的场景方案,直至当前更新状态满足停止准则。
7、可选地,计算更新策略的目标函数,包括按照如下公式计算目标函数:
8、l(θ')=et[π(at|st;θ')/π(at|st;θ)×at(θ)]
9、其中,l(θ')为目标函数,et为在时间步t的期望,θ为初始策略参数,θ'为新的策略参数,π(at|st;θ)为初始方案,π(at|st;θ')为新的方案,at(θ)为在时间步t下按照初始策略参数θ获得的优势函数。
10、可选地,按照梯度上升方式更新策略参数,获得新的策略参数,包括按照如下公式获得新的策略参数:
11、
12、其中,θ'为新的策略参数,θ为初始策略参数,为目标函数关于θ的梯度,α为学习率。
13、可选地,按照梯度上升方式更新策略参数,获得新的策略参数,还包括:确定新的策略参数与上一策略参数的库利贝克-莱布勒kl散度;控制新的策略参数与上一策略参数的kl散度低于或等于预设kl散度阈值。
14、可选地,选取与用户的输入信息相对应的场景的策略参数,包括:对用户的输入信息进行分类,获得分类结果;选取与分类结果相对应的场景的策略参数。
15、在一些实施例中,所述场景生成方案的控制装置包括:包括处理器和存储有程序指令的存储器,所述处理器被配置为在运行所述程序指令时,执行如上述的场景生成方案的控制方法。
16、在一些实施例中,所述电子设备,包括:电子设备本体;如上述的场景生成方案的控制装置,安装于所述电子设备本体。
17、本公开实施例提供的场景生成方案的控制方法及装置、电子设备,可以实现以下技术效果:
18、在本公开实施例中,根据用户的输入信息选取策略参数,可以通过策略参数对用户的信息做出初步的理解,便于从大量的知识中选择出与用户的输入相关的知识,从而使得后续的操作与用户的输入更加匹配。将知识向量库中与策略参数相对应的知识向量进行线性处理,能够使不同类型的知识能够在同一规则下进行处理和分析。将用户行为感知数据、环境感知数据、策略参数和经过线性处理的知识向量进行组合后,能够将当前的环境信息组合,形成一个完整的当前状态描述,并通过场景状态描述数据来表示。利用场景状态描述数据,强化学习算法能够为当前的环境提供一个场景控制方案。场景控制方案能够适应环境的变化并控制家居设备自动生成智能场景。
19、以上的总体描述和下文中的描述仅是示例性和解释性的,不用于限制本申请。
1.一种场景生成方案的控制方法,其特征在于,包括:
2.根据权利要求1所述的场景生成方案的控制方法,其特征在于,将知识向量库中与策略参数相对应的知识向量进行线性处理,包括:
3.根据权利要求1所述的场景生成方案的控制方法,其特征在于,基于强化学习算法,计算与场景状态描述数据相对应的所述场景控制方案,包括:
4.根据权利要求3所述的场景生成方案的控制方法,其特征在于,按照如下方式获得多个场景方案:
5.根据权利要求4所述的场景生成方案的控制方法,其特征在于,计算更新策略的目标函数,包括按照如下公式计算目标函数:
6.根据权利要求4所述的场景生成方案的控制方法,其特征在于,按照梯度上升方式更新策略参数,获得新的策略参数,包括按照如下公式获得新的策略参数:
7.根据权利要求6所述的场景生成方案的控制方法,其特征在于,按照梯度上升方式更新策略参数,获得新的策略参数,还包括:
8.根据权利要求1至7任一项所述的场景生成方案的控制方法,其特征在于,选取与用户的输入信息相对应的场景的策略参数,包括:
9.一种场景生成方案的控制装置,包括处理器和存储有程序指令的存储器,其特征在于,所述处理器被配置为在运行所述程序指令时,执行如权利要求1至8任一项所述的场景生成方案的控制方法。
10.一种电子设备,其特征在于,包括:
