尊龙凯官网入口

English日本語

AI+清静-尊龙凯官网入口新一代清静防护系统焦点 > 人工智能赋能清静手艺先容

清静大模子训练优化

作者:尊龙凯官网入口 2024-11-01

大模子在下游清静领域使命中体现往往欠佳,通常被以为是既缺乏领域知识,也缺乏应用领域知识的方法 。


绘图-主要手艺.jpg


上图中,我们枚举了现在主流的大模子调优手艺 。关于L1清静行业大模子,我们使用右半图的手艺,通过更新模子参数来获得一个具备更强清静知识的大模子 。而关于L2的应用场景层,我们则会使用左半图的手艺,使大模子在现实场景中无需参数更新即可快速落地 。


我们将这些手艺区分为“注入知识”和“注入应用知识的方法”两种 。直观来讲,前者(上半图)的主要目的是让大模子获得清静领域知识,能够在回覆时有理有据而不是凭空捏造 。此后者(下半图)的主要目的则是教会大模子应用知识,希望大模子的回覆能够依循特命名堂或特定思绪;特别的,人类反响强化学习是希望大模子能够对齐人类认知,在合理应用知识的同时,提升回覆的可用性和清静性 。


下面我们将划分先容这些手艺的应用方法和优弱点 。


增量预训练


增量预训练(Continuous Pre-train,CPT)是一种常见的知识注入方法 。它的思绪是,大模子是通过学习大宗通用知识获得的,那么我将领域知识和通用知识混淆到一起,然后使用这些数据继续训练原有L0基础大模子 �;欢灾�,增添了领域知识在训练数据中的比重,即增添了原有模子的领域知识 。


这种思绪显然是合理且有用的 。增量预训练的弱点通常在于数据和算力本钱 。它不但对算力的要求相对偏高,也需要大宗全心洗濯的领域知识数据 。不过,它的优点是注入模子的数据不需要人工打标,也就是说,算法职员只需要对数据做去重、去广告等洗濯事情,不需要逐条对数据做细腻处置惩罚 。因此,增量预逊获取的数据通�?梢杂薪洗笞诩�,注入的知识也较为周全 。


有监视微调


有监视微调(Supervised Fine-tuning,SFT)是指基于已有的大模子,在有标注数据上举行模子训练 。现有的SFT手艺通常无需微调模子的所有参数,仅微调少量(或特殊)模子参数,从而显著降低盘算和安排本钱,同时爆发与全量微调模子相当的性能 。通过这种方法,可以在消耗级硬件上训练和存储大模子,让大模子顺应种种下游应用 。


有监视微调的弱点在于,用于微调大模子的数据通常需要极其细腻化的洗濯和逐条的人工打标,幸亏需求的数据量并不大,使用最低百条数据微调往往就能让大模子学会一些简朴的思绪与名堂 。


到这里,我们希望通过一个例子来更好的讲述上文提及的手艺看法 。在清静运营场景中,用户希望大模子对已知的清静事务举行解读,包括告警内容、事务类型、攻击手法、资产属性等 。这样的应用场景需要这样完成:


1.首先,我们使用大宗果真的网络清静与主机清静相关知识对大模子做增量预训练

2.其次,我们使用清静专家标注后的如下问答对,对我们的清静大模子举行有监视微调

{

 "问题":用户提出的问题 + 已知事务信息 + 期望返回效果,

 "回覆":事务类型 + 攻击手法 ...

}

3.最后,就获得了我们可以在现实场景中使用的模子 。


可是,对每一个下游使命举行微调显得过于重大和冗余了 。于是,我们引入了一些不需要更新模子参数的手艺,它们同样能有优异的使用效果 。


检索增强天生


检索增强天生(Retrieval Augmented Generation,RAG)是时下热门的大模子应用解决计划 。它的主要原理是,用户提出问题,通过类似搜索引擎的方法从知识库中找到相关的知识片断,随后将用户的问题与搜索的效果一同输入给大模子,让大模子对着∥拷寮谜底”天生回覆 。


绘图-RAG.jpg


它的优点很是显着,相比于增量预训练,检索增强天生的本钱更低,并且知识更新更快 。弱点则是,检索增强天生对知识库的质量要求较高,要求最后获得的相关知识片断确实提供了回覆用户问题所需要的知识,且能够被大模子顺遂明确 。幸运的是,使用增量预训练照旧检索增强天生并不是一个单选题,实践中我们可以选择“我全都要”,即可同时享受两种手艺的优点 。


上下文学习


上下文学习(In-context Learning,ICL)是一种很是便当的要领 。它只需要我们在给大模子输入问题时,对它给出一些“树模”性子的提醒,即可让大模子凭证树模来天生回覆 。通常使用上下文学习的用户问题名堂如下所示 。


绘图-ICL.jpg


上下文学习的优点是它的便当性,而弱点则是,关于重大的问题,简朴的提醒往往很难起到优异的效果 。


那么到这里,我们似乎可以不再对每一个下游使命都举行有监视微调,而是用越发无邪的方法完成上面的清静运营场景(关于和之前办法差别的地方,我们做了加粗标注):


1.首先,我们使用大宗果真的网络清静与主机清静相关知识对大模子做增量预训练

2.其次,我们使用清静专家标注后的多个差别清静使命场景下的问答对,对我们的清静大模子举行有监视微调

3.再次,我们对每个单独的下游使命,使用检索增强天生和上下文学习来举行单独的使命提醒

4.获得最终天生的效果


现实应用场景中,大模子还需要通过人类反响强化学习获得更好的清静性和可用性,我们将继续先容这一手艺 。


人类反响强化学习


人类反响强化学习(Reinforcement Learning from Human Feedback,RLHF)手艺的主要目的是通过将人类的反响纳入训练历程,为机械提供了一种自然的、人性化的互动学习历程 。实践中,人类反响强化学习往往被用于提升大模子的清静性和可用性,前者一样平常指用户询问不正当内容时大模子可以给出拒绝回覆,后者则指大模子给出的回覆能够切实资助到用户 。



绘图-RLHF.jpg


值得注重的是,清静性和可用性之间保存着玄妙的关系 。一方面,过于严酷的清静步伐可能会限制模子的表达自由度,导致它不可充分展示自己的知识库来资助用户;另一方面,若太过追求用户体验而掉臂及内容审查,则可能使模子袒露于爆发不当输出的危害之中 。因此,在RLHF的应用历程中,必需找到两者之间的平衡点,以阻止泛起“左支右绌”的情形 。这要求开发者们全心设计奖励机制,并一连监控模子的体现,确保每一次迭代都能朝着既定的目的前进,即同时提高系统的清静性和用户体验质量 。


总之,通过将人类反响融入到强化学习的历程中,RLHF不但增进了AI系统的自我优化,还使得这些系统能够更好地服务于人类社会,成为人们一样平常生涯和事情中值得信任的伙伴 。


总结


本文先容了几种大模子手艺在网络清静领域的应用,包括增量预训练、有监视微调、人类反响强化学习、上下文学习和检索增强天生 。这些手艺通过差别的方法为大模子注入知识,显著提升了网络清静系统的性能 。


展望未来,这些大模子手艺将为网络清静领域注入新的活力 。它们不但能够提高系统的检测和响应能力,还能自动预见和防御新型威胁 。通过一连学习和优化,这些手艺将使网络清静系统越发智能、高效,成为企业和小我私家在数字天下中的坚实后援 。

上一篇 下一篇

7*24小时服务热线

400-624-3900


网站地图