一、文章主要内容总结本文聚焦大语言模型(LLMs)的模型融合问题,提出了一种名为激活感知融合(Activation-Informed Merging, AIM)的技术。模型融合是将多个基于同一预训练基础模型微调的任务专用模型的参数与嵌入结合,以在保持计算效率的同时提升多任务性能,但现有方法多仅关注权重空间,忽略了激活空间的关键信息,且易出现“灾难性遗忘”(即丢失基础模型的通用能力)或受低质量微调模型影响。AIM 的核心思路是从持续学习和模型压缩的原则出发,利用任务无关的校准数据集分析基础模型的激活空间,识别并优先保留基础模型中关键的显著权重,同时整合微调模型的专用知识。其具体实现包括:通过校准数据获取基础模型各层激活的平均幅度,构建权重调整矩阵以限制显著权重的变化;设计自适应松弛方案,可灵活适配现有任何融合方法(如DARE、TIES Merging、Task Arithmetic等)。实验验证方面,作者在Llama-2-13B和Qwen 2.5-VL-7B(跨架构/模态)上,针对代码生成(HumanEval、MBPP)、语言理解(MMLU)、数学推理(MATH、GSM8K)、指令遵循(IFEval)等6个基准测试,验证了AIM的有效性。结果显示,AIM能使融合模型的基准性能最高提升40%,超体积增益(HV Gain)显著提高,且仅需8个校准数据块即可稳定发挥作用,鲁棒性强。二、文章创新点激活空间信息的首次深度应用:突破现有模型融合仅依赖权重空间的局限,证明激活空间包含权重重要性的关键线索,可有效指导融合过程。