在审

零样本视觉-语言模型泛化方法及装置

季向阳、刘耕源、王楠舟、刘畅、吴沁雯、陈博奎
清华大学

摘要

本申请涉及一种零样本视觉‑语言模型泛化方法及装置,其中,方法包括:通过多秩正交分解模块将预训练权重矩阵分解为多个不同秩的正交组件。这种设计使得模型能够同时捕获不同层次的视觉特征;利用统一组件融合模块基于混合专家机制,通过轻量级路由器实现不同秩组件的动态组合,以根据输入图像的局部特征选择最适合的秩组件;此外,路由采用持续路由更新机制,以通过持续更新路由器来积累领域知识。同时,该机制将适应过程限制在最深层网络,有效缩短了梯度传播路径,提高了优化稳定性。由此,解决了相关技术缺乏一种能够根据输入数据特征动态调整适应策略的机制,难以有效提升视觉‑语言模型在实际应用场景中的鲁棒性和适应性等问题。

暂无引用专利