人工智能(AI)竞争正从模型性能延伸至训练技术,一项原本属于AI研究常用工具的“模型蒸馏”(Model Distillation),如今成为美国与中国科技竞争的新焦点。美国政府及多家AI企业指责中国竞争者利用这项技术,从受保护的AI模型中提取能力,进一步加剧双方围绕先进AI技术的争议。

所谓模型蒸馏,是利用功能更强大的“大模型”作为“教师”,产生答案、代码等大量输出,再以这些资料训练规模较小的“学生模型”。经过训练后,小模型无需复制原模型的参数、架构或全部能力,也能掌握部分特定任务的处理方式,从而以较少的算力完成类似工作。

这项技术的吸引力在于可以降低AI部署成本。前沿模型通常需要庞大的数据中心、高性能晶片及巨额资金支撑,而经过蒸馏的小型模型则可在要求较低的硬件上运行,并针对工厂、汽车、个人设备及私人网络等特定应用进行优化。随着AI应用范围扩大,如何用较低成本获得先进模型能力,也成为企业和政府关注的重点。

近年来,AI模型的“推理轨迹”进一步提高了蒸馏技术的价值。与单纯提供最终答案相比,详细记录模型如何拆解问题、推导答案的过程,可以让较小模型学习解决复杂任务的方法。不过,模型蒸馏本身并非违规技术,美国及中国研究人员过去都曾利用先进模型的输出训练较小系统,包括斯坦福大学的Alpaca项目及微软的Orca研究。

真正引发美中争议的,是企业是否在未经授权下大量获取封闭式AI模型的输出。Anthropic指控包括DeepSeek、Moonshot及MiniMax在内的中国企业,曾针对Claude进行大规模能力提取,涉及软件工程及高级推理等领域;OpenAI也表示发现中国相关人士尝试利用旗下模型进行蒸馏。由于ChatGPT、Claude等封闭模型的核心参数并未公开,若通过大量输出反向复制其商业能力,可能触及知识产权、商业利益及AI安全等问题,使模型蒸馏成为美中AI技术竞争的新争议点。

上一则新闻政治三足鼎立已经瓦解 火箭被2大老对手围攻
下一侧新闻柔新经济特区迎关键一步 主计划12月正式亮相