近日,国际电信联盟电信标准分局(ITU-T)正式公布了由中国信息通信研究院(简称“中国信通院”)主导制定的全新国际标准——ITU-T F.748.44,该标准聚焦于大模型基准测试评估体系,命名为“基准测试/Assessment criteria for foundation models: Benchmark”。这一里程碑式的成就标志着大模型技术评估领域迈向了国际化标准化的新篇章。
该国际标准深入规范了大模型基准测试的各项关键要素,包括测试维度、数据集、方法及工具,旨在构建一个全球公认的大模型能力评估框架。通过系统性研究全球产学研界超过500项基准测试,标准确立了四大核心测试维度,即测试场景、测试能力、测试任务和测试指标,为全面、客观地衡量大模型性能提供了科学依据。
随着人工智能技术的飞速发展,如何准确评估大模型的综合能力及其潜在缺陷,已成为学术界与产业界共同关注的焦点。模型基准测试作为目前最为认可的评估手段,通过精心设计的测试任务和评价数据集,实现了对模型性能的公正、量化评估。然而,由于缺乏统一标准,当前市场上存在众多基准测试方法和数据集,评测结果的公正性备受质疑。
为了破解这一难题,中国信通院自2023年起便着手布局大模型基准测试研究,并于年底推出了“方升”大模型基准测试体系,创新性地引入了自适应动态测试方法,积累了600万条数据集,并构建了FactTeting测试工具,实现了大模型测试流程的自动化。这一系列的努力为国际标准的制定奠定了坚实基础。
自2024年起,中国信通院参照已发布的ITU大模型基准测试国际标准,对国内外众多标杆大模型进行了持续监测,涵盖了OpenAI o1、DeepSeek R1、Gemini 2.5 Pro、Claude 3.7 Sonnet、Qwen2.5-Max以及百度文心大模型X1等上百个模型。通过每两个月一次的周期性评测,发布了涵盖大语言通用能力、推理能力、代码能力、多模态理解能力、文生图能力以及文生视频能力等多个方面的评测结果,为行业提供了权威、全面的参考。
ITU-T F.748.44国际标准的发布,不仅为大模型技术的提供方和应用方提供了高质量的能力评估依据,还促进了大模型基准测试体系架构的国际共识,引导大模型技术及产业健康有序发展。这一标准化成果对于推动技术创新、引领行业趋势以及加强国际合作与交流具有重要意义,标志着大模型测试领域迈出了坚实的一步。