AI对决高考全科目:超过一本线

文摘   2024-07-22 12:01   上海  

7月17日,上海人工智能实验室公布了7个AI大模型的高考全科目测试结果,测试结果显示,书生・浦语2.0系列文曲星大模型、阿里通义千问大模型Qwen2-72B以及GPT-4o包揽文、理科前三甲;前三名AI“考生”的文、理科成绩分别超过了“一本”“二本”线(以今年高考人数最多的河南省的分数线为参考)。

01

得分情况

阿里通义千问大模型Qwen2-72B以546分的成绩荣获AI高考“文科状元”,浦语文曲星则以468.5分成为理科第一名,分别超过了“非开源国际插班生”GPT-4o(文科531分,理科467分)。同为国外机构发布的Mixtral 8x22B平均得分最少,弱于国内大模型的高考表现。


评测团队选取河南省录取批次线作为参考,对比了大模型得分与对应分数线。Qwen2-72B、浦语文曲星、GPT-4o的文科成绩均超越“一本线”,展现了大模型在语文、历史、地理、思想政治等科目上深厚的知识储备和理解能力


理科成绩方面,AI“考生”整体表现弱于文科,体现了大模型在数理推理能力上普遍存在短板,但前三甲的理科成绩均超过二本分数线,具备巨大提升潜力得益于研究团队在数学推理上的投入,浦语文曲星取得了468.5分的最高理科成绩,超过所有受测模型。

02

评测特点

全卷考试:进行全卷评分,而不只针对单一题型,且包括带图的高考题。


考前开源:评测覆盖的开源模型均为今年高考前开源的模型,排除泄题的可能性


老师打分:邀请有高考阅卷经验的老师打分,确保评分和高考尽量一致。


完全公开:生成答案的代码、模型答卷、评分结果完全开源。

03

老师反馈

阅卷老师们一致认为,大模型与真人考生仍存在差距,虽然对于基础知识的掌握表现出色,但在逻辑推理和知识灵活应用方面,大模型仍然差强人意。具体而言,在作答主观题时,大模型往往无法完整理解题干,不明白代词指向,结果导致答非所问;解答数学题时,解题过程机械且逻辑性差,对于几何题,常出现与空间逻辑相违背的推断;对物理、化学实验理解肤浅,无法准确识别并运用实验器材。


此外,大模型也会伪造虚构内容,编造看似合理但实际不存在的诗句,或在存在明显计算错误的情况下之后不反思,“硬着头皮蒙”一个答案,均给阅卷老师带来了困扰。

来源上海人工智能实验室

编写|张羽翔
审核|尚健





上海市人工智能与社会发展研究会
上海市人工智能与社会发展研究会官方公众号,聚焦人工智能时代的前沿理论和现实议题,助力国家、城市、组织的数智化转型。
 最新文章