凤凰网科技讯 7月18日,上海人工智能实验室公布了大模型开源开放评测体系司南对7个AI大模型进行了高考全科目测试结果。结果显示:书生·浦语2.0系列文曲星大模型(浦语文曲星)、阿里通义千问大模型Qwen2-72B以及GPT-4o再次包揽文、理科前三甲;前三名AI“考生”的文、理科成绩分别超过了“一本”“二本”线(以今年高考人数最多的河南省的分数线为参考)。
从官方提供的测试结果来看,前三甲“考生”达一本水平,大部分模型未到二本线。其中,阿里通义千问大模型Qwen2-72B以546分的成绩获得AI高考“文科状元”,浦语文曲星则以468.5分成为理科第一名。
在文科成绩方面,Qwen2-72B、浦语文曲星、GPT-4o的文科成绩均超越“一本线”,展现了大模型在语文、历史、地理、思想**等科目上深厚的知识储备和理解能力。而在理科成绩方面,AI“考生”整体表现弱于文科,体现了大模型在数理推理能力上普遍存在短板。
据悉,本次评测具有几大特点:
1. 全卷考试:进行全卷评分,而不只针对单一题型,且包括带图的高考题
2. 考前开源:评测覆盖的开源模型均为今年高考前开源的模型,排除泄题的可能性
3. 老师打分:邀请有高考阅卷经验的老师打分,确保评分和高考尽量一致
4. 完全公开:生成答案的代码、模型答卷、评分结果完全开源
在此次测试中,阅卷老师们一致认为,大模型与真人考生依然存在差距。具体而言,在作答主观题时,大模型往往无法完整理解题干,不明白代词指向,结果导致答非所问;解答数学题时,解题过程机械且逻辑性差,对于几何题,常出现与空间逻辑相违背的推断;对物理、化学实验理解肤浅,无法准确识别并运用实验器材。
此外,大模型也会伪造虚构内容,编造看似合理但实际不存在的诗句,或在存在明显计算错误的情况下之后不反思,“硬着头皮蒙”一个答案,均给阅卷老师带来了困扰。
通过盘点AI“考生”的答卷,司南的模型评测团队深入分析了当前大模型普遍存在的问题:反思能力弱、“一本正经”虚构内容、缺乏空间想象能力以及对物理、化学实验理解肤浅。
最新发现
相关资讯
上海人工智能实验室公布了七款AI大模型高考总成绩公布,“AI考生”能上什么学校?
凤凰网科技讯 7月18日,上海人工智能实验室公布了大模型开源开放评测体系司南对7个AI大模型进行了高考全科目测试结果。结果显示:书生·浦语2 0系列文曲星大模型(浦语文曲星)、阿里通义千问大模型Qwen2-72B以及G
2025-05-11 14:14:54
《人工智能法案》将于8月1日在整个欧盟范围内生效
NO 1 《人工智能法案》将于8月1日在整个欧盟范围内生效欧盟发布的全球首个《人工智能法案》(EU AI Act)将于8月1日在整个欧盟范围内生效,这也是迄今为止全球发布的一项最为全面的针对人工智能监管的法案。欧盟
2025-05-11 13:54:55
人工智能让瑰丽想象生动可见
用人工智能真正讲好优秀传统文化故事,还需在接通当代生活的“内里”上多下功夫。不仅要“深度学习”丰富的传统文化,也要将传统文化的精髓注入当代生活。最近一段时间,一批借助生成式人工智能创作的视听作品密集上
2025-05-11 13:34:51
OpenAI与博通洽谈制造人工智能芯片
鞭牛士报道,7月19日消息,据《Information》周四报道称,博通公司 (Broadcom Inc ) 已讨论为 OpenAI 制造一款人工智能芯片,这可能使其进一步进入英伟达公司的领域。此后,博通公司股价上涨近 3%。据新闻媒体报
2025-05-11 13:14:51
Meta停止在欧盟发布人工智能模型高级版本
鞭牛士报道,7月19日消息,据外电报道,马克·扎克伯格的 Meta 将不会在欧盟发布其人工智能模型的高级版本,并将这一决定归咎于监管机构的不可预测的行为。Facebook、Instagram 和 WhatsApp 的所有者正准备以多模
2025-05-11 12:54:48
马云说的AI电商要怎么做?阿里国际先打了个样
经历了“百模大战”之后,2024年关于AI应用落地的讨论多了起来。这当中,电商几乎是生成式AI落地最快的应用场景和天然的优势战场。由于电商本身离“钱”更近,产业链条上的制造、运营、市场等各环节都迎来被AI改变和
2025-05-11 12:34:46
今日热榜
聚焦人工智能“互联网之光”博览会今日开幕
2025-01-15 10:48:35AI造谣乱象“野蛮生长”?专家:可设置敏感关键词禁止生成显著违法信息内容
2025-01-15 10:28:26云南省第十三届“挑战杯”大学生课外学术科技节“大数据与人工智能创新科技作品”专项竞赛暨第四届中国移动“梧桐杯”大数据创新大赛云南赛区决赛顺利落幕
2025-01-16 14:25:24中国大模型助力AI技术更开放更高效
2025-03-17 10:28:27AI招聘法律风险解析:求职者陷低分出局困境
2025-05-09 11:50:42为什么AI公司都要用“星星”符号?
2025-05-09 12:10:44微软亚马逊挖AI独角兽核心团队遭调查
2025-05-09 15:11:33中国AIPC行业研究报告
2025-05-09 15:31:42AI端侧爆发,桌面机器人迎量产,产业链上市公司加码“抢鲜”
2024-12-24 14:45:31AI眼镜风口来了!剑指千亿级规模、百万台销量,小度狂飙
2025-01-22 10:19:37热门推荐