加入收藏 | 设为首页 | 会员中心 | RSS    今天是:  发布信息
您当前的位置:首页 > 闽商人物

AI高考状元:文科超一本,理科超二本又一新谍战片定档,影帝甘愿作配,导演实力惊人,男主竟是她(二本)2021年全国高考文理科状元,

时间:2024-08-07 02:56:13  来源:闽商界  作者:闽商界  点击:

 

凤凰网科技讯 7月19日,上海人工智能实验室公布了大模型开源开放评测体系司南对7个AI大模型进行了高考全科目测试结果。结果显示:书生·浦语2.0系列文曲星大模型(浦语文曲星)、阿里通义千问大模型Qwen2-72B以及GPT-4o再次包办文、理科前三甲;前三名AI“考生”的文、理科结果分别凌驾了“一本”“二本”线(以今年高考人数最多的河南省的分数线为参考)。

从官方提供的测试结果来看,前三甲“考生”达一本水平,大部门模型未到二本线。其中,阿里通义千问大模型Qwen2-72B以546分的结果获得AI高考“文科状元”,浦语文曲星则以468.5分成为理科第一名。

在文科结果方面,Qwen2-72B、浦语文曲星、GPT-4o的文科结果逾越“一本线”,展现了大模型在语文、历史、地理、思想政治等科目上深厚的知识储备和理解能力。而在理科结果方面,AI“考生”整体体现弱于文科,体现了大模型在数理推理能力上普遍存在短板。

据悉,本次评测具有几大特点:

1. 全卷考试:进行全卷评分,而不但针对单一题型,且包罗带图的高考题

2. 考前开源:评测覆盖的开源模型均为今年高考前开源的模型,排除泄题的可能性

3. 老师打分:邀请有高考阅卷经验的老师打分,确保评分和高考尽量一致

4. 完全公开:生成答案的代码、模型答卷、评分结果完全开源

在此次测试中,阅卷老师们一致认为,大模型与真人考生依然存在差距。具体而言,在作答主观题时,大模型往往无法完整理解题干,不明白代词指向,结果导致答非所问;解答数学题时,解题过程机械且逻辑性差,对于几何题,常出现与空间逻辑相违背的推断;对物理、化学实验理解肤浅,无法准确识别并运用实验器材。

别的,大模型也会伪造虚构内容,编造看似合理但实际不存在的诗句,或在存在明显计算错误的情况下之后不反思,“硬着头皮蒙”一个答案,均给阅卷老师带来了困扰。

通过盘点AI“考生”的答卷,司南的模型评测团队深入分析了当前大模型普遍存在的问题:反思能力弱、“一本正经”虚构内容、缺乏空间想象能力以及对物理、化学实验理解肤浅。

来顶一下
近回首页
返回首页
评论回复 共有 条评论>>查看
我也说两句(审核以后才能显示)
表情图:
用户名: 密码:
验证码: 确定发表
推荐资讯
嫌浙大“没有含金量”,浙江672分考生报二本,95%入编才是真的香被吴谨言新剧造型惊艳,贾静雯老发型重出江湖,《春花厌》又要爆(二本)二本上岸浙大,
中信银行全球银行1000强排名升至18位(中信银行)中信银行“全球银行品牌500强”排名升至16位,
今年下半年经济走势如何?国家发改委回应以色列的女人,为什么这么强?以色列的大长腿,同样征服美国?(发改委)以色列最新重大消息,
国家发改委:将发布新版市场准入负面清单连续3天收视第1,连《新闻联播》都花20秒推荐,央视这新剧要爆了(发改委)国家市场准入负面清单以外的领域包罗,
WPS 365为银行、保险、证券三大金融业交付“企业大脑”震惊我!汪小菲居然登上韩国头条!还被誉为“全韩国女性的梦想”(保险)wps365专属版不登录怎么用,
基金是什么?如何利用基金赚钱?(基金)基金是什么玩意儿,
资讯|《只此青绿》官宣定档国庆 成龙李连杰《功夫之王》8.3重映(资讯)只此青绿 演员表,
暖新闻丨 一辆装满爱心物资的小货车熄火,交警与群众合力护送曝与杨议打斗歌手身份,他是郭德纲师弟,一场演出给两千连演一月
我国31省区市新增327例确诊,湖北黄石鄂州等12地无新增(全国新增327例确诊病例)湖北新增本土病例83例,
共创智能新时代|紫光展锐携手中国联通推动数字经济高质量发展31岁在春晚一炮而红,观众都以为他隐退了,其实已经去世10年了(支持数字经济创新发展)紫光联盛是什么公司,
相关文章
    无相关信息
栏目更新
栏目热门