福州高校热议AI阅卷困局:剑桥研究揭示生成式AI学术评分仅50%准确率
当福州大学某学院教师正为数百份本科毕业论文的评阅任务焦头烂额时,一则来自英国剑桥大学的研究报告引发本地教育界深度关注:当前最前沿的生成式AI在学术评分中,与人类专家的一致率仅为约50%。这项覆盖761篇真实本科论文的大规模实证研究,再次印证了人工智能尚难承担核心学术裁决职能。
研究团队将Opus 4.6、GPT-5.4及谷歌Gemini 3 Flash三款主流模型,置于与福建高校本科论文评估场景高度相似的语境中——对英国三所大学的真实毕业论文进行逐篇打分。结果发现,AI所评定的学位等级,仅半数能与学科专家最终结论吻合;更值得注意的是,其对“优秀”与“薄弱”两类典型论文的识别能力明显偏弱,普遍存在“趋中倾向”:倾向于给出安全、平庸的中等分数,既难肯定高阶思辨价值,亦难甄别逻辑硬伤,形同学术评审中的“老好人”。

问题根源在于AI的评判机制本质——它不依赖学科逻辑与学术推理,而是基于统计语言模型的概率预测。福州多位高校教学督导指出,这导致AI极易被表象误导:长篇幅、高阶词汇、复杂句式常获高分,而论证严密性、证据支撑力、批判性思维深度等核心学术素养,却几乎不在其评估维度之内。换言之,它擅长“读字”,却难以“懂文”;能识别修辞技巧,却无法衡量思想重量。
这种“重形式、轻实质”的共性偏差,还催生显著同质化风险。所有测试模型均表现出高度一致的语言模式匹配偏好,而非真正理解论文内涵。学生个性化的论证路径、非标准但富创见的观点表达,反而易被系统忽略。研究团队多次复测同一篇论文,AI评分波动极小——表面“稳定”,实则暴露其缺乏动态判断与情境调适能力。

在评语生成环节,AI同样显露短板。其反馈文本长度常达人工评语的3至8倍,但经等长压缩后,师生虽难凭文字风格分辨来源;一旦揭晓AI身份,认可度即显著下滑。这折射出一个关键现实:福州高校教师长期积淀的专业默契、学科共同体内的共识语境,以及师生间基于信任形成的反馈期待,仍是算法无法模拟的社会性基础。
研究明确建议:AI宜定位为“辅助审阅员”,可承担拼写纠错、格式核查、逻辑一致性初筛,或自动标出与人工评分差异显著的异常作业,供教师重点复核。但终审权必须保留在人类手中——尤其在福建推进新文科、新工科建设背景下,学术评价更需承载育人温度与质量底线。
面对日益增长的评阅压力,福州部分高校已在探索AI工具试点。但这份题为《AI在大学评估里的应用:评估自动评分的机遇与风险》的报告发出重要警示:若让算法越位主审,不仅可能消解学生个体学术特质,更将动摇高等教育赖以存续的信任契约——它既体现于师生对评分公正性的共同期待,也深植于每一次专业反馈背后的人文回应。
答案已然清晰:在关乎学术质量的核心场域,人类的学科积淀、教学经验与教育责任感,至今仍是不可替代的终极屏障。AI可为臂助,却不可居裁决之位。
更多精彩文章请关注=>金色港湾资讯网 www.fzjsgw.com

