{主关键词}

A | 8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。 8月24日消息,据报道,近期,第二届世界人形机器人运动会于国家速滑馆“冰丝带”正式开幕,开幕式结束后,大型组400米预赛随即展开,八场分组比拼轮番上演,赛场上却接连上演机器人摔倒的意外场面。 弯道成为众多机器人难以逾越的关卡。研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。首场较量中,两台机器人起步后加速向前,可临近最后弯道时,一台机器人失衡倒地,机身迸出火花,遗憾没能完成比赛。

B | ChatGPT 需要按照 7 项标准批改这些论文,研究人员还采用了 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。 后续场次同样事故不断,有的机器人刚进入首个弯道就直接跌倒,由工作人员搬离赛场;还有一台机器人闯过两道弯道,即将进入第三个弯道时重重摔倒,甚至在跑道表面留下划痕。

C | 赛场也不乏亮眼表现。图源:Pexels卡迪夫大学生物科学学院威廉 · 凯博士指出:“研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。经过工作人员抢修,天工队的机器人登场,跑出了39秒7的成绩,大幅改写上届赛事纪录,引得现场观众阵阵欢呼。 余下场次里,多数机器人顺利跑完全程,但也出现小插曲,天链队一台机器人似乎没能识别发令信号,始终停留在起点。

D | 第八场的机器人更具戏剧性,摔倒后自行站起重返赛道,成功冲线,却在结束后撞上场地设备,机身直接散架。

E | ”研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。

F | 但这项研究表明,目前并不适合这么做。此外,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。“随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让 AI 给出的分数与人工评分真正保持一致,恐怕并不容易。
Current article:http://434eg12.sunaichitikouchua.bond/c79mj/mgfqu.html
Published on:05:36:04
我的网站热门国内