大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能

2024-11-03

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第1张

其实这是最近爆火的一种新的测试基准(doge)。

游戏结果一定程度上能反映出大模型能力,比如这组测试一共进行了6局游戏,表现最好的是Claude:它赢了3次!

GPT-4o表现有点抽象。就它画的这龙卷风,人类也看不懂。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第2张

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第3张

不止如此,在很多轮游戏中,其他模型都在认认真真地答题,而它的第一个回答经常是Circle??有点子抽象。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第4张

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第5张

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第6张

所以有人就说,这游戏可以当测试基准来用啊。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第7张

还有人表示,AI照这个速度发展,人类就只能当围观的瓦力了。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第8张

来看看更多有趣的例子

在比较简单的题目上,所有模型都在一两个回合中就猜对了答案,比如下面的房子:

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第9张

还有非常简洁的草地、海洋:

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第10张

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第11张

动物主题相对复杂一些,模型们一般需要猜4-5轮,比如大象这题:

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第12张

游戏整体效果非常棒,网友们也是好评如潮:

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第13张

你画我猜项目起源

模型画画早已不是新鲜事,但让大模型玩你画我猜?这天才想法是怎么产生的?

首先,不得不提到Simon Willison的一次测试,他让所有模型绘制自行车上有一只鹈鹕主题的图像,然后进行效果对比。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第14张

随后Paul Calcraft看到测试,他产生了一个想法:这样一个个比对太慢了,效果也不好,既然都画同一个主题,为什么不让大模型玩你画我猜的游戏呢?

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第15张

没想到这位小哥说干就干,1天后就发布了“你画我猜”的0.0.1版(这令人羡慕的执行力)。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第16张

游戏中,他设定回答的模型每2秒猜测一次,回答更快的模型会更快返回答案。

网友评价褒贬不一

不少网友表示,之前大模型在《我的世界》里面比赛盖楼,令人印象深刻,而你画我猜可能成为新的视觉benchmark!

还有人热心地提出了优化建议,比如以答对互相题目的速度作为评分准则,或者加入人类成绩作为参考。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第17张

还有人提议将游戏变成对抗式训练,这样大模型会进步更快。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第18张

不过,抛去趣味性,也有网友持负面观点,表示不理解这个项目的意义。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第19张

有网友调侃说,这个游戏的作用就是成为未来AI考古时的文物,帮助它们了解自己的起源。

好嘛,咱们AI有自己的洞穴壁画(doge)。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第20张

不过,游戏化学习(Learning through play)其实是教育理论和心理学中的一个重要术语。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第21张

多位网友表示,小孩子也是通过玩游戏来提升智力、学习技能的,或许这可以成为训练大模型的新方式。

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第22张

大模型玩你画我猜:Claude6局3胜,GPT - AI 人工智能  (https://www.qianyan.tech/) 头条 第23张

虽然这次只有6轮游戏,参与的模型也有限,但确实是一次很有趣的实践。

作者Paul Calcraft也表示会继续更新这个游戏,包括分数显示、更多的游戏主题等等,期待更多后续!

相关推荐