大酷樂
  • 汽车
  • 理财
  • 军事
  • 科技
  • 游戏
  • 互联网
  • 娱乐
  • 财经
  • 科学
  • 社会
  • 亲子
  • 电影
  • 健康
  • 教育
  1. 首頁
  2. 科学

OpenAI实名举报Grok3作弊,一题答64次踩着台阶和o3-mini比

2025-02-22 简体 HK SG TW

今天小编分享的科学经验:OpenAI实名举报Grok3作弊,一题答64次踩着台阶和o3-mini比,欢迎阅读。

Grok-3 才发布 3 天,就陷入作弊风波。

隔壁 OpenAI 应用主管火速掀桌:每次评估中 o3-mini 都要比 Grok-3 好,看到 Grok 团队作弊真是令人失望。

咋回事?

在 Grok-3 的 Blog 中有一张 AIME 2025 评估图令人印象深刻,两个新版本模型都超过 o3-mini 高配版。

但注意看,Grok-3 两个模型的柱状图中都有 1 段颜色更浅的部分。OpenAI 指责的作弊,就是在这里。

浅色部分代表了 Grok-3 模型在 Con@64 上的成绩。

即这是模型进行 64 次答案后的成绩,而不是单次回答。

那么问题就来了,被拿来对比的 o3-mini、o1、DeepSeek-R1、Gemini-2 Flash Thinking 似乎并没有这部抽成绩。

有人就表示,如果真是如此,那么 Grok-3 推理模型只是和 o1 相当。OpenAI 和 xAI 之间依旧差了 9 个月。

OpenAI 负责模型设计的研究员 Aidan McLaughlin 更是激情开麦,表示马斯克发布时说的话极其有误导性,这会让人以为浅蓝色部分是通过推理实现的成绩。

不过值得一提的是,这种模型评估对比方法似乎是 OpenAI 开了头。o3-mini 的 Blog 中,也看到了类似形式的评估。

所以,为啥这么对比不合理?

采用 cons@64,o1 都能和 o3-mini 相当

首先明确概念:

cons@64:让模型生成 64 个答案,最终采用出现频率最高的回答。

pass@64:如果 64 个答案中只要有一个答案正确,模型就得分。

所以有人就说了,问题的关键不是 xAI 不应该使用 cons@64;

关键在于,如果其他模型只是尝试了一次,那就不太公平了。

因为 blog 中并没有说清楚,所以假定是这种情况。

有 AI 博主也列出了搜集到的相关数据,o3-mini 在单次回答上的表现更好。

其次,根据 o3-mini 的 blog,o1 模型采用 cons@64 成绩,甚至可以和 o3-mini 打个相当。

这意味着采用 cons@64 成绩是 " 有优势 " 的。

有人也揪着这事不放,但是 OpenAI 确实没让 o3-mini 用 cons@64。

最后,Grok-3 发布时的说法似乎有一定误导性。

有人贴出来了原片段。在被问及评估图中的浅色部分是什么时,官方给出的解释是:

这些模型可以推理、可以思考,可以要求模型思考更长、花更多时间进行测试时推理。这种情况下,这些浅色部分意味着我们只是花费更多时间让模型解决同一个问题,然后它才会得出什么是正确的答案。如果这样做,模型甚至可以表现得更好。

OpenAI 研究员 Aidan 觉得这段话极具误导性,他只是说使用更多测试时计算,听起来像是做更多推理,但其实不是如此。

总而言之,Grok 团队这么干确实有点不地道。

吃瓜到这,网友们不免开始蛐蛐:

Grok-3 不如 o3-mini,马斯克就会给团队上压力。然后想出的好办法就是在基准测试上做手脚。

以及为啥都不和 Claude 做对比呢?

不过也有人觉得这事不能一棒子打死,Grok 仍旧有很多值得关注的方面。比如 Grok-3 一个月前才完成预训练,这只是一个月内基于 CoT 的后训练结果,模型还有很大的提升空间。此外 xAI 正在以行业内最快的速度扩展预训练计算能力。

以及 Grok-3 发布后,开发者们已经火速琢磨出了一些有趣的新玩法。

轻松开发小游戏

这不,有人就晒出了在特斯拉上完用 Replit+Grok 开发的小游戏。

还有曾在微软深度参与 Windows 系统开发的大佬 Dave Plummer,也用 Grok-3 复刻了经典的打砖块游戏。

他为 Windows 创建了任务管理器、为 Windows 完成了对 zip 檔案的支持。

这一次,他展示了如何只用几句话就让 Grok-3 开发小游戏。

提示词都很简单:

" 来做个彩色版打砖块怎么样 "

" 让球自动移动,并让球每次从球拍上弹起时速度提高 10%"

" 很好,球在垂直弹射时会卡住。一开始游戏是怎么设计的?do the same"

最后得到的效果是这样的:

值得一提的是,马斯克最近证实了成立了 AI 游戏工作室的消息,他要让游戏再次伟大(doge)。

参考链接:

[ 1 ] https://x.com/BorisMPower/status/1892407015038996740

[ 2 ] https://www.reddit.com/r/singularity/comments/1itoi3f/grok3_thinking_had_to_take_64_answers_per/

[ 3 ] https://www.tomshardware.com/tech-industry/artificial-intelligence/grok-3-used-to-clone-breakout-game-fabled-windows-developer-shares-prompts-and-code

熱門排行
  • 王治郅:杨瀚森主要的问题是速度 他 王治郅:杨瀚森主要的问题是速度 他 郟君昊 | 2025-05-05
  • 贸易战烧进电影院:特朗普拟重税打击 贸易战烧进电影院:特朗普拟重税打击 習又夏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天 贷款追高炒黄金的人后悔了!有人一天 寸飛蘭 | 2025-05-05
  • 手机电池突破8000mAh?硅碳技术的回 手机电池突破8000mAh?硅碳技术的回 衛青柏 | 2025-05-05
  • 贷款追高炒黄金的人后悔了!有人一天 贷款追高炒黄金的人后悔了!有人一天 繁綺文 | 2025-05-05
  • 任天堂对Genki提起Switch 2商标侵 任天堂对Genki提起Switch 2商标侵 郜萌運 | 2025-05-05
  • 哪吒汽车APP和官网恢复正常 知情人 哪吒汽车APP和官网恢复正常 知情人 袁曼雁 | 2025-05-05
  • 极越汽车 CEO 夏一平名下青岛/义乌 极越汽车 CEO 夏一平名下青岛/义乌 集玲琳 | 2025-05-05
  • 全国经济第一大省明确,推动组建农商 全国经济第一大省明确,推动组建农商 佼昌翰 | 2025-05-05
  • 桑保利:亚马尔有配合意识&有点像梅 桑保利:亚马尔有配合意识&有点像梅 甄正浩 | 2025-05-05
  • 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 高露现身上海虹桥机场 黑色外套点缀亮色爱心装饰俏皮亮眼 惠惠君 | 2023-05-02
  • 《歧路旅人2》:向光而生 《歧路旅人2》:向光而生 衛青柏 | 2023-05-02
  • vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 vivo X90S曝光:处理器更新为天玑9200+ 安卓最强芯 袁曼雁 | 2023-05-05
  • “懒癌”发病率上升,定期体检别忽视 “懒癌”发病率上升,定期体检别忽视 幸聽楓 | 2023-05-02
  • 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 宋慧乔获百想视后 韩素希发图手动加爱心表情庆祝 賁芳蕤 | 2023-05-02
  • 曹操墓,里面都有啥? 曹操墓,里面都有啥? 衛青柏 | 2023-05-02
  • 十年了,他们终于要HE! 十年了,他们终于要HE! 惠惠君 | 2023-05-07
  • 中央部署经济工作,释放5大信号 中央部署经济工作,释放5大信号 郜萌運 | 2023-05-02
  • 高德上线手机弯道会车预警功能 高德上线手机弯道会车预警功能 習又夏 | 2023-05-02
  • 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 陈自瑶抱病为爱女做蛋糕庆生,王浩信点赞没露面 賁芳蕤 | 2023-05-02
  • 等比例长大的童星,李兰迪算一个 等比例长大的童星,李兰迪算一个 郟君昊 | 2023-05-02
  • 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 这些被抓来做实验的流浪狗,最终拯救了无数糖尿病人 集玲琳 | 2023-05-02
  • 高端国产车:军车血统,目前电动车越野的“天花板”? 高端国产车:军车血统,目前电动车越野的“天花板”? 謝飛揚 | 2023-05-02
  • 《云襄传》终于抬上来啦,男O女A让人好上头! 《云襄传》终于抬上来啦,男O女A让人好上头! 集玲琳 | 2023-05-02
  • 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 21家A股游戏公司2022年收入651亿 今年“游戏+AI”能否逆风翻盘? 衛青柏 | 2023-05-04
  • 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 信用风险释放趋缓,结构性风险需重点关注 ——2023年一季度债市信用风险回顾与下阶段展望 袁曼雁 | 2023-05-02
  • 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 与周立波夫妇闹纠纷成老赖,唐爽被司法拘留15日 寸飛蘭 | 2023-05-05
  • 普京签署总统令,批准对俄刑法典相关法条的修正案 普京签署总统令,批准对俄刑法典相关法条的修正案 集玲琳 | 2023-05-02
  • 解除资格!停止一切合作 解除资格!停止一切合作 佼昌翰 | 2023-05-02
  • 中银证券给予南京银行增持评级 中银证券给予南京银行增持评级 袁曼雁 | 2023-05-03
  • 3699起 联想小新mini主机上架 13代酷睿标压处理器 3699起 联想小新mini主机上架 13代酷睿标压处理器 習又夏 | 2023-05-05
  • 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 前董事长被免,天山生物全面进入“中植系”时代?股价曾在一月内暴涨超400% 惠惠君 | 2023-05-02
  • 疯成这样,怎么还能被全网吹捧? 疯成这样,怎么还能被全网吹捧? 郜萌運 | 2023-05-02
  • 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 狂吼11次“让一下”!交警咆哮开道嘶吼到吐 寸飛蘭 | 2023-05-03
  • 摩根大通收购美国第一共和银行 摩根大通收购美国第一共和银行 謝飛揚 | 2023-05-02
  • 台剧赢麻了,又来一部8.9 台剧赢麻了,又来一部8.9 衛青柏 | 2023-05-02
  • 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 事关农村土地承包和农民权益,《农村土地承包合同管理办法》5月1日起施行 郟君昊 | 2023-05-02
  • 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 下降45分,上涨35分!34所自划线院校复试分数线涨幅汇总 袁曼雁 | 2023-05-07
  • "三高"已盯上青少年,做好这件事是关键 "三高"已盯上青少年,做好这件事是关键 習又夏 | 2023-05-05
  • 五一档没一个能打的 五一档没一个能打的 集玲琳 | 2023-05-05
  • 恐怖韩剧下神坛,这次胆小可入 恐怖韩剧下神坛,这次胆小可入 袁曼雁 | 2023-05-05
  • 这剧是不是用ChatGPT写的呀? 这剧是不是用ChatGPT写的呀? 惠惠君 | 2023-05-02
  • 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 200户连夜疏散,原因让人愤怒!“损失超一亿”,官方通报 袁曼雁 | 2023-05-03
  • 性骚扰惯犯,滚出娱乐圈 性骚扰惯犯,滚出娱乐圈 謝飛揚 | 2023-05-05
  • 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 48岁何炅自曝已老花眼,黄磊睡前认老,《向往的生活》证实将停办 佼昌翰 | 2023-05-02
  • 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 一个《长月烬明》倒了,《狐妖》《长相思》《与凤行》…在路上了 惠惠君 | 2023-05-02
  • 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 张天爱假期晒“酷”存照 卷发披肩穿黑色吊带裙大秀好身材 嬴覓晴 | 2023-05-02
  • 当年轻人开始不随份子钱 当年轻人开始不随份子钱 袁曼雁 | 2023-05-02
  • 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 毕滢用8年时间成功逼宫?曾被传已婚生子的她,不容小觑 幸聽楓 | 2023-05-03
  • 宋慧乔获视后首次晒照,拿奖杯笑容温柔 宋慧乔获视后首次晒照,拿奖杯笑容温柔 郜萌運 | 2023-05-02

©2022 大酷樂 版權所有

隱私政策 | 服務條款 | 聯繫我們