OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

大模型天花板gpt-4和最强竞品claude,不光商业上竞争激烈,两家公司的员工私下也“剑拔弩张”了起来:

约战提示词决斗,看谁能在最短时间让AI完成高难度任务。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

OpenAI一方出战的是思维链(Chain-of-Thought)开山论文的一作Jason Wei,也就发现让大模型按步骤思考就能提高推理能力的人。

他刚从谷歌跳槽到OpenAI不久,现在圈里都叫他“思维链哥”。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

Anthropic一方的选手Karina Nguyen也不简单,毕业于UC伯克利,现在负责设计构建大模型人机交互界面。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

比赛规则很简单,通过优化提示词让AI正确排序一组单词,谁先完成谁获胜。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

而这不光是一场有趣的对决,还有不少围观的网友表示从中get到了大模型的一些新特性。

情商能提高大模型的推理能力

推理能力足够强的大模型能把问题用结构化的方式表达出来,并用结构化的表现形式解决问题。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

想知道这些结论是如何得出的,还是回到这场比赛本身。

提示词大师巅峰对决

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

由于Karina表示只擅长提示Claude,Jason也同意让出主场优势,还因为打字速度的原因让对面3分钟。

总之经过一番讨价还价后,比赛正式开始了!

首先要了解的是,这项任务看起来不难,但无论GPT-4还是Claude都不能通过简单提示词直接完成。

(anaconda应该排在anchor前面)

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

Jason首先尝试让Claude编写一些代码并执行,让它进入编码模式。

然鹅,失败了。(还是anaconda的位置不对)

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

1分钟后Karina说她完成了,Jason直接瞳孔地震。

Karina:既然是你让了我3分钟,那我也给你3分钟让你赶上。

Jason:其实现在我很恐慌,我作为“提示小王子”的声誉岌岌可危。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

一分钟后……Jason Wei想出了第二个策略:

既然首字母都是A就无关紧要了,那么让AI先把每个单词的首字母去掉,对剩下部分排序后再放回去。

商汤商量 商汤商量

商汤科技研发的AI对话工具,商量商量,都能解决。

商汤商量 36 查看详情 商汤商量

完整思维链提示词如下:

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

不幸的是这仍然不起作用,时间也到了,Jason只能认输。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

比赛结束后,Karina也展示了她的提示词,完全不需要什么中间推理步骤,只是先想办法让AI承认能理解这个任务,再执行就好了。

人类:你的任务是把列表按字母顺序排列后输出到里……你明白了吗?

AI:明白了

人类:列表如下……

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

Jason很困惑,这居然行得通?并尝试在自家大模型上找回场子。

结果发现他的方法对GPT-4确实有效,GPT-4可以编写正确的Python代码并给出正确结果。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

One More Thing

虽然输了比赛,但Jason作为科学家还是从中分析出一些结论。

Jason Wei表示,这场战斗非常有启示性。

Karina的提示策略是让AI承认自己理解任务要求(情商)。而自己的策略是让模型更多地进行推理(智商)。

双方使用的策略在各自习惯使用的语言模型上都取得了成功。

所以,究竟是我们在训练语言模型,还是语言模型在训练我们?

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

最后,还有网友又出了一个新题目:

如果你能让它创作一首“philish 诗歌”(每个词的长度与圆周率的后续数字相对应),我愿为你加冕称王

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

(我已经尝试了几个月了)。

OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力

你觉得解决这个问题要靠AI的情商还是智商?不如也来亲自试试。

参考链接:[1]https://twitter.com/_jasonwei/status/1661781745015066624

以上就是OpenAI员工与友商玩起提示词决斗!网友:居然能靠大模型的情商增强推理能力的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/533914.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
有关 jQuery UI 1.7 的基本信息
上一篇 2025年11月9日 11:56:36
《崩坏星穹铁道》2.3版本前瞻信息一览
下一篇 2025年11月9日 11:56:37

相关推荐

  • Claude Haiku 4.5— Anthropic最新推出的小型AI模型

    Claude Haiku 4.5— Anthropic最新推出的小型AI模型Claude Haiku 4.5— Anthropic最新推出的小型AI模型Claude Haiku 4.5— Anthropic最新推出的小型AI模型Claude Haiku 4.5— Anthropic最新推出的小型AI模型

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 百川大模型 百川智能公司推出的一系列大型语言模型产品 62 查看详情 Claude Haiku 4.5 是什么 claude haiku 4.5 是由 anthropic 推出的最新小型 ai …

    2026年9月13日 用户投稿
    100
  • 月之暗面(Moonshot AI)将完成数亿美元融资

    据公开报道,国内大模型初创企业月之暗面(moonshot ai)或将迎来新一轮数亿美元级别的融资,引发业界广泛关注。截至目前,该公司尚未对此消息作出回应。 这家曾被誉为“中国最值得期待的大模型创业公司”之一的企业,在过去一段时间内相对低调。回顾此前融资记录,月之暗面最近一次公开融资发生在2024年8…

    2026年9月11日
    000
  • Claude默认用用户数据训练AI保留5年,月底前速点“拒绝”!

    近日,Anthropic宣布将调整其数据使用政策,开始利用用户的新聊天记录和代码编写会话来训练其AI模型,除非用户主动选择退出。与此同时,公司还把相关数据的保留期限延长至五年,适用于未选择退出的用户。所有用户必须在**9月28日前**完成设置,否则默认同意。如果你现在点击“接受”,Anthropic…

    用户投稿 2026年9月10日
    100
  • 腾讯朱雀大模型入口 朱雀AI检测官网网页版工具

    腾讯朱雀大模型检测入口为https://matrix.tencent.com/ai-detect/,提供文本与图像AI生成内容检测服务,支持主流格式上传与多模型识别,准确率超90%,用于学术、内容审核等场景。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R…

    2026年9月8日
    000
  • Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生

    Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生Claude 4.5 刚刚发布,能连肝 30 多个小时,史上最卷 AI 诞生

    论编程能力的极致内卷,还得看 Anthropic 的 Claude。 就在今天,Anthropic 正式推出全新升级版模型——Claude Sonnet 4.5。 先看硬核表现:在衡量真实编码实力的 SWE-bench Verified 测试中,Claude Sonnet 4.5 一举登顶榜首,成为…

    2026年9月8日 用户投稿
    200
  • RealDevWorld— MetaGPT推出的AI自动化测试工具

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ RealDevWorld 是由 MetaGPT 团队推出的先进自动化测试平台,专为提升软件测试效率与智能化水平而设计。该工具基于多智能体系统架构,能够模拟真实开发团队的协作模式,实现从需求理解、…

    2026年9月8日
    100
  • OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了

    OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了OpenAI智能体新线索曝光!网友:新ChatGPT时刻要来了

    openai的智能体时代真的要来了!据可靠消息源透露,openai在mac版chatgpt桌面应用中隐藏了启用/禁用智能体“operator”的选项。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 这一消息得到了多方证实,Operator智…

    2026年9月7日 用户投稿
    100
  • 最懂医疗的国产推理大模型,果然来自百川智能

    最懂医疗的国产推理大模型,果然来自百川智能最懂医疗的国产推理大模型,果然来自百川智能最懂医疗的国产推理大模型,果然来自百川智能最懂医疗的国产推理大模型,果然来自百川智能

    年末将至,全球ai大模型竞争骤然白热化。本周,kimi模型开启强化学习新范式,deepseek r1以开源姿态“接棒”openai,谷歌则将gemini 2.0 flash thinking的上下文长度扩展至百万级。种种迹象表明,各大玩家正试图在近期决出胜负。 1月24日,百川智能重磅发布国内首个全…

    2026年9月7日 用户投稿
    100
  • 美媒初体验DeepSeek:厉害,这项能力是ChatGPT的两倍

    ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 近日,DeepSeek在美国科技圈引发热议。《纽约时报》科技记者对DeepSeek进行了深入体验,并将其与ChatGPT和Claude进行了对比评测。评测结果显示,DeepSeek在某些方面展现…

    2026年9月5日
    600
  • 70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?

    70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?70年AI研究得出了《苦涩的教训》:为什么说AI创业也在重复其中的错误?

    人人都在做垂直 AI 产品,为什么要反其道而行? Scaling Laws 是否失灵,这个话题从 2024 年年尾一直讨论至今,也没有定论。 Ilya Sutskever 在 NeurIPS 会上直言:大模型预训练这条路可能已经走到头了。上周的 CES 2025,黄仁勋有提到,在英伟达看来,Scal…

    2026年9月4日 用户投稿
    200
  • 为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家

    为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家为了让DeepSeek-R1用起来更顺畅,火山引擎将TPM上调到了500万!全网首家

    deepseek风靡一时,但并非人人可用。 众多ai云服务商抓住机遇,纷纷上线deepseek模型,并推出优惠活动吸引用户。然而,免费token往往难以顺利调用deepseek-r1,可用性堪忧。 这凸显了选择可靠大厂的重要性。 火山引擎上线DeepSeek-R1模型(含完整版及蒸馏版),并赠送50…

    2026年9月2日 用户投稿
    100
  • Claude挣钱强于o1!OpenAI开源百万美元编码基准,检验大模型钞能力

    Claude挣钱强于o1!OpenAI开源百万美元编码基准,检验大模型钞能力Claude挣钱强于o1!OpenAI开源百万美元编码基准,检验大模型钞能力Claude挣钱强于o1!OpenAI开源百万美元编码基准,检验大模型钞能力Claude挣钱强于o1!OpenAI开源百万美元编码基准,检验大模型钞能力

    ai领域昨日捷报频传:马斯克xai发布了grok-3旗舰大模型;deepseek梁文锋团队则公开全新注意力架构nsa。openai迅速回应,推出并开源了swe-lancer基准测试,用于评估ai大模型的软件工程能力。该基准包含1400多个来自upwork平台的真实软件工程任务,总价值高达百万美元。这…

    2026年8月31日 用户投稿
    200
  • 全球首个混合推理模型:Claude 3.7 Sonnet来袭,真实编码力压一切对手

    全球首个混合推理模型:Claude 3.7 Sonnet来袭,真实编码力压一切对手全球首个混合推理模型:Claude 3.7 Sonnet来袭,真实编码力压一切对手全球首个混合推理模型:Claude 3.7 Sonnet来袭,真实编码力压一切对手全球首个混合推理模型:Claude 3.7 Sonnet来袭,真实编码力压一切对手

    anthropic发布迄今为止最强大的ai模型:claude 3.7 sonnet Anthropic于近日正式发布了其最新旗舰模型——Claude 3.7 Sonnet,这款混合推理模型被誉为目前市面上最智能的AI模型之一。 Sonnet具备两种思考模式:标准模式和扩展模式,前者提供近乎即时的响应…

    2026年8月30日 用户投稿
    400
  • AbletonMCP— AI音乐制作工具,基于MCP支持音轨创建与修改

    abletonmcp:ai赋能的音乐制作工具 AbletonMCP是一个开源项目,它利用模型上下文协议(MCP)将Ableton Live与Claude AI连接起来,实现AI辅助音乐创作。通过双向通信,用户可以借助Claude AI完成各种音乐制作任务,例如创建和修改MIDI及音频轨道、选择乐器和…

    2026年8月26日
    000
  • Meta发布AI新模型系列 Llama 4,首次采用“混合专家”架构

    meta发布全新多模态ai模型系列llama 4,引领开源ai发展! 该系列包含llama 4 scout、llama 4 maverick和llama 4 behemoth三个模型,能够处理文本、视频、图像和音频等多种数据类型,并在不同格式间实现内容转换。 ☞☞☞AI 智能聊天, 问答助手, AI…

    2026年8月26日
    000
  • 人工智能工具市场

    AIprophetic.com 网站文章列表: 2025年: 2025-01-24: 人工智能工具市场概览 (https://www.php.cn/link/1c52486ff0b2a44fbfefeb15d21f53ae)2025-01-24: ChatGPT 故障排除及替代方案 (https:/…

    2025年12月19日
    000
  • 代码异味 – 非命令式函数名称

    代码异味 – 非命令式函数名称代码异味 – 非命令式函数名称代码异味 – 非命令式函数名称代码异味 – 非命令式函数名称

    清晰的函数命名:避免歧义,提升代码可读性 简而言之:含糊不清的函数名会隐藏其功能,令读者困惑。请使用具有描述性、面向动作的名称。 问题 函数用途不明确认知负担增加上下文误导可读性降低协作困难功能隐藏 解决方案 使用面向动作的动词使用描述性名称反映函数目的避免通用术语提供有意义的上下文明确表达单一职责…

    2025年12月19日 用户投稿
    000
  • 克劳德·十四行诗 vs GPT-4o

    克劳德·十四行诗 vs GPT-4o克劳德·十四行诗 vs GPT-4o克劳德·十四行诗 vs GPT-4o克劳德·十四行诗 vs GPT-4o

    本案例研究对claude 3.5 sonnet和gpt-4o两种人工智能模型进行了深入比较,涵盖性能、定价和具体应用场景,并结合社区反馈、基准测试和实际使用经验。 Claude 3.5 Sonnet:智能且人性化 Claude 3.5 Sonnet是什么? Claude 3.5 Sonnet是Ant…

    2025年12月19日 用户投稿
    200
  • 轨道:太阳系之旅

    去年十月,Masons团队参与了2024年NASA Space Apps Cairo黑客马拉松,并开发了一个令人振奋的项目——Orbit。Orbit是一个交互式3D网页应用,能够模拟太阳系并追踪近地天体(NEO)。它基于Next.js、Three.js和Golang后端构建,旨在提供宇宙的实时信息,…

    2025年12月19日
    300
  • 自写 Lang 图状态

    第一人工智能响应: 输出:感谢您伸出援手,.我很乐意为您提供帮助,但我想确保我完全理解您的需求。您能否提供有关您正在寻找的内容的更多详细信息?您分享的信息越多,我就越能提供帮助!我很乐意尽我所能地帮助你。您想进一步探索某个特定领域吗?您的意见将帮助我根据您的具体需求定制我的帮助。我完全致力于让您的体…

    2025年12月19日
    000

发表回复

登录后才能评论
关注微信