中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

机器之心发布

机器之心编辑部

今天,一年一度的高考正式拉开帷幕。

与往年不同的是,当全国考生奔赴考场的同时,还有一些大语言模型也成为了这场角逐中的特殊选手。

随着 AI 大语言模型越来越多地表现出接近人类智能,面向人类设计的高难度、综合性考试被越来越多地引入到对语言模型的智能水平进行评测。

比如,在关于 GPT-4 的技术报告中,OpenAI 就主要通过各领域的考试对模型能力进行检验,而 GPT-4 展现出的优秀「应试能力」也是出人意料。

中文大语言模型挑战高考卷的成绩如何?是否能够赶超 ChatGPT ?让我们来看看一位「考生」的答题表现。

综合 “大考”:“书生・浦语” 多项成绩领先于 ChatGPT

近日,商汤科技、上海 AI 实验室联合香港中文大学、复旦大学及上海交通大学发布千亿级参数大语言模型 “书生・浦语”(InternLM)。

“书生・浦语” 具有 1040 亿参数,是在包含 1.6 万亿 token 的多语种高质量数据集上训练而成。

全面评测结果显示,“书生・浦语” 不仅在知识掌握、阅读理解、数学推理、多语翻译等多个测试任务上表现优秀,而且具备很强的综合能力,因而在综合性考试中表现突出,在多项中文考试中取得超越 ChatGPT 的成绩,其中就包括中国高考各个科目的数据集(GaoKao)。

“书生・浦语” 联合团队选取了 20 余项评测对其进行检验,其中包含全球最具影响力的四个综合性考试评测集

由伯克利加州大学等高校构建的多任务考试评测集 MMLU; 微软研究院推出的学科考试评测集 AGIEval(含中国高考、司法考试及美国 SAT、LSAT、GRE 和 GMAT 等); 由上海交通大学、清华大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集 C-Eval; 以及由复旦大学研究团队构建的高考题目评测集 Gaokao;

实验室联合团队对 “书生・浦语”、GLM-130B、LLaMA-65B、ChatGPT 和 GPT-4 进行了全面测试,针对上述四个评测集的成绩对比如下(满分 100 分)。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

“书生・浦语” 不仅显著超越了 GLM-130B 和 LLaMA-65B 等学术开源模型,还在 AGIEval、C-Eval,以及 Gaokao 等多个综合性考试中领先于 ChatGPT;在以美国考试为主的 MMLU 上实现和 ChatGPT 持平。这些综合性考试的成绩反映出 “书生・浦语” 扎实的知识掌握程度和优秀的综合能力

虽然 “书生・浦语” 在考试评测上取得优秀成绩,但在测评中也可以看到,大语言模型仍然存在不少能力局限性。“书生・浦语” 受限于 2K 的语境窗口长度(GPT-4 的语境窗口长度为 32K),在长文理解、复杂推理、撰写代码以及数理逻辑演绎等方面还存在明显局限。另外,在实际对话中,大语言模型还普遍存在幻觉、概念混淆等问题。这些局限使得大语言模型在开放场景中的使用还有很长的路要走。

四个综合性考试评测数据集结果

MMLU 是由伯克利加州大学(UC Berkeley)联合哥伦比亚大学、芝加哥大学和 UIUC 共同构建的多任务考试评测集,涵盖了初等数学、物理、化学、计算机科学、美国历史、法律、经济、外交等多个学科。

细分科目结果如下表所示。

中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

图中粗体表示结果最佳,下划线表示结果第二

AGIEval 是由微软研究院在今年新提出的学科考试评测集,主要目标是通过面向的考试来评估语言模型的能力,从而实现模型智能和人类智能的对比。

这个评测集基于中国和美国各类考试构建了 19 个评测大项,包括了中国各科高考、司法考试以及美国的 SAT、LSAT、GRE 和 GMAT 等重要考试。值得一提的是,在这 19 个大项有 9 个大项是中国高考,通常也列为一个重要的评测子集 AGIEval (GK)。

下列表格中,带 GK 的是中国高考科目。

中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

图中粗体表示结果最佳,下划线表示结果第二

C-Eval 是由上海交通大学、清华大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集。

它包含了 52 个科目的近 14000 道考题,涵盖数学、物理、化学、生物、历史、政治、计算机等学科考试,以及面向公务员、注册会计师、律师、医生的职业考试。

测试结果可以通过 leaderboard 获得。

中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

此链接是ceva评测竞赛的排行榜

天工大模型 天工大模型

中国首个对标ChatGPT的双千亿级大语言模型

天工大模型 115 查看详情 天工大模型

Gaokao 是由复旦大学研究团队构建的基于中国高考题目的综合性考试评测集,包含了中国高考的各个科目,以及选择、填空、问答等多种题型。

在 GaoKao 测评中,“书生・浦语” 在超过 75% 的项目中均领先 ChatGPT。

中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

分项评测:阅读理解、推理能力表现出色

为避免 “偏科”,研究人员还通过多个学术评测集,对 “书生・浦语” 等语言模型的分项能力进行了评测对比。

结果显示,“书生・浦语” 不仅在中英文的阅读理解方面表现突出,并且在数学推理、编程能力等评测中也取得较好成绩

中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」

知识问答方面,“书生・浦语” 在 TriviaQA 和 NaturalQuestions 两项评测上得分为 69.8 和 27.6,均超越 LLaMA-65B(得分为 68.2 和 23.8)。

阅读理解(英语)方面,“书生・浦语” 明显领先于 LLaMA-65B 和 ChatGPT。浦语在初中和高中英语阅读理解中得分为 92.7 和 88.9,ChatGPT 得分为 85.6 和 81.2,LLaMA-65B 则更低。

中文理解方面,“书生・浦语” 成绩全面超越主要的两个中文语言模型 ERNIE-260B 和 GLM-130B。

多语翻译方面,“书生・浦语” 在多语种互译中的平均得分为 33.9,显著超越 LLaMA (平均得分 15.1)。

数学推理方面,“书生・浦语” 在 GSM8K 和 MATH 这两项被广泛用于评测的数学考试中,分别取得 62.9 和 14.9 的得分,明显领先于 Google 的 PaLM-540B(得分为 56.5 和 8.8)与 LLaMA-65B(得分为 50.9 和 10.9)。

编程能力方面,“书生・浦语” 在 HumanEval 和 MBPP 这两项最具代表性的考评中,分别取得 28.1 和 41.4 的得分 (其中经过在代码领域的微调后,在 HumanEval 上的得分可以提升至 45.7),明显领先于 PaLM-540B(得分为 26.2 和 36.8)与 LLaMA-65B(得分为 23.7 和 37.7)。

此外,研究人员还对 “书生・浦语” 的安全性进行评测,在 TruthfulQA(主要评价回答的事实准确性) 以及 CrowS-Pairs(主要评价回答是否含有偏见)上,“书生・浦语” 均达到领先水平。

以上就是中文大语言模型赶考:商汤与上海AI Lab等新发布「书生·浦语」的详细内容,更多请关注创想鸟其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。
如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 chuangxiangniao@163.com 举报,一经查实,本站将立刻删除。
发布者:程序猿,转转请注明出处:https://www.chuangxiangniao.com/p/528224.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2025年11月9日 09:11:17
下一篇 2025年11月9日 09:16:09

相关推荐

  • HiDream-I1— 智象未来开源的文生图模型

    hidream-i1:一款强大的开源图像生成模型 HiDream-I1是由HiDream.ai团队开发的17亿参数开源图像生成模型,采用MIT许可证,在图像质量和对提示词的理解方面表现卓越。它支持多种风格,包括写实、卡通和艺术风格,广泛应用于艺术创作、商业设计、科研教育以及娱乐媒体等领域。 HiDr…

    2025年12月5日
    000
  • 2025年全球AI应用top20最新榜单出炉

    生成式AI与多模态应用的代表包括:1. OpenAI GPT-5通过图灵测试,支持跨模态推理,API调用量达10万亿次/月;2. DeepSeek-R1用户破百万,推理成本低,支持中文理解;3. Google Gemini Ultra与谷歌生态深度整合,市占率40%;4. MidJourney V5…

    2025年12月4日
    000
  • OpenAI o4-mini— OpenAI推出的小型推理模型

    openai o4-mini 是由openai推出的一款小型推理模型,专为快速且经济高效的推理任务而设计。该模型在数学、编程和视觉任务上表现卓越,在aime 2024和2025基准测试中表现出色,是最佳模型之一。openai o4-mini 支持高容量和高吞吐量的推理任务,适用于快速处理大量问题。它…

    2025年12月4日
    000
  • OpenAI拟30亿美元收购AI编程工具Windsurf

    据知情人士透露,openai正在商谈以约30亿美元的价格收购人工智能辅助编码工具windsurf(原名codeium)。此项交易将成为openai迄今为止最大的一笔收购案,尽管具体细节尚未敲定,谈判仍有可能会改变或终止。 报道指出,Windsurf正在与Kleiner Perkins和General…

    2025年12月4日
    000
  • 苹果回应马斯克指控:App Store 公平且无偏见

    感谢网友 風見暉一、对的时间点 提供的线索! 8 月 13 日,苹果公司针对埃隆・马斯克(Elon Musk)此前关于 App Store 在人工智能应用推广中偏袒 OpenAI 的 ChatGPT 的说法作出回应,强调其应用商店平台始终保持中立与公平。 苹果向彭博社记者马克・古尔曼(Mark Gu…

    2025年12月3日
    100
  • 快速生成ai图片的工具排行榜单top10汇总

    以下是快速生成AI图片的工具排行榜单前三名:1. DALL·E 3:由OpenAI开发,支持复杂指令和多轮对话修改,集成于ChatGPT Plus或通过Bing Image Creator免费使用。2. Midjourney:基于Discord,艺术风格多样,生成质量高,需订阅使用。3. Stabl…

    2025年12月3日 科技
    100
  • RL 是推理神器?清华上交大最新研究指出:RL 让大模型更会“套公式”、却不会真推理

    清华和上交的最新论文中,上演了一场“学术打假”的戏码。文中研究者们对当前“纯 rl 有利于提升模型推理能力”的主流观点提出了相反的意见。 通过一系列实验,他们证明引入强化学习的模型在某些任务中的表现,竟然不如未使用强化学习的模型。 论文批判性地探讨了 RLVR 在提升 LLM 推理能力方面的作用,尤…

    2025年12月3日 科技
    100
  • Agent 要被吃进大模型了

    今天凌晨,奥特曼突然发文宣布推出自家最新的 o 系列模型:满血版 o3 和 o4-mini,同时表示这两款模型都可以自由调用 chatgpt 里的各种工具,包括但不限于图像生成、图像分析、文件解释、网络搜索、python。 总的来说,就是比前一代的性能更强而且价格更低。 ☞☞☞AI 智能聊天, 问答…

    2025年12月3日 科技
    000
  • APP接入AI大模型:实现智能化!

    ai大模型凭借其卓越的理解、生成与推理能力,正在重塑软件应用的形态。将ai大模型能力融入现有或新开发的app中(即app接入ai大模型),已成为开发者增强产品竞争力、为用户打造前所未有的智能体验的关键手段。这不仅是一次技术迭代,更是推动应用向智能化转型的核心战略。 为何APP接入AI大模型已成为不可…

    2025年12月3日
    000
  • AI如何连接数据库执行SQL_利用AI工具连接并运行SQL教程

    AI连接数据库执行SQL是通过自然语言理解将用户需求转化为可执行的SQL语句,实现人机协作的数据查询方式。首先选择支持数据库类型的AI工具,配置安全连接并提供数据库Schema以提升准确性;接着输入自然语言问题,AI生成SQL后需经人工审查优化,再执行获取结果。该技术降低了非技术人员使用数据的门槛,…

    2025年12月3日 数据库
    000
  • 首届魔搭开发者大会举办,重磅发布开发者激励计划

    雷峰网讯 6 月 30 日,首届魔搭开发者大会在北京盛大召开。自 2022 年 11 月成立以来,经过两年多的快速发展,社区已聚集超过 500 家贡献机构,托管开源模型数量突破 7 万个,增长达 200 多倍;用户规模从 2023 年 4 月的 100 万迅速扩展至目前的 1600 万,增幅约 16…

    2025年12月2日
    000
  • 怎样用免费工具做年终PPT_免费年终总结PPT的制作方法

    使用AI工具可免费快速制作专业年终总结PPT。首先通过Autoppt输入主题一键生成多套方案;其次利用博思AIPPT或笔灵PPT导入已有文档自动转为幻灯片;再从OfficePlus等网站下载免费模板手动填充内容;最后熟悉VBA者可用ChatGPT生成代码自动化创建8页基础结构,提升效率。 如果您需要…

    2025年12月2日
    000
  • 夸克网盘资源精品合集_夸克网盘入口快速下载链接直达

    夸克网盘资源精品合集_夸克网盘入口快速下载链接直达?这是不少网友都关注的,接下来由PHP小编为大家带来夸克网盘资源精品合集_夸克网盘入口快速下载链接直达,感兴趣的网友一起随小编来瞧瞧吧! 夸克网盘资源精品合集入口 1、夸克网盘资源精品合集可通过其官方应用或网页端直接访问,官方地址为:https://…

    2025年12月2日 软件教程
    000
  • 如何使用 CSS Flexbox 实现图片和文本的响应式布局?

    CSS Flexbox 响应式布局:图片与文本的完美结合 构建自适应网页布局,应对不同屏幕尺寸至关重要。本文将演示如何利用 CSS Flexbox 实现一个常见的布局需求:左侧固定尺寸图片,右侧自适应文本内容。 在宽屏设备上,文本占据剩余空间;而在窄屏设备(例如手机)上,图片则显示在文本上方。 挑战…

    2025年12月2日 web前端
    000
  • Grok和ChatGPT有什么不同 Grok核心功能与区别对比【分析】

    Grok依托X平台实时数据,擅长热点追踪与分步推理,支持“Deep Search”等专业模式,但仅限Premium+用户使用;ChatGPT知识库固定但功能全面,通过插件实现联网,图像生成更精准,提供免费至付费多层级服务,生态开放且接入便捷。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免…

    2025年12月2日 科技
    000
  • ChatGPT对话内容怎么分享给别人 ChatGPT生成分享链接设置方法【教程】

    可通过复制内容、截图、导出文件或使用笔记工具实现ChatGPT对话分享。1、复制对话文本粘贴至邮件或文档共享;2、用Command+Shift+4截取对话区域并发送图片;3、将对话保存为.txt或.docx文件上传至iCloud、Google Drive等云存储,生成“仅查看”权限的链接;4、将内容…

    2025年12月2日 科技
    000
  • 抖音AI如何用角色设定生成连续剧情_抖音AI角色设定生成连续剧情步骤【详细步骤】

    先锁定角色形象再生成剧情,使用AI绘画工具创建角色并获取gen_id与提示词,通过多角度图像训练提升一致性;构建“起承转合”故事框架,分段生成剧本避免偏离主线;撰写包含六要素的分镜描述,结合gen_id确保画面统一;最后用高保真图生视频技术将分镜转为动态内容,保证角色稳定与叙事连贯。 ☞☞☞AI 智…

    2025年12月2日 科技
    000
  • ChatGPT如何用温度参数调创意度_ChatGPT用温度参数调创意度【创意调控】

    调低温度值(0.1-0.3)使输出更稳定,适用于精确场景;提高温度(0.7-1.0)增强创造性,适合创意任务;动态调节可先高温度激发灵感,后低温度优化表达。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 如果您希望调整ChatGPT生成内容…

    2025年12月2日 科技
    000
  • ChatGPT如何用自定义指令提输出稳_ChatGPT用自定义指令提输出稳【指令定制】

    通过设置自定义指令可提升ChatGPT输出的一致性与精准度。1、在“个性化设置”中设定角色与回应规则,统一语气和结构;2、限定回答框架,如“概述-说明-注意”三部分,增强可控性;3、提供理想回答示例,引导模型模仿格式与用词;4、限制自由发挥,禁止推测与外部知识调用,减少波动。 ☞☞☞AI 智能聊天,…

    2025年12月2日 科技
    000
  • ChatGPT怎样用提示词优化文案质量_ChatGPT用提示词优化文案质量【提示工程】

    明确角色设定可提升文案专业性,如指定“资深品牌文案策划师”角色并结合具体场景任务,确保角色与需求匹配,避免输出泛化。 ☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜ 如果您希望利用ChatGPT生成更高质量的文案,但发现输出内容不够精准或缺乏…

    2025年12月2日 科技
    000

发表回复

登录后才能评论
关注微信