新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了

article/2025/6/1 13:22:09

新智元报道

编辑:编辑部 YXZH

【新智元导读】新版DeepSeek-R1重磅开源,凌晨已放出权重!此次模型性能几乎与o4-mini(Medium)相当,编程实测超越Claude 4 Sonnet。网友纷纷惊叹:开源又一次胜利了。

临近端午假期,DeepSeek果然又开始搞事。

就在今天凌晨,新版DeepSeek-R1正式开源了!

DeepSeek-R1-0528模型权重已上传到HuggingFace,不过模型卡暂未更新。

项目地址:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

时隔4个月,DeepSeek-R1完成了超进化,编码能力强到离谱,而且思考时间更长了。

据称,新模型基于DeepSeek-V3-0324训练(参数为660B)。

经典物理模拟测试中,DeepSeek-R1新旧版本的对比

在LiveCodeBench基准上,DeepSeek-R1-0528性能几乎与o3-mini(High)和o4-mini(Medium)实力相当,一举超越了Gemini 2.5 Flash。

有网友称赞,DeepSeek-R1能够像o3一样纠正思维链,并且像Claude一样创造性进行世界构建。

可以说,这是属于开源模型的巨大胜利!

不用R2,直接对标SOTA

此次,DeepSeek-R1-0528更新核心亮点,网友做了一个浓缩版的总结:

能像谷歌模型一样深度推理

文本生成优化:更自然,格式更佳

独特的推理风格:不仅快,而且更缜密

支持长时思考:单任务处理时长可达30-60分钟

思考时间更长,成为了全网讨论最多的一点。有网友实测后,R1思考时长超过了25分钟。

另外,这似乎是唯一一个能持续正确做对「9.9 - 9.11是多少」的模型。

编程能力强到爆

网友实测显示,新版DeepSeek-R1在编程方面简直不可思议!

AI圈大佬「karminski-牙医」用同一个prompt测试了DeepSeek-R1-0528和Claude 4 Sonnet后发现。

不管是光线照射在墙上形成的漫反射,还是球在撞击后的运动方向,亦或是控制面板的美观程度,这一把R1稳赢。

网友Alex的测试也显示出,DeepSeek-R1在前端编码的能力上超越了Claude 4 Sonnet。

网友Haider.则是让模型构建一个单词评分系统。R1简要思考后,就立刻出了关于代码和工作测试的两个文件,第一次运行就完美无瑕。

此前,o3是唯一能完成这个任务的模型。而如今,R1堪称是完成这个任务的最佳模型。

注意,R1的表现之所以如此惊人,是因为它返回的两个文件在第一次都能运行良好,不用编辑,不用重试,这极其少见。

因为此前的大多数模型,要么会在边缘情况下终端,要么会做得太复杂,要么缺少适当的测试覆盖率。

和Gemini高能PK

还有人将DeepSeek-R1与Gemini 2.5 Pro进行了对标。同一个提示下,它们各自的表现如何?

首先是深度研究的能力,给出「研究微剂量服用裸盖菇素对长期认知的影响,需引用学术来源」提示。

这一把Gemini的响应更快,引用了可靠的研究文献,并且答案结构清晰。

再来看看它们搜索+对比能力如何?提示模型用实时来源列出全民基本收入(UBI)的五大优点和缺点。

这时,Gemini 2.5 Pro和DeepSeek R1表现都不错,打成平手。

Prompt: List top 5 pros/cons of Universal Basic Income using live sources.

上下滑动查看

再让模型为AI SaaS工具制定TikTok增长策略,两款模型再次打成平局。

在智能体任务规划方面,让Gemini和DeepSeek一同设计一个完整的市场调研智能体,包含工具链、用户角色和流程交接,结果是Gemini生成一张信息图,而DeepSeek稍逊一筹。

由此,大家对DeepSeek-R2的期待值也是拉满了。

一手实测来了

新版DeepSeek-R1的能力经过我们实测,虽然是一次「小版本」更新,但是性能得到了「史诗级」的加强。

尤其是编程能力,感觉已经超过或者足以媲美Claude 4和Gemini 2.5 Pro,可以说所有提示都是「一把过」,不需要任何修改!并且可以在网页端直接运行,展示效果。

首先是制作一个「新智元」字体在宇宙中旋转的3D动画,完成度相当之高。

对于简单任务,DeepSeek-R1的思考时间明显缩短,不再像以前对简单任务也疯狂思考。

设计一个新智元的官方网站,对于这种相对容易的任务,DeepSeek-R1-0528只需要10s的思考时间。

能够明显感觉到,这次DeepSeek-R1新版本的思考过程更加稳定。

以模拟一个太阳系运行为例,还要求行星比例大小与实际相同,能看到DeepSeek-R1-0528的思考过程已经趋近于「完美」。

最后,再给DeepSeek-R1-0528上点强度,要求演示篮球落地后的弹跳过程,并且要完美遵循现实中物理规律。

最终DeepSeek的成果还贴心的设计了参数控制面板,以及速度方向指示,是真的很强,以上所有代码都是提示之后一遍过,没有任何的Debug过程。

对于类似「华容道」的多步骤思考问题,DeepSeek-R1-0528的表现也非常完美,

比如「一位农夫要带一只狐狸、一只鹅和一袋豆子过河。船每次只能载他和一样物品。如果农夫不在场,狐狸会吃掉鹅,鹅会吃掉豆子。请问农夫该如何安排过河,才能确保所有物品安全?」这种复杂推理问题,DeepSeek-R1还可以给出核心问题所在。

最令我感到震惊的是,这次的「思考」能力似乎进行了秘密加强。

我给他了一个非常无厘头的族谱问题:「我的妈妈的爸爸的儿子的侄女的孙子的爷爷的舅舅的外孙女的姑姑,是我的谁,你能画出关系族谱图吗?」

以下过程经过3倍加速,可以看到DeepSeek-R1真的在通过数学的符号化方式在进行思考。

并且最后还真让他分析出了结果,简直震惊!这么长的思考链条都没有断。

另外值得一提的是,这次的思考过程并没有遇到服务算力不够的情况,看来DeepSeek有针对性的提高了算力,毕竟现在是模型刚发布后的高峰「测评」期。

参考资料:

https://chat.deepseek.com/

https://x.com/i/status/1927770337170592033

https://x.com/Yuchenj_UW/status/1927828675837513793

https://x.com/chetaslua/status/1927716608384094545

https://x.com/AiBattle_/status/1927824419478536405

https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

原标题:《刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了》

阅读原文

    本文为澎湃号作者或机构在上传并发布,仅代表该作者或机构观点,不代表的观点或立场,仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。


    http://news.xdnf.cn/PiFgwwuLUG

    相关文章

    3万加盟AI洗头机,暴富印钞机还是韭菜收割机?

    原创 翟元元 Tech星球 Tech星球(微信ID:tech618) 文| 翟元元封面来源 | 图虫创意 “北上广深”等一线城市,正在掀起一股AI洗头热。 所谓“AI洗头”,就是在AI洗头吧或理发店等消费场景,智能设备AI洗头机取代人工,从洗发到烘干,只要按一下按钮,便可以为消费者提供一条…

    百余明清犀角器上博展出,从天然之美到雕琢之巧

    澎湃新闻获悉,5月30日,“古犀珍献:上海博物馆藏明清犀角器”展在上海博物馆人民广场馆正式启幕。展览将展出上博馆藏的百余件犀角器珍品,为观众多角度呈现明清犀角器的独特魅力与深厚内涵,也展现古时人们对美好生活的追求旨趣。展览现场“南方之美”“犀出九德”,犀角质地…

    巴西到底有什么,大厂都去“抢滩”?

    原创 听筒Tech工作室 听筒Tech巴西是蓝海,但绝非坦途。 听筒Tech(ID:tingtongtech)原创 文 | 杨 林 编 | 饶 言 “本地生活”这一高频市场业务,不仅在国内是必争之地,就算放眼全球,于中国互联网大厂来说,都是一件必须要做的事。 过去多年,国内的互联网大厂,在海外…

    前4月上海出口增13.8%背后:无论关税如何变化,全球订单仍在奔向中国工厂

    从控制塔上俯瞰上海洋山港四期无人码头。新华社 资料图经济学有一条基本逻辑——资源总倾向于流向效率更高、风险更低、更能稳定产出的地方。这样的基本逻辑,也正是上海以及全国出口企业的底气所在4月至5月,美国关税大棒令外贸人心情跌宕。但上海海关5月29日最新公布的数据凸…

    “AI拥有自主意识”成真?媒体:该不该担忧AI“抗命不遵”

    派生万物AI 图新华社援引英国媒体报道,美国一家研究机构最近公布了一系列针对各AI大模型的测试结果,其中提到,OpenAI的o3推理模型在得到“关闭”指令后,不仅拒绝执行,还篡改了代码以免被关闭。只看这条简短的新闻,很多人心头一惊。“AI拥有自主意识”是不是成真了?不过,…

    美方宣布撤销中国留学生签证,我使馆:已提出严正交涉

    关于美国务院发表声明称将撤销有关中国在美留学生签证一事,中国驻美使馆发言人5月29日在回答媒体提问时表示,中方坚决反对美方这一政治性、歧视性做法。中国驻美使馆表示,美方此举将严重损害中国在美留学人员正当合法权益,也将进一步损害美自身国际形象和国家信誉。中国驻美…

    “息屏”后的孩子,如何找回真正的“玩商”?|湃客Talk

    近日,北京市教委发布了《关于促进中小学生身心健康发展的若干意见》,鼓励学生和家长共同开展“息屏行动”,减少对电子产品过度依赖,倡导家长每天与孩子“倾听一刻钟,活动一小时”。一个多月前,深圳也率先面向全社会发布了“每天息屏一小时,读书运动爱自然”的倡议,“息…

    周云蓬和导盲犬熊熊:再见熊熊,你是永远的乡愁

    一条温暖湿润的大舌头卷走了周云蓬手心里的狗粮,它是熊熊,一只漂亮的酒红色美式金毛,这是导盲犬基地特意为周云蓬挑选的。“他们听说我是歌手经常上台演出,就说给我挑一只颜值高的。”在舞台的黑暗中,熊熊光亮的长毛显眼又美丽。5月29日,民谣歌手周云蓬匆匆结束在台北和京…

    党旗下的青春|许国屏的艺术人生:一支笛、一件事、一辈子

    【编者按】为深入学习贯彻党的二十大精神,推动党的创新理论入脑入心入行,上海市委宣传部机关团委、市科技团工委、市卫生健康委团委持续推进第三期“党旗下的青春”初心寻访。活动走访上海科技、卫生、宣传思想文化战线的老党员、老干部、老专家,引领广大青年在跨越年代的对…

    第一集|《在人间》:一次与自己的灵魂对话

    【编者按】帮大家看剧的“第一集”,最近开播的剧集,值不值得入坑?也许有的剧会渐入佳境,也许有的剧高开低走,本文仅评测开头几集供参考。后续如有打脸,随时通知大家。《在人间》播出平台:爱奇艺开播时间:5月28日该剧由徐兵执导并编剧,赵丽颖、尹昉、张一山、周一围、董…

    禁招国际生案哈佛再获胜,美政府改立场提出“30天限期”

    当地时间29日,美国马萨诸塞州联邦地区法院一名法官批准了哈佛大学提出的发布初步禁令请求,“叫停”特朗普政府取消哈佛大学招收外国学生资质的政策。该法院法官艾莉森伯勒斯29日就该案举行听证会。法院网站最新信息显示,此前发布的临时限制令将继续有效,待各方协商并提交提…

    英国利物浦汽车冲撞人群事件嫌疑人身份公布,警方通报调查进展

    英国默西赛德郡警方发言人当地时间5月29日说,日前在利物浦市中心驾车冲撞球迷的男子面临7项指控,将于30日在利物浦地方法院出庭。据英国媒体报道,默西-柴郡地区皇家检察署授权默西赛德郡警方正式对53岁的嫌疑人保罗多伊尔提出指控,罪名包括非法、恶意造成他人严重身体伤害和…

    蒙特内格罗被再次任命为葡萄牙总理

    葡萄牙首都里斯本(资料图)葡萄牙总统德索萨当地时间5月29日任命民主联盟领导人蒙特内格罗为新一任总理。据葡萄牙总统府发布的公告,德索萨当天在会晤民主联盟、社会党和“够了”党的领导人后表示,根据议会选举结果,听取议会中各政党意见,并依据宪法程序,在确保新一届政府…

    以总理称将继续加沙地带军事行动,直到彻底消灭哈马斯

    当地时间29日,总台记者获悉,以总理内塔尼亚胡当天在会见以色列被扣押人员家属时表示,以色列同意此前美方提出的加沙停火提案,但是以色列不相信哈马斯会释放所有以方被扣押人员,因此将继续其对加沙的军事行动,直到彻底消灭哈马斯。内塔尼亚胡同时表示,在任何未来可能达成…

    美国联邦上诉法院批准特朗普政府请求,暂时恢复其关税政策

    当地时间5月29日,美国联邦上诉法院批准了特朗普政府的请求,暂时中止此前一家下级法院禁止执行美政府多个关税行政令的裁决。此前美法院裁定禁止执行政府多个关税行政令28日,位于纽约的美国国际贸易法院裁定,美国政府依据《国际紧急经济权力法》发布对多国加征关税的行政令属…

    哈马斯称诉求未获以方回应,对美方加沙停火提案感到失望

    加沙地带(资料图)当地时间5月29日,巴勒斯坦阿克萨电视台发布哈马斯高级官员巴塞姆纳伊姆的声明。声明证实,哈马斯已经收到美方提出的加沙地带停火提案以及以色列对该提案的回应。哈马斯认为,以方对该提案的回应本质上是延续其对加沙地带的占领、继续实施杀戮和饥饿政策。同…

    美联储主席鲍威尔与美总统特朗普会面,未讨论货币政策预期

    当地时间5月29日,美联储发布声明表示,应总统邀请,美联储主席鲍威尔当日在白宫与特朗普会面,讨论包括增长、就业和通胀在内的经济发展问题。声明表示,鲍威尔并未讨论他对货币政策的预期,只是强调政策路径将完全取决于即将发布的经济信息及其对经济前景的影响。鲍威尔表示,…

    美国法官称将下令要求政府无限期维持哈佛大学的学生签证项目

    当地时间5月29日,总台记者获悉,美国联邦地区法官艾莉森伯勒斯表示,她将下令要求美国国土安全部和国务院无限期维持哈佛大学的学生签证项目,不得做出任何改变。伯勒斯表示,她“希望维持现状”,允许哈佛大学继续接收持签证的国际学生。具体细节仍将在法庭上进行讨论。据悉,…

    俄外交部发言人:下一轮俄乌谈判俄方代表团成员与上一轮相同

    当地时间5月29日,俄罗斯外交部发言人扎哈罗娃在一档电视节目中表示,计划由第一轮俄罗斯代表团成员参加与乌克兰的第二轮谈判。当地时间5月16日下午,在土耳其方面主持下,俄罗斯和乌克兰代表团在土耳其伊斯坦布尔开始关于和平解决乌克兰危机的会谈。俄方代表团由俄总统助理梅…

    王毅会见亚洲和平和解理事会主席素拉杰

    2025年5月29日下午,中共中央政治局委员、外交部长王毅在香港会见出席国际调解院公约签署仪式的亚洲和平和解理事会主席、泰国前副总理素拉杰。王毅表示,中泰一家亲,两国友谊历久弥坚。今年正逢中泰建交50周年暨“中泰友谊金色50年”。双方要落实两国领导人达成的重要共识,加…