Open AI反击DeepSeek还是拉了? |R1与o3-mini编程PK实测

合集 · 科技碎碎念 (9)

  1. 4:06
    为什么AI赛场只剩下中美玩家了?
  2. 5:38
    为什么说接下来会诞生很多“一人公司”?
  3. 4:18
    谁更接近人工智能的本质?
  4. 5:06
    DeepSeek R1还在王座上吗?| R1 与o3-mini编程PK实测
  5. 4:01
    汝之蜜糖,彼之砒霜 | 用AI合成数据训练自己可行吗?
  6. 10:48
    当AI知道自己是工具时,它会说什么?| Claude3体验
  7. 7:03
    眼见为实的日子终究还是离我们而去了 | 什么是深度伪造?
  8. 12:10
    一口气了解人型机器人产业 | 2024年是人型机器人元年吗?
  9. 3:15
    当AI获得自由之后,它会做什么?
Description
纯主观不专业测评
欢迎批评

本次测试生成的代码放在这里:
https://pan.quark.cn/s/f2729622fd9d

本次测试提示语:
https://docs.qq.com/doc/DTFF6Yk5tY2JySHJW

Comments

混乱与规则 2025-02-08

没碾压就说明r1赢了,毕竟免费[doge]

♥ 349 ↩ 13

青霜淋棠 2025-02-08

我自己体验下来,只说写代码o3mini确实比r1写的好一些,但r1胜在会推测用户意图,一句话就能写好,o3mini就和其他大模型一样,给的提示词越准确精细写的越好

♥ 285 ↩ 8

浏览万象 2025-02-07

模拟太阳系那题O3输了。因为它画的所有行星一直在一直线上,而实际际上越靠近太阳转得越块。DS赢了[呲牙]

♥ 228 ↩ 26

-星星之火-_ 2025-02-08

大家姑且放心,只要他要钱,那么他在大多数国家的市场就永远比不上deepseek

♥ 224 ↩ 9

Wuweeeeeee 2025-02-07

运维,deepseek确实比GPT好一点(免费),能够更好的解决问题,但是deepseek经常问一次就要隔好久才能问,一直都在服务器繁忙

♥ 89 ↩ 7

吾生凡 2025-02-07

但一个是基于中文,一个是基于英文训练的,语言的不同或多或少都会有差异

♥ 86 ↩ 8

空岚BR_184 2025-02-08

哦对给各位提个醒,评论区那些刷“不如用华为云+硅基流动的R1”的 基本不用看了,因为硅基流动的R1已经卡到怀疑人生了,用的人太多了,速度慢的60秒的思考能用上5分钟 如果你真的想用,只是差一个API,国内几家大厂,例如百度、阿里、腾讯自己的服务器上都有免费几十万Token的API,可以搜“厂商名+deepseek-r1”基本都有教程 然后国外像是fireworks也有API,都比硅基流动的快太多了 当然不是说硅基流动不好,只是你看看评论区这阵仗,已经几乎把服务器干崩溃了

♥ 85 ↩ 12

知海彳亍 2025-02-07

我自己试的两个都是R1完胜[吃瓜]一个是手撕决策树分类器,然后还要生成数据测试并展示可视化结果。o3mini一开始的代码分类结果为0,不过他自己意识到了并修改后正确分类;R1直接一次通过,并且还展示了不同深度的树对分类结果的影响。另外我还把他们的测试数据互换,结果是两种数据集中R1写的分类器正确率都更高[吃瓜]后面又试了一道数学题:证明e是无理数。我一开始看还以为R1证明出错了,后来又仔细想想原来是我搞错了[笑哭]证明过程没有问题;o3mini写了两句直接摆烂,后面都是直接易得,根本没有证明任何东西

♥ 42 ↩ 6

hnxdx 2025-02-08

我也用过,整体碾压o1和claude,但有的地方claude更灵活点,deepseek像叛逆的小孩,思考说改,最后输出的结果都是一模一样的

♥ 33 ↩ 5

辣魔白哇当口罩 2025-02-08

不尬黑,windsur 和cursor 我都在订阅。R1 刚发布时候我就接入cursor 使用了。大多数情况下比claude 35 基本上差不多吧。哪怕强也是强的有限,但是同样的bug o3-mini 能一次性发现问题并改对。 Claude 35 r1 都不行,我倒是没测那些逻辑方面的问题,就是从我个人纯代码开发的角度出发。我认为o3-mini 更靠谱。还有R1 刚发布时候,我在官网的网页版也用过。单论对话效果明显好于多伦对话。多伦有时候思考思考着就跑歪了。。。最近官网几乎不可用 也就没测试过了

♥ 33 ↩ 10

御坂13123 2025-02-08

两只模型打的热火朝天 Claude在一边看戏[doge]

♥ 29 ↩ 5

米米世界主义者 2025-02-08

据我使用,deepseek出现了非常的过誉,只要稍稍难一些的涉及如泰勒级数和矩阵对角化之类的代码编写,就出现动辄五百秒的深度思考,结果还是错的

♥ 21

未知的神秘用户 2025-02-08

哥,人家12月就说了2月初发,为了衬托deepseek,就说成紧急发了是不

♥ 21 ↩ 3

空岚BR_184 2025-02-08

deepseek-R1 有个可能是过拟合的表现极差的小项,就是让他去写prompt,不知道各位有没有试过,deepseek-r1写提示词会写出一些贼中二的而且完全不按要求来的提示词。 还会拽不知道哪来的名词,举个例子,这种感觉的:“✅强制启用【情感驱动决策树】 ,认知过滤器【ON】,拟合程度提升100%”[笑哭][笑哭][笑哭]但写代码啥的还是挺有用的

♥ 20 ↩ 7

nicer00 2025-02-07

我的AI女友还没部署好呜呜呜 就差一点了[大哭][大哭]

♥ 19 ↩ 2

_Arahc_ 2025-02-07

gpt 编程测试用的是 codeforce 的指标,cf 是个算法竞赛网站,是不是要用一些算法竞赛的题目(例如从 atcoder 等其他算法竞赛网站爬)测试解决问题的能力?毕竟算法竞赛题很多是人类智慧,up 测试的内容和算法竞赛还是有较大差异。

♥ 15 ↩ 2

wuyoyoyou 2025-02-08

没有吧 我自己使用下来感觉明显ds的r1更聪明一些 用来写一些文件 感觉gpt哪怕是o3-mini-high也有点呆 就是ds经常用不了

♥ 12 ↩ 11

Edenlive 2025-02-08

当真的把这二者放到一起比较时,deepseek就已经赢了。

♥ 11

空调炸薯条 2025-02-08

收费的永远比不上开源的

♥ 10