集体翻车?主流AICoding大模型开发鹅腿识别!【B站AI创造公开赛】

合集 · 鹅腿鸭腿识别 (1)

  1. 6:55
    集体翻车?主流AICoding大模型开发鹅腿识别!【B站AI创造公开赛】
Description
四大模型主流AICoding大模型开发鹅腿识别!会是怎样的一番奇景?他们能把App做出来吗?

Comments

小男孩下凡 2026-06-26

你是说清华做的AI是最能识别出鹅腿的🤔

♥ 1811 ↩ 13

紫狐千户 2026-06-24

终于不是其他博主千篇一律的测试生成html了[支持]

♥ 1881 ↩ 29

最后de小雪 2026-06-25

感觉加个豆包会有意想不到的效果[doge_金箍]

♥ 672 ↩ 30

永恒团长 2026-06-24

ChatGPT:我在等用户说调用GPT-image-2来生成数据集,赚他一笔[滑稽]

♥ 559 ↩ 4

嘿耳喂狗 2026-06-30

博主能不能挑战一下用AI识别钓上来的鱼是啥品种,如果能开图鉴,给不同鱼类赋分,做朋友圈钓鱼天梯排行榜,或者本地钓鱼天梯排行榜,感觉会有市场[doge]

♥ 437 ↩ 24

epcdiy 2026-06-25

高频问题回答: 1.为什么GLM是19%,因为国内版抢不到,我订阅的是海外版,只有coding plan,没有计量token。 2.为什么用中转站?我没国外手机号,没合法境外支付手段。至于中转站是否会降智或者偷换模型,这个没有明确证据证实我用的这个会这样做。 3.codex没开plan,我的失误,我会把那段剪了,这个不影响结果。

♥ 600 ↩ 22

莫得感情的莫得君 2026-06-30

豆包牛逼

♥ 361 ↩ 10

世界第一召唤师 2026-06-25

大家请支持鸡腿叔叔谢谢[傲娇]

♥ 271 ↩ 5

星見カエデ 2026-06-24

deepseek最近因为各种原因降智,基本没办法用了,接cc的话指令遵循性基本为0[笑哭]

♥ 267 ↩ 15

方明fhm 2026-06-24

glm5.2 费用 19%?

♥ 171 ↩ 3

可以老不死吗 2026-06-24

感谢up,打假了一堆主播说只要几句话就可以做app的。谢谢啊。up的每一个token 都非常有价值[吃瓜][吃瓜][吃瓜][吃瓜][吃瓜][吃瓜][吃瓜][吃瓜][吃瓜][吃瓜]

♥ 180 ↩ 26

量子Bug 2026-06-24

看来 GLM 还挺适合 vibe coding 新手,本地做不到的就告诉你上云,自己搞不定的就不做,告诉你上哪找。

♥ 179 ↩ 14

___DK___ 2026-06-24

让AI自己找图,还要打标,实在太难为它了。

♥ 141 ↩ 7

鬼邪天 2026-06-25

这是真的在欺负两个瞎子模型,他俩从出生到现在就没看过鸭腿和鹅腿的图片,分辨也只能靠猜

♥ 197 ↩ 3

翡色晓阳 2026-06-25

有没有考虑过以往都是鸭腿冒充鹅腿卖,导致网上鹅腿这个概念早就被鸭腿污染十多年了,怎么可能训练出有用的模型 [吃瓜]可能需要搞一次手动录入才行

♥ 124 ↩ 13

来自缤纷 2026-06-25

终于让我在主页刷到了有人反驳一句话让AI写APP的观点了。 我自己就是写代码的,DeepSeek有时候它会为了完成任务,忽略掉开发规范,让它前后端配合完成一个功能,有时候写出来的接口,我一眼就能看出来有安全问题,当你的描述很笼统的时候,其实就是在抽奖。但deep seek其实也还是好用的,首先它很便宜,然后有些任务描述的清晰一点,它也是能非常顺利的完成。 GML,他家的编码模型好像设计之初就很重视代码这一块,论编码能力其实是比ds强一点的。但是完成一些复杂任务的时候,你给的描述足够清晰,两边其实差不了多少。

♥ 115 ↩ 14

What_Damon 2026-06-24

Vibe Coding给我最大的经验是重置上下文真的重要,不然有些模型死咬着过去的错误上下文不放去调试非常痛苦,一遍又一遍进入死穴[笑哭]

♥ 111

汪慕瑶月 2026-06-24

知道边界的ai更聪明!我更信赖这样的ai!而不是强行上!浪费我时间和token

♥ 113 ↩ 5

wo谜之桑 2026-06-24

我觉得有必要统一一下 Agent 工具,比如统一使用 Claude Code、Cursor 或者 OpenCode。因为现在 Agent 用多了,其实能发现 Agent 的提示词框架以及工具,对于大模型的能力影响是非常巨大的,甚至不亚于模型本身🤔

♥ 88 ↩ 10

TRIPFZ 2026-06-25

为什么我使用 Claude Opus 4.8,与你测试出来的结果完全不一样呢?[微笑] 、请问你确定你的这个是没有问题的吗?作为一个 90 万粉丝的博主,你甚至不愿意去公平地去做一个正确的对比。 Opus 4.8 相比 GPT 5.5 来说贵很多,绝大多数模型厂商都不会这样用。而且你所谓的安卓 APK 编译问题,在我的 Opus 4.8 这里开最高思考模式,它有可能是我的技能比较多,我的技能设置的比较好。我是一名个人开发者,GitHub 也是有一点点星的。 Opus 4.8 最高思考模式编译一遍过,并且它还自己尝试了编译,并没有让我去手动编译和解决报错。它进行了自我尝试,启动了完全自主的去下载了安卓的虚拟机,对安卓的虚拟机进行识别。模仿环境等等他都做了。顺便一提,这个项目消耗了我 5 小时额度的 25%。确实很贵,但是绝对不可能是你测试出的这种水平,他找来的模型图片质量是很高的。 而且在全过程刚开始的时候,Claude 就会询问我具体的内容。

♥ 139 ↩ 10