2分钟教你做一个可以自我迭代的 Agent

合集 · 大模型竞技场 (78)

  1. 1:40
    全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
  2. 4:24
    5分钟教你使用AI写一个风扇控制器
  3. 2:46
    10小时前发布的大模型 Mistral-small-24B 马上开测!
  4. 0:51
    NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
  5. 1:43
    一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
  6. 1:17
    国产视频生成框架!能让老黄唱野狼 Disco!
  7. 4:03
    大模型竞技场 - Gemini-2.0-Flash 全网首测!
  8. 2:10
    微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
  9. 2:52
    来啦!Grok-3 全网首测!登陆火星 demo!
  10. 1:55
    视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
  11. 7:32
    谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
  12. 2:06
    全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
  13. 4:18
    我用AI做了个网页版我的世界,还能用砸瓦鲁多
  14. 2:25
    全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
  15. 5:53
    极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
  16. 12:42
    我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
  17. 2:02
    使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
  18. 0:37
    nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
  19. 1:06
    nano-banana 幼儿园教程第②弹! 教你如何做模特图!
  20. 0:55
    nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
  21. 0:46
    nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
  22. 0:41
    nano-banana 教程第五弹! 如何万物像素化!
  23. 1:10
    nano-banana 生成 8K 分辨率图片教程!
  24. 3:06
    Kimi-K2-0905 实测! 一口气输出1100行代码
  25. 1:41
    Qwen3-Max-Preview 实测! 给大家放个鞭炮
  26. 2:20
    Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
  27. 1:31
    刚发布的 Qwen3-TTS-Flash 实测!
  28. 2:54
    DeepSeek-V3.2 实测! 真就只提升了0.1?
  29. 2:18
    Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
  30. 2:22
    GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
  31. 2:22
    DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
  32. 2:05
    claude-haiku-4.5 实测! 便宜大碗?
  33. 2:15
    Vibe Coding 不流行了? Spec Coding 教程来啦
  34. 2:36
    KAT-Coder-Pro-V1 实测! 早放3个月就好了?
  35. 2:07
    Minimax M2 实测! 你也晚了3个月?
  36. 1:16
    Cursor 推出炼蛊模式!一口气能开8个代理!
  37. 2:32
    Cursor 终于有自己的大模型啦!来看实测!
  38. 2:28
    Qwen3-Max-Thinking 实测! 呃......
  39. 2:17
    Kimi-K2-Thinking 实测! 差距继续缩小!
  40. 3:17
    Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
  41. 0:52
    nano banana pro 幼儿园教程! 如何合成橱窗图片!
  42. 4:31
    Meta 的新模型 SAM 3 实测!
  43. 2:05
    什么? 用 Claude Code 剪视频?
  44. 2:50
    DeepSeek V3.2 正式版实测! 提升真的有限?
  45. 2:57
    教程来啦! 如何使用AI打造自媒体博主军火库
  46. 2:54
    GPT-5.2 实测! 美是真的美, 卡是真的卡
  47. 1:25
    一秒生成高斯点云? Apple新模型SHARP实测!
  48. 4:38
    AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
  49. 4:33
    现在都流行大模型月更吗? MiniMax-M2.1 实测!
  50. 3:42
    2025年全球大模型厂商下载量排行榜
  51. 3:27
    500张图片测试! 一个视频告诉你GLM-Image怎么用!
  52. 5:58
    不写 prompt 改看视频了! Kimi-K2.5 实测!
  53. 4:55
    提升明显! Qwen3-Max 正式版 vs Preview版 实测!
  54. 2:29
    不是说好了年前不发吗? DeepSeek 你个大猪蹄子
  55. 7:04
    GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
  56. 5:06
    啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
  57. 7:01
    Qwen3.5实测! 来看贺岁档大模型的实力!
  58. 4:32
    Gemini-3.1-pro 实测! 更新了个寂寞?
  59. 5:15
    inclusionAI Ling&Ring 2.5-1T 大模型实测!
  60. 6:07
    Agent 能力有多强? 来看豆包 Seed 2.0 实测!
  61. 5:10
    龙虾专用大模型? GLM-5-Turbo 实测!
  62. 3:44
    如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
  63. 8:01
    从国产SOTA走向世界SOTA? GLM-5.1 实测!
  64. 6:06
    AI能帮我拍照了? Qwen3.5-Omni实测!
  65. 8:51
    花费106刀测试! Claude-Opus-4.7 到底更新了啥?
  66. 9:04
    Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
  67. 2:32
    大模型写代码比说话还快是什么体验?
  68. 7:36
    Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
  69. 5:39
    MiniMax-M3 最佳实践? 这个视频告诉你!
  70. 1:06
    Fable 5 超越人类还为时尚早!
  71. 0:44
    单卡 700TPS! Diffusion Gemma 来了!
  72. 5:40
    GLM-5.2实测! 什么才是Agent能力的提升?
  73. 1:43
    2分钟教你做一个可以自我迭代的 Agent
  74. 6:12
    Flash模型横评! 性价比之选竟然是这个?
  75. 6:33
    混元3实测! 300B参数竟然有这种Agent能力!
  76. 1:13
    1B就能达到这种效果?LingBot-Vision实测!
  77. 14:05
    Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
  78. 4:57
    我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
Description
给大家分享一个自我迭代 Agent 的构建技巧啊, 也是我在今天字节 seed-2.1 模型发布 demo 中用到的技巧.

这个技巧的核心就是, 干一件复杂的事情, 用两个Agent比用一个Agent要好. 简单来讲打工Agent干完活之后, 还要增加一个评审Agent, 这个Agent要给打工Agent的产出评分, 然后说明评分理由, 哪里做得好, 哪里做的不好.

然后, 一定要输出结构化的评分结果(JSON就行), 这样, 打工Agent接到评分后, 进行修改, 修改完毕再次交给评审Agent, 评审Agent再次打分, 这时候就可以跟上次的打分进行对比. 只有得分大于上次的得分, 你的框架才合并这次的修改. 这就是 Agentic 自我迭代了.

基于 AI 反馈的强化学习的雏形基本就是这样的了, 以及吴恩达提出的 Agentic Workflow 核心原则之一就是 Reflection(反思),框架让模型像人类程序员提交 PR一样:打工 Agent 提交 PR,裁判 Agent 跑测试、打分。只有 Review 通过才能 Merge 到主分支。这就是真正的“工程化迭代”了. 甚至我框架内其实就是采用的Git模式, 多个Agent进行并行评估模拟多个分支, 只有打分高的才会合并到主分支.

最终得益于 Seed-2.1 本身的自我迭代和多模态能力也很强, 在它的驱动下, 成功实现了这个【只需要上传一个城市的相册, 就能建模一整个城市】的demo. 相信在现场的同学已经看到这个 demo 了哈哈. 

下一期告诉你当这个办法也失效了, 该怎么办☆.

Comments

Lee李钊鸿 29d ago

与近期很火的 loop enginnering 概念相似. 在这个视频中能看到更详细的探讨: WTF Is an "AI Agent Loop"? Genius or Hype? - YouTube: https://www.youtube.com/watch?v=7clJ8IH784Q 核心实践就是加入一个 LLM judeg 审判结果. —— 譬如五分制.  如果得分大于4分才算成功. 否则加入新的 prompt 优化. --- 但是, 不是人人都在大厂上班, 可以有无限的 token 免费使用.  一轮 issue 开发跑下来就耗费了 25% 以上的 4小时/token.  我能循环几次?我手头 3 个 codex plus 都耗不起. 再精心设计的 loop 也是空中楼阁.

♥ 11 ↩ 2

肥仔起飞扣篮 29d ago

ds4pro怎么还没剪完

♥ 10 ↩ 1

flywule 29d ago

# 自我迭代开发规则 复杂任务采用「Worker + Judge」双 Agent 架构,禁止单 Agent 在同一上下文内反复自改。 ## 角色分工 - Worker Agent:执行任务并产出结果。 - Judge Agent:以独立上下文评审,不参与执行过程,规避模型「自圆其说」与上下文污染。 ## 结构化评分 Judge 必须输出 JSON 评分:总分(0~1)、各维度分项分、扣分理由、改进建议。禁止仅口头描述问题。 ## 迭代闭环 1. Worker 依据评分修改后重新提交。 2. Judge 复评并与上次得分对比。 3. 仅当新分 > 上次分才采纳修改,否则回退保留上一版本。 4. 循环至分数收敛或达标为止。 ## 多分支并行 可派多个 Worker 并行产出,Judge 统一评分,仅最高分版本合并入主分支(Git 模式)。

♥ 6 ↩ 1

iRepeat 29d ago

很棒的想法,使我的订阅套餐429[doge]

♥ 6

独在故乡亦为异客 29d ago

所以, Seed 2.1 Pro怎么样呢?🤔

♥ 6 ↩ 1

bababaddd 29d ago

各位怎么学习和获取ai资源的

♥ 1

梅林梅林梅林酱 29d ago

太吊了!怎么说实现 up 求分享!

♥ 1 ↩ 1

大气扩散模拟 29d ago

啊???具体怎么做?看的一脸懵逼[星星眼]

♥ 1 ↩ 1

半瓶入梦 29d ago

单线程token都不够用了,别说agent集群了

♥ 1

chelies 29d ago

求教程[星星眼]

♥ 1

赛博阿明 25d ago

再告诉你一个小技巧: 1.用三个聪明的模型比用两个模型好,但是如果三个都是垃圾模型的话,不如用两聪明的模型 2.用两个垃圾模型 不如用一个聪明的模型 3.当你什么不懂的时候,用三个最厉害的模型的模型给你的是垃圾项目,但是你懂的话,两个顶级厉害的模型可以超过你用三个顶级模型

大志66666- 28d ago

有没有什么框架能实现这个?omo行不行

怪怪的徐悲鸿几 28d ago

@总结猫 提取视频完整字幕

RunningBugs 29d ago

kpi是吧[doge]

Null_terminated 17d ago

Btw,up有没有考虑把这个做成一个通用的skills 这样agent 执行长任务的时候自己就使用这个机制[呲牙]

总结猫 28d ago

@怪怪的徐悲鸿几,喵,感谢召唤,总结猫来咯 [妙啊] 两个Agent协作比单一Agent更高效。当模型在上下文中反复修改却效果不佳时,其“自圆其说”的倾向(如坚持最初错误推论)是主要障碍。解决方法是引入两个角色:一个负责执行任务的“打工Agent”,一个不参与初始过程、只负责评估的“裁判Agent”。裁判Agent需输出结构化的量化评分,打工Agent修改后,裁判再次评分并与上次对比。只有当前次得分高于前次时,才采纳该修改。这种基于得分对比的自我迭代框架,配合自我迭代能力较强的模型,能实现自动化的持续优化,显著提升最终输出质量。 (提示:评论区字数有限,可在本条下继续追问。)