Meta 的新模型 SAM 3 实测!

合集 · 大模型竞技场 (78)

  1. 1:40
    全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
  2. 4:24
    5分钟教你使用AI写一个风扇控制器
  3. 2:46
    10小时前发布的大模型 Mistral-small-24B 马上开测!
  4. 0:51
    NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
  5. 1:43
    一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
  6. 1:17
    国产视频生成框架!能让老黄唱野狼 Disco!
  7. 4:03
    大模型竞技场 - Gemini-2.0-Flash 全网首测!
  8. 2:10
    微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
  9. 2:52
    来啦!Grok-3 全网首测!登陆火星 demo!
  10. 1:55
    视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
  11. 7:32
    谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
  12. 2:06
    全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
  13. 4:18
    我用AI做了个网页版我的世界,还能用砸瓦鲁多
  14. 2:25
    全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
  15. 5:53
    极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
  16. 12:42
    我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
  17. 2:02
    使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
  18. 0:37
    nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
  19. 1:06
    nano-banana 幼儿园教程第②弹! 教你如何做模特图!
  20. 0:55
    nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
  21. 0:46
    nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
  22. 0:41
    nano-banana 教程第五弹! 如何万物像素化!
  23. 1:10
    nano-banana 生成 8K 分辨率图片教程!
  24. 3:06
    Kimi-K2-0905 实测! 一口气输出1100行代码
  25. 1:41
    Qwen3-Max-Preview 实测! 给大家放个鞭炮
  26. 2:20
    Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
  27. 1:31
    刚发布的 Qwen3-TTS-Flash 实测!
  28. 2:54
    DeepSeek-V3.2 实测! 真就只提升了0.1?
  29. 2:18
    Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
  30. 2:22
    GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
  31. 2:22
    DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
  32. 2:05
    claude-haiku-4.5 实测! 便宜大碗?
  33. 2:15
    Vibe Coding 不流行了? Spec Coding 教程来啦
  34. 2:36
    KAT-Coder-Pro-V1 实测! 早放3个月就好了?
  35. 2:07
    Minimax M2 实测! 你也晚了3个月?
  36. 1:16
    Cursor 推出炼蛊模式!一口气能开8个代理!
  37. 2:32
    Cursor 终于有自己的大模型啦!来看实测!
  38. 2:28
    Qwen3-Max-Thinking 实测! 呃......
  39. 2:17
    Kimi-K2-Thinking 实测! 差距继续缩小!
  40. 3:17
    Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
  41. 0:52
    nano banana pro 幼儿园教程! 如何合成橱窗图片!
  42. 4:31
    Meta 的新模型 SAM 3 实测!
  43. 2:05
    什么? 用 Claude Code 剪视频?
  44. 2:50
    DeepSeek V3.2 正式版实测! 提升真的有限?
  45. 2:57
    教程来啦! 如何使用AI打造自媒体博主军火库
  46. 2:54
    GPT-5.2 实测! 美是真的美, 卡是真的卡
  47. 1:25
    一秒生成高斯点云? Apple新模型SHARP实测!
  48. 4:38
    AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
  49. 4:33
    现在都流行大模型月更吗? MiniMax-M2.1 实测!
  50. 3:42
    2025年全球大模型厂商下载量排行榜
  51. 3:27
    500张图片测试! 一个视频告诉你GLM-Image怎么用!
  52. 5:58
    不写 prompt 改看视频了! Kimi-K2.5 实测!
  53. 4:55
    提升明显! Qwen3-Max 正式版 vs Preview版 实测!
  54. 2:29
    不是说好了年前不发吗? DeepSeek 你个大猪蹄子
  55. 7:04
    GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
  56. 5:06
    啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
  57. 7:01
    Qwen3.5实测! 来看贺岁档大模型的实力!
  58. 4:32
    Gemini-3.1-pro 实测! 更新了个寂寞?
  59. 5:15
    inclusionAI Ling&Ring 2.5-1T 大模型实测!
  60. 6:07
    Agent 能力有多强? 来看豆包 Seed 2.0 实测!
  61. 5:10
    龙虾专用大模型? GLM-5-Turbo 实测!
  62. 3:44
    如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
  63. 8:01
    从国产SOTA走向世界SOTA? GLM-5.1 实测!
  64. 6:06
    AI能帮我拍照了? Qwen3.5-Omni实测!
  65. 8:51
    花费106刀测试! Claude-Opus-4.7 到底更新了啥?
  66. 9:04
    Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
  67. 2:32
    大模型写代码比说话还快是什么体验?
  68. 7:36
    Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
  69. 5:39
    MiniMax-M3 最佳实践? 这个视频告诉你!
  70. 1:06
    Fable 5 超越人类还为时尚早!
  71. 0:44
    单卡 700TPS! Diffusion Gemma 来了!
  72. 5:40
    GLM-5.2实测! 什么才是Agent能力的提升?
  73. 1:43
    2分钟教你做一个可以自我迭代的 Agent
  74. 6:12
    Flash模型横评! 性价比之选竟然是这个?
  75. 6:33
    混元3实测! 300B参数竟然有这种Agent能力!
  76. 1:13
    1B就能达到这种效果?LingBot-Vision实测!
  77. 14:05
    Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
  78. 4:57
    我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
Description
给大家带来 Meta 的 SAM 3 大模型实测! 

这个大模型有4个功能, 分别是视频内容识别, 图片内容识别, 图片生成3D模型, 图片生成3D人物姿势模型.

首先来看第一个测试, 视频内容识别

让我们从简单的场景开始, 这是一个机器人工作的场景, 左侧搜索栏自动给出了视频中物体的名称, 我们选择 robot, 然后进行标记. 结果效果一般, 可以看到只有后面一段成功标记了机器人, 但是视频前面没有标记, 这意味着模型可能迁移性较差. 

真的是这样吗? 我们再来复杂一些的视频, 高速运动的自行车比赛视频, 左侧并没有识别到运动员, 但神奇的是识别到了袜子哈哈哈, 别担心, 我们看下这个自行车标记的效果怎样, 很不错,  那么我们手动增加标记试一下, 牛皮, 这次毫无问题了.

那么最大可以标记多少? 来看第三个测试, 点击标记 people 后, 自动标记了 10个人. 当我们手动标记第11个时, 就会失败, 所以视频内容识别最大标记量为10个目标.


再来看图片内容识别

我们上来就来个猛的, 让他标记图片中所有的泡泡, 可以看到绝大部分的泡泡都成功标记了, 不过有些重叠的还是漏掉了. 当然这个效果已经很牛了, 跟专门训练的 yolo 有一拼.

那么再增加一些, 还能识别吗? 来看这个识别水滴, 完蛋啦! 这个无法正确标记, 主要还是目标天多了, 不过手动标记单个目标还是没问题的.

动物能标记吗? 没问题, 看这个绵羊标记, 很成功. 另外, 如果是训练的少的内容, 泛化效果也不好, 比如终极难题电路板, 虽然识别出来有电容电阻, 但是点击后还是会把各种原件混淆到一起.


然后是3D场景建模

首先是Mamiya相机, 我们让它建模, 可以看到图片中展示的面还可以, 但是其它面就出现幻觉了, 这个时目前3D建模模型的通病. 毕竟没看过的东西大模型也脑补不出来. 另外还内置了一些有趣的特效, 对于社交媒体的场景很有创意.

然后复杂一点, 我们来一个蒸汽机车, 可以看到这次则是建模精度有些问题, 火车的机械细节还原度不够.

我们来测试多物体建模, 这个表现很好, 可以看到乐高小人建模的效果很不错.

那么场景建模怎样呢? 我们来个楼梯, 完蛋, 这个幻觉太严重了, 把楼梯建模成了平台.


最后是图片生成3D人物姿势

我们先上传一个单人场景, 效果非常不错, 可以看到人物姿势非常还原

复杂一些, 我们增加一下人数, 画面中也增加一些遮挡. 完美, 可以看到人物姿势还原还是没问题, 甚至画面中第三个人都是别到了. 当然有些瑕疵, 比如这个人物的腹部由于裙子遮挡, 建模出现了一些问题.

再复杂一些, 打篮球场景, 这个建模也很精准. 被遮挡的人物建模也很还原.

再复杂一些, 一个超级多人场景, 仍然成功建模了, 不过这个也出现了一些问题, 所有人其实都是在凭证地地面的, 但是模型把透视理解错了, 变成了所有人都站在一个斜面上, 高低不同.

总结

目前来看四种模式中, 最好用的是图片生成3D人物姿势, 其次是图片内容识别, 然后是视频内容识别, 最差的是图片生成3D模型. 不过即使是这样, 这个模型也是业界相当大的进步了.

Comments

prunusis 2025-11-22

唱,跳,rap,橄榄球

♥ 18

晨隐_ 2025-11-22

省流:拉完了

♥ 4 ↩ 2

幻象西瓜酱 2025-11-23

这玩意生成3d靠库,没有的就是随便代替了

♥ 2

坏求老狐 2025-12-10

坐等大神突破

SmileTaozi 2025-11-29

速度快吗

lineheartX 2025-11-25

这个3d生成物体还有一个问题,导出的模型只有点,没有面和线,不知是我用的有问题还是本就是这样

↩ 3

ChuwuYo 2025-11-22

速度这么快吗