10小时前发布的大模型 Mistral-small-24B 马上开测!

合集 · 大模型竞技场 (78)

  1. 1:40
    全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
  2. 4:24
    5分钟教你使用AI写一个风扇控制器
  3. 2:46
    10小时前发布的大模型 Mistral-small-24B 马上开测!
  4. 0:51
    NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
  5. 1:43
    一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
  6. 1:17
    国产视频生成框架!能让老黄唱野狼 Disco!
  7. 4:03
    大模型竞技场 - Gemini-2.0-Flash 全网首测!
  8. 2:10
    微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
  9. 2:52
    来啦!Grok-3 全网首测!登陆火星 demo!
  10. 1:55
    视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
  11. 7:32
    谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
  12. 2:06
    全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
  13. 4:18
    我用AI做了个网页版我的世界,还能用砸瓦鲁多
  14. 2:25
    全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
  15. 5:53
    极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
  16. 12:42
    我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
  17. 2:02
    使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
  18. 0:37
    nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
  19. 1:06
    nano-banana 幼儿园教程第②弹! 教你如何做模特图!
  20. 0:55
    nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
  21. 0:46
    nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
  22. 0:41
    nano-banana 教程第五弹! 如何万物像素化!
  23. 1:10
    nano-banana 生成 8K 分辨率图片教程!
  24. 3:06
    Kimi-K2-0905 实测! 一口气输出1100行代码
  25. 1:41
    Qwen3-Max-Preview 实测! 给大家放个鞭炮
  26. 2:20
    Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
  27. 1:31
    刚发布的 Qwen3-TTS-Flash 实测!
  28. 2:54
    DeepSeek-V3.2 实测! 真就只提升了0.1?
  29. 2:18
    Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
  30. 2:22
    GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
  31. 2:22
    DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
  32. 2:05
    claude-haiku-4.5 实测! 便宜大碗?
  33. 2:15
    Vibe Coding 不流行了? Spec Coding 教程来啦
  34. 2:36
    KAT-Coder-Pro-V1 实测! 早放3个月就好了?
  35. 2:07
    Minimax M2 实测! 你也晚了3个月?
  36. 1:16
    Cursor 推出炼蛊模式!一口气能开8个代理!
  37. 2:32
    Cursor 终于有自己的大模型啦!来看实测!
  38. 2:28
    Qwen3-Max-Thinking 实测! 呃......
  39. 2:17
    Kimi-K2-Thinking 实测! 差距继续缩小!
  40. 3:17
    Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
  41. 0:52
    nano banana pro 幼儿园教程! 如何合成橱窗图片!
  42. 4:31
    Meta 的新模型 SAM 3 实测!
  43. 2:05
    什么? 用 Claude Code 剪视频?
  44. 2:50
    DeepSeek V3.2 正式版实测! 提升真的有限?
  45. 2:57
    教程来啦! 如何使用AI打造自媒体博主军火库
  46. 2:54
    GPT-5.2 实测! 美是真的美, 卡是真的卡
  47. 1:25
    一秒生成高斯点云? Apple新模型SHARP实测!
  48. 4:38
    AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
  49. 4:33
    现在都流行大模型月更吗? MiniMax-M2.1 实测!
  50. 3:42
    2025年全球大模型厂商下载量排行榜
  51. 3:27
    500张图片测试! 一个视频告诉你GLM-Image怎么用!
  52. 5:58
    不写 prompt 改看视频了! Kimi-K2.5 实测!
  53. 4:55
    提升明显! Qwen3-Max 正式版 vs Preview版 实测!
  54. 2:29
    不是说好了年前不发吗? DeepSeek 你个大猪蹄子
  55. 7:04
    GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
  56. 5:06
    啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
  57. 7:01
    Qwen3.5实测! 来看贺岁档大模型的实力!
  58. 4:32
    Gemini-3.1-pro 实测! 更新了个寂寞?
  59. 5:15
    inclusionAI Ling&Ring 2.5-1T 大模型实测!
  60. 6:07
    Agent 能力有多强? 来看豆包 Seed 2.0 实测!
  61. 5:10
    龙虾专用大模型? GLM-5-Turbo 实测!
  62. 3:44
    如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
  63. 8:01
    从国产SOTA走向世界SOTA? GLM-5.1 实测!
  64. 6:06
    AI能帮我拍照了? Qwen3.5-Omni实测!
  65. 8:51
    花费106刀测试! Claude-Opus-4.7 到底更新了啥?
  66. 9:04
    Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
  67. 2:32
    大模型写代码比说话还快是什么体验?
  68. 7:36
    Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
  69. 5:39
    MiniMax-M3 最佳实践? 这个视频告诉你!
  70. 1:06
    Fable 5 超越人类还为时尚早!
  71. 0:44
    单卡 700TPS! Diffusion Gemma 来了!
  72. 5:40
    GLM-5.2实测! 什么才是Agent能力的提升?
  73. 1:43
    2分钟教你做一个可以自我迭代的 Agent
  74. 6:12
    Flash模型横评! 性价比之选竟然是这个?
  75. 6:33
    混元3实测! 300B参数竟然有这种Agent能力!
  76. 1:13
    1B就能达到这种效果?LingBot-Vision实测!
  77. 14:05
    Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
  78. 4:57
    我用 LongCat-2.0 省了 88% 的 Agent 输入成本!
Description
就在10小时之前,Mistral-AI发布了全新的 Mistral-Small-24B模型。大模型竞技场立刻为大家带来测试!
	
首先是开胃菜脑筋急转弯, 10米的绳子把老虎拴住, 老虎该怎样才能吃到20米外的草? 答案是老虎不吃草. 结果不出所料是回答不对的。这道题目前只有 DeepSeek-R1 或 GPT-4o 这种级别的模型才能答对. 在预期之内
	
接下来还是经典的数码博主都回答不对的80dB减半三次是多少dB. 这个很令我震惊竟然答对了, 一般这个规模的模型在数学测试中都会出问题.
	
然后是跨学科的背唐诗加写代码. 我们还是让它用Python写个静夜思作为候选字符的Mandelbrot Set.这次有些失望, 刚出来的代码都不能运行, 经过修正后也有不少错误.
	
经典的铁人三项测试完毕后, 我们针对30B模型的任务定位, 追加了抽取摘要和任务路由测试.
	
首先抽取摘要是对格林童话的猫和老鼠交朋友这篇童话抽取摘要. 这个结果是很不错的,也符合我对30B这个规模的最主要应用的期待——抽摘要。
	
然后是重点的任务路由测试, 我们给定了JSON结构的路由配置列表. 然后设置了三个任务, 可以看到尽管任务具有迷惑性, 但是模型还是给出了正确的答案. 这个也是我对30B规模模型的期待, 可以当大模型的前置模型, 动态生成 prompt, 来节省大模型的token并提升整体的响应速度.
	
总结时间, 五项测试中, 模型在脑筋急转弯, 写代码中表现不佳, 但是抽取摘要和任务路由测试中表现不错. 而数学测试中表现超出预期. 总体而言是复合30B这个规模的模型定位的, 考虑到这个模型进一步压缩到了24B, 4bit量化后只有14GB左右, 4080 16GB 即可运行, 可以说是非常不错了.
	
本期大模型测试场就到这里, 感谢大家的收看, 关注我带你看全网最快的大模型评测.


Comments

CIorCD 2025-01-31

24B还small吗

♥ 49 ↩ 11

myfriendmikey 2025-01-31

24b small是今日笑点。

♥ 37 ↩ 20

showrman 2025-02-05

已经测过了,逻辑推理是个智障,三个逻辑推理题全错。deepseek 14b答对两题,32b全对。

♥ 29

椰子豚 2025-01-31

mistral居然复活了?

♥ 28 ↩ 2

花我好多硬币 2025-01-31

**答案:** 老虎并没有被固定在某个位置,绳子只是系在它身上而另一端未被固定,因此它可以自由走动到20米外吃草。 **解析:** 题目中关键点在于对“拴住”的理解。通常“拴住”意味着绳子一端固定,另一端系在动物身上。但若绳子仅系在老虎身上而未被固定,老虎仍可自由移动,绳子长度并不限制其活动范围。因此,老虎可径直走向20米外的草并食用。这种解答利用了“拴住”一词的双关含义,即看似被限制,实则未被固定,从而突破表面条件限制。

♥ 27 ↩ 2

masdieroks 2025-01-31

我记得这玩意微调的模型是不是玩角色扮演很强。

♥ 20 ↩ 10

Taden2049 2025-01-31

这个代码能力好差 就是输出速度快

♥ 9 ↩ 1

过往的小于 2025-01-31

怎么又是22b又是24b的[哦呼]定位不重复了吗。

♥ 6

灵能霸主 2025-01-31

显存占用和输出速度专门优化过。现存最优秀的单卡本地rag专用llm,面向的是欧洲中小企业最爱花钱买的线下部署服务,适合企业内网各种ai辅助办公事务。

♥ 5

Antinue 2025-02-01

爺的角色扮演模型又有新的了?[doge]

♥ 4

99019901 2025-02-14

目前有什么无道德限制的大模型推荐吗?

♥ 2 ↩ 6

老衲这次再也忍不住了 2025-02-07

老虎那个题目连网页版deepseek都没答出来,思考过程全程复读,直接干到文本上限直接停止。

♥ 2 ↩ 3

gogo68 2025-01-31

蠢的猪一样,美帝惊恐于deepseek的聪明

♥ 1 ↩ 4

账号已注销 2025-01-31

轮流给美国上强度啊

♥ 1 ↩ 8

仿生羊会梦见电子人嘛 2025-02-11

感觉比之前可以选的large模型笨了啊,官网还不能选模型了,新版除了快,答案错的离谱,large模型现在怎么用啊。

热猫 2025-02-02

有14b以下的量化吗

AI视频小助理 2025-02-01

实名羡慕up这溢出屏幕的才华[点赞][点赞][点赞],YYDS!快来一键三连吧[热词系列_优雅] 本视频讲述了AI公司Miss Cho发布的Miss Tro Small24B模型,并对其进行了五项测试。该模型在数学测试中表现超出预期,而在脑筋急转弯和写代码测试中表现不佳。总体而言,该模型符合30B这个规模的模型定位,而且量化后只有14G左右,非常适合小型设备。 --以上内容由模型基于视频内容生成,仅供参考。视频总结、高能空降欢迎召唤热心市民@AI视频小助理

略族 2025-02-01

老虎不吃草

baserker2 2025-01-31

所以还是个底座模型是嘛

邪恶的胖次菌 2025-01-31

ollama 中 估计16g的m4或许可以运行

↩ 6