万字测评!18个主流大模型深度评测,读懂AI现状【深度模评03】

合集 · 中文AI测评 (23)

  1. 37:40
    耗时半年,测遍全网AI,我们做了个百大AI榜单【全网首发】
  2. 12:24
    万字测评!18个主流大模型深度评测,读懂AI现状【深度模评01】
  3. 7:16
    我用AI搜索救助了一只流浪小猫【不一样的AI测评】
  4. 4:34
    用海量数据喂出来的AI,竟然比我还懂赚钱?【蚂小财深度测评】
  5. 6:56
    比家长更懂辅导孩子?杀死教培行业的也许是AI大模型
  6. 8:12
    让AI帮我做猫meme视频,竟被甲方爸爸夸赞【如何用一台AIPC完成猫meme制作】
  7. 12:11
    ChatGPT是陷阱?回顾AI爆发元年,我们似乎走错了路【大模型年终随想】
  8. 9:05
    把大模型放进手机系统?这个AI助手有点出人意料【蓝心小V首发测评】
  9. 7:55
    国产AI到底行不行?测试完通义千问,我只想说两个字【模型测评02】
  10. 5:34
    参加完稚晖的人形机器人发布会,我的感受是……
  11. 6:22
    我用AI把暴雪游戏的经典台词写成了一首歌【图灵计划08】
  12. 10:56
    不降价就死?调研了40多家大模型,我发现了致命问题
  13. 8:54
    AI暴打陪玩行业!新时代人机能有多离谱?
  14. 5:28
    AI手机是伪概念? 测评完华为Mate 70后我的答案是..
  15. 6:27
    0.0001m²能装下多少AI能力? 小芯片怎么带动大模型【AI与手机芯片】
  16. 5:16
    火力全开的Deepseek骂人有多狠?一句话给我干破防
  17. 4:39
    大厂产品接入Deepseek,是被迫妥协还是真有东西?【DeepSeek测评系列01】
  18. 7:18
    我们试着开发了一套DeepSeek家电,结果发现...
  19. 7:37
    六根圆满+自我进化,AI手机也能秒开仙人?【荣耀Magic8深度测评】
  20. 7:42
    实习生靠一个AI,把职场老油条干沉默了
  21. 6:37
    那些裸辞搞OPC一人公司的人,现在怎么样了?AI时代三大“骗局”:一人公司、openclaw、AI培训
  22. 6:32
    当AI拥有第一视角,我们能通关地球Online吗?
  23. 8:28
    关于AI手机,大模型厂商终于开窍了?当智能体开始影响现实,安全如何保证
Description
本次测评的所有模型都是基于测评开始时(1月初)已公开的版本,后续一些新发布的模型版本并没有纳入其中,不排除榜单和性能在发布时产生的变化,但这一期仍旧可以作为整体表现的长期参考。
 
此外,我们只提供了客观的测评结果,并没有给出谁好谁坏这样的结论,因为模型具有很大的成长性和不确定性,就像GPT-2到4一样,没人知道未来哪个模型会突然变化。不过我们可以给出自己的主观感受,仅供大家参考:
1.  基础大模型领域,GPT-4和GEMINI Ultra理论最强, LLAMA架构目前开源项目用的最多(也有公司直接copy代码的)但效果差强人意
2.  中文场景,通义千问、文心一言、vivo蓝心和GLM4是第一梯队,效果比gpt-3.5略好。除了华为盘古做业务垂类场景(地质、气象)不好评测,其余国产大模型表现都不错。
3.  截至发布之日,移动端又多了一个三星的Galaxy AI,但能力不如国内的四小只。其中蓝心小V应用场景最广、能力最全,华为小艺指令调度很强,效率工具很实用,小布基础能力很好,但手机场景还有待开发,小爱则在智能家居场景有很大潜力。
 
最后,制作不易,希望大家可以多多三连~这是对我们最大的支持与鼓励。

Comments

llIIIIIIIIIIIIll 2024-02-08

我们公司在内测大模型,当然不对外开放的,怎么说呢,一看就是自研的,因为无论是买的还是开源的都不可能那么烂[doge]

♥ 1535 ↩ 16

StarTrek星航 2024-02-07

综合下来我个人推荐通义千问,一是现在大家都可以用,二是它上下文理解能力比较优秀,三是中文创作能力也不错,比较自然,不像chatgpt和文心等等模板化严重,一股ai味

♥ 728 ↩ 37

草丛里的猫 2024-02-07

在手机app上用“求y=x^(2-x)的极大值”对文心一言3.5,通义千问和智普清言(GLM-4)进行测试,三家app的思路都是对函数求导判断单调性再计算结果,但是文心3.5和通义千问在第一步计算函数一阶导函数的步骤上就算错了,从而得出错误的函数单调性结论,而近期推出的GLM-4给出了正确的一阶导函数,并指出由于函数方程的复杂性无法直接求出,但通过调用编写代码插件计算出了数值解。单就这个问题看,GLM-4给我的惊喜还是很大的。

♥ 598 ↩ 20

Res4tia 2024-02-08

vivo商单和别家真的区别挺大,很多都是你不看到后面根本察觉不出是商单

♥ 550 ↩ 20

ZMotu 2024-02-13

如果一个评测视频声称在测试GPT-4,然而实际上使用的是GPT-3.5,这可能会误导观众,因为GPT-4和GPT-3.5之间可能存在着性能上的重大差异,包括但不限于对话理解、处理特定问题的能力以及更复杂的推理任务。 这样的行为可能会有以下几个问题: 1. **误导性信息**:观众可能以为他们看到的是最新技术的性能,实际上却不是。 2. **信誉问题**:对那些发布内容的人或组织来说,误导性的标题和描述可能会损害他们的信誉,并减少观众的信任。 3. **评价准确性**:如果评价的基础信息不准确,其评价结果可能会引起误解或误导,尤其是对正在考虑如何利用这些技术的开发者和利益相关者。 4. **竞争不公**:在技术发展迅速的领域,准确的信息对于维持公平竞争至关重要。误导性内容可能会给其他采用诚实方式进行市场定位的竞争者造成不公。 为了保持诚信和透明度,内容制作者应该准确说明其评测的是哪个版本的模型,并且标题和描述不应该误导观众。 如果有人对该视频的行为提出质疑或不满,那么与其进行沟通,并寻找更为准确和值得信赖的信息来源是一种合适的处理方法。

♥ 385 ↩ 12

流云落花喵喵喵Official 2024-02-07

那么瑟瑟呢....好像最后都并没有提这个

♥ 344 ↩ 56

你的月我的心 2024-02-07

公开benchmark测评存在过优化问题,特别是中文,需要谨慎参考

♥ 338 ↩ 5

Furrrrrry 2024-02-08

你接商单就直说 要不是我做arcgis eviews这些的时候只有gpt4能分析和生成命令的话我就信了

♥ 328 ↩ 6

乡熊0_0 2024-02-07

为啥文心一言的参数量那么大,跑分却不如通义千问呢

♥ 314 ↩ 30

ao001111 2024-02-08

商单你就直接说呗,这样搞让之前相信你的人怎么办?会不会有点过分?

♥ 230 ↩ 2

白糖血橙 2024-02-12

那个叫人类的模型分好像一直很高呢

♥ 195 ↩ 4

Riker审美小桌板 2024-02-07

华为云盘古是一堆不同领域的多个模型的总称,但其实一直没有揭开盘古NLP模型的面纱。目前手机上小艺之外,找不到另一个入口,惟一一个就是华为云盘古NLP里面有一个企业内测申请,我们公司申请了半年了都没通过[笑哭]去给华为云客服电话对方直接说要千万级以上项目才能比较快批准内测[笑哭]你这不玩我吗?另外能够找到的一个地方是开源的盘古alpha模型,但是好像也是两年前开源的版本了,性能就是LLM出圈之前水平,记得之前看过一个文章训练路线上比较独特

♥ 191 ↩ 13

犬夜叉的犬舍 2024-02-08

蓝厂这个AI大模型表现属实是让人有点意外,在众多实测中成绩表现相当优异

♥ 167 ↩ 12

清爽的初晨 2024-02-08

vivo、阿里这些能吧大模型开源确实是让我没想到

♥ 158 ↩ 12

跟风远走高飞 2024-02-08

简单点来说在更大难度的移动端测试中vivo蓝心基本就是独一档

♥ 152 ↩ 15

StinkySaltedFish 2024-02-07

个人感觉综合来说GPT还是领先的,Gemini比GPT3.5好些,国内的大模型还有进步空间,话说除了中美好像也没几个国家在搞大模型吧

♥ 149 ↩ 18

vladimir_K 2024-02-09

用GPT3.5测真够逆天的

♥ 147 ↩ 6

司尺音 2024-02-07

这两年ai发展迅猛,我有时真人配音也被说ai[妙啊]是不是普通话太标准了

♥ 139 ↩ 6

青霐 2024-02-07

文言文电脑这一道,gpt4不同的空对话连续问了三遍,全部都没有出现up提到的“没有意识到电脑是现代产物”的问题。。。

♥ 108 ↩ 9