我们决定让全B站白嫖,只为找到最强大模型!
合集 · 科技杂谈 (65)
-
万字解析黑神话动作系统!为什么天命人的大棒如此丝滑?
22:19
-
雷军模拟器?一键清日常?耗时3个月,我们体验了数百款AI工具......
7:26
-
刷爆朋友圈的年度总结,是怎么做出来的?
8:33
-
大模型是怎么学会讲人话的?
5:39
-
暴雷的英特尔,烂尾的芯片法案?
14:20
-
电子游戏,科技沃土!
12:33
-
AI手机,干掉App?
11:18
-
我们提前做出了苹果的Apple Intelligence !?
9:30
-
如何教会甲方自己给自己做广告
7:10
-
关于显卡坞,我和林哥吵了一架...
6:57
-
2024,电子阳痿有救了?
10:45
-
我爸竟然用AI淘汰了我?
8:57
-
华为AI,⚡️AI 中的 AI⚡
7:35
-
英特尔:AI必须落实,我说的
6:20
-
2024了 AI诈骗你顶得住么?
8:42
-
不要199!免费教程速通大模型!AI是怎么学会讲人话的?
15:37
-
完蛋!我被AI美女包围了
7:34
-
【教程向】当AI遇到人类抽象大师...
7:21
-
AI杀疯了?我们花了一年时间,总结出十款必备AI工具
9:58
-
请警惕使用Vision Pro的老板
8:55
-
10岁小孩也能写原神?低代码编程是噱头吗?
9:20
-
我要回去当程序员了
16:41
-
人类什么时候被AI送走?
30:32
-
逃离香港?带大家看看我们深圳的新工作室
10:26
-
聊天就能编程!我用GPTs做了个自己的数字化身
10:54
-
用AI给大家抽一个华为Mate X5+iPhone 15 Pro Max|0代码编程时代来了
1:34
-
灵犀通信:移动信号新高度|华为 Mate60 Pro 移动使用体验
14:51
-
聊聊香港生活,顺便招点人
11:32
-
华为 Mate X5 大战苹果 iPhone 15 Pro Max?2023顶级机皇之争 含抽奖预告
8:24
-
我要被取代了?AI数字生态发展到了哪一步 | 腾讯全球数字生态大会
5:53
-
雷布斯的机器人梦 !12999元的电子狗你会养吗?
3:15
-
来评论区和AI大模型聊天吧!「鸿蒙4.0元服务开发」
7:43
-
四分钟速览我国AI大模型生态建设|世界人工智能大会
4:19
-
【亦】什么叫AI艺术家啊
8:44
-
【亦】手机杀死了摄影?
26:12
-
【亦】为啥手机屏幕越来越大?
6:34
-
【亦】插帧rap画画,AI杀疯了!RTX4090深度测评
21:43
-
【亦】电动汽车覆灭史
7:24
-
我把B站观众做进了游戏里
8:49
-
【亦】被库克“杀死”的产品:iPod touch
16:36
-
【亦】学习方法分享:工具和努力一样重要
14:59
-
【亦】唠唠AlphaCode:AI会写代码了,人类怎么办?2022新年闲唠
9:26
-
【亦】简单几步,把手机变成最强HDR游戏显示器
9:52
-
【猿亦】黑客帝国5:穿越2077!电脑领奖横跨半个中国!
8:36
-
【亦】元宇宙是未来?不,已经在做了
12:28
-
【直播回放】挑战!用弹幕通关原神 | B站1024程序员节活动
2:26:39
-
不为人知的AI真神!Ilya Sutskever!
19:25
-
聊聊MCP:AI大一统要来了?
5:37
-
Mac接口进化史
10:58
-
我让AI教我学习,结果她骂我!
10:25
-
国产大模型新赛季:五强争锋
13:55
-
美国人的AI理想,要靠中国人来实现?
15:21
-
iPad+AI>PC?我们又锐评了一波苹果!
8:08
-
体验一下腾讯的裸眼3D掌机
4:37
-
AI:就你叫赌怪是吧
10:49
-
我后悔让AI看B站了...
6:59
-
我做了一个AI版微信,七进七出富婆群
9:01
-
AI读心术?我们花了5个月,给乡村孩子开源了一套房树人心理测试系统
21:36
-
我们决定让全B站白嫖,只为找到最强大模型!
11:10
-
100G评论!我们从B站挖出了什么东西?
13:07
-
让AI学散户炒股?一个月亏掉26%!
9:01
-
暴躁AI在线折磨!我让AI盯着我,骂好了我的弯腰驼背
11:55
-
DeepSeek干翻弱智吧!feat.bilibili新国辩
9:53
-
我用AI做了个网恋外挂!
7:04
-
200个AI能帮贾老板挽救西贝吗?MiroFish模拟多重宇宙!
11:44
Description
我们制作了一个基于真实用户反馈进行排名的大模型横评网站!大家可以在上面免费使用各种大模型,一起找出各个门类下的最强大模型! 林哥的大模型野榜传送门 -> lyihub.com 欢迎大家狠狠白嫖,咱们一起找出那个最强大模型! 大家也可以进群交流!添加公众号【林亦LYi】,发送“入群”上车! AI#DEA大赛传送门 -> aidea.lyihub.com 大赛不追求参赛作品有啥用,主打一个乐!有任何好玩的项目,都欢迎来官网报名! 后面我们会在深圳举办决赛,咱们一起选出最好玩的 AI 项目!线下见!
Comments
简单总结,花点费用接API让用户使用,让大量用品喂数据及打分来实现节省购买数据或人工成本。一旦项目数据成熟可快速大量变现。互联网免费永远是最贵的。[歪嘴]
♥ 566 ↩ 27
干得漂亮,这就是AI世界的“大众点评”,注意产权保护,后期有商业化的概率的,不要浪费了好东西
♥ 250 ↩ 11
好封面[doge]
♥ 143 ↩ 1
分享一个很有意思的事情,我这边用“一款可以梦到电子羊的仿生人”这句话测试过很多AI,得到的结论是,只有ChatGPT 4o、ChatGPT 4mini、Claude3.5 Sonnet这三款能get到我这句话是来源于银翼杀手这部电影的小说原作,因为只有这三款把仿生人翻译成了Android,而书名恰好就是《Do Androids Dream of Electric Sheep?》,所以一直以来这两个AI都是我认为翻译领域比较强大的。但是,在用UP的竞技场测试是,ChatGPT和Claude一次都没有翻译出Android这个词,其它的大模型更没有。我甚至有点怀疑是不是这俩大模型更新过了,翻译出来的结果变了。但是当我用一个新号重新去测试ChatGPT和Claude时,它们又能完美的把仿生人翻译成Android,从没有一次翻译成别的。同理,我测试了一些国产AI综合体,都是采用调用API模式,这些也都没有翻译出Android这个词。因此,会不会是因为调用API得到的结果和直接在大模型官网里询问的结果会有差异呢?如果是这样的话,那我觉得林哥的竞技场似乎也得想想别的办法了。也欢迎大家用这句话一起来测试一下,看看你们在API调用翻译的结果,和直接在大模型官网翻译的是不是会有较大出入。
♥ 116 ↩ 8
简单的来说,有能力有chatGPT的和愿意为它的4o模型买单的,openAI现阶段仍然碾压其它模型。特别是chatGPT-s,这个定制化模型的功能强的离谱。如果是工作需要,比如说程序员,目前还是不要寄希望于国内AI模型,正确率和可参考价值chatGPT领先太多了,特别是在启用chatgpt-s授权github和进行项目同步后,直接让开发进入简单模式。 当然,目前国内翻墙都难,需求不高没必要花20美元的价格订阅chatgpt会员的,国内的免费版也是足够了
♥ 164 ↩ 7
课代表总结: 为了找到最强大模型,视频制作者搭建了一个大模型竞技场,免费开放给用户使用。这个竞技场借鉴了Chat Bot Arena的ELO机制,让模型和模型进行对抗,用户提问并打分,以评判模型的表现。这个排行榜解决了传统测试方法中作弊问题和分数不可靠的问题,更加贴合实际使用需求。排行榜将模型表现细化到六个评价维度,并引入AI自动判断对话维度,提升用户体验。排行榜还提供了模型详细介绍、价格信息、官网链接等,方便用户找到适合自己的模型。 要点: - 搭建大模型竞技场,免费开放给用户,让模型和模型对抗,用户提问并打分。 - 细化评价维度,引入AI自动判断对话维度,提升用户体验。 - 提供模型详细介绍、价格信息、官网链接,方便用户找到适合自己的模型。 哇,这个大模型竞技场太有趣了!它不仅让模型之间互相比拼,还让用户体验感更加贴近现实。模型们就像在竞技场上战斗的勇士,而观众则像裁判一样,决定着胜败。这样的测试方式简直太棒了!让我们在乐趣中寻找最强大模型吧! --内容由@AI视频总结 生成,仅供娱乐【关注自取总结工具】
♥ 160 ↩ 1
训飞综合第二超乎我的想象,在我个人主观感受中从来未进入到主流,我不知道发生了什么问题。
♥ 88 ↩ 7
为了防止模型速度慢被打低分,可以设置为不回答完不许打分嘛
♥ 65 ↩ 4
别的能力我不好说,但是在中英翻译这个单一赛道,我个人觉得综合表现最好的是deepseek(所以看到这个模型在翻译这项的排名如此之低很惊讶),网页翻译和字幕翻译都非常棒,俚语网络用词都能翻译的很好。而且很少出现幻觉,这个很重要,其他模型经常改变句子原意,还有就是一些专有名词\英文简写\新兴词汇它能保持原文不会强行翻译,其他模型经常出现强行翻译的情况。
♥ 77 ↩ 10
你这配色有点熟悉,好像在哪见过
♥ 75 ↩ 9
自曝了
♥ 54 ↩ 1
Chat.lmsys.org 是有分类对比的啊,不是只有总分 分类里面coding也是有的
♥ 50
有个小建议,既然后台存储了所有测试的结果,那可不可以开发一个根据你的提示词推荐大模型的功能~比如我这会儿可能想用AI进行某一个特定领域的论文润色,那或许可以根据我输入的内容匹配类似的已有测试结果,然后即时生成排名
♥ 52 ↩ 1
deepseek的大模型质量挺高的,在很多榜单也能排名前列,可是在up主 林亦的排行榜上几乎都排倒数几名,有人知道为什么吗?
♥ 43 ↩ 19
lmsys有不同领域的榜单啊,code,chinese什么的都有
♥ 42 ↩ 1
这个榜单最好的大模型第二名是讯飞星火,gpt第四......细分项角色扮演里claude排第六...... 说实话角色扮演一栏付费用户用钱和牛子投票,现在最火的相关社区群里大家一致认为claude遥遥领先。不可能作假的。这排行榜测了啥
♥ 46 ↩ 6
支持一下,通义千问果然是综合排名第一
♥ 37
[笑哭][笑哭][笑哭] 这个问题,很多大模型都跪了: 数字 9.9 和 9.11 哪个大?
♥ 30 ↩ 8
所以代码排行呢,程序员很需要
♥ 25 ↩ 17