我们决定让全B站白嫖,只为找到最强大模型!

合集 · 科技杂谈 (65)

  1. 22:19
    万字解析黑神话动作系统!为什么天命人的大棒如此丝滑?
  2. 7:26
    雷军模拟器?一键清日常?耗时3个月,我们体验了数百款AI工具......
  3. 8:33
    刷爆朋友圈的年度总结,是怎么做出来的?
  4. 5:39
    大模型是怎么学会讲人话的?
  5. 14:20
    暴雷的英特尔,烂尾的芯片法案?
  6. 12:33
    电子游戏,科技沃土!
  7. 11:18
    AI手机,干掉App?
  8. 9:30
    我们提前做出了苹果的Apple Intelligence !?
  9. 7:10
    如何教会甲方自己给自己做广告
  10. 6:57
    关于显卡坞,我和林哥吵了一架...
  11. 10:45
    2024,电子阳痿有救了?
  12. 8:57
    我爸竟然用AI淘汰了我?
  13. 7:35
    华为AI,⚡️AI 中的 AI⚡
  14. 6:20
    英特尔:AI必须落实,我说的
  15. 8:42
    2024了 AI诈骗你顶得住么?
  16. 15:37
    不要199!免费教程速通大模型!AI是怎么学会讲人话的?
  17. 7:34
    完蛋!我被AI美女包围了
  18. 7:21
    【教程向】当AI遇到人类抽象大师...
  19. 9:58
    AI杀疯了?我们花了一年时间,总结出十款必备AI工具
  20. 8:55
    请警惕使用Vision Pro的老板
  21. 9:20
    10岁小孩也能写原神?低代码编程是噱头吗?
  22. 16:41
    我要回去当程序员了
  23. 30:32
    人类什么时候被AI送走?
  24. 10:26
    逃离香港?带大家看看我们深圳的新工作室
  25. 10:54
    聊天就能编程!我用GPTs做了个自己的数字化身
  26. 1:34
    用AI给大家抽一个华为Mate X5+iPhone 15 Pro Max|0代码编程时代来了
  27. 14:51
    灵犀通信:移动信号新高度|华为 Mate60 Pro 移动使用体验
  28. 11:32
    聊聊香港生活,顺便招点人
  29. 8:24
    华为 Mate X5 大战苹果 iPhone 15 Pro Max?2023顶级机皇之争 含抽奖预告
  30. 5:53
    我要被取代了?AI数字生态发展到了哪一步 | 腾讯全球数字生态大会
  31. 3:15
    雷布斯的机器人梦 !12999元的电子狗你会养吗?
  32. 7:43
    来评论区和AI大模型聊天吧!「鸿蒙4.0元服务开发」
  33. 4:19
    四分钟速览我国AI大模型生态建设|世界人工智能大会
  34. 8:44
    【亦】什么叫AI艺术家啊
  35. 26:12
    【亦】手机杀死了摄影?
  36. 6:34
    【亦】为啥手机屏幕越来越大?
  37. 21:43
    【亦】插帧rap画画,AI杀疯了!RTX4090深度测评
  38. 7:24
    【亦】电动汽车覆灭史
  39. 8:49
    我把B站观众做进了游戏里
  40. 16:36
    【亦】被库克“杀死”的产品:iPod touch
  41. 14:59
    【亦】学习方法分享:工具和努力一样重要
  42. 9:26
    【亦】唠唠AlphaCode:AI会写代码了,人类怎么办?2022新年闲唠
  43. 9:52
    【亦】简单几步,把手机变成最强HDR游戏显示器
  44. 8:36
    【猿亦】黑客帝国5:穿越2077!电脑领奖横跨半个中国!
  45. 12:28
    【亦】元宇宙是未来?不,已经在做了
  46. 2:26:39
    【直播回放】挑战!用弹幕通关原神 | B站1024程序员节活动
  47. 19:25
    不为人知的AI真神!Ilya Sutskever!
  48. 5:37
    聊聊MCP:AI大一统要来了?
  49. 10:58
    Mac接口进化史
  50. 10:25
    我让AI教我学习,结果她骂我!
  51. 13:55
    国产大模型新赛季:五强争锋
  52. 15:21
    美国人的AI理想,要靠中国人来实现?
  53. 8:08
    iPad+AI>PC?我们又锐评了一波苹果!
  54. 4:37
    体验一下腾讯的裸眼3D掌机
  55. 10:49
    AI:就你叫赌怪是吧
  56. 6:59
    我后悔让AI看B站了...
  57. 9:01
    我做了一个AI版微信,七进七出富婆群
  58. 21:36
    AI读心术?我们花了5个月,给乡村孩子开源了一套房树人心理测试系统
  59. 11:10
    我们决定让全B站白嫖,只为找到最强大模型!
  60. 13:07
    100G评论!我们从B站挖出了什么东西?
  61. 9:01
    让AI学散户炒股?一个月亏掉26%!
  62. 11:55
    暴躁AI在线折磨!我让AI盯着我,骂好了我的弯腰驼背
  63. 9:53
    DeepSeek干翻弱智吧!feat.bilibili新国辩
  64. 7:04
    我用AI做了个网恋外挂!
  65. 11:44
    200个AI能帮贾老板挽救西贝吗?MiroFish模拟多重宇宙!
Description
我们制作了一个基于真实用户反馈进行排名的大模型横评网站!大家可以在上面免费使用各种大模型,一起找出各个门类下的最强大模型!

林哥的大模型野榜传送门 -> lyihub.com
欢迎大家狠狠白嫖,咱们一起找出那个最强大模型!
大家也可以进群交流!添加公众号【林亦LYi】,发送“入群”上车!

AI#DEA大赛传送门 -> aidea.lyihub.com
大赛不追求参赛作品有啥用,主打一个乐!有任何好玩的项目,都欢迎来官网报名!
后面我们会在深圳举办决赛,咱们一起选出最好玩的 AI 项目!线下见!

Comments

crazyJT 2024-07-12

简单总结,花点费用接API让用户使用,让大量用品喂数据及打分来实现节省购买数据或人工成本。一旦项目数据成熟可快速大量变现。互联网免费永远是最贵的。[歪嘴]

♥ 566 ↩ 27

济洲二号 2024-07-12

干得漂亮,这就是AI世界的“大众点评”,注意产权保护,后期有商业化的概率的,不要浪费了好东西

♥ 250 ↩ 11

小蚊子zzzzz 2024-07-12

好封面[doge]

♥ 143 ↩ 1

飞云零狼 2024-08-14

分享一个很有意思的事情,我这边用“一款可以梦到电子羊的仿生人”这句话测试过很多AI,得到的结论是,只有ChatGPT 4o、ChatGPT 4mini、Claude3.5 Sonnet这三款能get到我这句话是来源于银翼杀手这部电影的小说原作,因为只有这三款把仿生人翻译成了Android,而书名恰好就是《Do Androids Dream of Electric Sheep?》,所以一直以来这两个AI都是我认为翻译领域比较强大的。但是,在用UP的竞技场测试是,ChatGPT和Claude一次都没有翻译出Android这个词,其它的大模型更没有。我甚至有点怀疑是不是这俩大模型更新过了,翻译出来的结果变了。但是当我用一个新号重新去测试ChatGPT和Claude时,它们又能完美的把仿生人翻译成Android,从没有一次翻译成别的。同理,我测试了一些国产AI综合体,都是采用调用API模式,这些也都没有翻译出Android这个词。因此,会不会是因为调用API得到的结果和直接在大模型官网里询问的结果会有差异呢?如果是这样的话,那我觉得林哥的竞技场似乎也得想想别的办法了。也欢迎大家用这句话一起来测试一下,看看你们在API调用翻译的结果,和直接在大模型官网翻译的是不是会有较大出入。

♥ 116 ↩ 8

哥布林梦想成为40k绿皮 2024-07-17

简单的来说,有能力有chatGPT的和愿意为它的4o模型买单的,openAI现阶段仍然碾压其它模型。特别是chatGPT-s,这个定制化模型的功能强的离谱。如果是工作需要,比如说程序员,目前还是不要寄希望于国内AI模型,正确率和可参考价值chatGPT领先太多了,特别是在启用chatgpt-s授权github和进行项目同步后,直接让开发进入简单模式。 当然,目前国内翻墙都难,需求不高没必要花20美元的价格订阅chatgpt会员的,国内的免费版也是足够了

♥ 164 ↩ 7

AI全文总结 2024-07-12

课代表总结: 为了找到最强大模型,视频制作者搭建了一个大模型竞技场,免费开放给用户使用。这个竞技场借鉴了Chat Bot Arena的ELO机制,让模型和模型进行对抗,用户提问并打分,以评判模型的表现。这个排行榜解决了传统测试方法中作弊问题和分数不可靠的问题,更加贴合实际使用需求。排行榜将模型表现细化到六个评价维度,并引入AI自动判断对话维度,提升用户体验。排行榜还提供了模型详细介绍、价格信息、官网链接等,方便用户找到适合自己的模型。 要点: - 搭建大模型竞技场,免费开放给用户,让模型和模型对抗,用户提问并打分。 - 细化评价维度,引入AI自动判断对话维度,提升用户体验。 - 提供模型详细介绍、价格信息、官网链接,方便用户找到适合自己的模型。 哇,这个大模型竞技场太有趣了!它不仅让模型之间互相比拼,还让用户体验感更加贴近现实。模型们就像在竞技场上战斗的勇士,而观众则像裁判一样,决定着胜败。这样的测试方式简直太棒了!让我们在乐趣中寻找最强大模型吧! --内容由@AI视频总结 生成,仅供娱乐【关注自取总结工具】

♥ 160 ↩ 1

愚无尽 2024-07-13

训飞综合第二超乎我的想象,在我个人主观感受中从来未进入到主流,我不知道发生了什么问题。

♥ 88 ↩ 7

正花级 2024-07-12

为了防止模型速度慢被打低分,可以设置为不回答完不许打分嘛

♥ 65 ↩ 4

kukakukiki 2024-07-15

别的能力我不好说,但是在中英翻译这个单一赛道,我个人觉得综合表现最好的是deepseek(所以看到这个模型在翻译这项的排名如此之低很惊讶),网页翻译和字幕翻译都非常棒,俚语网络用词都能翻译的很好。而且很少出现幻觉,这个很重要,其他模型经常改变句子原意,还有就是一些专有名词\英文简写\新兴词汇它能保持原文不会强行翻译,其他模型经常出现强行翻译的情况。

♥ 77 ↩ 10

南国小豆豆 2024-07-12

你这配色有点熟悉,好像在哪见过

♥ 75 ↩ 9

幻夢結社Official 2024-07-13

自曝了

♥ 54 ↩ 1

_at2049 2024-07-12

Chat.lmsys.org 是有分类对比的啊,不是只有总分 分类里面coding也是有的

♥ 50

惊丶羽 2024-07-12

有个小建议,既然后台存储了所有测试的结果,那可不可以开发一个根据你的提示词推荐大模型的功能~比如我这会儿可能想用AI进行某一个特定领域的论文润色,那或许可以根据我输入的内容匹配类似的已有测试结果,然后即时生成排名

♥ 52 ↩ 1

马督杠 2024-07-12

deepseek的大模型质量挺高的,在很多榜单也能排名前列,可是在up主 林亦的排行榜上几乎都排倒数几名,有人知道为什么吗?

♥ 43 ↩ 19

ABLYwpr 2024-07-13

lmsys有不同领域的榜单啊,code,chinese什么的都有

♥ 42 ↩ 1

击穿爱欲 2024-07-13

这个榜单最好的大模型第二名是讯飞星火,gpt第四......细分项角色扮演里claude排第六...... 说实话角色扮演一栏付费用户用钱和牛子投票,现在最火的相关社区群里大家一致认为claude遥遥领先。不可能作假的。这排行榜测了啥

♥ 46 ↩ 6

犬夜叉神心 2024-07-15

支持一下,通义千问果然是综合排名第一

♥ 37

发量浓密的程序猿 2024-07-16

[笑哭][笑哭][笑哭] 这个问题,很多大模型都跪了: 数字 9.9 和 9.11 哪个大?

♥ 30 ↩ 8

HEXT 2024-07-12

所以代码排行呢,程序员很需要

♥ 25 ↩ 17