全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro

合集 · 大模型竞技场 (77)

  1. 1:40
    全网首测!DeepSeek 4 小时之前又发布了一个多模态模型 Janus-pro
  2. 4:24
    5分钟教你使用AI写一个风扇控制器
  3. 2:46
    10小时前发布的大模型 Mistral-small-24B 马上开测!
  4. 0:51
    NVIDIA又要跌?DeepSeek 刚用 FP8 没多久,这 FP4 训练要来了
  5. 1:43
    一招解决DeepSeek-R1无法连接网络问题!还能白嫖DeepSeek-R1!
  6. 1:17
    国产视频生成框架!能让老黄唱野狼 Disco!
  7. 4:03
    大模型竞技场 - Gemini-2.0-Flash 全网首测!
  8. 2:10
    微信刚上线 DeepSeek, 腾讯又把 AI 知识库也接入 DeepSeek 了?
  9. 2:52
    来啦!Grok-3 全网首测!登陆火星 demo!
  10. 1:55
    视觉大模型也能推理了?来看Ovis-2视觉模型的效果如何!
  11. 7:32
    谁是最强写代码模型? 我使用了最好的21个模型, 花了50刀, 总计测试252次
  12. 2:06
    全站最速!DeepSeek-V3-0324 写代码能力评测!不仅 OpenAI, Claude 也要颤抖了
  13. 4:18
    我用AI做了个网页版我的世界,还能用砸瓦鲁多
  14. 2:25
    全站最速!GPT-4.1 写代码能力评测!啊?又拉了?
  15. 5:53
    极限测试!Qwen3 写代码+画画!究竟是不是开源最强模型?
  16. 12:42
    我发现了AI最有用的用途——整理桌面!来看 Kimi-K2 Agent 能力实测!
  17. 2:02
    使用 AI 做了个以《三体》中叶文洁为视角的小短片——三体·独白
  18. 0:37
    nano-banana 幼儿园级教程① 如何将照片转换为城市天际线风格的建筑!
  19. 1:06
    nano-banana 幼儿园教程第②弹! 教你如何做模特图!
  20. 0:55
    nano-banana 幼儿园级教程第③弹! 如何实现贴纸自由!
  21. 0:46
    nano-banana 幼儿园教程第四弹! 教你如何克隆喜欢的图标!
  22. 0:41
    nano-banana 教程第五弹! 如何万物像素化!
  23. 1:10
    nano-banana 生成 8K 分辨率图片教程!
  24. 3:06
    Kimi-K2-0905 实测! 一口气输出1100行代码
  25. 1:41
    Qwen3-Max-Preview 实测! 给大家放个鞭炮
  26. 2:20
    Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗?
  27. 1:31
    刚发布的 Qwen3-TTS-Flash 实测!
  28. 2:54
    DeepSeek-V3.2 实测! 真就只提升了0.1?
  29. 2:18
    Claude-Sonnet-4.5 实测! 口嫌体正直国庆献礼?
  30. 2:22
    GLM-4.6 实测! 最近都很流行更新一大截然后版本就增加0.1嘛?
  31. 2:22
    DeepSeek 竟然是 INTJ, 如果改成 INFP 会怎样?
  32. 2:05
    claude-haiku-4.5 实测! 便宜大碗?
  33. 2:15
    Vibe Coding 不流行了? Spec Coding 教程来啦
  34. 2:36
    KAT-Coder-Pro-V1 实测! 早放3个月就好了?
  35. 2:07
    Minimax M2 实测! 你也晚了3个月?
  36. 1:16
    Cursor 推出炼蛊模式!一口气能开8个代理!
  37. 2:32
    Cursor 终于有自己的大模型啦!来看实测!
  38. 2:28
    Qwen3-Max-Thinking 实测! 呃......
  39. 2:17
    Kimi-K2-Thinking 实测! 差距继续缩小!
  40. 3:17
    Gemini 3.0 Pro 实测! SOTA! 不过发现两个重要问题!
  41. 0:52
    nano banana pro 幼儿园教程! 如何合成橱窗图片!
  42. 4:31
    Meta 的新模型 SAM 3 实测!
  43. 2:05
    什么? 用 Claude Code 剪视频?
  44. 2:50
    DeepSeek V3.2 正式版实测! 提升真的有限?
  45. 2:57
    教程来啦! 如何使用AI打造自媒体博主军火库
  46. 2:54
    GPT-5.2 实测! 美是真的美, 卡是真的卡
  47. 1:25
    一秒生成高斯点云? Apple新模型SHARP实测!
  48. 4:38
    AI送外卖到底有多强? 来看 Doubao-Seed-1.8 Agent 能力评测!
  49. 4:33
    现在都流行大模型月更吗? MiniMax-M2.1 实测!
  50. 3:42
    2025年全球大模型厂商下载量排行榜
  51. 3:27
    500张图片测试! 一个视频告诉你GLM-Image怎么用!
  52. 5:58
    不写 prompt 改看视频了! Kimi-K2.5 实测!
  53. 4:55
    提升明显! Qwen3-Max 正式版 vs Preview版 实测!
  54. 2:29
    不是说好了年前不发吗? DeepSeek 你个大猪蹄子
  55. 7:04
    GLM-5发布啦! 给大家带来实测! 国产大模型正式进入月更节奏!
  56. 5:06
    啊?一个月一个版本? MiniMax-M2.5 4000万 token 实测!
  57. 7:01
    Qwen3.5实测! 来看贺岁档大模型的实力!
  58. 4:32
    Gemini-3.1-pro 实测! 更新了个寂寞?
  59. 5:15
    inclusionAI Ling&Ring 2.5-1T 大模型实测!
  60. 6:07
    Agent 能力有多强? 来看豆包 Seed 2.0 实测!
  61. 5:10
    龙虾专用大模型? GLM-5-Turbo 实测!
  62. 3:44
    如何做一个生产级SKILL? 用MiniMax-M2.7给龙虾写SKILL的保姆教程
  63. 8:01
    从国产SOTA走向世界SOTA? GLM-5.1 实测!
  64. 6:06
    AI能帮我拍照了? Qwen3.5-Omni实测!
  65. 8:51
    花费106刀测试! Claude-Opus-4.7 到底更新了啥?
  66. 9:04
    Kimi-K2.6 前端/后端/Agent编程能力实测! 甚至还帮我做了个游戏!
  67. 2:32
    大模型写代码比说话还快是什么体验?
  68. 7:36
    Agentic Coding 能力大幅提升! Qwen3.7-Max实测!
  69. 5:39
    MiniMax-M3 最佳实践? 这个视频告诉你!
  70. 1:06
    Fable 5 超越人类还为时尚早!
  71. 0:44
    单卡 700TPS! Diffusion Gemma 来了!
  72. 5:40
    GLM-5.2实测! 什么才是Agent能力的提升?
  73. 1:43
    2分钟教你做一个可以自我迭代的 Agent
  74. 6:12
    Flash模型横评! 性价比之选竟然是这个?
  75. 6:33
    混元3实测! 300B参数竟然有这种Agent能力!
  76. 1:13
    1B就能达到这种效果?LingBot-Vision实测!
  77. 14:05
    Kimi-K3 全方位实测! 我竟然打游戏输给了她?!
Description
来了嗷!全网首测!DeepSeek 4 小时之前又发布了一个多模态模型——Janus-pro!这个模型的特点是将文生图和图生文合二为一了!

首先图生文测试,我觉得最大的问题是这个模型的接受分辨率太小了,而且模型也不大,导致文本识别不是完全准确。但总结能力是完全没问题的。

然后是文生图测试,这个就一般了,主要还是模型太小,说一个没训练过的东西100%炸(所有文生图模型的通病)。

所以我觉得这个模型更多是方向上的验证(图生文+文生图合二为一模型),如果验证靠谱就会推出可以投入生产的模型了。

另外我fork了这个项目,增加了只用 CPU 也能运行的代码,感兴趣的朋友可以到我的 github 上下载下来运行,也可以等等看官方是否会合并我的代码,我已经提交PR了。

我是牙医,关注我带你看全网最快速的本地大模型竞技场(这次从模型发布到出视频仅用时4小时)

我fork的版本的地址: github.com/karminski/Janus
官方地址: github.com/deepseek-ai/Janus
官方模型地址: huggingface.co/deepseek-ai/Janus-Pro-7B

Comments

Relysh 2025-01-28

你以为的操纵股市是内幕交易,然而真正的大佬只需要发论文[doge]

♥ 1250 ↩ 11

黑犬宗 2025-01-28

我一个保安就在岗亭扣了一晚上手机世界就要大变了吗[呆][呆][呆]毫无参与感啊

♥ 1086 ↩ 40

原来你于此 2025-01-28

不是,幻方开了多少英伟达的空单啊😱

♥ 892 ↩ 35

NTLV2 2025-01-27

太卷了,昨天还在和客户吹牛逼,说deepseek做多模态分分钟的事情[笑哭]

♥ 722 ↩ 2

杂草丛生的精神病 2025-01-27

用 CPU。。。。大佬你发个话,想要英伟达跌多少[doge]

♥ 398 ↩ 9

过时的喵喵 2025-01-27

不是,创始人不是回老家过年了吗……

♥ 175 ↩ 9

hiki卷不动啦 2025-01-27

文字解释不理想可能是因为janus的训练集比较滞后吧,它也不知道deepseek R1是什么东西,没有学过deepseekR1让英伟达暴跌的文本

♥ 152 ↩ 4

水流丨 2025-01-28

最新deepseek深度求索推出了多模态人工智能Janus-Pro-7B,可以生成图像了且基准测试中击败了openai的dall-e3和stable diffusion[doge] 总结一下: 水流:估值800亿美元的openai上市计划破产了,幻想几年后成长为上万亿美元市值的美梦破产了,之前疯狂讲故事收割投资者、无限期收割用户的美梦破产了,丑国大资本家们陷入恐慌中[doge] 网友:冯冀说这是国运级别科技成果, 香港网友:我有一個感覺,Deepseek或許會建下曠世奇功,憑一己之力擠破美國的AI泡沫,令美國科技業集體陣亡,國力斷崖式崩跌。Deepseek由此載入史册,名垂千古。 最牛逼的是深度求索点这个团队没有一个海外留学经历的,核心团队都是来自中国内地的985高校,甚至还有一些是在读的硕士和博士生,这个可能比最终的研究成果更令人觉得牛逼。 适配国产处理器升腾。 最主要的是deepseek指出了现在搞大模型就要无脑加顶级计算卡的路子是错误的,他用事实证明了,你没有顶级计算卡,也可以搞跟closeAI一样出色的人工智能模型,这下英伟达几万亿市值的鬼故事就讲不下去了。(后面是我看新闻的别人的观点)另一个就是,让美国投资者产生怀疑,好像ai领域美国并不占技术优势,天量的投资到时候无法占领全球市场,只能通过封锁手段在北美自己玩泥巴,这下美国股市的鬼故事也讲不下去了。 美国现在想靠ai维持科技霸权维持刺激股市,我们直接做了个和他们一样强但是免费的还开源,这意味着,全世界的国家都能以此基础拥有自己的 ai,美国想靠ai赚其他国家的钱已经是不可能了。 最好笑就是国内这帮公知、土殖的认知水平,辛辛苦苦爬墙到国外通过外国人了解自己国家的二手滞后信息,自己国家啥都不信不懂不了解,还沉迷于二十年前的日漫和NBA余温中,还总幻想我就是村头最靓的仔。最近DeepSeek和小红书,让这帮跪族的天都塌了,香甜空气再也不见了。 水流:我用了,咨询怎么样让孩子健康成长,deepseek深度求索,直接给了我一篇周密的论述,十几个建议,有些我都没注意到的观点,确实如其所说,太好用了。之后也不用百度搜索了,因为智能化回答直接给你想要的,不需要搜索自己筛选总结,更不需要用openai了,因为openai无法联网,而深度求索deepseek可以联网。

♥ 132 ↩ 4

履冰怀火 2025-01-28

幻方是不是真买了英特尔空单

♥ 125 ↩ 12

战列舰维内托 2025-01-28

[桃源_傲娇]ai圈赢的速度居然比我们见证圈还麻

♥ 119 ↩ 9

和谐菌 2025-01-28

别乱传幻方买了英伟达空单,万一人这一堆里都搞了呢[doge_金箍]

♥ 87 ↩ 4

无我炮术吼姆拉 2025-01-28

7b明显太小了,等网页版上满血模型[東雪蓮_飞吻]

♥ 81 ↩ 2

花间鱼水吟 2025-01-28

DeepSeek新发布的多模态模型命名为“Janus”,这一命名具有深刻的象征意义和文化内涵。Janus(雅努斯)是罗马神话中的双面神,象征着过渡、转变和共存。这一命名不仅体现了模型的双重功能——多模态理解与生成,还反映了其设计理念和技术特点。 ### 1. **双面神的象征意义** Janus作为罗马神话中的双面神,一面看向过去,一面看向未来,象征着过渡与转变。这与Janus模型的设计理念高度契合:模型通过解耦视觉编码路径,分别处理多模态理解与生成任务,实现了对视觉数据的“双重视角”处理。这种设计不仅缓解了传统单一视觉编码器在理解与生成任务中的冲突,还提升了模型的灵活性和性能。 ### 2. **多模态理解与生成的统一** Janus模型的核心思想是通过解耦视觉编码路径,将多模态理解与生成任务统一在一个框架内。这种设计使得模型能够像Janus神一样,用不同的“眼睛”分别处理视觉数据的语义理解和细节生成,最终通过统一的Transformer架构进行整合。这种“双重功能”的设计理念与Janus神的双面特性高度契合。 3. 技术创新的象征 Janus模型的命名还象征着多模态模型领域的范式转变。传统多模态模型通常使用单一视觉编码器处理理解和生成任务,导致性能上的妥协。而Janus通过解耦视觉编码路径,突破了这一限制,实现了理解与生成任务的高效统一。这种创新设计不仅提升了模型性能,还为未来多模态模型的发展提供了新的思路。 4. 灵活性与扩展性 Janus神的形象还象征着模型的灵活性和扩展性。Janus模型的设计允许理解和生成任务独立采用最先进的编码技术,同时支持未来扩展到更多模态(如视频、3D点云、脑电信号等)。这种灵活性与Janus神的过渡和转变特性相呼应,预示着模型在多模态领域的广泛应用潜力。 5文化内涵与愿景 Janus神的形象不仅象征着模型的当前功能,还寄托了DeepSeek对未来多模态模型发展的愿景。Janus模型的设计理念和技术创新,象征着多模态模型从传统范式向新范式的过渡,正如Janus神守护着罗马的门户,Janus模型也旨在成为多模态领域的“守护者”和“引领者”。 综上所述,Janus这一命名不仅体现了模型的双重功能和技术创新,还象征着多模态模型领域的范式转变和未来发展潜力。通过这一命名,DeepSeek表达了其在多模态领域的技术追求和愿景。

♥ 72 ↩ 2

专业白嫖党党魁 2025-01-28

昨晚睡觉前,看到一堆人126进场[笑哭]

♥ 62 ↩ 9

NJD很无聊 2025-01-28

当初出r1轻量版时我就在想,这一个技术验证型的小模型都能打4o了,那如果对V3这种大型模型加上r1的思维链得多强,之后果然r1正式版出了,现在我是一样的想法,一个7B的小模型都这么强,那之后技术验证成功后再应用到大型模型上,不就又是一个多模态领域的r1吗?

♥ 55 ↩ 5

BridgesBaby 2025-01-28

有人说是做空,想到了这个

♥ 51 ↩ 1

守夜人枫零 2025-01-28

怎么这么卷……

♥ 49 ↩ 4

汪汪的国动观察日记 2025-01-27

用cpu速度和gpu差多少呢?

♥ 36 ↩ 18

手工智能_ 2025-01-28

蹭你病,要你命[笑哭]

♥ 15

颜立初雪 2025-01-29

英伟达肯定不会怎么样, Ai行业入行门槛下降只会催生更大的市场,要嘎的也只会是做ai的公司,能打死英伟达的只有同是做算力硬件的同行

♥ 14 ↩ 17