如何让AI有理有据地识别情绪?
合集 · 通义前哨站 (71)
-
【直播回放】ICLR 2025论文解读(上)——通义实验室篇
1:02:05
-
智能体工作流评估新框架:WorFBench
1:11
-
这是通义千问的来时路。
1:20
-
从单图到可驱动3D数字人生成技术讲解
15:23
-
有人问Qwen2.5-Omni 和VL的区别?
1:15
-
【直播回放】ICLR 2025论文解读(下)——通义实验室篇
1:27:46
-
通义万相2.1的3D VAE是什么?
2:03
-
多模态大模型解题新思路:mPLUG-Owl3
1:29
-
行业首发全栈MCP服务,尽在百炼平台~
0:42
-
通义万相2.1首尾帧生视频模型开源
1:29
-
【玩转MCP】手把手教你自定义部署MCP服务
1:23
-
【玩转MCP】手把手教你搭建专属MCP Agent
1:23
-
超写实3D数字人大模型(LAM)技术报告解读
1:57
-
表情、声音、说话风格一键复刻!
1:34
-
我们为千行百业而来。
0:23
-
Qwen3 来了!
0:40
-
Thinking Budget:让大模型灵活思考
1:20
-
Qwen3+MCP带来哪些新场景?
0:56
-
太好了,是Qwen的Deep Research,我们有救了
1:00
-
通义万相视频编辑统一模型VACE开源发布
1:07
-
【直播回放】通义万相视频编辑统一模型VACE开源
10:01
-
如果有Wan Day,它会是什么样子?
2:14
-
ZeroSearch:无需真实搜索也能激发模型搜索能力
2:42
-
今天来复习一下Qwen2.5-VL技术报告!
3:24
-
ParScale:一种全新的大模型Scaling Law
3:15
-
大模型如何持续进化,实现精准检索?
2:01
-
【直播回放】Qwen3-Embedding模型深度解析
59:14
-
语音识别怕噪声?CoGenAV 来破局!
2:40
-
在这里,了解通义千问的一切
0:37
-
微表情捕捉、潜台词翻译,AI“读心专家”就位!
1:36
-
理解画面捕捉细节,你的AI音效师来啦!
1:47
-
框架开源,无需邀约,即刻体验!
5:03
-
Qwen Vlo|描绘你关于世界的想象
0:57
-
10分钟,打造你的专属实时语音交互应用!
1:51
-
手机也能跑 Qwen3?手把手教你部署!
1:41
-
一句话玩转网页开发!
1:10
-
【直播回放】Ask Qwen3 Anything 2025年04月30日10点场
1:04:15
-
如何让AI有理有据地识别情绪?
52:16
-
来吧,上船,起航!
5:10
-
👂听说,Qwen3-Coder其实也能听懂大白话?
1:16
-
人人都是大导演!通义万相2.2来了!🤩
1:57
-
Github 5K+🌟WebAgent研究团队新作:WebShaper来啦
1:05
-
书画双全!Qwen-Image开源🖌
1:57
-
【直播回放】Qwen-Image技术报告解读和模型实战攻略01
2:04:47
-
音画传情 声启万相
1:05
-
什么呀?语音识别现在也要调监控啦🧐?
3:39
-
AgentScope1.0:终结智能体黑盒🗃️,打造生产级可控应用
4:03
-
🎙️ 开麦即真:CosyVoice 全面升级
1:41
-
不止入戏,更能入景🎬
1:20
-
说得更好、更准、更自然:Qwen3-TTS上线
2:35
-
原生全模态不降智
6:55
-
Qwen3-VL 看懂、理解并响应世界
2:03
-
多图编辑进化,万物皆可一键“同框”!
0:58
-
大就是好!Qwen3-Max 正式亮相
0:41
-
通义万相2.5:一句指令,玩转图像魔法
0:41
-
别让声音困住你的效率
0:44
-
通义万相2.5:一句话实现“Vibe PSing”!
0:47
-
通义万相2.5:让声音当你的视频“导演”!
0:48
-
通义万相2.5:让画面“声”动起来!
1:21
-
通义万相2.5:能听懂,也能准确执行!
0:54
-
Qwen3-Omni API上新:声形意合,令出智随
4:52
-
Fun-CosyVoice 3 重磅升级|更快、更准、更强表达力
1:15
-
Fun-ASR 全新升级|企业级抗干扰
1:21
-
「通义万相2.6」来啦!所有角色,听我指挥
0:39
-
Qwen-Image-Layered:下一代图像生成基础模型 🚀
0:51
-
进来复习!是谁8步推理1秒出图
0:55
-
【能干活的高情商语音搭子】
1:39
-
Qwen3-TTS上新,支持跨物种克隆音色!
3:19
-
Qwen-Image-2512 正式开源发布!
0:57
-
除夕!Qwen3.5来了!
1:16
-
Qwen-Audio-3.0-Realtime 发布:懂倾听,更聪明的实时语音方案
2:53
Description
本次直播课程内容重点如下: ꔷ 基础Omni展示 ꔷ R1-Omni模型训练细节与案例展示 ꔷ 如何本地部署与微调模型 通义实验室开源R1-Omni全模态情绪识别模型,R1-Omni 是业界首个将可验证奖励强化学习 (RLVR) 应用于全模态大模型的案例。我们专注于情感识别任务,强化学习机制增强了模型的推理能力、提高了视觉和听觉信息的理解能力,以及更强的泛化能力。研究结果验证了 RLVR 与 Omni 模型相结合的潜力。 模型下载:魔搭社区/Hugging Face 技术主页:github.com/HumanMLLM/R1-Omni
Comments
听声音就能听出来,经常熬夜加班[阴险]
♥ 99 ↩ 11
oi醒醒,你github仓库没了
♥ 29 ↩ 4
deepseek-r1感觉有非常强烈的过拟合感,聊着聊着就会飙一些看似牛逼其实无用的奇奇怪怪的词汇
♥ 23 ↩ 8
搞个专门在食品安全方面弄辟谣的,让中老年人免受其害[藏狐]
♥ 23
一人一个应用场景,谁先来?[doge_金箍]
♥ 12 ↩ 22
什么时候给通义APP的智能体安排一个清空聊天记录的功能?“清除上下文”删不干净真的有点难受[tv_流泪]
♥ 7 ↩ 1
不错不错, 你们那个新的qwq我很喜欢, 只要别量化, 然后和它说汉语, 别人遇到的问题我都没遇到. qwq是不是大概就是没有MoE的deepseek r1? 然后MoE的能力换了一个工具能力. 也是个办法.
♥ 4 ↩ 2
通义和千问有什么区别
♥ 4 ↩ 3
占个坑,预言一波,这玩意以后会是模型的主流形态,以后这个视频就是祖坟[吃瓜][吃瓜]
♥ 3
这个模型有可能上线ollama么
♥ 2
通通~~
♥ 2
也就是说可以通过视频+音频+文字去识别情绪?那能不能只用文字,然后把llm接入群聊去监测情绪波动之类的?
♥ 1
火钳刘明[doge_金箍]
♥ 1
UP很可能肾脏出现了问题
♥ 1 ↩ 1
AI课代表总结: 视频探讨了如何运用带有可验证奖励(RVR)的强化学习来增强AI模型的情感识别能力,并详细阐述了实验方法及其应用前景。 要点: - 📈强化学习(RVR)显著提高了AI模型在复杂场景下的表现及可靠性。 - 💪将强化学习应用于图像+文本+音频的多模态大型模型,使其具备更强的推理能力和泛化能力。 - 👨🏫在教育领域的应用展示了AI能够解释清楚的学习步骤,从而大幅提升教学质量。 - 🔒在安全监控方面,AI能综合分析视觉和音频信息,及时发现并预警潜在风险。 - 🚗自动驾驶情境中,AI同样展现出良好的实时决策能力,增强了行车安全性。
♥ 1
哇
♥ 1 ↩ 2
现在的中国互联网巨头剩下华为和小米,阿里把一手天胡牌打成平和牌,大疆和比亚迪虽然凑出硬件但没有灵魂。可惜老乔死早点不然这互联网世界会更精彩。灵魂只有安装在躯壳内才会发出有趣的光彩,不然只有黑白世界。
♥ 1 ↩ 1
有疲劳检测方面的探索吗?
♥ 1 ↩ 1
我不如ai[doge]