Description
https://www.youtube.com/watch?v=nfBbmtMJhX0
本视频标题,简介,字幕,时间戳均为ai生成,注意甄别
OpenAI正式推出新一代实时语音模型GPT-4o及配套API,实现三大技术突破:
原生语音理解:端到端Speech-to-Speech架构,支持情感感知、多语言无缝切换,延迟降至毫秒级;
通信协议升级:新增SIP支持,兼容传统电话系统与WebRTC,企业可快速集成AI客服;
MCP生态扩展:首次将模型上下文协议(MCP)引入语音交互,实现动态工具调用(如查询数据库、执行业务逻辑)。
发布会演示涵盖情感表达、指令遵循、图像输入等场景,T-Mobile现场展示4天搭建的设备升级AI助手。开发者即日起可接入API构建实时语音应用。
用到的工具:
https://github.com/yt-dlp/yt-dlp
https://ffmpeg.org/
https://huggingface.co/TEN-framework/ten-vad
https://huggingface.co/microsoft/Phi-4-multimodal-instruct
https://pypi.org/project/pymss/
https://hf-mirror.com/pcunwa/Kim-Mel-Band-Roformer-FT
Doubao-Seed-1.6-thinking
代码整理完后开源,这次试着把vad换成了ten-vad,感觉比nemo好用,nemo的多语种vad总是提前截断。asr换成了phi-4-multimodal-instruct,这模型实在太慢了,但是又没好的多语种asr,要是有api白嫖好了,默认还是用senenvoice了。此视频仅为效果展示,审核大大手下留情
Comments
宝宝还没睡呀
♥ 4
openai还是强
♥ 2
ai真的华人天下,老美招了这么多亚洲面孔[吃瓜]
♥ 1
宝宝好厉害
♥ 1 ↩ 1
居然支持sip
评论区是什么仙家对话
更像人 说话了,进步明显。
期待萝莉音 小白菜早上好
chatgpt确实好用