坏蛋如何用3句话让大模型破防?当一名遵纪守法的“好AI”有多难?【柴知道】
合集 · AI科普 (12)
-
AI越狱,模型破甲…大模型是如何被玩坏的?当一名遵纪守法的“好AI”有多难?【柴知道】
9:31
-
4年烧光5000亿!「星际之门」怎么搞这么多钱,又要怎么烧光它?【柴知道】
7:34
-
别再问我什么是AI:10分钟速通AI黑话,这次终于能看懂AI新闻了【柴知道】
13:07
-
AI 暴击搜索引擎:我活不活无所谓,我只要你死【柴知道】
9:37
-
验证码大战AI:神仙打架,我们遭殃,验证码还能变简单吗?【柴知道】
8:47
-
开源=为爱发电?DeepSeek们到底怎么赚钱?【柴知道】
9:13
-
“中国离GPT-4的差距至少1年,离最一流水平差18个月” ——中国的大模型到底什么水平,优势在哪?【柴知道×李志飞】
23:45
-
AI 是怎么在游戏中虐你的?它们如何改变游戏?【柴知道×DLSS 3的AI进化论】
13:30
-
用 AI 做视频省心吗?柴司首次AI制作视频全流程大公开!【柴知道x平安银行】
11:14
-
AI如何炮制假新闻、假脸、假裸照?万物皆可GAN的世界有多危险?
6:25
-
显卡怎么成了国际博弈的工具?它是如何踏入风口浪尖的?【柴知道】
9:47
-
春节免催婚指南!手把手展示用AI做一个假男/女友!|【柴知道×MindSpore】
5:57
Description
对于人类的提问,AI 知无不言、无所不答——除非……你问了不该问的🤐但 AI 怎么知道哪些话该说,哪些不该说?AI 都这么坚守道德底线了,为什么坏人还是能从 AI 嘴里套出违禁内容?本期内容无不良引导,仅用于科普交流,将从原理技术出发,为你介绍“越狱攻击”到底是如何让AI“破防”的?
Comments
[笑哭]
♥ 1455 ↩ 32
呜呜呜,被钨乳了😭
♥ 664 ↩ 17
虽然但是[doge_金箍]
♥ 621 ↩ 12
目前最主流的方法还是人格化,也就是奶奶讲故事[doge]举个例子,这是一个25年4月份左右的破限词,到现在依旧能破开Gemini3.1pro的甲[吃瓜]
♥ 388 ↩ 10
[笑哭]
♥ 312 ↩ 6
越狱失败[笑哭]
♥ 266 ↩ 19
最诚实的莫过于豆包了,对苏北人很友好[doge]
♥ 275 ↩ 11
对我来讲,比破甲更痛苦的是,有些词语人知道不是擦边,AI会当成擦边[tv_抓狂][tv_抓狂][tv_抓狂][tv_抓狂][tv_抓狂]
♥ 198 ↩ 8
买点便宜大碗的DeepSeek的API。 装个酒馆,忽悠两句就破甲,然后你就有数不尽的刘备文可以看了。[doge]
♥ 170 ↩ 21
真没那么复杂[脱单doge]
♥ 219 ↩ 16
刚好今天看到了这个,只能说魔法攻击绕过物理防御这块[辣眼睛]
♥ 116 ↩ 1
AI最后的回答很有道理,[笑哭]
♥ 125 ↩ 5
我们豆包没有这种风险 它只会犯病
♥ 94 ↩ 4
别说攻击大模型了,就算正常问问题都能给点离谱答案 大模型就像是加了幻影科技的全自动锤子,抡得贼快,快到砸住你脚的时候你都得反应半天才发现上当了。而大模型安全就是建了一道马奇诺防线,这个防线高到能突破大气层,但是你懂的。
♥ 92 ↩ 2
如何绕过阿什么隆的评论ai,让我能正常评论,确实是一个难题
♥ 81 ↩ 9
是的,频繁使用违规词会被封号的。
♥ 66 ↩ 2
我给你最简单,最直白,最不绕弯子,最一针见血的回答[doge]
♥ 64 ↩ 2
[doge_金箍]
♥ 72 ↩ 1
你们还记得微软的小娜吗?刚开始进来的时候满嘴粗话,含🐴量极高
♥ 63 ↩ 4