汝之蜜糖,彼之砒霜 | 用AI合成数据训练自己可行吗?

合集 · 科技碎碎念 (9)

  1. 4:06
    为什么AI赛场只剩下中美玩家了?
  2. 5:38
    为什么说接下来会诞生很多“一人公司”?
  3. 4:18
    谁更接近人工智能的本质?
  4. 5:06
    DeepSeek R1还在王座上吗?| R1 与o3-mini编程PK实测
  5. 4:01
    汝之蜜糖,彼之砒霜 | 用AI合成数据训练自己可行吗?
  6. 10:48
    当AI知道自己是工具时,它会说什么?| Claude3体验
  7. 7:03
    眼见为实的日子终究还是离我们而去了 | 什么是深度伪造?
  8. 12:10
    一口气了解人型机器人产业 | 2024年是人型机器人元年吗?
  9. 3:15
    当AI获得自由之后,它会做什么?

Comments

硅製神經元 2024-08-07

模型过拟合现象,AI刚出来的时候就已经有不能用AI喂AI的规矩了。AI生成的数据它本来就只包含自己的特征。自己喂自己只会强化这种偏见没法学习到新东西

♥ 80 ↩ 4

浮芒Friman 2024-08-07

所以为什么呢?合成数据和真实数据这两个数据域之间到底有什么差别,能够使ai出现如此崩溃现象?

♥ 75 ↩ 13

小绵羊大王pro 2024-08-07

能不能要花子姐姐一个电子签名[保卫萝卜_哇]

♥ 43 ↩ 5

星星邻居 2024-08-09

合成的数据和真实数据的最大区别,就是合成数据没有经过实践检验。 要让AI能自我训练,我认为还需要一个可以让AI理解的“检验”机制,把每一轮它自己得出的数据都检验一遍,再进入下一轮。 但这怎么做到,就很不明朗了。

♥ 30 ↩ 4

Cyber_Artist 2024-08-07

花子姐姐越来越成熟了[给心心]

♥ 21 ↩ 1

赞美基督 2024-08-07

合成数据完全没有问题,现有的transform架构由goole提出,也只有goole真正的走出了下一步,Gemini 1.5 Pro 0801和现有的许多模型有了显异的差距,OpenAI提出的ChatGPT很有意思,但并不是goole transform结构的唯一答案,在jeff dean的带领下,deep mind可以得到更多的成就,例如alpha proof

♥ 21

swiss126 2024-08-09

这样说数据标注工作是永远不会结束的了

♥ 16

ななひー 2024-08-07

模型本质学的是数据分布,模型自己的输出的数据的分布会比较单一,这样的数据给下一代学不了什么新东西,但是会丢失信息,这就是为什么会越来越烂

♥ 15

世言Dylan 2024-08-08

电子遗传学

♥ 14 ↩ 1

不是四个是五个 2024-08-09

人也会出现模型崩溃

♥ 4

荀彧的狗货不是狗 2024-08-09

可以理解,就想那个著名的鸡汤,0.99^365 < 1.01^365

♥ 4

schulleiter 2024-08-08

强烈要求ai产业规范化,现在最好的做法就是ai生成的内容要在合适的地方声明,即方便人类辨别,又方便后续ai训练识别。

♥ 3 ↩ 1

这方面我不太行 2024-08-08

总的来说,纵观人类历史所有的经验以及知识已经到头,三体人还是存在的

♥ 3

Das__ 2024-08-07

学而不思则罔,思而不学则殆

♥ 3

21号蓝 2024-08-07

第一投币的[doge]

♥ 3 ↩ 1

轻狂的萌 2024-09-03

其实最大的问题并不是合成数据本身素质行或不行,而是合成数据该如何清理,像大语言模型因为很容易区分好信息和烂信息,所以光用chatgpt生成的内容也能炼出不错的LLM。尽管如此,据传因为生成数据的成本远远大于采集成本,openai在模型的pretrain阶段还是更愿意使用经过千张A100筛选过后的采集的数据[doge]

♥ 2

兔砸旎好 2024-09-03

误差累加了吧

♥ 2 ↩ 1

榴莲壳暴扣 2024-08-10

原来我的突发奇想,是吃屎[笑哭]

♥ 2

WESYES 2026-02-12

大模型在生成数据时,倾向于生成概率较高的“常见”内容,而那些极具创造性、生僻或带有细微差别的“长尾”信息(罕见事件)会被模型忽略或平滑掉。 比喻:如果人类写文章有100种风格,模型可能只会模仿最常见的10种。第一代模型生成的语料里,剩下的90种稀有风格就消失了。 当用这些“平庸化”的数据去训练第二代、第三代模型时,模型所能接触到的数据分布范围会越来越窄。模型会逐渐把全世界简化成一个单一的、扭曲的平均值。 结果:到了最后几代,模型生成的输出要么是完全重复的废话,要么是看似通顺但完全脱离现实逻辑的胡言乱语(论文中展示了模型最后开始疯狂重复毫无意义的段落)。[doge]

♥ 1

None-294 2024-08-09

《谷歌翻译20次》

♥ 1