星星邻居 2024-08-09 合成的数据和真实数据的最大区别,就是合成数据没有经过实践检验。 要让AI能自我训练,我认为还需要一个可以让AI理解的“检验”机制,把每一轮它自己得出的数据都检验一遍,再进入下一轮。 但这怎么做到,就很不明朗了。 ♥ 30 ↩ 4
赞美基督 2024-08-07 合成数据完全没有问题,现有的transform架构由goole提出,也只有goole真正的走出了下一步,Gemini 1.5 Pro 0801和现有的许多模型有了显异的差距,OpenAI提出的ChatGPT很有意思,但并不是goole transform结构的唯一答案,在jeff dean的带领下,deep mind可以得到更多的成就,例如alpha proof ♥ 21
轻狂的萌 2024-09-03 其实最大的问题并不是合成数据本身素质行或不行,而是合成数据该如何清理,像大语言模型因为很容易区分好信息和烂信息,所以光用chatgpt生成的内容也能炼出不错的LLM。尽管如此,据传因为生成数据的成本远远大于采集成本,openai在模型的pretrain阶段还是更愿意使用经过千张A100筛选过后的采集的数据[doge] ♥ 2
WESYES 2026-02-12 大模型在生成数据时,倾向于生成概率较高的“常见”内容,而那些极具创造性、生僻或带有细微差别的“长尾”信息(罕见事件)会被模型忽略或平滑掉。 比喻:如果人类写文章有100种风格,模型可能只会模仿最常见的10种。第一代模型生成的语料里,剩下的90种稀有风格就消失了。 当用这些“平庸化”的数据去训练第二代、第三代模型时,模型所能接触到的数据分布范围会越来越窄。模型会逐渐把全世界简化成一个单一的、扭曲的平均值。 结果:到了最后几代,模型生成的输出要么是完全重复的废话,要么是看似通顺但完全脱离现实逻辑的胡言乱语(论文中展示了模型最后开始疯狂重复毫无意义的段落)。[doge] ♥ 1
Comments
模型过拟合现象,AI刚出来的时候就已经有不能用AI喂AI的规矩了。AI生成的数据它本来就只包含自己的特征。自己喂自己只会强化这种偏见没法学习到新东西
♥ 80 ↩ 4
所以为什么呢?合成数据和真实数据这两个数据域之间到底有什么差别,能够使ai出现如此崩溃现象?
♥ 75 ↩ 13
能不能要花子姐姐一个电子签名[保卫萝卜_哇]
♥ 43 ↩ 5
合成的数据和真实数据的最大区别,就是合成数据没有经过实践检验。 要让AI能自我训练,我认为还需要一个可以让AI理解的“检验”机制,把每一轮它自己得出的数据都检验一遍,再进入下一轮。 但这怎么做到,就很不明朗了。
♥ 30 ↩ 4
花子姐姐越来越成熟了[给心心]
♥ 21 ↩ 1
合成数据完全没有问题,现有的transform架构由goole提出,也只有goole真正的走出了下一步,Gemini 1.5 Pro 0801和现有的许多模型有了显异的差距,OpenAI提出的ChatGPT很有意思,但并不是goole transform结构的唯一答案,在jeff dean的带领下,deep mind可以得到更多的成就,例如alpha proof
♥ 21
这样说数据标注工作是永远不会结束的了
♥ 16
模型本质学的是数据分布,模型自己的输出的数据的分布会比较单一,这样的数据给下一代学不了什么新东西,但是会丢失信息,这就是为什么会越来越烂
♥ 15
电子遗传学
♥ 14 ↩ 1
人也会出现模型崩溃
♥ 4
可以理解,就想那个著名的鸡汤,0.99^365 < 1.01^365
♥ 4
强烈要求ai产业规范化,现在最好的做法就是ai生成的内容要在合适的地方声明,即方便人类辨别,又方便后续ai训练识别。
♥ 3 ↩ 1
总的来说,纵观人类历史所有的经验以及知识已经到头,三体人还是存在的
♥ 3
学而不思则罔,思而不学则殆
♥ 3
第一投币的[doge]
♥ 3 ↩ 1
其实最大的问题并不是合成数据本身素质行或不行,而是合成数据该如何清理,像大语言模型因为很容易区分好信息和烂信息,所以光用chatgpt生成的内容也能炼出不错的LLM。尽管如此,据传因为生成数据的成本远远大于采集成本,openai在模型的pretrain阶段还是更愿意使用经过千张A100筛选过后的采集的数据[doge]
♥ 2
误差累加了吧
♥ 2 ↩ 1
原来我的突发奇想,是吃屎[笑哭]
♥ 2
大模型在生成数据时,倾向于生成概率较高的“常见”内容,而那些极具创造性、生僻或带有细微差别的“长尾”信息(罕见事件)会被模型忽略或平滑掉。 比喻:如果人类写文章有100种风格,模型可能只会模仿最常见的10种。第一代模型生成的语料里,剩下的90种稀有风格就消失了。 当用这些“平庸化”的数据去训练第二代、第三代模型时,模型所能接触到的数据分布范围会越来越窄。模型会逐渐把全世界简化成一个单一的、扭曲的平均值。 结果:到了最后几代,模型生成的输出要么是完全重复的废话,要么是看似通顺但完全脱离现实逻辑的胡言乱语(论文中展示了模型最后开始疯狂重复毫无意义的段落)。[doge]
♥ 1
《谷歌翻译20次》
♥ 1