捧星拾月 2024-05-24 我有些眉目了,人类在说话的时候确实是直接事先完全理解了自己要表达的意思,然后再组织语言框架(基于语法规则和常用说话方式,由于经常说话,这个过程人几乎是无意识地就发生了)之后填入具体的词语来组成一句有意义的句子。比方说你想要突然说出一大堆有逻辑的话,肯定会卡一小会想想该怎么说,或者你想变得文邹邹一点说话,也会有这样的反应。 但是GPT是那种用前面的文本来预测后面要说啥的模型,这一点上和人类完全不同。不过,如果我的想法是正确的话,我不禁开始思考,ai明显并没有事先完全理解它的整个回答,一直是走一步说一步,最后回答完了整体看起来确实是一种“理解了问题”应有的表象,但是它的“理解”是基于人类先前的“理解”,某种程度上相当于复述一个“平均的人类”的话,这样的“理解”算是真正的“理解”么?[思考]。 当然我要是一开始就理解错了那就没事了[难过]。 ♥ 229 ↩ 17
漫士沉思录 2024-05-24 纠正一个重要的失误:输入法只看前一个词应该是2-gram model,这里的n应该是包含这个预测词在内的窗口大小,而不是上文窗口,有一个1的差别[捂眼] ♥ 153 ↩ 4
Duawieh 2024-05-24 给大家推荐一本书,邵浩、刘一烽编写的《预训练语言模型》。 这本书不太厚,300页左右,图文并茂地讲述了语言模型的发展历程和运作原理,对于喜欢广泛涉猎而不追求专业性研究的读者,它的确可以提供很好的定性说明。 在阅读过这本书之后,我觉得 up 主的讲述同样条例清晰举例形象,在 B 站具有较好的受众群体广度。[给心心] ♥ 96 ↩ 2
银河赤岸 2024-05-24 看到up讲“预测下一个语素”所带来的对词语的理解,这让我想到了小时候语文课上的一个常见问题——解释词语。我们用熟悉的词语解释一个生词帮助理解,但是所谓熟悉的词语又该怎么解释呢?用曾经更熟悉的词语理解吗?那熟悉的词语又怎么变熟悉的呢?如果一层一层深入下去溯源,第一个词是怎么理解的呢?因此我觉得很难定义词语的意思。今天看了up的视频我突然又想起了小时候的疑惑:我们对词语的理解,或者说对于词语含义的定义,可以用基于大量语境的统计规律解释。也就是说,定义一个词语含义的是所有它的用法的集合,而不是反过来。就好像现在我们高中生在学圆锥曲线,它可以用点的集合定义,也可以用射影几何里切线组的集合来定义,但本质上,它也是集合来定义的……所以人类的语言,显然不是先学会了语法模型后学会说话,所以其实也是统计模型。这就是为什么大家都在强调学外语口语语境的重要[doge]就像背单词,要背的不是“用汉语解释词汇”,而是这个单词的“所有使用集合”(bushi) ♥ 87 ↩ 3
AI视频小助理 2024-05-24 --本内容由 @无法对和紗说谎 大佬下凡召唤,热心市民@AI视频小助理闪现赶来 一、语言大模型的原理和局限,以及如何理解人类语言的规律。大模型并不能完全模仿人类的思维方式,但可以完成几乎任何语言任务。 00:01 - 语言大模型成为最接近人的AI,能写文案、读论文、写代码样样精通 00:38 - 大模型说话方式非常不一样,每次接话尾属于是脚踩西瓜皮 02:57 - 语言规律的本质在于如何传递信息和意义,语言的规律本质上就是理解每个token的含义以及他们以什么样的内在规律一个接一个的出现 二、语言模型的威力以及人类使用语言的灵活性,解释了为什么基于语法的建模方法行不通,并详细讲解了统计语言模型的原理和应用。 04:14 - 语言模型的力量在于即使没有特定句子也能说出它 04:28 - 语法只是规定了基本规则,不能描述语言的本质 05:51 - GT本质上是一个语言模型,通过接化尾实现语言理解,类似输入法的联想 三、大模型的训练方法以及其强大的语言理解能力,通过自回归生成可以解决各种问题,具有通用的智能。 08:29 - 大模型通过学习前面的词预测下一个词,涉及词汇向量和运算。 09:01 - 大模型预测下一个词的信息不仅限于前一个或两个词,而是之前所有的内容。 12:40 - 大模型通过自回归生成实现续写对话和回答,具有通用智能的潜力。 四、基于千亿参数的对话模型——质朴青岩,它可以成为学习生活中的好帮手,同时也可以用于数据分析和智能体创作等领域。 12:42 - 质朴AI带来了千亿参数的对话模型,代表本土大模型。 13:09 - 大模型能帮助我们处理大量专业知识和信息,成为博学的助手。 15:27 - 大模型需要大量语料库进行训练,需要超级计算机进行运算,成本高昂。 五、大模型的应用和限制,强调了大模型只是在语言的符号中来回,难以处理复杂的现实问题,但可以成为个人助手和老师。 16:57 - 大模型理解语言,创造个性化内容 18:24 - 大模型处理语言符号,总结规律,但无法理解现实世界 20:26 - 大模型是生活中的帮手,研究深入,未来可能有更深刻的理解 实名羡慕up这溢出屏幕的才华[点赞][点赞][点赞],YYDS!快来一键三连吧[热词系列_优雅] ♥ 37 ↩ 4
狗狗猫猫兔兔头中大奖 2024-05-25 有一点有点不认同,人在说话之前,脑子里想好一句话的过程其实也可能是一个字一个字出来的,只是最后一口气从嘴巴里输出而已。只是这个一个字一个字的生成过程自我感知不明显,以为是自己按语法组织出来的,但有时候自己有些话生成不通顺,你会反复在心里重新选择词汇使其通顺,也有时候别人说个词,你能条件反射接上,每个人可能接的都不一样,这些就是神经网络记忆的不同反射。 ♥ 34 ↩ 3
云端悠 2024-05-24 我理解的“涌现”,就和人的开窍差不多。 学习初期,知识点a 依赖b,c,d 去解释。 只是点b依赖 a, c, g, h。 知识点c依赖 a, b, f, k 。。。 初期有大量知识点存在相互依赖,循环解释的现象。 顾头顾不住尾,天天炒冷饭,学了后面 忘了前面。似乎每个知识点都是孤立的。 可一旦这个领域的基础知识点被记住,形成稳固的网络,那么今后该领域的其他新知识 则很容易触类旁通,一点就懂。因为新知识都依赖基础知识,不再有循环依赖的现象。 所以我认同学习计算机软件的一个特别反直觉的学习方法:初期学习时 大量背代码,抄代码。才能快速度过痛苦的入门阶段。 智力就是建立在记忆的基础上的,很多基础知识就是凭空印在脑子里,没有缘由。大量基础知识印在脑子里,相互依赖,他们自己就形成了“自圆其说”的解释。当你开窍的时候,完全无法解释:为什么现在懂了,同样的解释,去年却无法理解。 记忆力差的人,神经网络建立新链接的速度不如聪明人,就得用笨办法快速度过艰难的入门阶段。 ♥ 31 ↩ 2
rough_tale 2024-05-24 人类对语言的理解感觉也是建立在现实世界的映射上的。真实存在的物体本来无名,但我们为它创造了一个词汇作为映射。 从本期视频我的感受是人类和大模型对于语言的理解本质都是统计模型,人类是在统计实物和词语间的映射关系,大模型是在统计词语和词语间的映射关系。 ♥ 24 ↩ 1
漫士沉思录 2024-05-25 捞捞自己的视频 里面有一个重要的错误需要纠正:只看前一个词预测后面一个是bigram也就是2 gram,而不是1 gram。 此外,gpt不能生成20个字的话的重要原因是,这需要在说话之前预先规划,自回归无法在说之前处理这件事,更不能在到20的时候清楚意识到到限制了得赶紧停。这些都揭示了自回归的局限性 ♥ 16
随机沙拉碗 2024-05-24 话说关于最后那个涌现现象,有篇paper站出来说是因为非连续的metric让结果看起来像涌现,实际上换个metric可以看到模型性能是在平稳地爬坡。当然你如果非说这个非连续metric更符合实际,好像也是 ♥ 13
Comments
兄弟们智谱它说得对吗[脱单doge]对的话我就转发给漫士导师了[脱单doge]
♥ 404 ↩ 14
我有些眉目了,人类在说话的时候确实是直接事先完全理解了自己要表达的意思,然后再组织语言框架(基于语法规则和常用说话方式,由于经常说话,这个过程人几乎是无意识地就发生了)之后填入具体的词语来组成一句有意义的句子。比方说你想要突然说出一大堆有逻辑的话,肯定会卡一小会想想该怎么说,或者你想变得文邹邹一点说话,也会有这样的反应。 但是GPT是那种用前面的文本来预测后面要说啥的模型,这一点上和人类完全不同。不过,如果我的想法是正确的话,我不禁开始思考,ai明显并没有事先完全理解它的整个回答,一直是走一步说一步,最后回答完了整体看起来确实是一种“理解了问题”应有的表象,但是它的“理解”是基于人类先前的“理解”,某种程度上相当于复述一个“平均的人类”的话,这样的“理解”算是真正的“理解”么?[思考]。 当然我要是一开始就理解错了那就没事了[难过]。
♥ 229 ↩ 17
纠正一个重要的失误:输入法只看前一个词应该是2-gram model,这里的n应该是包含这个预测词在内的窗口大小,而不是上文窗口,有一个1的差别[捂眼]
♥ 153 ↩ 4
给大家推荐一本书,邵浩、刘一烽编写的《预训练语言模型》。 这本书不太厚,300页左右,图文并茂地讲述了语言模型的发展历程和运作原理,对于喜欢广泛涉猎而不追求专业性研究的读者,它的确可以提供很好的定性说明。 在阅读过这本书之后,我觉得 up 主的讲述同样条例清晰举例形象,在 B 站具有较好的受众群体广度。[给心心]
♥ 96 ↩ 2
看到up讲“预测下一个语素”所带来的对词语的理解,这让我想到了小时候语文课上的一个常见问题——解释词语。我们用熟悉的词语解释一个生词帮助理解,但是所谓熟悉的词语又该怎么解释呢?用曾经更熟悉的词语理解吗?那熟悉的词语又怎么变熟悉的呢?如果一层一层深入下去溯源,第一个词是怎么理解的呢?因此我觉得很难定义词语的意思。今天看了up的视频我突然又想起了小时候的疑惑:我们对词语的理解,或者说对于词语含义的定义,可以用基于大量语境的统计规律解释。也就是说,定义一个词语含义的是所有它的用法的集合,而不是反过来。就好像现在我们高中生在学圆锥曲线,它可以用点的集合定义,也可以用射影几何里切线组的集合来定义,但本质上,它也是集合来定义的……所以人类的语言,显然不是先学会了语法模型后学会说话,所以其实也是统计模型。这就是为什么大家都在强调学外语口语语境的重要[doge]就像背单词,要背的不是“用汉语解释词汇”,而是这个单词的“所有使用集合”(bushi)
♥ 87 ↩ 3
作为3岁小孩的妈妈,非常喜欢观察我孩子,据我观察,我儿子学习语言、理解含义和生成连贯话语的过程真的和gpt很像,
♥ 55 ↩ 3
我在质谱上问它近代越南有几个领导人,叫什么名字,结果它输出一半,突然“撤回”转而回答说不能回答我的问题,这是个什么原理呢?[笑哭]
♥ 40 ↩ 5
--本内容由 @无法对和紗说谎 大佬下凡召唤,热心市民@AI视频小助理闪现赶来 一、语言大模型的原理和局限,以及如何理解人类语言的规律。大模型并不能完全模仿人类的思维方式,但可以完成几乎任何语言任务。 00:01 - 语言大模型成为最接近人的AI,能写文案、读论文、写代码样样精通 00:38 - 大模型说话方式非常不一样,每次接话尾属于是脚踩西瓜皮 02:57 - 语言规律的本质在于如何传递信息和意义,语言的规律本质上就是理解每个token的含义以及他们以什么样的内在规律一个接一个的出现 二、语言模型的威力以及人类使用语言的灵活性,解释了为什么基于语法的建模方法行不通,并详细讲解了统计语言模型的原理和应用。 04:14 - 语言模型的力量在于即使没有特定句子也能说出它 04:28 - 语法只是规定了基本规则,不能描述语言的本质 05:51 - GT本质上是一个语言模型,通过接化尾实现语言理解,类似输入法的联想 三、大模型的训练方法以及其强大的语言理解能力,通过自回归生成可以解决各种问题,具有通用的智能。 08:29 - 大模型通过学习前面的词预测下一个词,涉及词汇向量和运算。 09:01 - 大模型预测下一个词的信息不仅限于前一个或两个词,而是之前所有的内容。 12:40 - 大模型通过自回归生成实现续写对话和回答,具有通用智能的潜力。 四、基于千亿参数的对话模型——质朴青岩,它可以成为学习生活中的好帮手,同时也可以用于数据分析和智能体创作等领域。 12:42 - 质朴AI带来了千亿参数的对话模型,代表本土大模型。 13:09 - 大模型能帮助我们处理大量专业知识和信息,成为博学的助手。 15:27 - 大模型需要大量语料库进行训练,需要超级计算机进行运算,成本高昂。 五、大模型的应用和限制,强调了大模型只是在语言的符号中来回,难以处理复杂的现实问题,但可以成为个人助手和老师。 16:57 - 大模型理解语言,创造个性化内容 18:24 - 大模型处理语言符号,总结规律,但无法理解现实世界 20:26 - 大模型是生活中的帮手,研究深入,未来可能有更深刻的理解 实名羡慕up这溢出屏幕的才华[点赞][点赞][点赞],YYDS!快来一键三连吧[热词系列_优雅]
♥ 37 ↩ 4
有一点有点不认同,人在说话之前,脑子里想好一句话的过程其实也可能是一个字一个字出来的,只是最后一口气从嘴巴里输出而已。只是这个一个字一个字的生成过程自我感知不明显,以为是自己按语法组织出来的,但有时候自己有些话生成不通顺,你会反复在心里重新选择词汇使其通顺,也有时候别人说个词,你能条件反射接上,每个人可能接的都不一样,这些就是神经网络记忆的不同反射。
♥ 34 ↩ 3
预测下一个词,简直就是我之前写作文的方法[笑哭]但我都是句内预测,只能保证句子通顺,段内意义相对关联,但全篇就经常跑题[笑哭]
♥ 33 ↩ 1
ngram那里说错了,完全不考虑上下文的才是1gram,输入法那种只考虑一个上下文token的是2-gram
♥ 32
我理解的“涌现”,就和人的开窍差不多。 学习初期,知识点a 依赖b,c,d 去解释。 只是点b依赖 a, c, g, h。 知识点c依赖 a, b, f, k 。。。 初期有大量知识点存在相互依赖,循环解释的现象。 顾头顾不住尾,天天炒冷饭,学了后面 忘了前面。似乎每个知识点都是孤立的。 可一旦这个领域的基础知识点被记住,形成稳固的网络,那么今后该领域的其他新知识 则很容易触类旁通,一点就懂。因为新知识都依赖基础知识,不再有循环依赖的现象。 所以我认同学习计算机软件的一个特别反直觉的学习方法:初期学习时 大量背代码,抄代码。才能快速度过痛苦的入门阶段。 智力就是建立在记忆的基础上的,很多基础知识就是凭空印在脑子里,没有缘由。大量基础知识印在脑子里,相互依赖,他们自己就形成了“自圆其说”的解释。当你开窍的时候,完全无法解释:为什么现在懂了,同样的解释,去年却无法理解。 记忆力差的人,神经网络建立新链接的速度不如聪明人,就得用笨办法快速度过艰难的入门阶段。
♥ 31 ↩ 2
漫士等众多知识区UP主是B站真正的灵魂所在
♥ 29
人类对语言的理解感觉也是建立在现实世界的映射上的。真实存在的物体本来无名,但我们为它创造了一个词汇作为映射。 从本期视频我的感受是人类和大模型对于语言的理解本质都是统计模型,人类是在统计实物和词语间的映射关系,大模型是在统计词语和词语间的映射关系。
♥ 24 ↩ 1
捞捞自己的视频 里面有一个重要的错误需要纠正:只看前一个词预测后面一个是bigram也就是2 gram,而不是1 gram。 此外,gpt不能生成20个字的话的重要原因是,这需要在说话之前预先规划,自回归无法在说之前处理这件事,更不能在到20的时候清楚意识到到限制了得赶紧停。这些都揭示了自回归的局限性
♥ 16
话说关于最后那个涌现现象,有篇paper站出来说是因为非连续的metric让结果看起来像涌现,实际上换个metric可以看到模型性能是在平稳地爬坡。当然你如果非说这个非连续metric更符合实际,好像也是
♥ 13
不是,我还在蹲3b1b的更新你就抢先了[惊讶]
♥ 13
GPT指路@蒋工GPT
♥ 13
那量子计算机出来的时候,人类神经元是否能模拟出来?然后再导入到现有的大数据语言模型里面,现在缺少想象能力啊(现在是基于现实的数据推断出来)
♥ 8 ↩ 3
最近做神经网络的课题,想到这样一个问题,能帮我看看吗
♥ 7