紧凑高效的中文,真的不适合用与AI对话吗?

Comments

克里斯exe 2025-08-11

让我们试试豆包吧 !无论你用中文还是英语他都能搞出来奇形怪状的诡异玩意

♥ 443 ↩ 17

loveryou- 2025-08-11

那为什么不搞一个表达信息量大,信息熵还低的语言[doge]

♥ 167 ↩ 10

新和联胜大Diablo 2025-08-12

意思意思,什么意思,没什么意思一点小意思,那多不好意思,是我不好意思 你不能一边夸中文博大精深,一边又指望它指代精准

♥ 89 ↩ 52

城空燕去 2025-08-11

中文一词多意对机器来说确实是更容易混淆的,别说机器了,活了大半辈子的中国人还不是一样有你几个意思的疑惑[doge]

♥ 80 ↩ 6

NezVibe 2025-08-12

因為國外都是用英文訓練的大模型當然是英文更強,但我們國內的大部分用中文訓練,因為發現中文訓練出來的大模型更加厲害,所以用什麼要看大模型是用什麼語言訓練的

♥ 23 ↩ 10

InfinityVortex 2025-08-16

因为互联网88%资料都是英文,体量绝对差距

♥ 22

熙珩-X 2025-08-11

用代码[doge]

♥ 22

回调无神盾神 2025-08-16

其实事实就是ai实际上根本看不懂任何自然语言,ai在中文语言处理表现比英文处理差是因为训练的时候英文资源才是大头[笑哭]

♥ 21

还会睡觉 2025-08-12

中文太模糊了,有时候强烈依赖上下文和个人理解以及语言积累,再加上汉字是象形文字演化过来的书写比较难,如果母语不是汉语,我认为学习汉语的难度绝对是top1的

♥ 21

零点五倍速人生 2025-08-11

只有我使用二进制吗[doge][doge][doge]

♥ 18 ↩ 4

猫猫会念经 2025-08-11

反正我本地部署的gpt-oss用英文的输出感觉就比用中文快[笑哭]可能是因为是美国人的模型吧[笑哭]

♥ 13 ↩ 4

-_源代码_- 2025-08-11

其实就是因为聊天模型是文字生成模型,是利用上下文来实时推断这个字生成什么比较合适[doge]中文数据比较少更难生成罢了

♥ 12 ↩ 3

账号已注销 2025-08-13

其实问题非常多, 首先互联网无可争议的英文不仅语料烂大街的多, 相同内容的语料质量还总是优于中文 (Wikipedia英文数量和质量都胜过 百毒百科 你懂的). 再者训练模型是不可能不加其他语言的内容. 目前业内至少50%英文, 剩下的都是其他语言内容或者多模态的东西. 你如果反过来50%中文, 那语料质量和总数量都要缩水. 还有中文分词问题, 我 觉得 最有效 可行 的 办法 是 立法 2025年 起 中文输入 也 需要 开始 空格.

♥ 12 ↩ 9

先輩suki 2025-08-16

有没有一种可能只是因為ai一开始都是用英文资料来做训练的[笑哭]

♥ 6

左手转一圈 2025-08-11

我认为是token占用问题,同意思的一段文本,英文占用的token少而中文占用更多,导致了效率质量的降低和,用api消耗的也会更多

♥ 6 ↩ 3

一只轱辘 2025-08-11

因为市面上没有中文编程软件

♥ 6 ↩ 16

断简零墨Reiboku 2025-08-22

其实应该是中文更合适。因为LLM终究是基于Token在向量空间里的拼句游戏。中文词因为造词法和高信息熵以及对于外来语的克制,在向量空间中更密切,比如牛奶,牛肉,奶牛。milk、beef、cow缺乏共同词根,难以向量化到一起,训练也会产生更多Token。中文也可以产生法律书面语一样的严格精准的句子,只不过作为分析语,中文习惯了上下文推断句子消除歧义,所以口语经常会省略一些成分,但是这种规则完全可以用模型去训练学习,DeepSeek也能学会模仿各种贴吧、知乎平台的说话方式。最大的问题是中文互联网的有效高质量语料太少了,中文只占互联网1%左右。

♥ 5 ↩ 1

Doscalar 2025-08-12

本质上是中文分词跟英文分词不一样,从自然语言处理nlp就能看出来,中文跟英文走的是两个路子。

♥ 5

崩坏神域代打 2025-08-12

人话:中文太高级了,al就像小孩一样理解不了[吃瓜]

♥ 5 ↩ 7