Matt Pocock 科普:如何理解 LLM 的 token【中英字幕】
合集 · Matt Pocock 科普 (6)
-
Matt Pocock 科普:大多数人根本没搞懂 agent 到底是什么【中英字幕】
16:19
-
Matt Pocock 科普:如何理解 LLM 的 token【中英字幕】
21:08
-
Matt Pocock 科普:为什么永远不能盲信 LLM【中英字幕】
28:22
-
Matt Pocock 科普:上下文窗口并非越大越好 —— 多数开发者没真正理解 context window【中英字幕】
19:30
-
Matt Pocock 科普:MCP 协议入门 —— 2 分钟搭好一个 MCP Server【中英字幕】
4:51
-
Matt Pocock 科普:为什么代码库比 prompt 更影响 AI 编程效果?用深模块架构治 AI 读不懂你代码的病【中英字幕】
18:52
Parts
Description
Matt Pocock(@mattpocockuk)用 TypeScript 代码把 LLM 的 token 从头讲透——从计费、词表构造到为什么不同模型对同一段文本算出不同的 token 数。 他在波兰一场 AI 工作坊上问"知道 token 是什么的请举手",结果只有约三分之一的人举手——所以做了这期视频,给天天用 LLM 但没搞懂底层原理的开发者补课。 看点: 1. token 计费的真相——input 和 output 单价不同,同一个 "hello world" 不同模型算出不同 token 数 2. 分词器到底在干什么——从字符级到子词级,词表大小如何决定一句话被切成几块 3. 生僻词和小语种的隐性成本——为什么用 Haskell 比 JavaScript 更费 token 关键内容: · 计费模型:input/output token 单价不同,用 AI SDK 实测 Claude 3.5 Haiku vs Gemini 2.0 Flash · token 本质:每个单词/子词映射到一个编号,LLM 在数字上运算而非文本 · tiktoken 与 o200k_base:OpenAI 的分词器和 GPT-4o 用的编码 · 词表构造:用 "the cat sat on the mat" 演示从字符级到子词级的演进 · 词表大小的权衡:1000 → 50000 → 200000,越大越高效但模型越臃肿 · 生僻词与语言效率:Lewis Carroll 造的 "frabjous" 被拆成 4 个 token;JavaScript 比 Haskell 省 token 来源: · 作者:Matt Pocock(@mattpocockuk) · 原视频:https://www.youtube.com/watch?v=nKSk_TiR8YA · 作者网站:https://www.aihero.dev(AI Hero newsletter) · 代码:https://github.com/mattpocock/ai-sdk-tips/tree/main/exercises/03-tokens 中英双语字幕,AI 辅助转录 + 翻译并经人工校对,技术术语已对齐。 如有不准确之处,欢迎在弹幕或评论指出。
Comments
看完这个视频终于搞明白token怎么计费了,之前一直稀里糊涂的,感谢up主补课。
Bro 走的是冯诺依曼路线