Matt Pocock 科普:如何理解 LLM 的 token【中英字幕】

合集 · Matt Pocock 科普 (6)

  1. 16:19
    Matt Pocock 科普:大多数人根本没搞懂 agent 到底是什么【中英字幕】
  2. 21:08
    Matt Pocock 科普:如何理解 LLM 的 token【中英字幕】
  3. 28:22
    Matt Pocock 科普:为什么永远不能盲信 LLM【中英字幕】
  4. 19:30
    Matt Pocock 科普:上下文窗口并非越大越好 —— 多数开发者没真正理解 context window【中英字幕】
  5. 4:51
    Matt Pocock 科普:MCP 协议入门 —— 2 分钟搭好一个 MCP Server【中英字幕】
  6. 18:52
    Matt Pocock 科普:为什么代码库比 prompt 更影响 AI 编程效果?用深模块架构治 AI 读不懂你代码的病【中英字幕】

Parts

  1. P1 · 【中英字幕】Matt Pocock 科普:如何理解 LLM 的 token
  2. P2 · 【中配中字】Matt Pocock 科普:如何理解 LLM 的 token
Description
Matt Pocock(@mattpocockuk)用 TypeScript 代码把 LLM 的 token 从头讲透——从计费、词表构造到为什么不同模型对同一段文本算出不同的 token 数。

他在波兰一场 AI 工作坊上问"知道 token 是什么的请举手",结果只有约三分之一的人举手——所以做了这期视频,给天天用 LLM 但没搞懂底层原理的开发者补课。

看点:
1. token 计费的真相——input 和 output 单价不同,同一个 "hello world" 不同模型算出不同 token 数
2. 分词器到底在干什么——从字符级到子词级,词表大小如何决定一句话被切成几块
3. 生僻词和小语种的隐性成本——为什么用 Haskell 比 JavaScript 更费 token

关键内容:
· 计费模型:input/output token 单价不同,用 AI SDK 实测 Claude 3.5 Haiku vs Gemini 2.0 Flash
· token 本质:每个单词/子词映射到一个编号,LLM 在数字上运算而非文本
· tiktoken 与 o200k_base:OpenAI 的分词器和 GPT-4o 用的编码
· 词表构造:用 "the cat sat on the mat" 演示从字符级到子词级的演进
· 词表大小的权衡:1000 → 50000 → 200000,越大越高效但模型越臃肿
· 生僻词与语言效率:Lewis Carroll 造的 "frabjous" 被拆成 4 个 token;JavaScript 比 Haskell 省 token

来源:
· 作者:Matt Pocock(@mattpocockuk)
· 原视频:https://www.youtube.com/watch?v=nKSk_TiR8YA
· 作者网站:https://www.aihero.dev(AI Hero newsletter)
· 代码:https://github.com/mattpocock/ai-sdk-tips/tree/main/exercises/03-tokens

中英双语字幕,AI 辅助转录 + 翻译并经人工校对,技术术语已对齐。
如有不准确之处,欢迎在弹幕或评论指出。

Comments

阿杰skm 4d ago

看完这个视频终于搞明白token怎么计费了,之前一直稀里糊涂的,感谢up主补课。

一小口奶酪 28d ago

Bro 走的是冯诺依曼路线