返回案例
INTERACTIVE

Tokenizer 交互 Demo

基于《Hands-On Large Language Models》Ch2 Tokens and Embeddings 的可视化练习。在前端模拟 BPE/Subword 分词,帮助建立文本到 token 到 id 的直觉。

Tokenizer Demo / 分词演示

Hands-On LLMs Ch2

Tokens

我喜欢 Transformer 的注意力机制。

统计

  • 字符数:23
  • Token 数:13
  • 平均 token 长度:1.77

快速示例

说明:此为前端简化演示,使用基于字符/词的贪心切分模拟 BPE/Subword 分词。真实 LLM 用训练好的 tokenizer(如 GPT-2、LLaMA)并映射到固定 vocab。