返回案例INTERACTIVE
Tokenizer 交互 Demo
基于《Hands-On Large Language Models》Ch2 Tokens and Embeddings 的可视化练习。在前端模拟 BPE/Subword 分词,帮助建立文本到 token 到 id 的直觉。
Tokenizer Demo / 分词演示
Hands-On LLMs Ch2Tokens
我喜欢 Transformer 的注意力机制。
统计
- 字符数:23
- Token 数:13
- 平均 token 长度:1.77
快速示例
说明:此为前端简化演示,使用基于字符/词的贪心切分模拟 BPE/Subword 分词。真实 LLM 用训练好的 tokenizer(如 GPT-2、LLaMA)并映射到固定 vocab。