漫话开发者 - UWL.ME Mobile
Loading more...
漫话开发者 - UWL.ME Mobile

近日,分词器研究者Sander Land复现了类似Claude当前使用的分词器,发现其词表规模仅约15000个条目。这一结果与近年来大模型“词表越大越好”的主流趋势形成明显反差。由于大模型最终输出层的softmax计算成本与词表大小直接相关,较小的词表可以显著降低计算量和显存占用。有分析认为,Anthropic可能是在针对最终softmax层带来的瓶颈进行工程优化,通过更紧凑的分词器设计来提升训练效率和推理性能。文章进一步探讨了这种选择可能的实现方式,以及它对模型训练动态、多语言覆盖能力和长尾表达处理的影响。如果这一策略被验证有效,可能会影响后续大模型在分词器设计上的技术取舍。

核心要点

  • 复现显示Claude当前分词器词表仅约1.5万条,明显小于主流大模型
  • 较小词表可缓解最终softmax层带来的计算与显存瓶颈
  • 该设计可能挑战“词表越大越好”的趋势,影响模型训练与多语言表现

Read more >