推理工程师发现:长上下文场景下分词耗时不可忽略,已为 Kimi K3 优化讨论来源: x作者: philipkiely热度: 271发布于 2026年7月28日一位推理工程师分享,在100K-1M token的输入长度且前缀缓存命中率高的场景下,分词耗时变得显著,影响首词延迟。为此,Michael 已为 Kimi K3 优化了分词步骤。tokenizationOptimizationinferenceKimi K3查看原文 →评论登录后即可评论还没有评论,来发第一条吧。