问题
TokenCounter 使用 字符数 / 固定比例(GPT: /3.5, Claude: /4.0),对中文(1 字符 ≈ 1.5-2 tokens)、代码等场景严重不准确。预算执行是近似值。
建议
- 集成 tiktoken C++ port 或 HuggingFace tokenizers C API
- 短期可用更细粒度的启发式:ASCII / CJK / 标点分别加权
涉及文件
libs/context/include/merak/token_counter.hpp
libs/context/src/token_counter.cpp
问题
TokenCounter使用字符数 / 固定比例(GPT: /3.5, Claude: /4.0),对中文(1 字符 ≈ 1.5-2 tokens)、代码等场景严重不准确。预算执行是近似值。建议
涉及文件
libs/context/include/merak/token_counter.hpplibs/context/src/token_counter.cpp