Skip to content

P2: Token 计数纯启发式 — 非英文/代码场景偏差大 #6

Description

@ULookup

问题

TokenCounter 使用 字符数 / 固定比例(GPT: /3.5, Claude: /4.0),对中文(1 字符 ≈ 1.5-2 tokens)、代码等场景严重不准确。预算执行是近似值。

建议

  • 集成 tiktoken C++ port 或 HuggingFace tokenizers C API
  • 短期可用更细粒度的启发式:ASCII / CJK / 标点分别加权

涉及文件

  • libs/context/include/merak/token_counter.hpp
  • libs/context/src/token_counter.cpp

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

Labels

Projects

No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions