Argo v2.7.3 — 引擎激活 + 体验修复
Argo v2.7.3
这版主要干了一件事:让 150 个引擎里那些「注册了但一直没被用起来」的,真正派上用场,顺手修了一批会让搜索结果变差的小毛病。
以前不行,现在能行
1. arxiv 这类「认生」的接口,以前经常超时白等
有些搜索源对请求方式很挑剔,以前用的是最朴素的抓取方式,arxiv 实测 5 秒超时后 0 条结果。现在请求统一走了增强层:换浏览器身份、自动重试、跟随跳转。实测 arxiv 从「5 秒空手而归」变成「2 秒内 10 条有效结果」。
2. 25 个垂直引擎以前永远选不中
marginalia(独立博客)、usda(营养成分)、gov_policy(国务院政策)、cnii(日本学术)这些引擎其实都配了识别文档,但路由规则只认正则,它们永远排不上号,只能手动指定。现在语义匹配分数高的垂直引擎能自动顶上:问「独立博客 长尾」走 marginalia,问「营养成分 热量」走 usda,问「国务院 政策」走 gov_policy,问「日本 学术论文」走 cnii。
3. 查英文宏观数据以前 0 条
worldbank 和 eurostat 的国家名、指标名只认中文,「China GDP」「US inflation」「Japan population」全都查不到。现在中英文都认(还防了「focus」这类词被误认成美国)。实测 China GDP 19.5 万亿美元、Japan population 1.23 亿人,都能直接给出数字。
4. 问「今日金价」以前缓存 1 小时
48 个搜索域没配缓存时长,全部按 1 小时缓存,金价、快讯这类实时内容会过期 55 分钟。现在按时效分类:金价/快讯/天气 15 分钟,行情 5 分钟,学术资料 2 小时,百科 24 小时。
5. 说「快讯」反而查不到快讯
财联社电报这类引擎会把查询词当关键词过滤,而快讯标题里不会出现「快讯」两个字,于是全量榜单被滤空。现在纯触发词(快讯/美股/资讯)直接放行全量,具体主题(美联储/AI)才做过滤。
6. 萌娘百科这类站,搜索跳转到词条页就查不到
百科类搜索有时直接跳到词条页而不是结果列表,原来的解析器只认列表结构,于是恒空。现在能识别词条页,直接返回标题和简介。实测「初音未来」「东方Project」都能查到。
新增依赖
相比 v2.7.2 只多了一个可选依赖:
- curl_cffi(可选):模拟浏览器 TLS 指纹用的。装了之后对反爬站(比如 Cloudflare 保护的页面)抓取成功率更高;不装完全不影响日常使用。安装:
pip install curl_cffi
其他依赖不变:PyYAML(必需)、ddgs CLI(本地搜索用)、Chrome(页面截图用,可选)。
怎么装
跟之前一样,任选一种:
# 一键安装
curl -fsSL https://raw.githubusercontent.com/taxueseek/argo/main/scripts/install.sh | bash
# MCP 方式
npx -y github:taxueseek/argo
# 源码
git clone https://github.com/taxueseek/argo.git技术细节(给想看的人)
- 引擎层 HttpClient 接入(UA 轮换/重试/重定向跟随),
ARGO_ENGINE_HTTP_CLIENT=0可回退 - TF-IDF 强语义注入(≥0.6 分),通用引擎黑名单,注入位置在 primary 扶正后
- env 占位缺失过滤(github 无 token 从 401 恢复匿名 API)
- 70 域 TTL 全覆盖
- 熔断 empty 语义修复、查询改写去重、慢源 6s 收紧、wave-2 提前终止
- 国际引擎中文 URL 编码修复(18 处)
- open_meteo geocode 加 language=zh(中文地名恢复)
- europeana 已禁用(上游 demo key 失效 401)
- 抓取链升级 fetch_v3(UA 轮换 + TLS 指纹 + Wayback 降级)
- 版本号统一 2.7.3
测试:740 passed, 18 skipped,无回归。