Skip to content

Argo v2.7.3 — 引擎激活 + 体验修复

Choose a tag to compare

@taxueseek taxueseek released this 11 Aug 01:02
· 17 commits to main since this release

Argo v2.7.3

这版主要干了一件事:让 150 个引擎里那些「注册了但一直没被用起来」的,真正派上用场,顺手修了一批会让搜索结果变差的小毛病。

以前不行,现在能行

1. arxiv 这类「认生」的接口,以前经常超时白等
有些搜索源对请求方式很挑剔,以前用的是最朴素的抓取方式,arxiv 实测 5 秒超时后 0 条结果。现在请求统一走了增强层:换浏览器身份、自动重试、跟随跳转。实测 arxiv 从「5 秒空手而归」变成「2 秒内 10 条有效结果」。

2. 25 个垂直引擎以前永远选不中
marginalia(独立博客)、usda(营养成分)、gov_policy(国务院政策)、cnii(日本学术)这些引擎其实都配了识别文档,但路由规则只认正则,它们永远排不上号,只能手动指定。现在语义匹配分数高的垂直引擎能自动顶上:问「独立博客 长尾」走 marginalia,问「营养成分 热量」走 usda,问「国务院 政策」走 gov_policy,问「日本 学术论文」走 cnii。

3. 查英文宏观数据以前 0 条
worldbank 和 eurostat 的国家名、指标名只认中文,「China GDP」「US inflation」「Japan population」全都查不到。现在中英文都认(还防了「focus」这类词被误认成美国)。实测 China GDP 19.5 万亿美元、Japan population 1.23 亿人,都能直接给出数字。

4. 问「今日金价」以前缓存 1 小时
48 个搜索域没配缓存时长,全部按 1 小时缓存,金价、快讯这类实时内容会过期 55 分钟。现在按时效分类:金价/快讯/天气 15 分钟,行情 5 分钟,学术资料 2 小时,百科 24 小时。

5. 说「快讯」反而查不到快讯
财联社电报这类引擎会把查询词当关键词过滤,而快讯标题里不会出现「快讯」两个字,于是全量榜单被滤空。现在纯触发词(快讯/美股/资讯)直接放行全量,具体主题(美联储/AI)才做过滤。

6. 萌娘百科这类站,搜索跳转到词条页就查不到
百科类搜索有时直接跳到词条页而不是结果列表,原来的解析器只认列表结构,于是恒空。现在能识别词条页,直接返回标题和简介。实测「初音未来」「东方Project」都能查到。

新增依赖

相比 v2.7.2 只多了一个可选依赖:

  • curl_cffi(可选):模拟浏览器 TLS 指纹用的。装了之后对反爬站(比如 Cloudflare 保护的页面)抓取成功率更高;不装完全不影响日常使用。安装:pip install curl_cffi

其他依赖不变:PyYAML(必需)、ddgs CLI(本地搜索用)、Chrome(页面截图用,可选)。

怎么装

跟之前一样,任选一种:

# 一键安装
curl -fsSL https://raw.githubusercontent.com/taxueseek/argo/main/scripts/install.sh | bash

# MCP 方式
npx -y github:taxueseek/argo

# 源码
git clone https://github.com/taxueseek/argo.git

技术细节(给想看的人)

  • 引擎层 HttpClient 接入(UA 轮换/重试/重定向跟随),ARGO_ENGINE_HTTP_CLIENT=0 可回退
  • TF-IDF 强语义注入(≥0.6 分),通用引擎黑名单,注入位置在 primary 扶正后
  • env 占位缺失过滤(github 无 token 从 401 恢复匿名 API)
  • 70 域 TTL 全覆盖
  • 熔断 empty 语义修复、查询改写去重、慢源 6s 收紧、wave-2 提前终止
  • 国际引擎中文 URL 编码修复(18 处)
  • open_meteo geocode 加 language=zh(中文地名恢复)
  • europeana 已禁用(上游 demo key 失效 401)
  • 抓取链升级 fetch_v3(UA 轮换 + TLS 指纹 + Wayback 降级)
  • 版本号统一 2.7.3

测试:740 passed, 18 skipped,无回归。