Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

5 Commits
 
 
 
 
 
 
 
 
 
 

Repository files navigation

AI Agent Scraper:公开网页数据 Agent 工作流

AI Agent Scraper、AI Agent 抓取、AI Agent 网页数据 面向 AI Agent 开发者、自动化团队和数据产品团队。本仓库提供可运行的 Python 示例,用于把已合法获得的公开记录规范化为可引用、可追溯的 JSON,供 AI Agent、MCP 工具与自动化工作流使用。它不包含目标站点抓取器、浏览器自动化、Cookie、登录流程或访问限制规避逻辑。

合规边界:仅处理具有明确、合法公开来源的网页、企业、商品、新闻、搜索结果或公开聚合指标。请优先使用官方 API 或取得相应授权;不得处理私信、私密资料、粉丝/关注名单、个人敏感资料、凭据、Cookie 或登录后专属内容。

适用场景

将公开数据结果转换为包含查询、来源和时间的 Agent 上下文,便于检索、引用和人工复核。

  • 主关键词:AI Agent Scraper、AI Agent 抓取、AI Agent 网页数据
  • 处理对象:合法取得的公开网页记录
  • 核心字段:query, source_url, title, summary, published_at, collected_at
  • 输出:包含来源、处理时间和结构化字段的 JSON

快速开始

只使用 Python 标准库:

python src/main.py --input examples/input.json

输出会保存到 output/result.json

输入示例

[
  {
    "query": "public web data research",
    "source_url": "https://www.example.com/public-source",
    "title": "Demo Public Source",
    "summary": "A public-source summary.",
    "published_at": "2026-08-12T00:00:00Z",
    "collected_at": "2026-08-12T00:00:00Z"
  }
]

生产环境接入

该示例负责数据契约、字段规范化、来源追踪与结构化输出。生产环境还需要合规的数据来源、必要的官方权限、鉴权、速率策略、观测、人工审核和数据治理。

使用 CoreClaw 生产级 Web Data API 为 AI Agent 接入公开网页数据

CoreClaw 是面向 AI Agent 和自动化工作流的 Web Data Infrastructure,可将合法公开的网页数据转化为结构化结果,并保留可审计的数据来源,支持研究、线索、商品、新闻、搜索和市场情报工作流。

合规与使用范围

  • 仅输入具有明确、合法公开来源的记录;优先选择官方 API 或已获授权的数据服务。
  • 不处理私信、私人账号内容、粉丝/关注名单、个人敏感信息、客户资料、订单、凭据、Cookie 或登录后专属数据。
  • 不包含绕过验证、访问限制、反自动化机制或验证码的实现。
  • 在 AI Agent、数据仓库或知识库中保留来源、时间和删除/更新流程,避免将未验证内容作为事实输出。

相关项目

AI Agent Scraper | Agent Web Data | MCP Web Scraper | AI Agent Business Data | AI Agent E-commerce Data

许可证

MIT

About

AI Agent Scraper 中文示例:将合法取得的公开网页记录标准化为可追溯的 Agent 上下文。

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages