网页爬取

「网页爬取」标签聚合的各栏目已发布内容,按本站发布日期从新到旧排列。

2 条

  1. 爬虫GitHub

    AnyCrawl:把网页变成 LLM 数据的抓取工具包

    用 TypeScript 编写、可自托管的网页抓取工具包,以三种引擎覆盖静态页到 JS 渲染页,支持搜索结果批量采集、全站遍历与 LLM 结构化抽取,输出对大模型友好的数据。

    #网页爬取#结构化抽取#RAG