资讯动态

wigolo crawl的5种策略:BFS、DFS、sitemap、map模式与robots.txt合规

发布时间:2026/8/31 9:43:40 来源:尧图企业网站定制
wigolo crawl的5种策略BFS、DFS、sitemap、map模式与robots.txt合规【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolowigolo 是一个本地优先local-first的 AI 编程代理网络工具其crawl工具可以把整个站点抓取进本地缓存供后续的搜索、研究和缓存问答使用。本文介绍 wigolo crawl 的 5 种抓取策略BFS、DFS、sitemap、map 模式以及默认的 robots.txt 合规机制帮你用最少的配置拿到最干净的站点内容全程无需 API key$0/query。先认识一下 wigolo crawlcrawl是 wigolo 面向 AI 代理的多页抓取工具它从一个种子 URL 出发自动发现链接、抓取页面、提取 Markdown并把结果写进本地知识缓存——之后cache、search、find_similar等工具都可以直接复用这些内容。核心逻辑在 src/crawl/crawler.ts入口封装在 src/tools/crawl.ts。调用时只需要传 4 个常用参数参数默认值说明url必填种子 URLstrategybfs抓取策略bfs/dfs/sitemap/map/automax_depth2map 为 3最大跳转深度max_pages20map 为 200最大抓取页数 抓取完成后页面还会按max_total_chars默认 10 万字符和 token 预算做自动裁剪保证喂给 AI 上下文的内容不会爆掉见 src/tools/crawl.ts。策略一BFS 广度优先默认最稳BFSBreadth-First Search是 wigolo crawl 的默认策略。它从种子 URL 出发逐层向外扩散先抓完第 0 层再抓第 1 层……队列取页逻辑见 crawler.ts 的队列循环。适合场景想快速覆盖站点浅层最重要页面比如文档站的前几层目录。wigolo 对 BFS 做了两个贴心优化文档页优先同一层链接中路径包含/docs/、/guide/、/api/的页面会被排到前面抓取营销页靠后isDocPage锚点去重/page#a和/page#b会被折叠成同一条边不会重复抓取同一页策略二DFS 深度优先挖垂直内容把strategy设为dfs后队列改为后进先出会沿着一条链接链不断向下钻直到到达max_depth才回头。适合场景沿着下一篇导航深入抓取某个主题的全部文章需要完整拿到深层页面BFS 在页数上限内可能永远轮不到注意DFS 消耗页数更快建议把max_pages调小、配合exclude_patterns排除无关路径。策略三sitemap 站点地图驱动最快最全strategy: sitemap不靠链接跳转而是直接读取网站的 sitemap先从robots.txt里找Sitemap:声明extractSitemapUrlFromRobots找不到就探测默认路径/sitemap.xml支持sitemap index多级子 sitemap逐个展开抓取按lastmod排序最近更新的页面优先生存避免max_pages截断后只剩陈旧的词汇表页面sitemap 解析与排序逻辑见 src/crawl/sitemap.ts 和 crawler.ts 的 discoverSitemapUrls。适合场景内容站的批量入库——官方推荐的先 map 后 crawl组合拳就是它先用 map 模式摸清全部 URL再用 sitemap 策略精准抓取见 examples/one-shot-cli。策略四map 模式只列 URL不抓内容strategy: map是侦察兵模式它只发现 URL 列表不提取页面正文所以又快又省。map 模式分两个阶段src/crawl/mapper.tsSitemap 发现尽力读取 sitemap把其中的 URL 并入结果BFS 链接遍历纯 HTTP 抓取 HTML不渲染 JS只提取a href链接默认max_pages高达200、max_depth为 3返回urls列表 sitemap_found标记。适合场景抓取前先踩点评估站点规模生成站点 URL 清单交给后续 pipeline 处理配合 examples/shell-ndjson-pipeline 的 NDJSON 管道做批量调度策略五auto 自动策略 robots.txt 全程合规auto策略会先探测 sitemapprobeSitemap找到可用地图就走 sitemap 路径否则回退 BFS——一条命令兼顾两种场景。而robots.txt 合规则是所有策略共享的隐形第六策略wigolo 默认开启respectRobotsTxt抓取前解析站点robots.txt遵守Allow/Disallow规则且最长匹配优先RobotsParser读取Crawl-delay指令并让它与本地限流取更严格的值RateLimiter按域名做并发 间隔限流内网地址自动降速降并发即使你显式传了 sitemap URL 列表被 robots 禁掉的页面依然会被跳过这意味着 wigolo crawl 开箱即用就是礼貌爬虫无需任何额外配置。五种策略怎么选一张表看懂策略速度内容完整度最佳用途bfs默认⭐⭐⭐浅层优先文档站、官网概览dfs⭐⭐⭐深层优先追踪单条内容链sitemap⭐⭐⭐⭐官方全量清单内容站批量入库map⭐⭐⭐⭐⭐仅 URL抓取前侦察、URL 清单auto⭐⭐⭐⭐自动择优不确定时的一键兜底上手小贴士先 map 后 crawl大站点先用strategy: map看规模再决定max_pages用模式过滤include_patterns/exclude_patterns支持路径通配只抓docs/*能省下大量 token缓存为王crawl 的页面都会进本地缓存重复提问时cache工具直接从磁盘应答成本为零——详见 docs/tools.md进阶资料完整工具参数见 docs/tools.md架构与配置见 docs/configuration.md核心源码目录一览抓取器主体src/crawl/crawler.tssitemap 解析src/crawl/sitemap.tsmap 模式src/crawl/mapper.tsrobots 解析src/crawl/robots.ts限流器src/crawl/rate-limiter.ts工具入口src/tools/crawl.ts掌握这 5 种策略你就拥有了 wigolo crawl 的全部武器库——从快速侦察到全量入库总有一款适合你的 AI 代理工作流。【免费下载链接】wigoloThe go-to web for your AI coding agent — local-first search, fetch, crawl research over MCP. No API keys, no cloud, $0/query. Public beta.项目地址: https://gitcode.com/GitHub_Trending/wi/wigolo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价