资讯动态

Crawlee 爬虫入门指南:快速搭建专业级网页抓取项目

发布时间:2026/9/5 17:20:48 来源:尧图企业网站定制
Crawlee 爬虫入门指南快速搭建专业级网页抓取项目【免费下载链接】crawleeCrawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.项目地址: https://gitcode.com/GitHub_Trending/cr/crawlee要把网页上的数据变成自己的 JSON 文件Node.js 里最顺手的工具是 Crawlee——它把 HTTP 抓取、Cheerio/Playwright/Puppeteer 解析、无头浏览器自动化装进同一个库里一套 API 走到底。这是一篇重写过的 Crawlee 入门教程专治「装完不知道下一步」用 CLI 命令一条线完成项目生成与启动3 种爬虫类型的选型标准附对比表直接对号入座一个字段提取实战数据直接落到本地数据集文件。两步跑起来先确认环境Crawlee 要求 Node.js 16 以上用下面这条命令看一眼版本node -v然后让 Crawlee CLI 帮你把项目脚手架和依赖一次装齐交互式选模板即可npx crawlee create my-crawler cd my-crawler npm start先问页面一个问题要不要跑 JS选型判断逻辑很简单页面是服务器端渲染好的静态 HTML就用最轻的 HTTP 方案页面靠 JavaScript 动态渲染就上无头浏览器如果你长期深耕 Chrome 生态、需要最成熟的 Chromium 自动化 APIPuppeteer 更稳。CheerioCrawler纯 HTTP 请求 Cheerio 解析速度最快但 JS 渲染的页面拿不到。PlaywrightCrawler可驱动 Chromium、Firefox、WebKit是功能最全面的多浏览器自动化方案。PuppeteerCrawler专注 Chrome/ChromiumAPI 稳定生态集成成熟。维度CheerioCrawlerPlaywrightCrawlerPuppeteerCrawlerJS 渲染支持不支持支持支持运行速度最快快快可驱动浏览器无HTTPChromium / Chrome / Firefox / WebKitChrome / Chromium典型场景静态页、API 型站点动态页、跨浏览器验证Chrome 深度集成实战抓列表页三个字段落盘目标访问首页提取标题、meta description、链接数三个字段存入数据集而不是只抓一个标题。import { CheerioCrawler, Dataset } from crawlee; const crawler new CheerioCrawler({ async requestHandler({ $, log }) { // 一次性取走三个字段 const data { title: $(title).text(), metaDesc: $(meta[namedescription]).attr(content) ?? , linkCount: $(a).length, }; await Dataset.pushData(data); // 落盘到本地数据集 log.info(已保存${data.title}链接 ${data.linkCount} 条); }, }); await crawler.run([https://crawlee.dev]);预期终端输出每次运行结果会略有不同INFO CheerioCrawler: Starting the crawl 已保存Crawlee · The scalable web crawling, scraping and automation library for JavaScript/Node.js | Crawlee链接 120 条 INFO CheerleeCrawler: Crawling finished. Final request statistics: Requests processed: 1跑完后到./storage/datasets/default/找生成的 JSON 文件即可每条 pushData 对应一个文件。生产环境四个关键点递归发现链接在 handler 里调await enqueueLinks()页面新链接自动进队列配合transformRequestFunction可过滤域名或路径。导出 CSV/JSON数据集支持一键导出文件名由你指定import { Dataset } from crawlee; await Dataset.exportToCSV(my-data); // 导出 CSV await Dataset.exportToJSON(my-data); // 导出 JSON重试与反屏蔽maxRequestRetries默认 3 次控制失败重试配合maxConcurrency限并发、proxyConfiguration轮换代理、sessionPoolOptions复用会话比单纯加延迟更稳。Headful 调试加两个构造参数即可看见浏览器实际操作slowMo还能放慢节奏new PlaywrightCrawler({ headless: false, // 显示浏览器窗口 slowMo: 500, // 每步间隔 500ms便于观察 });部署三选一Docker官方镜像预装好浏览器与依赖本地与服务器行为一致。云部署任意 Node.js 云服务AWS、GCP 等直接部署用CRAWLEE_STORAGE_DIR环境变量指向持久化存储目录。Apify 平台托管运行平台自动处理存储与代理。详见docs/guides/docker_images、docs/deployment。收个尾用npx crawlee create生成项目并npm start按「静态页 → Cheerio动态页 → Playwright/Puppeteer」选爬虫在requestHandler里提取字段并Dataset.pushData落盘生产上启用maxRequestRetries、代理与会话池继续深入可以读快速上手示例docs/quick-start结果存储详解docs/guides/result-storage反屏蔽指南docs/guides/avoid_blocking现在就可以打开终端输入第一条命令十分钟之后你会看到自己的第一份 JSON 数据集。【免费下载链接】crawleeCrawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.项目地址: https://gitcode.com/GitHub_Trending/cr/crawlee创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价