资讯动态

在 AWS Lambda 上运行 Crawlee 浏览器爬虫:Playwright + Chromium 完整部署指南

发布时间:2026/9/12 22:36:05 来源:尧图企业网站定制
在 AWS Lambda 上运行 Crawlee 浏览器爬虫Playwright Chromium 完整部署指南【免费下载链接】crawleeCrawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.项目地址: https://gitcode.com/GitHub_Trending/cr/crawlee在 AWS Lambda 等无服务器环境中运行浏览器型爬虫Browser Crawler时最大的障碍不是代码本身而是浏览器二进制文件的携带与启动。Crawlee 的 PlaywrightCrawler 依赖完整版的 Chromium/Chrome 可执行文件而 Lambda 对直接上传的代码包有大小限制且其文件系统只读、无 GPU 加速。本文将基于 Crawlee 官方部署文档Browsers on AWS Lambda从浏览器二进制的打包、Lambda Layer 的创建、sparticuz/chromium的接入、代码改造到最终的部署与内存调优逐步带你跑通一条完整、可复制的实践路径。读完本文你将掌握如何让 Playwright 驱动的 Crawlee 爬虫在 AWS Lambda 上稳定运行并理解Configuration、launchContext等核心机制在无服务器环境下的真实行为。为什么在 Lambda 上运行浏览器爬虫有难度在本地开发环境Crawlee 的 PlaywrightCrawler 开箱即用——Playwright 会自行下载并管理 Chromium文件系统可写、GPU 可用。但迁移到 AWS Lambda 后问题集中在三个方面浏览器二进制必须随包携带Lambda 运行环境中没有预装浏览器我们需要上传的不只是代码和依赖还有 Chromium 可执行文件本身直接上传有大小限制AWS 对 Lambda 直接上传的代码包有50MB限制而压缩后的 Chromium 构建体量本身就接近这个数字常规做法会直接撞上限运行环境受限Lambda 文件系统只读无法像本地一样把浏览器安装到磁盘同时执行环境缺少 GPU 加速等硬件支持需要显式向 Chromium 声明这些能力限制。好消息是这些障碍都有成熟的解决方案。对于同为无服务器场景的 Cheerio 方案可参考同一目录下的 Cheerio on AWS Lambda 文档那里的难点集中在无状态化与存储配置上而本文聚焦浏览器方案重点则是浏览器二进制的分发。管理浏览器二进制sparticuz/chromium社区已有成熟的 NPM 包帮我们解决浏览器二进制安装问题sparticuz/chromium一个包含 brotli 压缩 Chromium 二进制的 NPM 包。在 Lambda 环境中运行时该包会把二进制解压到/tmp/路径下并返回可执行文件的路径。使用它只需要两步把包加入项目依赖然后把node_modules目录打成 zip。# 安装包 npm i -S sparticuz/chromium # 打包依赖 zip -r dependencies.zip ./node_modules通过 S3 Lambda Layer 绕过 50MB 限制dependencies.zip不能直接作为 Lambda Layer 上传——直接上传有50MB 限制而压缩后的 Chromium 构建体量已经接近这个数字。正确的做法是将dependencies.zip作为对象上传到S3 存储桶创建 Lambda Layer 时提供该 S3 对象的链接而非直接上传文件Layer 创建完成后将 Layer 附加到你的 Lambda 函数上。这样既绕过了直接上传的大小限制又能把依赖层与代码层分离——之后每次修改爬虫代码只需要重新部署体积很小的代码包node_modules无需重复上传。改造代码三步适配 Lambda 环境接下来需要对 Crawlee 代码做三处关键修改最终代码位于示例项目中的src/main.js。第一步为爬虫注入独立的 Configuration 实例默认情况下Crawlee 的所有爬虫实例共享同一个存储。在 Lambda 环境中这种共享会带来状态残留问题AWS 会在首次执行后的一段时间内保持运行环境存活以减少冷启动时间后续调用会复用已创建的实例导致难以排查的脏状态。因此我们需要给每个爬虫传入一个新的Configuration实例让每个实例拥有独立的存储互不干扰// For more information, see https://crawlee.dev/ import { Configuration, PlaywrightCrawler } from crawlee; import { router } from ./routes.js; const startUrls [https://crawlee.dev]; const crawler new PlaywrightCrawler({ requestHandler: router, }, new Configuration({ persistStorage: false, })); await crawler.run(startUrls);这里的关键是persistStorage: false。从仓库源码看configuration.ts 中该字段的默认值是true对应的环境变量是CRAWLEE_PERSIST_STORAGE。关闭持久化存储后存储后端的选择会随之改变service_locator.ts 中的逻辑是——persistStorage为true时使用FileSystemStorageBackend写入磁盘为false时使用MemoryStorageBackend纯内存。这正是 Lambda 场景需要的Lambda 文件系统只读数据必须保存在内存中由 Lambda 在返回响应时统一带回。第二步注入 Chromium 可执行路径与启动参数sparticuz/chromium包在 Lambda 运行时负责解压二进制并暴露路径。我们需要把该路径传给 Playwright 的启动配置同时声明 Lambda 环境的硬件限制// For more information, see https://crawlee.dev/ import { Configuration, PlaywrightCrawler } from crawlee; import { router } from ./routes.js; import aws_chromium from sparticuz/chromium; const startUrls [https://crawlee.dev]; const crawler new PlaywrightCrawler({ requestHandler: router, launchContext: { launchOptions: { executablePath: await aws_chromium.executablePath(), args: aws_chromium.args, headless: true } } }, new Configuration({ persistStorage: false, }));这三项配置各有讲究executablePath告诉 Playwright 使用sparticuz/chromium解压出来的 Chromium 可执行文件而不是本地安装的浏览器args: aws_chromium.argsAWS Lambda 执行环境缺少 GPU 加速等硬件支持该包内置了适用于 Lambda 的 Chromium 启动参数集如禁用 GPU、必要的沙箱/无沙箱标志等直接传入即可让 Chromium 知晓环境限制headless: trueLambda 没有显示设备必须无头运行。从源码层面看launchContext.launchOptions是 Playwright 原生browserType.launch选项的透传通道。playwright-launcher.ts 中PlaywrightLauncher会把传入的launchOptions与默认解析逻辑合并——其中getDefaultExecutablePath会优先采用用户在launchOptions.executablePath中显式指定的路径见 playwright-launcher.ts其次才考虑useChrome或配置中的defaultBrowserPath。也就是说我们手动传入的executablePath拥有最高优先级这正是把 Lambda 上的 Chromium 路径交给 Playwright 的正确姿势。第三步将爬虫逻辑包装进 handler 函数AWS Lambda 真正执行的是导出的handler函数。我们把爬虫的创建与运行全部放进handler内部并在爬虫结束后把抓取到的数据作为 HTTP 响应体返回import { Configuration, PlaywrightCrawler } from crawlee; import { router } from ./routes.js; import aws_chromium from sparticuz/chromium; const startUrls [https://crawlee.dev]; export const handler async (event, context) { const crawler new PlaywrightCrawler({ requestHandler: router, launchContext: { launchOptions: { executablePath: await aws_chromium.executablePath(), args: aws_chromium.args, headless: true } } }, new Configuration({ persistStorage: false, })); await crawler.run(startUrls); return { statusCode: 200, body: await crawler.getData(), }; }注意两点每个 Lambda 调用都新建爬虫实例这是保持 Lambda 无状态原则的落地。crawler是在handler内部创建的每次执行都是全新的实例配合独立的Configuration彻底避免跨调用复用导致的状态污染await crawler.getData()返回抓取结果由于persistStorage: false数据都保存在内存数据集Dataset中爬虫运行结束后通过getData()一次性取出。从源码看dataset.ts 中的getData()支持limit、offset等分页参数返回结构化内容可直接序列化为 Lambda 的响应体返回给调用方。部署代码与配置 Lambda代码改造完成后进入部署环节打包代码将项目代码打成 zip 归档——注意排除node_modules文件夹因为依赖已经放进了之前创建的 Lambda Layer上传代码把代码 zip 作为 Lambda 函数体上传到 AWS挂载 Layer在 Lambda 配置中指定使用前面创建的依赖 Layer让sparticuz/chromium、crawlee、playwright等依赖在运行时可用测试在 AWS Lambda 控制台点击Test发送一个测试事件验证爬虫是否正常运行。:::tip 内存与超时设置 由于这里运行的是完整版浏览器Lambda 配置需要相应调整。最重要的是内存设置到 1024 MB 或更高——完整浏览器Chromium 渲染引擎非常吃内存更新 Lambda 超时时间——超时值取决于爬虫的实际运行时长。建议先在本机运行爬虫并测量执行时间再据此设定 Lambda 的超时留出足够的余量。 :::无服务器环境下的源码机制小结回到仓库源码可以更完整地理解上述配置背后的行为配置项默认值环境变量无服务器环境下的意义persistStoragetrueCRAWLEE_PERSIST_STORAGE置为false时service_locator.ts 会选择MemoryStorageBackend而非文件系统后端适配 Lambda 只读文件系统storageDir./storageCRAWLEE_STORAGE_DIR持久化存储的落盘目录配合persistStorage使用headlesstrueCRAWLEE_HEADLESSLambda 无显示设备必须无头运行launchOptions.executablePath自动探测—显式指定时优先级最高playwright-launcher.ts 会优先采纳此外Configuration的解析优先级是构造参数 环境变量 crawlee.json 默认值见 configuration.ts因此你在代码里显式传入的persistStorage: false会覆盖环境变量与默认值。这也是 Lambda 场景下推荐在代码中显式配置的原因——不依赖外部环境变量行为可预测。总结在 AWS Lambda 上运行 Crawlee 浏览器爬虫的完整链路是用sparticuz/chromium携带 Chromium 二进制 → 将node_modules打包并通过 S3 创建 Lambda Layer → 改造代码独立ConfigurationpersistStorage: false、注入executablePath与aws_chromium.args、包装handler→ 打包上传代码并挂载 Layer → 调高内存与超时。核心原则始终是保持 Lambda 无状态每个调用新建爬虫实例、存储放内存、结果随响应返回。掌握这套方法后你可以把任何 Playwright 驱动的 Crawlee 爬虫平滑迁移到无服务器架构按调用量付费、免运维地运行你的抓取任务。【免费下载链接】crawleeCrawlee—A web scraping and browser automation library for Node.js to build reliable crawlers. In JavaScript and TypeScript. Extract data for AI, LLMs, RAG, or GPTs. Download HTML, PDF, JPG, PNG, and other files from websites. Works with Puppeteer, Playwright, Cheerio, JSDOM, and raw HTTP. Both headful and headless mode. With proxy rotation.项目地址: https://gitcode.com/GitHub_Trending/cr/crawlee创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价