资讯动态

如何用 gsutil 批量下载 23 TiB 完整 AlphaFold Protein Structure Database 并处理解压后的文件数量

发布时间:2026/9/15 12:49:33 来源:尧图企业网站定制
如何用 gsutil 批量下载 23 TiB 完整 AlphaFold Protein Structure Database 并处理解压后的文件数量【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold这篇文章解决一个具体的资源下载任务把完整的 AlphaFold Protein Structure Database(AFDB,214M 条蛋白质结构预测,总规模 23 TiB,每条预测提供 3 个文件)落到本地磁盘上。操作路径是:准备 Google Cloud 账户并安装gsutil,按官方推荐方式批量下载全部 1,015,797 个 sharded proteome tar 分片,再在本地 un-tar 与 un-gzip,并处理解压后约 644M 个文件的文件系统问题。下文步骤与数字均来自仓库内的官方下载指南 afdb/README.md。开始之前:确认确实需要完整数据集官方文档明确表示:除非需要用本地计算资源处理(例如学术高性能计算中心),否则不推荐下载完整数据集。如果你只需要部分蛋白质或部分物种,文档提供了预置子集(覆盖重要物种 / Swiss-Prot)、按物种 proteome 下载、以及通过 manifest 文件清单或 BigQuery 自定义子集等替代路径——这些是独立任务,本文不展开。在开始下载前,先记下文档给出的两个规模事实:完整数据集为23 TiB、3 × 214M 个文件,文档明确警告difficult to manipulate without significant computational resources,需要预先准备至少同量级的磁盘空间,并确认文件系统能力;文档估算:1 Gbps 网络下下载完整数据库大约需要 2.5 天。准备 Google Cloud 账户并安装 gsutil从 Google Cloud Public Datasets 下载数据需要 Google Cloud 账户(数据本身在 CC-BY-4.0 许可下免费下载使用)。按文档的步骤准备:创建账户:文档指引到 cloud.google.com/datasets 页面,点击 get started for free 开始免费账户流程并同意服务条款。注意注册时需要填写支付方式,但文档说明在启用计费前不会使用它。设置项目:在 Cloud overview - Dashboard 页面选择或新建一个项目。安装gsutil:文档指引到 Google Cloud 官方的 gsutil 安装文档执行。文档中关于费用边界的说明,开始下载前必须读清:Public Datasets 存储桶的访问始终免费,免费账户包含 free tier 访问权限;90 天试用期结束后,需要升级到计费账户才能继续使用。免费层访问(包括 Public Datasets 存储桶)继续期间,超出免费层的用量会产生费用——文档要求用户熟悉所使用服务的定价,避免意外扣费。完整数据库存放在 GCS 桶gs://public-datasets-deepmind-alphafold-v4。用 gsutil 批量下载全部 1,015,797 个 proteome 分片官方推荐的整体下载方式,是下载proteomes/目录下全部 1,015,797 个 sharded proteome tar 文件,而不是逐条下载 6 亿多个单独文件。文档解释原因:单个文件存在较大的固定延迟,分片 tar 方式显著更快。每个 proteome 被分片,使每个 shard 至多包含 10,000 个蛋白质(即每 shard 30,000 个文件,因为每个蛋白质有 3 个文件)。先cd到预留了 23 TiB 级空间的目标目录,再执行文档原命令:gsutil -m cp -r gs://public-datasets-deepmind-alphafold-v4/proteomes/ .该命令会把整个proteomes/目录递归下载到当前目录.,下载约 23 TiB 内容,请确认目录位置与磁盘余量后再执行。tar 文件的命名模式为proteome-tax_id-[TAX ID]-[SHARD ID]_v4.tar,其中 TAX ID 是 NCBI taxonomy ID,SHARD ID 是分片编号。下载完成后的规模核对以文档给出的数字为准:本地应有1,015,797 个 tar 文件。可选分支:Storage Transfer Service部分用户可能改用 Google Cloud 的 Storage Transfer Service,在源桶与另一个桶或其他云服务之间建立传输。文档明确警告:使用该服务可能产生费用,需要到官方定价页查看详情,尤其是传输到其他云服务的情况。这是替代传输路径,不是文档的默认推荐。解压并评估文件数量官方文档对下载后的步骤描述为:un-tar 所有 proteome,再 un-gzip 所有单个文件。文档没有给出这一步的具体命令;下面给出对应文档命名模式的tar操作示例,方括号内需替换为实际文件名中的对应值:tar -xf proteome-tax_id-[TAX ID]-[SHARD ID]_v4.tar对每个已下载的 tar 分片重复该操作。解压前,文档给出了一条必须落实的警告:解压后将出现约 644M 个文件,文档原文要求make sure your filesystem can handle this——即文件系统能否容纳数亿个小文件是解压前的前置条件;每条预测展开为 3 个文件:model_v4.cif(预测结构的原子坐标及元数据)、confidence_v4.json(逐残基 pLDDT 置信度)、predicted_aligned_error_v4.json(残基对 PAE 置信度)。文档没有提供专门的验证命令;判断下载与解压规模是否到位,以文档给出的数字为参照:解压前 1,015,797 个 tar 分片,解压后约 644M 个文件(数据集整体构成按文档记为 3 × 214M 文件)。边界说明耗时:文档的估算值为 1 Gbps 网络下约 2.5 天,这是文档给出的估计,不是固定承诺;桶内另有accession_ids.csv与sequences.fasta两个附加文件,它们不属于proteomes/分片,不在上述批量下载命令的覆盖范围内;下载过程中遇到问题时,文档提供的联系渠道是 alphafolddeepmind.com;若最终只需要某个物种或某个置信度条件筛出的子集,应回到 afdb/README.md 的 Downloading subsets of the data 一节,使用按物种 proteome 的gsutil命令、manifest 清单(gsutil -m cp -I)或 BigQuery 生成文件列表的路径,而不是完整下载。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价