资讯动态

scientific-agent-skills Gtars 技能实战:基因组区间集合代数、共识覆盖度与 Tokenizer/Refget 的安全工作流

发布时间:2026/9/10 6:23:16 来源:尧图企业网站定制
scientific-agent-skills Gtars 技能实战基因组区间集合代数、共识覆盖度与 Tokenizer/Refget 的安全工作流【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills本文基于 Gtars 技能定义 展开讲明该技能如何使用 Gtars 的 Rust 原生实现、Python 绑定与gtars命令行工具完成基因组区间的重叠计数、集合代数、共识consensus与覆盖度coverage计算、区间词元化tokenization、片段fragment处理以及 refget/BEDbase 规划。读完后你将掌握如何以精确版本固定exact pin安全安装 Gtars 0.9.2/0.9.0如何在每一次操作前执行数据契约校验以及 Python、CLI、Rust 三个 API 面的正确用法与边界——尤其是哪些旧 API 已经失效、哪些调用会触发隐式网络与缓存副作用。技能定位与版本快照Gtars 提供面向基因组区间与参考序列操作的三种使用面原生 Rust 实现、Python 绑定、以及特性门控feature-gated的gtars二进制。技能的核心原则是先跑自带的本地检查器只有当数据契约、来源provenance、资源边界和副作用都被明确界定之后才调用上游代码见 skills/gtars/SKILL.md。技能文档给出了截至 2026-07-23 的验证快照使用时必须注意各工件独立发版版本号相同不代表产物相同工件版本发布/验证信息Python 包gtars0.9.2发布于 2026-06-17Requires-Python 3.10Rust 元 crategtars0.9.0发布于 2026-06-15默认 feature 集为空CLI crategtars-cli0.9.0安装后的二进制名为gtars组件 crategtars-refget0.9.1发布于 2026-06-17gtars0.9.0元 crate 锁定的组件集内是 refget 0.9.0两个容易踩的坑在文档中被明确点名上游有意让 workspace crate、Python 绑定和 CLI 独立版本化不要假设数字对齐意味着产物对齐。官方发布文档的 changelog 停在 0.5.1因此文档中的 API 示例以 0.9.2 的 Python stub/运行时和v0.9.0的 CLI/Rust 源码为准上游发布文档与 stub 之间存在漂移例如旧版GlobalRefgetStore教程、0.9.2 不完整的 stub冲突时以安装后签名冒烟测试 不可变标签源码为权威。许可证方面技能自身的license: MIT字段只覆盖本技能发布的gtarscrate 声明 MIT而 GitHub 仓库根目录目前显示 BSD-2-Clause——重新分发前应核对具体工件的许可证。原生代码信任门与精确固定安装Python wheel 内含 PyO3 原生扩展cargo install会编译原生二进制并可能执行依赖的构建脚本。因此这两条路径都应视为代码执行安装前完成信任审查确认官方 PyPI/crates.io/GitHub 仓库所有方与不可变版本号审查文件名、平台标签、发布来源、许可证与 SHA-256——GitHub 的 v0.9.0 二进制发布附带每个归档包的.sha256旁路文件不运行未信任的预编译二进制、wheel、源码树、Cargo 构建脚本或归档安装器使用隔离环境并设置 CPU/RAM/磁盘/时间上限将 lockfile 与工件哈希随分析清单manifest一起保存。完成审查后创建隔离的 Python 环境注意--dry-run预演一步uv venv --python 3.11 .venv-gtars uv pip install --dry-run --python .venv-gtars/bin/python gtars0.9.2 uv pip install --python .venv-gtars/bin/python gtars0.9.2 .venv-gtars/bin/python -c \ import gtars; assert gtars.__version__ 0.9.2; print(gtars.__version__)对已审查的 CLI 源码发布用--locked锁定依赖解析cargo install gtars-cli --version 0.9.0 --locked gtars --version gtars --help在 Rust 项目中精确固定包装器 crate 并只启用需要的 feature[dependencies] gtars { version 0.9.0, default-features false, features [ core, overlaprs, uniwig, tokenizers, refget ] }只有当确实需要更新的直接组件 API 且兼容性已测试时才直接使用gtars-refget 0.9.1。不要把这些固定替换成 Git 分支或未审查的发布。CLI 的默认 feature 为scoring uniwig bbcache igd fragsplit overlaprs genomicdist refget如需构建缩减版二进制可用cargo install gtars-cli --version 0.9.0 --locked --no-default-features --features overlaprs,genomicdist见 skills/gtars/references/cli.md。0.9.0 的 CLI没有tokenizersfeature/子命令不要把旧版--all-features二进制的命令假设带进缩减版。基因组数据契约操作前必须过的六道关技能要求在每次操作前套用以下契约摘自 skills/gtars/SKILL.md坐标BED 区间是 0-based 半开区间[start, end)要求0 start end contig_length。Gtars 坐标是u32因此拒绝大于4,294,967,295的值。组装版本assembly记录 assembly accession/版本以及精确 chromosome-sizes 或 refget 序列集合元数据的 SHA-256。绝不从文件名或chr前缀推断 assembly。Contig 名称逐字比较。1与chr1、alt 位点、decoy、线粒体别名互不通用重命名或 liftover 只能是独立审查过的转换步骤。排序保留原始文件需要时再对副本按 chromosome-sizes 顺序加数值 start/end 排序。注意 PythonRegionSet(path)在加载时会按 contig 字典序、再按 start 排序此后不要依赖原始行序。链strandBED6 使用、-或.。Region.rest保留尾部 BED 字段但文件构造的 PythonRegionSet目前把独立的strands向量初始化为*多种集合操作会丢弃 strand。若链在科学上有意义须在外部保留并校验。重复/相邻显式选择策略。reduce()与 consensus 会合并重叠且相邻的区间而普通半开重叠判定不把[0,10)和[10,20)视为重叠。契约检查的第一步是运行本地校验器命令假定当前目录为skills/gtars/脚本本身零第三方依赖只用 Python 3.10 标准库python3 -B scripts/bed_validator.py \ --input data.bed.gz \ --assembly GRCh38.p14 \ --chrom-sizes GRCh38.p14.chrom.sizes \ --require-sorted从 bed_validator.py 源码可以看到该工具的完整参数面与默认边界--input必填、--assembly必填1–200 字符、--chrom-sizes本地两列 chrom.sizes--require-sorted行未按 chrom.sizes 顺序 数值 start/end 排列时失败--allow-empty允许无数据记录的 BED默认空集报错no_data_records--max-bytes默认 512 MiB压缩 展开字节上限--max-records默认 1,000,000--max-examples默认 10上限 100输出为 JSON 报告含contract声明coordinate_system: 0-based-half-open、gtars_coordinate_limit: u32、network_used: false、subprocess_used: false、symlinks_allowed: false等、input摘要、errors/warnings、issue_examples与normalization_plan如建议stable_sort_a_copy退出码 0 表示通过、2 表示存在错误。共享安全层 scripts/_common.py 定义了所有六个辅助 CLI 的硬边界HARD_MAX_BYTES 8 GiB、HARD_MAX_RECORDS 10,000,000、HARD_MAX_FILES 100,000、HARD_MAX_WORKERS 256、单行上限 1 MiB、MAX_COORDINATE 2**32 - 1。路径解析拒绝 NUL 字节、URL/URI 前缀http:、https:、ftp:、file:、s3:、gs:、hf:、ssh:及任意://、~展开、..父目录穿越并逐段lstat拒绝符号链接分量。安全本地工作流技能规定了六步标准流程清点本地文件、校验和、assembly、contig 字典、坐标系、strand 策略、患者/重复组与预期输出校验 BED/fragments 并估算工作量用小型合成文件做先导pilot从文档化 API 面中选定 Python、CLI 或 Rust不要靠猜测翻译 API 名称为输入字节/记录/文件数、线程/作业数、内存、临时磁盘、输出大小、墙钟时间设置硬上限在专用输出目录中运行除非明确批准覆盖否则拒绝输出冲突重新校验输出的排序、边界、行数、校验和与来源记录。Python 核心Region 与 RegionSet0.9.2 的导入都来自子模块而不是gtars顶层见 skills/gtars/references/python-api.mdfrom gtars.models import Region, RegionSet from gtars.genomic_distributions import consensus from gtars.tokenizers import Tokenizer, tokenize_fragment_file from gtars.refget import RefgetStore, digest_fasta, digest_sequenceRegion、RegionSet、Tokenizer、RefgetStore不是顶层类。0.9.2不导出Python 侧uniwig、igd、scoring、fragsplit、bbcache子模块。构造与查询的最小完整示例from gtars.models import Region, RegionSet query RegionSet.from_regions( [ Region(chrchr1, start100, end200, restNone), Region(chrchr1, start300, end400, restNone), ], strands[, -], ) universe RegionSet.from_vectors( [chr1, chr1], [150, 500], [350, 600], ) counts query.count_overlaps(universe) # 每个查询区间一个计数 flags query.any_overlaps(universe) # 每个查询区间一个布尔 indices query.find_overlaps(universe) # 指向 universe 的索引 pieces query.intersect_all(universe) # 全部相交碎片 fraction query.coverage(universe) # 查询区被覆盖的 bp 比例关键语义要点Region(chr, start, end, rest)中start/end是 Rustu32构造前应自行验证0 start end contig_length相等性只比较染色体/start/endrest不参与。RegionSet(path)解析规则接受 TAB 分隔的类 BED 输入与.gz跳过browser/track/#行首行第二列非数字时视为表头至少 3 列第 4 列起整体存为一个 TAB 拼接的rest字符串拒绝空集合在内存中按染色体字典序 数值 start 排序原文件不会被改写但对象内不再保留行序。内存构造RegionSet.from_regions(regions, strandsNone)与RegionSet.from_vectors(chrs, starts, ends, strandsNone)各坐标向量及可选 strand 向量必须等长省略 strands 时独立 strand 向量含*。属性与可变性len()、下标支持负索引、identifier对排序后前三列内容的 MD5 类标识、file_digest含保留尾列二者都不能替代独立记录的 SHA-256 来源哈希、header、strandsregions.sort()原地排序并返回 Noneto_bed/to_bed_gz/to_bigbed会创建/覆盖指定输出先查输出策略to_bigbed需要覆盖所有 contig 与边界的 chrom sizes从 regions/vectors 创建的集合调用path会抛ValueError。区间统计与结构操作widths()region_widths()为别名、mean_region_width()、get_nucleotide_length()、get_max_end_per_chr()、chromosome_statistics()、reduce()合并重叠且相邻区间、disjoin()、trim({contig: length})丢弃未知 contig 并钳制边界、gaps(...)、cluster(max_gap100)。这些变换不做 liftover且可能丢弃独立 strand 向量。promoters(upstream, downstream)在当前实现中相对每个区间的start计算不是链感知的 TSS 工作流的安全替代品。neighbor_distances()与nearest_neighbors()可能返回比输入更少的值跳过染色体上的单例结果不与行对齐。distribution(n_bins250, chrom_sizesNone)缺省 chrom sizes 时用观测到的最大 end 定标导致跨文件不可比提供 sizes 后未知/越界区间被跳过计数总和可能低于输入条数。成对与 all-vs-all 操作concatenated a.concat(b) # 不合并 union a.union(b) # 最小合并集 difference a.setdiff(b) # 从 a 中减去 b 的碱基可能把 a 的区间切碎 pairwise a.pintersect(b) # 按索引配对不是基因组 all-vs-all all_pieces a.intersect_all(b) # 每个基因组重叠碎片 [max(starts), min(ends)) jaccard a.jaccard(b) # intersection_bp / union_bp coverage a.coverage(b) # 被 a 覆盖的 bp / a 合并后的 bp[0,1] coefficient a.overlap_coefficient(b) # intersection_bp / min(query_bp, universe_bp) closest a.closest(b)重叠查询方法是有方向的a.count_overlaps(b)、a.any_overlaps(b)、a.find_overlaps(b)、a.subset_by_overlaps(b)的结果都对齐到a的区间find_overlaps返回的是指向内存中b的 0-based 索引。文件构造的集合已被构造器排序把这些数组关联回原始行号时必须携带独立的稳定标识符。consensus位于不同模块from gtars.genomic_distributions import consensus rows consensus([query, universe]) # rows: [{chr: ..., start: ..., end: ..., count: ...}, ...]实现语义是拼接所有集合 →reduce()成非重叠并集含相邻合并→ 对每个并集区间统计有多少个输入集合与其至少重叠一次。它不会在每个支持变化边界处切段例如[0,10)与[5,15)会产出并集[0,15)且 count 为 2尽管两端各有单个集合支持。解读count时必须采用合并并集组件的集合级支持这一确切含义而不是逐碱基支持。信号轨道生成没有以gtars.uniwig暴露给 Python 0.9.2——请使用经过审查的 CLI 或 Rust APIRegionSet.coverage()是碱基集合度量不是 WIG/bigWig 生成器。Tokenizer、片段与参考序列存储默认只使用本地构造器from gtars.models import RegionSet from gtars.tokenizers import Tokenizer tokenizer Tokenizer.from_bed(reviewed-universe.bed) regions RegionSet(local-query.bed) tokens tokenizer.tokenize(regions) encoding tokenizer(regions) ids encoding[input_ids]要点详见 skills/gtars/references/tokenizers.md类名是Tokenizer不是TreeTokenizerTokenizer(path)只自动识别.toml、.bed、.bed.gz。本地构造器读本地文件并建立内存重叠索引每个查询区间可产出 0 个、1 个或多个区元 token整个调用若无任何重叠则返回 unknown token未知 contig 同样落入 unknown 行为。经 0.9.2 wheel 实测tokenize()拒绝字符串列表如[chr1:100-200]必须传RegionSet或Region对象。from_config期望TOML而非 YAMLuniverse universe.bed.gz相对配置文件的相对路径与可选tokenizer_type bits | ailist缺省bits。默认特殊 token 角色为unk, pad, mask, cls, bos, eos, sep对 N 行的唯一 universe测试实现的词表为N 7条——不要硬编码来自其他 universe 的 ID。universe 兼容性是字节/顺序敏感的token ID 依赖精确的 universe 行、行序、重复策略、特殊 token 分配与后端/配置。训练或推理前应冻结一份 manifest含 assembly、坐标系、gtars 版本、universe SHA-256 与记录数、chrom.sizes SHA-256、后端、vocab_size、各特殊 token ID并用本地校验器复核不导入 gtarspython3 -B scripts/tokenizer_manifest.py \ --manifest tokenizer-manifest.json \ --universe universe.bed \ --assembly GRCh38.p14 \ --chrom-sizes GRCh38.p14.chrom.sizes该辅助脚本要求精确 SHA-256 与记录数、七个互不相同且在范围内的特殊 token ID、兼容的 assembly/坐标/版本、以及唯一合法的 BED。Tokenizer.from_pretrained(name)具备网络能力当参数不是已存在的本地目录时它会联系 Hugging Face 并把universe.bed.gz写入 Hub 缓存且签名不暴露revision、cache_dir、local_files_only或校验和参数。因此流程是取得对huggingface.co、仓库、精确 commit/revision、传输大小与缓存路径的显式批准 → 通过受审查的 revision 固定机制拉取 → 校验 SHA-256 与 manifest → 再传入包含已审查universe.bed.gz的已存在本地目录。无需为 universe 文件启用任何远程模型代码。片段分词绑定tokenize_fragment_file(fragments.tsv.gz, tokenizer)返回dict[str, list[int]]按 barcode。标签源码要求片段文件至少五列空白分隔字段chrom start end barcode count但实现不使用第五列 count——每行按重叠 token ID 各贡献一次且重复 ID 保留在每个 barcode 列表中。该函数把所有 barcode 与 token 列表累积在内存中用于单细胞数据前必须设置压缩/展开字节、行数、barcode 数、每行 token 数、总 token 数与进程 RSS 上限日志中绝不打印原始 barcode。若需要真正的计数矩阵用 CLI 的fscoring --barcode稀疏路径写 Matrix Market。Rust 侧启用features [tokenizers]后包装器支持from_bed、from_config、from_auto以及因包装器启用了huggingfacefeaturefrom_pretrained——同样适用本地优先与 revision/校验和门。Refget 侧优先使用RefgetStore.in_memory()或RefgetStore.open_local(path)open_remote(cache_path, remote_url)会联系远端服务、创建/使用本地缓存并执行按需范围读取详见 skills/gtars/references/refget.mdfrom gtars.refget import RefgetStore store RefgetStore.in_memory() metadata, was_new store.add_sequence_collection_from_fasta( reviewed-reference.fa, forceFalse, namespaces[refseq], ) store.write_store_to_dir(approved-store) reopened RefgetStore.open_local(approved-store)注意副作用矩阵in_memory()不写盘on_disk(path)打开已有 store 或新建磁盘 storeopen_local读元数据/索引并惰性加载本地序列write_store_to_dir/enable_persistence会创建/写文件forceTrue可替换已有条目。批量导入add_sequence_collections_from_fastas中jobs0表示自动并发受控运行应显式枚举文件并设正数并发上限。数据访问方法get_substring/get_substrings/stream_sequence等使用 0-based 半开范围应验证0 start end lengthstream_sequence限制峰值结果内存但下游累积仍可抵消流式效果。当前 CLI 唯一的 refget 子命令是本地 store 构建gtars refget build reference.fa --output approved-store --jobs 1没有digest或verify子命令离线校验可走scripts/refget_digest_plan.py它验证策略清单形状并逐条复算本地序列的 length/sha512t24u/MD5不重算序列集合摘要。网络与缓存门副作用清单技能声明没有隐式下载或缓存写入。任何具备网络能力的上游调用前必须完成——对精确主机/端点/数据/缓存的显式用户批准HTTPS 主机白名单并拒绝未审查重定向记录不可变 revision/标识符、获取时间、期望 SHA-256 与域摘要、assembly accession、大小配额与来源披露可能离开批准环境的敏感 BED 坐标、barcode、样本标签与参考选择把下载内容按不可信数据校验后再使用。已识别的隐式副作用清单RegionSet(path)启用 HTTP不存在的本地字符串可能被当作 URL 打开。构造前先确认本地路径存在这是安全边界不只是报错体验。Tokenizer.from_pretrained可能下载universe.bed.gz到 Hugging Face 缓存。RefgetStore.on_disk创建/写入 storeopen_remote拉取远端元数据并默认启用持久化。gtars bbcache仅在构造客户端时就会创建缓存目录缓存/下载命令使用BBCLIENT_CACHE默认~/.bbcache与BEDBASE_API默认https://api.bedbase.org。BEDbase 相关还有一个已确认的源码级问题v0.9.0 的BBClient.load_bed(id)把裸 ID 委托给RegionSet::try_from而核心源码中裸 BEDbase ID 回退被注释掉了——因此仅凭 ID 的cache-bed/BED-set 下载在该发布中可能失败尽管公开文档声称支持。技能明确要求不要靠猜测 URL 绕过而应在非敏感批准测试上验证实际行为或通过受审查的 BEDbase 元数据解析显式官方文件 URL。敏感元数据与数据泄漏防护基因组区间、罕见位点、barcode、样本名、表型乃至 assembly 选择都可能构成识别信息。日志中不要保留完整路径与原始坐标捆绑报告默认脱敏路径、只输出计数/校验和。训练/验证/测试切分必须先按患者/供体冻结同一患者的所有技术与生物学重复留在同一 splitconsensus 集、universe、tokenizer、缩放、阈值与 QC 规则只能在训练数据上拟合。不要先用全部样本构建 universe 再切分——那会泄漏验证/测试位点的支持度。被排除的样本与重复聚合方式需单独记录。六个捆绑确定性 CLI 与合成测试六个辅助脚本的共同性质拒绝 URL、路径穿越、符号链接与特殊文件施加字节/记录/文件/坐标/worker 上限不联网、不导入 gtars、不写任何输出文件生成的计划只包含固定 argv 模板绝不执行它们python3 -B scripts/bed_validator.py --help python3 -B scripts/execution_plan.py --help python3 -B scripts/tokenizer_manifest.py --help python3 -B scripts/refget_digest_plan.py --help python3 -B scripts/coverage_preflight.py --help python3 -B scripts/artifact_inspector.py --help其中 execution_plan.py 支持--operation overlap|count|coverage|consensus|fragment-score内置GTARS_CLI_VERSION 0.9.0与GTARS_PYTHON_VERSION 0.9.2常量coverage 计划可指定--coverage-format bw|wig|bedgraph|npy默认bw、--smooth-size默认 5、--step-size默认 1、--count-type start|end|core|all默认core以及--coverage-streaming只允许 wig/bedgraph。coverage_preflight.py 则对 uniwig 生成做确定性预检验证本地路径、边界、排序、u32坐标、输出冲突与保守的稠密值预算写什么都不执行什么。仓库为这些脚本提供了合成测试tests/gtars/test_scripts.py、tests/gtars/test_static.py按技能文档以禁用字节码的方式运行PYTHONDONTWRITEBYTECODE1 python3 -B -m unittest discover \ -s tests/gtars -p test_*.py -v常见 CLI 用法速查0.9.0gtars-cli的当前子命令面完整参数见 skills/gtars/references/cli.mdgtars overlaprs --query query.bed --universe universe.bed --backend bits-e可选bits|ailist处理器默认bits--streaming被解析但被 v0.9.0 处理器忽略不要据此宣称低内存。输出是每行一个重叠的 universe 命中 BED3 写到 stdout——它不是计数表不保留 query ID需要行对齐计数请用 Pythoncount_overlaps。gtars igd create --filelist BED 目录 --output 索引目录 --dbname 名与gtars igd search --database 目录 --query query.bed当前只有create与search。gtars uniwig ...批量大文件无generate子命令与gtars uniwig bamqc --input aligned.bam --output bamqc.tsv --threads 1并行 QC 需要.bai索引NRF/PBC1/PBC2 是技术 QC 摘要而非生物学质量证据。gtars consensus --beds a.bed b.bed c.bed --min-count 2 --output consensus.bed--beds至少两个--min-count默认 1输出默认 stdoutBED4chr start end count。gtars ranges ...区间代数全家桶——reduce、trim、promoters锚定在区间 start不要假设链感知 TSS、setdiff、pintersect、concat、union、jaccard、shift、flank、resize、narrow、disjoin、gaps、intersect无--output时写 stdout。gtars fscoring fragments consensus [--mode atac|chip] [--output PATH]fragments 按FragmentFileGlob解释单个显式本地文件最安全默认模式ataccut-site 计分语义与默认输出fscoring.csv.gz--barcode稀疏模式写出prefix_matrix.mtx.gz、prefix_barcodes.tsv.gz、prefix_features.tsv.gz。gtars pb fragments barcode_to_cluster.tsv --output 目录当前伪批量拆分命令名是pb不是fragsplit。gtars genomicdist --bed regions.bed --chrom-sizes assembly.chrom.sizes --bins 250 --output distribution.json提供 chrom sizes 使分箱跨文件可比省略则按观测 end 定标、不适合跨文件比较。可选--gtf、--tss、--signal-matrix、--fastaGC 含量、--dinucl-freq、--dinucl-raw-counts、--ignore-unk-chroms、--promoter-upstream/downstream、--compact。gtars prep把 GTF/signal matrix/FASTA 序列化为 Gtars 专有二进制GDA/bin/FAB应视为带版本的原生数据——哈希输入输出、记录 0.9.0、拒绝未信任的序列化文件。线程与资源0.9.0没有全局--threads/--memory-limit/--verbose等选项并发按命令区分——批量 uniwig--threads默认 6、bamqc --threads默认 1、refget build --jobs默认 0自动。uniwig 批量模式构建与--threads精确相等的 Rayon 线程池流式模式的内存受平滑/间隙行为界定输出工作量可能随全组装跨度 / step size而非 BED 行数增长。建议从 1 线程 1 个小型合成 contig 起步测量峰值 RSS、临时磁盘与吞吐后再扩。迁移陷阱0.9 中已删除/过时的 API技能 1.1 版清除了以下过时示例出现即应视为错误信号Python 侧gtars.RegionSet、RegionSet.from_bed、TreeTokenizer、gtars.igd.build_index、gtars.uniwig.coverage_from_bed、gtars.RefgetStore应为gtars.refget.RefgetStore、全局set_option/set_log_level、parallel_apply以及虚构的异常类gtars.FileNotFoundError/InvalidFormatError/ParseError。0.9.2 也不提供total_coverage、filter_by_size、to_json/from_json、stream_bed、mmapTrue、parallelTrue等。CLI 侧uniwig generate、igd build/query/count、scoring score/batch、fragsplit split/cluster-split、refget digest/verify、overlaprs overlap/count/filter/subtract均为过时形式。错误处理应改为调用前校验只捕获与操作相关的窄异常try: regions RegionSet(reviewed-local.bed) except (OSError, RuntimeError, ValueError) as exc: raise RuntimeError(Gtars could not load the validated BED) from exc不要用宽捕获越过损坏行继续执行。附六份捆绑参考文档索引技能的六份捆绑参考都是本地存在的路径是深入某一主题的第一入口验证日期均为 2026-07-23文档覆盖范围python-api.mdPython 0.9.2 的精确导入面、已验证签名与行为overlap.md重叠/计数/集合代数与 consensus 语义含 RustIndexedRegionSet建一次查多次模式coverage.mduniwig、bigWig、两种 coverage 语义、排序与资源边界tokenizers.mdtokenizer/universe 与片段兼容性、manifest 与泄漏防护refget.mdsha512t24u/MD5 摘要、store、BEDbase 与网络/缓存控制cli.mdCLI 0.9.0 命令、feature 与迁移说明整套技能的设计逻辑可以概括为一句话把 Gtars 当作一个需要供应链审查的原生库来使用用本地确定性脚本守住输入契约用显式批准的边界包住网络与缓存再用 0.9.2/0.9.0 的精确 API 面完成区间计算——这也是该技能能被 AI Agent 安全自动化的前提。【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价