资讯动态

unilm 仓库中 MoE 语言模型预训练数据卡片解读:1.1T 参数模型背后的 112B Token 数据全貌

发布时间:2026/9/14 8:37:46 来源:尧图企业网站定制
unilm 仓库中 MoE 语言模型预训练数据卡片解读1.1T 参数模型背后的 112B Token 数据全貌【免费下载链接】unilmLarge-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities项目地址: https://gitcode.com/GitHub_Trending/un/unilm本篇技术指南以 kosmos-2/fairseq/examples/moe_lm/data_card.md 为核心系统解读 Meta AI 论文《Efficient Large Scale Language Modeling with Mixtures of Experts》中 1.1T 参数 MoE 语言模型的预训练数据从数据动机、六大子数据集构成、采集时间线到清洗预处理、验证集划分、用途限制与维护机制并结合本仓库中的模型卡片与 fairseq 源码讲清楚这套数据是什么、怎么来的、怎么用。1. 背景为什么需要一张数据卡片该数据卡片遵循 Gebru et al. (2018) 的数据集文档规范为训练1.1T 参数 MoEMixture of Experts语言模型的预训练数据提供结构化描述。论文对比了自回归 MoE 语言模型与稠密dense模型在领域内/领域外语言建模、零样本与少样本提示、全量微调等场景下的扩展性表现仓库入口见 kosmos-2/fairseq/examples/moe_lm/README.md。数据创建目的预训练英文语言模型。数据由六个英文数据集合并而成——包括 RoBERTaLiu et al., 2019使用的五个数据集外加 CC100 的英文子集。创建与资助方Meta AI数据由机器挖掘、过滤、采样而非人工标注。训练总量约112B tokens对应 453GB文本数据。在仓库配套的 kosmos-2/fairseq/examples/moe_lm/model_card.md 中这六个子数据集同样被列为模型训练数据二者相互印证模型卡片还补充了关键结论1.1T MoE 模型相比 6.7B 稠密模型参数增加约 160 倍但 FLOPs 仅增加约 30%——这正是稀疏激活架构带来的效率收益也是这套数据支撑超大模型训练的直接背景。2. 数据组成Composition六大英文语料的并集2.1 六个子数据集明细训练数据是以下六个公开数据集的并集union每项来自论文或配套卡片具体如下数据集规模内容与来源说明BookCorpus4GB超过 1 万本未出版书籍Zhu et al., 2019English Wikipedia12GB英文维基百科排除列表、表格与标题CC-News76GB约 6300 万篇英文新闻文章抓取于 2016 年 9 月至 2019 年 2 月Nagel, 2016OpenWebText38GBGPT-2 所用 WebText 的开源复刻Gokaslan and Cohen, 2019CC-Stories31GBCommonCrawl 子集过滤以匹配 Winograd 模式的故事风格Trinh and Le, 2018English CC100292GB从 2018 年 1 月至 12 月的 CommonCrawl 快照中抽取按 CCNet 方法论过滤以匹配维基百科风格Wenzek et al., 2020注意这里CC-News 76GB与CC100 292GB等均为原始语料体积合并后经过去重等清洗最终得到112B tokens / 453GB的训练数据。CC-News 与 English CC100 均源自 CommonCrawl因此数据中可能包含直接查看时令人不适的语句。2.2 实例类型与标注情况实例形态每条实例是原始文本raw text无标签、无目标值实例之间不存在显式关系。采样属性English CC100 是从更大规模 CommonCrawl 快照中抽取的子集2018.01–2018.12维基百科风格过滤CC-Stories 同样是 CommonCrawl 的过滤子集。数据划分从预训练数据中按各子数据集大小按比例随机抽出约 150MB 作为验证集用于训练过程中的验证。2.3 隐私与敏感性说明六个数据集均为公开数据无保密内容预处理软件为 Meta Platforms 专有当前未公开。数据涉及人物新闻、维基百科描述等除有维基百科词条的公众人物外若 CommonCrawl 中存在姓名、Twitter 账号等信息理论上可识别其他个体数据部分源自 CommonCrawl可能包含敏感信息。3. 采集过程Collection Process获取方式N/A——数据是六个公开数据集的并集非问卷、传感器或人工采集。采集机制全部由机器挖掘、过滤与采样完成无人工作业。采集时间线各子数据集采集时段不同CC-News2016 年 9 月 – 2019 年 2 月爬取的英文新闻文章English CC1002018 年 1 月 – 2018 年 12 月 CommonCrawl 快照。伦理审查未进行机构审查委员会IRB流程但针对数据主体的影响执行了部分Responsible AIRAI评估详见论文正文与模型卡片。4. 预处理、清洗与标注Preprocessing / Cleaning / Labeling4.1 通用清洗规则各组成数据集经历了标准清洗与重新格式化包括移除重复/无信息文本例如删除类似Chapter One的章节标题噪声删除类似This ebook by Project Gutenberg的电子书版权/模板文本。原始组件数据集仍可在各自原始出处获取详见 data_card 参考文献但清洗软件不对外公开。4.2 预训练时的数据呈现格式仓库 kosmos-2/fairseq/examples/moe_lm/README.md 明确给出了预训练阶段模型看到的数据格式每行一个段落空行分隔不同文档doc0,para0,tok0 ... doc0,para0,tokX doc0,para1,tok0 ... doc0,para1,tokY doc1,para0,tok0 ... doc0,para0,tokX ...4.3 换行符处理一个关键工程细节模型使用 GPT-2/3 的 byte-level BPE但 fairseq 预处理会把换行符替换为句尾符/s对应 embedding 索引2。这意味着模型在预训练期间从未见过真正的换行符——少样本提示时也不应使用换行符而应匹配预训练格式。该机制在源码中有直接实现kosmos-2/fairseq/fairseq/hub_utils.py 的score()方法def score(self, sentences, replace_newline_with_eosFalse, **kwargs): ... def encode(sentence): if replace_newline_with_eos: return torch.cat([self.encode(line) for line in sentence.splitlines()]) else: return self.encode(sentence)即传入replace_newline_with_eosTrue时输入会按行拆分、逐行编码后拼接等效于把每行段落末尾的换行替换成/s。README 还给出了正反对比示例直接对含换行的多行文本调用lm.score(data)会把换行也编码进 token 序列\n in lm.decode(tokens_bad)为 True而启用replace_newline_with_eosTrue后\n not in lm.decode(tokens_good)行为才与预训练一致。这对复现论文评估结果至关重要。5. 用途Uses已用任务用于预训练论文所述模型1.1T MoE 及其对比的稠密模型。可扩展用途可作为英文语言模型预训练语料是众多当前与未来语言任务的基础。使用注意该数据构建流程展示了构建可扩展数据挖掘基础设施的路径未来使用者需注意数据源自 CommonCrawl 的子集可能包含偏见或不当内容。禁用场景卡片声明无明确禁用任务但模型卡片补充强调模型仅用于研究目的如复现评估结果主要用途不是文本生成生成仅在解释/论证或提示/探测类别标签的有限场景中使用。5.1 配套评估数据与模型的 RAI 关联模型卡片记录了 1.1T 模型在StereoSet与CrowS-Pairs上评估编码偏见性别、职业、种族、宗教等维度并观察到稠密与 MoE 模型随规模增大Stereotype ScoreSS均变差——这与数据来自公开语料含 CommonCrawl直接相关也是数据卡片敏感性说明一节在实践中的印证。6. 分发Distribution与维护Maintenance分发当前不向第三方分发无 DOI无计划分发时间无版权/IP 许可或 ToU无出口管制限制。维护方Meta AI负责支持/托管/维护联系渠道见论文正文。更新策略无更新计划无勘误表不承诺对旧版本持续支持也不提供第三方扩展/贡献机制。数据保留因不直接涉及个体数据采集无相关保留期限限制N/A。7. 参考文献数据卡片引用文献数据卡片引用的关键文献按其在卡片中的出现顺序Liu et al., 2019.RoBERTa: A Robustly Optimized BERT Pretraining Approach.Zhu et al., 2019.Aligning Books and Movies: Towards Story-like Visual Explanations.BookCorpusNagel, 2016.CC-News.CommonCrawl 新闻数据集公告Gokaslan Cohen, 2019.OpenWebText Corpus.Trinh Le, 2018.A Simple Method for Commonsense Reasoning.CC-StoriesWenzek et al., 2020.CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data.English CC100 的维基风格过滤方法8. 总结该数据卡片描述的是 Meta AI 1.1T MoE 语言模型的预训练数据六个公开英文语料并集 → 112B tokens / 453GB全部由机器挖掘、过滤、采样生成。核心工程要点在于预训练数据格式与换行符替换机制每行一段、空行分文档、换行以/s呈现少样本提示必须匹配该格式见 kosmos-2/fairseq/examples/moe_lm/README.md 与 hub_utils.py 源码实现。数据不对外分发、无更新计划使用受限方面包括来自 CommonCrawl 子集的潜在偏见与敏感内容模型卡片中以 StereoSet / CrowS-Pairs 的 RAI 评估作为补充说明见 kosmos-2/fairseq/examples/moe_lm/model_card.md。如需复现论文评估可进一步阅读 kosmos-2/fairseq/examples/moe_lm/README.md 中稠密模型125M–13B与 MoE 模型15B–1.1T的加载与评估示例含 COPA 零样本评估代码与数据格式说明。【免费下载链接】unilmLarge-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities项目地址: https://gitcode.com/GitHub_Trending/un/unilm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价