资讯动态

SDC数据库并购研究实操:从数据导出到变量构造的完整指南

发布时间:2026/10/7 3:40:53 来源:尧图企业网站定制
说实话我最早碰SDC数据库是在做并购绩效研究的时候那时学院刚买下Refinitiv原Thomson Reuters的Deals Intelligence权限我抱着反正就是下载数据的心态去拉样本结果被各种字段、筛选器、状态分类搞得一头雾水。后来前前后后用了两年才摸清这套数据库的脾气。今天这篇就把我从1986年到2023年并购样本的整套处理经验写出来覆盖SDC数据导出、字段含义、清洗规则、变量构造、股价匹配和常见错误排查这些实操环节给所有正在做并购研究、或者是想自己搭并购数据底表的同学一份能直接照着做的参考。1. 为什么是SDC并购研究的数据底座1.1 SDC数据库的前世今生SDC全称是Securities Data Company最早是一个独立的数据服务商专门收集全球股权、债券和并购交易信息后来被Thomson Financial收购又随Thomson Reuters并入Refinitiv现在归属伦敦证券交易所集团LSEG旗下产品名变成了Deals Intelligence但学术圈还是习惯叫它SDC。它的厉害之处在于两个第一覆盖范围极广并购交易从1980年代初就开始系统收录涵盖全球各大资本市场甚至包括一些非上市公司的交易第二字段结构非常细从公告日、生效日、交易金额、支付方式、交易态度到收购方和目标方的行业、国别、上市状态、财务顾问等等都有记录。我做的时间窗口是1986年到2023年这几乎是SDC能提供的完整历史纵深。选择这个起点有个现实原因SDC对1986年之前的并购收录相对稀疏很多交易缺少标准化的股价数据和财务数据支撑强行加入不仅样本量不完整还会在后续匹配CRSP和Compustat时大量丢失观测值。而1986年之后美国市场和欧洲主要市场的数据质量明显上了一个台阶公告日期、交易状态这些关键字段的可信度大幅提高。注意SDC并不是免费开放的数据库通常需要通过学校或机构的数据库订阅访问常见入口是Refinitiv Eikon或Web SDC平台。如果你的机构没有购买可以考虑用WRDS上的SDC镜像或者寻找研究机构的历史数据备份但无论如何数据使用协议一般禁止对外传播原始下载文件。1.2 1986-2023时间窗口背后的研究逻辑为什么一定要强调时间窗口因为并购研究里样本期基本决定了你能研究什么问题。如果你只取最近十年样本里大多是科技、医疗和新兴行业的交易金融和传统制造的比例被稀释而且你会错过几轮非常典型的并购浪潮——比如1990年代末的互联网并购潮、2008年金融危机前后的防御型并购潮、以及2015年之后的跨国巨型合并潮。从1986年开始拉数据你能完整覆盖这些周期性的波动在研究设计上可以有更多玩法可以做并购浪潮的驱动因素分析可以比较不同监管环境下的交易特征也可以做长窗口的事件研究比如公告后三年内的长期绩效。我个人的经验是时间跨度越长对清洗的考验越大。因为SDC对早期交易的信息录入不如近期完整你会发现1990年代很多交易的Target CUSIP是空的Ticker不存在甚至公告日只有一个年份没有月份。这不是数据库坏掉了而是当时的信息环境决定的历史局限。所以后面讲清洗时我会专门强调分时段处理的思路不建议对1986-1995和2010-2023用同一套字段完整度标准。2. 从SDC拉数据导出流程与字段取舍2.1 数据获取前的准备在打开SDC的Web查询界面之前我强烈建议你先写清楚三个东西研究问题、样本筛选条件、字段清单。听起来像废话但实操中无数人栽在这里。SDC的查询界面是分步筛选的逻辑你有大量筛选项可以选择时间范围、交易类型、地理范围、行业范围、上市状态、交易状态、交易金额下限等。如果不在动手前定义清楚很容易出现两种情况。一是条件过宽导出来几十万条记录其中大量是Minority Stake少数股权收购或者Asset Acquisition资产收购跟你想研究的控制权转移完全不是一回事。二是条件过窄比如只选美国并购结果把大量有国际视角的样本排除掉了。我自己的经验是准备一份查询条件清单至少包含交易公告日期1986/01/01 至 2023/12/31交易类型Merger合并、Acquisition of Majority Interest多数股权收购、Acquisition of Remaining Interest收购剩余股权交易状态Completed已完成交易金额建议设置下限如1百万美元过滤掉微型交易收购方或目标方上市状态视研究目的而定提示筛选条件里Percent of Shares Acquired收购股份比例很关键。如果你想研究控制权变更通常要求收购后持股比例在50%以上如果研究的是大股东增持这类话题则要放宽并单独记录收购前持股和收购后持股两个字段。SDC里直接用Percentage of Shares Owned After Transaction筛50%以上比事后清洗省力得多。2.2 关键字段拆解导出字段的选择直接影响后面所有工作。SDC的字段面板非常庞大我按重要性归成四组你可以在导出时按需勾选。第一组是交易识别字段包括Deal NumberSDC内部唯一编号、Date Announced公告日、Date Effective生效日、Date Terminated如果是终止交易则会有。其中Deal Number是最重要的它是后续合并、去重的唯一标识公告日是事件研究里的事件日0。第二组是交易双方信息Acquiror Name、Target Name以及它们的CUSIP、Ticker、国别、行业分类SDC的4位SIC码或行业细分代码。注意收购方和目标的代码不一定齐全尤其目标方是小公司时Ticker经常缺失。后面匹配股价数据时我会说怎么处理这部分。第三组是交易特征字段Transaction Value交易金额注意单位通常是百万美元、Deal Status状态、Payment Method支付方式现金、股票、混合、Attitude敌意收购还是友好收购、Form of Deal交易形式包括Friendly等。第四组是研究常用辅助字段Acquiror Ultimate Parent Name收购方最终母公司、Target Ultimate Parent Name、Number of Bidders竞标者数量等这些在做并购竞争和公司治理研究时非常有用。实际操作中不要一次导出所有字段。字段越多下载的数据文件越庞大而且很多字段会以弃留形式出现在同一行里处理起来很容易看花眼。按你本次研究的需求来够用就好。2.3 导出配置的常见选择SDC允许你选择需要显示的字段顺序也可以用Excel或文本格式导出。我的习惯是导出为表格文件比如TSV或CSV后再转码而不是直接用Excel打开原始导出文件因为数据量大时Excel容易崩溃并且SDC的文本文件偶尔带着奇怪的编码字符。导出时还有几个要注意的选项Deal Status要选Completed还是在事件研究里把Withdrawn也保留我的建议是研究公告效应时保留所有状态的交易公告反应用的是公告当天的信息冲击研究事后绩效时只看Completed。你可以在清洗阶段用状态字段拆分而不是一开始就筛死。金额单位确认。SDC的Transaction Value单位是百万美元这个别搞错。你在设金额下限时也要注意如果设1单位百万美元意味着100万美元以上如果设0.1就是10万美元以上。很多初始研究者在这里把尺度搞乱了。国家范围和汇率。SDC对非美元交易会给出美元换算后的金额但也有可能保留原始货币金额取决于你选的字段版本。如果研究跨国并购建议额外导出原始币种金额和汇率方便自己做稳健性检验。3. 清洗与变量构造把原始数据变成研究样本3.1 样本筛选的硬规则从SDC导出原始数据通常比你想的多得多尤其是1986到2023这个长窗口。我第一次拉的时候条件设得宽松结果导出30多万条记录把少数股权收购资产剥离杠杆收购全混在一起。这些能不能用取决于研究问题但如果是做经典的事件研究必须明确样本边界。我在多个项目里验证过的硬规则是只保留Deal Status为Completed或研究公告效应时额外保留Withdrawn并打标只保留Deal Form为Merger或Acquisition of Majority Interest删除Target与Acquiror相同的自我交易部分体内部重组按收购后持股比例Percent of Shares Owned After Transaction筛选一般要求大于等于50%对金融SIC 60-69和公用事业SIC 49行业很多研究选择剔除因为它们的并购受监管约束逻辑不同。但也有研究专门做金融业并购所以这个不是硬性标准全看你的研究问题。3.2 数据清洗的实操细节清洗是我花时间最多的一步。SDC的原始数据在下载下来后常见的脏数据有这几类重复记录、缺失代码、日期异常、金额缺失。重复记录。同一笔交易有时会以多行形式出现特别是在进行了一些嵌套收购比如先收购部分股权后又收购剩余股权时SDC会生成两个Deal Number。我的做法是把Deal Number作为主键去重同时用Acquiror Target Date Announced作为辅助键因为偶尔会有同一对公司在不同时间点的多笔交易这些不是重复要保留。缺失代码。这是最大的坑。Target CUSIP缺失的情况很常见尤其非美国公司。处理思路是先用WRDS上的CRSP/Compustat映射表通过公司名称做模糊匹配匹配不上的再手工查历史数据库实在缺失的标注并在回归中插补或剔除。这步耗时最长但也是最体现研究质量的地方。日期异常。有些交易的公告日早于1986年却在筛选时被包含或者生效日在公告日之前都需要写逻辑检查脚本。我习惯导入后在统计分析软件里跑一遍如果Date Effective - Date Announced小于0先人工看几条确认是数据错误还是特殊结构比如某些征求意见式交易。3.3 核心变量的构建清洗完之后就到了变量构造环节。根据我的经验以下变量是并购研究里最常用的我给你列一下构造逻辑交易规模Deal Size直接用Transaction Value取自然对数但要注意金额缺失问题。稳健性检验时可以用总资产标准化。支付方式Payment MethodSDC给出的是Cash、Stock、Mixed等文本建议转换为虚拟变量纯现金与否、纯股票与否方便做交叉分析。相对交易规模Relative Deal Size交易金额除以收购方公告日前一年的总市值或资产总额。这个变量对研究支付方式选择和短期市场反应很有用。累计异常收益CAR事件研究法的核心。需要先确定事件窗如[-1, 1]、[-3, 3]然后从CRSP取收购方股价数据用市场模型估算正常收益再用实际收益减去正常收益得到异常收益。估算市场模型时我一般用[-252, -31]作为估计窗避免事件窗污染。收购方是否拥有国际业务Cross-Border根据Acquiror Nation和Target Nation是否相同构造虚拟变量。注意变量构造建议分步骤写脚本每一步输出一个中间数据集方便回溯。我见过太多人一个脚本糊到底最后出结果时发现某个变量取错值全部要重跑。分步脚本虽然多写几行但调试成本低得多。4. 真实项目复盘1986-2023年样本验证4.1 样本量的预期与核对我对1986-2023年全市场并购样本做了一个实测统计。在条件为合并与多数股权收购、已完成、收购后持股大于50%、金额不低于100万美元时全球样本大约在12万到15万条之间。如果你加上了收购方必须为美国上市公司这一条样本会大幅缩水到1.5万到2万条左右这是很正常的因为SDC覆盖全球交易但CRSP可匹配的只有美国上市的股票。这里我特别想说不要拿别人的论文样本量硬套你的数据。每个研究的筛选条件不同同样做美国并购事件研究有的人用5,000个事件有的人用3,000个事件差异可能来自是否剔除了金融业、是否要求收购方在事件前必须有足够长度的股价历史、是否排除同时期多笔重叠公告等。只要你的筛选逻辑可复现样本量合理即可。提示写论文时一定要把样本构建流程单独写一小节说明每个筛选条件剔除了多少观测值最终留下多少。这是我复盘了多篇顶刊文章后总结出来的细节审稿人特别看重这个。4.2 与股价数据的匹配并购研究离不开市场反应而SDC本身不提供股价数据所以必须做SDC-CRSP匹配。这一步的操作顺序和细节非常考验功力。我的标准流程是从SDC导出Acquiror Name、Ticker、CUSIP、Deal Number。在CRSP里用PERMCO或NCUSIP做第一轮匹匹配不上的用Ticker加公告日前后时间窗口去CRSP历史名册里找。再匹配不上的用公司名称做模糊匹配。这一步建议用WRDS里的外部映射表或手工查找。有一点容易被忽略SDC的CUSIP有时是9位完整版CRSP里的NCUSIP也是9位但历史上可能有6位版本记录。匹配前要先把格式统一。如果你用的是WRDS的Excel加TotalLink等工具也能自动做一部分映射但我不建议完全依赖它们因为自律性检查很重要——每行匹配完成后至少手动抽查几十条记录确认收购方名称和时间窗与公告日吻合。4.3 实测中的坑我用1986-2023样本做了事件研究后发现几个非常典型的坑写在这里供你参考。第一个是公告日的事与市错位。SDC记录的公告日有时是宣布日但在CRSP上某些公司股价在宣布前就有明显异动原因是消息提前泄漏。学术上不算错但你要注意事件窗如果只取[-1, 1]可能错过前期的信息泄漏稳健性检验建议扩展到[-3, 3]或[-5, 5]。第二个是多重公告问题。一笔并购在谈判过程中可能有多次公告SDC可能会生成多条记录如果没有按Deal Number和公告日去重会导致同一事件在样本里出现多次严重偏倚CAR计算。我在处理时会在清洗环节以Deal Number 最终状态为口径去重同时保留最早公告日作为事件日。第三个是跨国并购的钱口径。很多非美国交易的金额是用原币记录的SDC自动折算成美元后可能因为汇率时点不同而波动。建议在稳健性检验里对金额数据用公告日前一个月的平均汇率重新折算检验结论是否稳定。5. 常见问题与排查技巧实录我整理了下面这张速查表这些都是我实操中真正遇到并且反复确认过的点你可以直接拿来对照。问题现象常见原因解决思路样本量异常庞大几十万行未筛选Deal Form混入了资产收购和少数股权收购明确只保留Merger和Acquisition of Majority InterestTarget CUSIP大量缺失非美国公司、早期交易信息不全通过名称匹配CRSP或Compustat再不行就标注缺失同一交易重复出现多次多重公告或者SDC生成多个Deal Number以Deal Number主键去重辅助用双方名称和公告日期事件日前后股价无变动公司停牌、代码变更或者匹配到了错误公司逐条抽查匹配结果核对名称和公告日交易金额为0或缺失未披露具体金额、部分交易仅有股权比例区分真实未披露和下载格式问题稳健性检验中插补或剔除同一家公司有多个Ticker历史代码变更、合并后代码失效用CUSIP或PERMCO为主键而非TickerCAR结果异常高或异常低事件窗重叠、公告日错误、估计窗包含其他重大事件逐一检查异常值样本必要时剔除多重公告冲突事件除了速查表还有几个经验想多说两句。一是Excel打开乱码问题。SDC导出文件如果包含欧洲字符或非ASCII文本在Windows自带的Excel里经常打开乱码。我后来直接用支持UTF-8的编辑器或数据库软件读取再另存为干净格式避免编码折磨。二是切勿把SDC当成唯一数据源。对于1986-1995年这段很多并购细节存在缺失比如支付方式里的Stock具体份额、交易完成后是否整合等信息不够全我建议结合Capital IQ、Zephyr或手工整理的公司公告来补充。不同数据库对同一笔交易的记录有细微差异做关键变量敏感性分析时最好用另一套数据交叉验证。三是注意下载日期和数据版本。SDC会不定时修正历史数据同一个Deal Number在不同批次下载中金额或日期可能不同。严谨的复现做法是在数据文件里记录下载日期和数据库版本号并在论文中注明。这个细节平时没人管但这两年复现性审查在顶刊里越来越严格有备无患。四是小心自我收购和内部重组。如果你直接拉全部并购SDC会把一些上市公司私有化、母公司吸收子公司等交易也放进去。它们技术上算并购但经济逻辑完全不同建议根据研究目的增加对Acquiror和Target关系的判断比如是否为同一最终母公司不能想当然地全部删除而是要有可复现的标准。结语我的几点实际操作体会写在最后玩SDC数据库几年下来我最深的感触是并购数据没有一步到位这回事。每一个你拿到的数字背后都有一连串关于口径的定义、关于状态的筛选、关于编码的匹配。1986年到2023年这个长窗口数据量大、维度多处理起来比那些只拉三五年的研究要繁琐得多但也正因为如此清洗出一个高质量、可复现的样本后后续研究的基础会非常扎实。我个人在实际操作中最受益的一个习惯是分步留痕。每做一次筛选、每构造一个变量都把中间数据单独存一份文件名带日期和版本号。这样既方便回溯也方便在写作时向审稿人展示样本构建逻辑。另一个实用技巧是在做大规模匹配之前先随机抽20条手工核验SDC和CRSP的对应关系确认匹配逻辑没问题再跑全样本可以省下大量返工时间。如果你现在正在为论文或者报告准备并购数据我建议你就按我上面这套流程走一遍从明确筛选条件开始到导出字段再到清洗去重和变量构造每一步都做记录。数据库没有大家说的那么玄大部分坑都是重复性的只要踩过一次并总结成清单后面就会顺畅很多。希望大家都能从SDC这个数据底座里做出扎实的研究来。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑