ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

A股董事网络位置数据2006-2024:中心度与结构洞指标详解

2026/10/5 8:23:16 拓冰建站 浏览量
A股董事网络位置数据2006-2024:中心度与结构洞指标详解 1. 先搞清楚这份数据到底是什么解决什么问题做公司金融、公司治理实证研究的朋友应该都有过类似的经历研究假设里需要“董事网络位置”或者“社会资本”作为解释变量但翻遍公开数据库要么只有股东数据要么董事信息零散不连续想用的时候无从下手。这个标题里提到的数据就是专门为这类研究准备的——2006到2024年覆盖A股上市公司的董事网络位置关系数据、中心度数据和结构洞数据。先解释一下“董事网络位置关系”的含义。它的核心逻辑并不复杂如果两名董事都在同一家公司担任董事职务那么这两个人之间就存在一条连接边。把所有上市公司董事作为节点、把“共同任职”作为连线就能构成一个跨公司、跨行业的社会网络。在这个网络里有的董事身处核心位置能接触到大量信息和资源有的董事则处于边缘信息渠道单一。这种位置的差异恰好在公司治理、投资效率、创新决策、信息披露质量等大量研究主题中都有解释力。这套数据的价值在于几个方面。第一时间跨度足够长2006年到2024年接近二十年可以做长窗口的面板分析覆盖了股权分置改革之后的完整市场化周期。第二指标比较完整不只是给你网络关系图直接把中心度Centrality和结构洞Structural Holes两大类的常用指标都计算好拿过来就能用。第三粒度细到“董事-公司-年度”既可以从公司层面聚合也可以从董事个人层面展开研究。适合哪类读者如果你正在写经管类硕士或博士论文或者准备投稿到公司金融、会计、公司治理方向的期刊这份数据能帮你省掉大量从零爬数据、清洗文本、计算网络指标的时间。当然如果你只是对社会网络分析感兴趣想看看上市公司董事之间的关系长什么样这份数据也能提供现成的研究素材。2. 从数据到研究理解董事网络的构建逻辑与指标含义2.1 网络构建的基本规则为什么“共同任职”能构成连接市面上有些文章把董事网络说得很玄乎动不动就是“复杂系统”“社会资本理论”但其实数据构建的第一步非常朴素连接的定义就是“同一家公司董事会里共事过的两个人”。举个例子。张三在A公司当独立董事李四也在A公司当独立董事那么张三和李四之间就有直接的连接边。如果张三同时还担任B公司的董事而王五也在B公司任职那么张三又把A公司的董事会圈子与B公司的董事会圈子连通了起来。这样一来一笔看似普通的个人兼职实际上搭建了不同公司之间的信息桥。这种定义方式在国内外学术文献中都很常见已经被反复验证和使用过。它的好处有三个一是数据可得性强。上市公司年报、董事任职公告、CSMAR和Wind里都有完整的董事会成员名单获取门槛低。二是可复现性高。只要基于同一套原始数据按照同样的规则构建网络任何人算出来的结果都一样学术研究的复现性要求能得到满足。三是经济意义明确。董事兼任不同公司的职务本身就会把一家的经营策略、行业经验、人脉资源带到另一家这种客观存在的交流渠道与“知识溢出”“资源获取”等理论机制高度契合。实际操作中网络构建通常以年度为单位。也就是说在某一年内两个人是否在至少一家公司的董事会中同时出现如果有就在当年的网络中建立一条边。年与年之间的网络是独立的这和研究中的面板结构正好对应。2.2 中心度指标家族程度、接近、中介、特征向量各自表达什么中心度这一类指标量化的是一个节点在网络中占据位置的“核心程度”。不同指标从不同角度切入理解它们的差异是做实证分析时选择指标的前提。先把最常用的几个指标讲清楚程度中心度衡量的是“直接认识多少人”。在董事网络中一个董事同时在多家公司任职直接连接数自然就多。这个概念最直观也最容易解释但它只看直接邻居忽略了间接关系。比如A公司与B公司之间隔着一层关系这种间接的信息通道程度中心度反映不了。接近中心度衡量的是“到网络内所有其他节点平均要经过多少步”。步数越少意味着信息从网络一端传递给该节点的路径越短获取信息的效率和速度越高。这个指标比较适合用来研究信息传播类问题比如股价崩盘风险、信息披露质量。中介中心度衡量的是“有多少最短路径要经过这个节点”。换句话说这个节点是不是很多信息交流的必经之路。如果某个董事在两个互不相连的董事圈子之间充当唯一桥梁他的中介中心度就会很高。这一指标与社会资本、资源控制权的理论逻辑最为贴近在讨论“权力”“关键节点”时经常被采用。特征向量中心度则是“你连接的人有多重要你就多重要”的思路。一个董事连接的虽然不多但他身边的董事都是网络中的核心人物那么他的特征向量中心度也不低。这个指标适合研究观点扩散、影响力传导一类的问题。下面的表格可以帮你快速对照不同指标的特点指标核心问题信息含义研究场景举例程度中心度你直接认识多少人信息获取的广度企业创新、风险承担接近中心度你离所有人有多远信息传递的速度信息披露、崩盘风险中介中心度多少信息必经你手资源控制与桥接融资约束、资本成本特征向量中心度你的朋友有多重要影响力的深度扩散战略决策、同群效应2.3 结构洞指标限制度才是真正好用的那一个结构洞理论与中心度思路不同它关注的是“桥接能力”的另一面——你在多大程度上是别人之间连接的“必要中间人”。结构洞的核心逻辑是如果A和B两个群体之间没有直接连接它们之间的信息流通必须依赖某个中间人C那么C就占据了结构洞位置并因此获得信息优势和控制优势。学术界一般用伯特Burt提出的四个指标来量化这种位置优势有效规模、效率、限制度、层级。其中最常用、最稳健的是限制度。限制度的含义可以这样理解你的网络关系有多集中、多依赖于某几个人。如果一个人的所有关系都集中在一个小圈子里他对这些关系的依赖程度就高限制度指数也就越高意味着他的网络自主性反而低。因此在实证分析中通常是用限制度的负向或倒数来衡量结构洞的丰富程度。实际论文里经常看到两种用法直接使用限制度指数本身数值越小代表结构洞优势越大或者用有效规模来度量规模越大代表跨越结构洞的能力越强。两种用法各有侧重前者更偏“约束视角”后者更偏“资源视角”。需要注意中心度和结构洞并不是一回事。一个中介中心度很高的节点未必限制度就低。因为中介中心度高说明他处于很多信息通道上但通道两端的群体可能已经认识彼此那他并没有真正地“控制”信息流动而结构洞优势要成立恰恰需要连接的两端彼此不连通。所以研究设计时最好把两类指标都纳入分析框架或者在稳健性检验中交替使用而不是简单替代。3. 拿到手的字段长什么样数据结构与面板组织方式3.1 核心字段说明与计算口径一份完整的董事网络数据通常包括三大块信息身份匹配字段、网络位置字段、年度标识字段。数据分析前先明确这些字段的含义能省掉很多后续排查的功夫。身份匹配字段主要包括公司证券代码、公司简称、年度、董事姓名、董事性别、董事年龄、任职类型执行董事、独立董事、外部董事等。其中证券代码和年度是面板匹配的键值董事姓名是个人层面追踪的识别信息。如果你要研究独立董事网络或者区分执行董事与非执行董事任职类型字段就有用了。网络位置字段包括该董事当年所在网络的节点总数、该公司当年的董事会规模、该董事在当年网络中的连接数量。有些数据还会给出一度连接、二度连接范围内的节点数量方便做局部网络密度分析。这些字段不需要你手工计算但理解它们的计算口径很有必要——节点总数是指当年整个A股董事网络的节点合计而不是公司内部的董事数量。中心度字段与结构洞字段则有程度中心度、接近中心度、中介中心度、特征向量中心度、限制度指数、有效规模、效率、层级等。每个指标都有明确的量化定义使用前建议先看数据说明文档中的公式版本因为不同软件如Ucinet、Pajek、NetworkX计算出来的数值可能会有细微差异——比如是否对指标做了标准化处理是否包含节点自身等。3.2 面板数据的组织方式公司-年度层面还是董事-个人层面从研究模型来看面板数据的组织方式直接决定了最终用于回归的数据形态。如果你做的是公司层面研究比如“董事网络中心度对公司投资效率的影响”通常需要先把董事个人的中心度聚合到公司-年度层面。常见的聚合方法有取均值、取最大值、取最小值或者采用董事会中所有非独立董事的中心度总和。不同的聚合方法含义不同均值反映整体网络资源禀赋最大值反映“最强人脉”的边际贡献总和则强调人力资本体量。建议在正文中采用一种主回归口径稳健性检验中更换其他口径看看结论是否稳健。如果你做的是董事个人层面研究比如“独立董事的网络位置与其监督职能的关系”那就保留董事-公司-年度的细粒度记录同时考虑同一个董事当年在不同公司之间的同一网络位置可能重复出现的问题。需要提醒的是证券代码和年份的匹配是面板分析的关键动作。如果只用公司简称同一家公司改名后会出现两张“皮”如果只用年份而忽略会计区间调整部分公司年报披露日和基准日错位也会干扰网络构建的时点。所以拿到数据后第一步永远是用“证券代码年份”确认面板的平衡性。4. 数据构建过程与质量把控一份可用数据的诞生记4.1 原始数据来源与清洗链路这套数据能覆盖2006-2024年离不开监管环境下上市公司信息披露质量的持续改善。事实上2006年之前很多公司的董事任职信息既不完整也不规范年报中披露的董事会成员名单经常有遗漏、笔误甚至同名混淆强行用到研究里反而容易引入噪声。数据构建的源头一般来自上市公司年度报告中的“董事、监事和高级管理人员情况”章节以及上市公告中关于董事任职、离任、换届的临时公告。抓取原始文本之后清洗链路通常包括几个步骤统一公司名称简称、统一董事姓名处理同名不同人的识别、剔除已离任或未就任的“名义董事”、按公司-年度汇总形成“公司-年内董事名单”。值得一提的是一些不太被注意的细节处理。比如董事兼任高管的情况并不罕见有的公司在披露时会把同一人列在“董事会成员”和“高级管理层”两处如果不做去重网络连接会被重复计数又比如年度中期换届导致董事长、董事名单发生变动那么需要确定以期末在任名单为准还是按月加权计算“全年任职”的状态。这些处理方式不同可能造成同一家公司在同一年的网络指标出现明显差异。4.2 时间跨度的连续性与口径统一从2006年至今接近二十年的时间跨度里A股上市公司从千余家的规模发展到五千余家董事网络的节点数和边数都翻了数倍。如果直接把不同年度的网络指标直接跨期比较需要思考一个问题指标数值的变化到底是“位置变化”还是“整体网络规模变化”带来的在网络规模越来越大的情况下即使一家公司董事的个人人脉毫无变化他所在网络的节点总数变多绝对数值的中介中心度也可能随之提升。因此数据在很多情况下会提供标准化后的指标值或者适合用于跨期比较的版本。这一点在做实证时特别重要尤其当你的样本跨越了较长时间区间时建议在回归模型中加入年度固定效应以吸收网络整体规模变化的影响。另外早期A股市场的董事兼任现象不如后期普遍这可能与职业经理人市场和独立董事制度的成熟度有关。2006年左右独立董事制度刚全面推行不久很多公司是从“没有”到“有了”但真正形成跨公司兼任网络的比例并不高2015年以后随着PE/VC背景董事、学术背景独立董事的大量出现董事网络的密度显著提高。这种阶段性特征在做分时段异质性分析时值得利用。4.3 数据质量校验的几个抓手拿到一套现成的董事网络数据还是要有最基本的校验意识。经验上我会从几个方向做质检快速判断数据靠不靠谱。第一看节点数和边数的变化趋势。A股上市公司数量2006年约1400家2024年约5300家董事网络的总体规模应该随之增长。如果某一年突然出现节点数骤降或骤升就要警惕当年数据是否存在缺失或重复合并的问题。第二抽查公司董事会规模。正常A股上市公司董事会人数通常在5到15人之间。如果数据显示某公司董事会人数只有1人或者超过20人大概率是原始数据或清洗过程出了问题。用已知的常识约束来排查数据质量是成本最低的质检方式。第三对比知名案例。比如国内有几家资本系族的典型公司其核心人物同时在多家上市公司担任董事这是公开信息。可以挑一两个这样的例子看数据中对应人物的连接数量是否符合公开事实。如果对不上就需要进一步沟通数据口径了。5. Stata实操用这份数据跑起你的第一个回归5.1 面板数据的声明与合并准备拿到基本数据后第一步是把董事网络数据与公司财务数据合并成一个公司-年度面板。这里以Stata为例完整跑一遍核心流程。先假设你手上有两个文件一个是公司财务面板文件含证券代码、年份、总资产、ROA、资产负债率等另一个是董事网络位置数据文件含证券代码、年份、董事姓名、各项中心度与结构洞指标。先把两个文件都导入然后确认证券代码与年份的格式一致。很多早期数据中的证券代码是字符串类型包含首尾空格或前导零直接合并会导致大量匹配失败。* 导入财务数据 import excel company_finance.xlsx, firstrow clear rename stockcode stkcd destring year, replace duplicates drop stkcd year, force save finance_panel.dta, replace * 导入董事网络数据 import excel director_network.xlsx, firstrow clear rename stockcode stkcd destring year, replace * 生成公司层面聚合变量董事会中心度均值 collapse (mean) degree closeness betweenness eigen constraint (max) max_degree, by(stkcd year) * 与财务面板合并 merge 1:1 stkcd year using finance_panel.dta keep if _merge 3这里特别讲一下collapse这一步。上面用了均值聚合如果你的主理论强调“最强的个人关系”你可以换成最大值聚合如果强调“网络资源总量”则用总和。每种聚合方式对应不同的经济含义没有绝对的“正确”只有是否与研究假设匹配的问题。5.2 描述性统计与相关性分析的必要动作合并完成之后不要急着回归。先做描述性统计和相关性分析这一步不仅是为了论文表格更是为了发现数据中的异常值。通常的做法是先看核心变量的分位数。如果一个变量的最大值为均值的几十倍说明存在极端值需要考虑缩尾处理。比如中心度和结构洞指标由于网络幂律分布的特性少数关键董事的中介中心度会特别大直接放进回归模型会让估计结果被少数观测值主导。经验上对这类变量做上下1%或2%的缩尾处理是比较常规的做法有的研究也会取对数转换以压缩量纲。相关性分析同样值得花时间。董事网络指标与公司规模之间往往存在正相关关系——大公司天然更容易吸引有兼职网络的董事这是正常现象但回归时要格外关注多重共线性问题。可以计算方差膨胀因子如果多个网络指标同时放入模型导致VIF过高说明这些指标之间确实高度重合此时就要重新思考指标选择而不是硬塞。5.3 固定效应回归主模型做公司治理实证固定效应模型是最常见的基准模型选择。公司固定效应可以吸收不随时间变化的公司特征年度固定效应可以吸收宏观经济冲击与制度变化。董事网络变量由于具有较强的时间持续性在公司固定效应下有时会表现出显著性下降这并不代表网络变量不重要而恰恰说明识别变异主要来自于时间维度上的网络变化。主回归模型的典型写法如下xtset stkcd year xtreg investment c_degree roa size leverage, fe vce(cluster stkcd) est store m1 xtreg investment c_betweenness roa size leverage, fe vce(cluster stkcd) est store m2 xtreg investment constraint roa size leverage, fe vce(cluster stkcd) est store m3 esttab m1 m2 m3, b(%6.3f) se(%6.3f) star(* 0.1 ** 0.05 *** 0.01)如果做的是中介效应或机制检验可以考虑使用递进回归的结构先检验董事网络对主因变量和机制变量的关系再检验加入机制变量后网络变量的系数变化。但无论采用什么模型设计都要记得用聚类稳健标准误处理公司层面上的序列相关性。这不只是技术问题更是实证严谨性的底线要求。5.4 内生化处理董事网络并非随机分配做董事网络研究最容易被审稿人追问的问题就是内生性有能力的董事选择进入更好的公司或者更好的公司更能吸引有资源网络的董事因果关系到底是哪边如果只做普通面板回归结论很可能被批判。几种常见的应对方法需要提前准备。第一种倾向得分匹配或赫克曼两阶段以控制可观测的公司特征对董事网络选择的影响第二种使用滞后的网络变量作为当期解释变量一定程度上缓解同期反向因果第三种寻找外部冲击作为工具变量——比如使用独立董事制度变迁、地区性人才引进政策等外生事件。最朴实的做法是在正文中坦诚讨论可能存在的内生性方向并在稳健性检验中逐步添加控制变量和固定效应观察系数是否仍然稳定。无论采用哪一种策略网络数据本身只是基础原料研究设计的严谨性才是论文能不能立住的根本。这一点在使用任何现成数据时都适用。6. 常见问题与排查技巧实录6.1 大量孤立节点很多董事为什么中心度为0打开数据后你可能会发现相当一部分董事的中心度数值是0连接数为0这不是bug而是网络中的真实状态。原因在于董事网络构建要求“至少在一家公司的董事会中与其他董事共同任职”。如果一个董事全年只在一家公司任职且没有在其他公司兼职他在跨公司网络中的直接连接关系就是0。这里想提醒的是连接数等于0不代表他没有内部网络只是说明他的“外部网络连接”为零。在研究“董事网络”时这类孤立节点通常也被纳入分析考察的是“有无外部连接”的边际效应。但如果你发现孤立节点比例高得离谱比如超过60%就要警觉了。一个可能的解释是构建网络时只抽取了独立董事而独立董事的兼职连接确实更少另一种可能是原始数据中同一家公司的董事名单存在大量缺失导致很多应该存在内部连接的节点被孤立。这个时候建议用几家“董事全员披露”的公司来人工核对数据中显示的公司董事数量。6.2 同一董事兼任多家公司个人层面与公司层面的冲突当同一个董事兼任两家公司董事时他在两家公司的当年记录中是同一个节点但这两条记录对应的中心度数值是相同的。如果你在公司层面做聚合这没问题但如果做董事个人层面的回归就需要考虑观测值之间的相关性——同一个人的多条记录不满足独立性假设。处理办法也不复杂。一是在回归中对董事个人方向做聚类调整使用vce(cluster director_id)二是在样本中只保留董事的“主职公司”记录比如以薪酬更高或者任职时间更长的那家公司为基准三是干脆把同一董事当年所有公司记录合并成一条以人-年度为分析单位。这些选择会改变样本量也会改变研究问题的层次关键在于与你的假设保持一致。6.3 年份匹配错位年报披露日与年末基准日的差异年报虽然反映的是12月31日的状态但实际披露时间往往滞后3-4个月。在这段间隔里董事会成员可能已经发生了变动。极少数公司在披露年报后立刻公布董事辞职公告年报中列示的董事成员在当年已经离任如果直接用年报名单构建网络就会高估实际任职期间的网络连接。处理思路有两种一是用年底任职状态为准追溯公告剔除在年末前已确定离任的人员二是用年初到年末的平均任职人数作为网络规模的近似。学术界常见做法是采用年报披露的期末名单因为数据的可获得性和一致性更好但这不妨碍你在稳健性检验中尝试不同口径确认网络指标的变化不会逆转核心结论。6.4 跨期比较时指标标准化直接用原始值还是标准化值在接近20年的长面板里董事网络的绝对规模发生了巨大变化。如果直接拿2006年的中介中心度和2024年的中介中心度做跨期回归其实是在两个完全不同的网络规模背景下比较一个绝对数值这会带来解释上的困难。处理办法是优先使用标准化版本或者按年度对网络指标进行排名、转换为百分位秩再进入回归。字段中如果同时提供了原始值和标准化值主回归建议使用标准化版本稳健性检验用原始值。7. 一点真实的经验与建议翻阅了不少使用这份数据做研究的项目有一个共性现象真正让论文差评的往往不是网络指标的计算错误而是指标选择与理论机制之间的脱节。比如研究“董事网络与创新”只放一个程度中心度实际上衡量的是创新资源的广度而不是信息流动的效率这时候同时加入中介中心度或结构洞才能讲清楚“网络位置通过何种渠道影响创新”的故事。所以我的建议是拿到数据后不必急着跑显著性先花两三天时间阅读核心文献搞清楚你要用的指标在理论上到底对应什么机制。再回到数据里用描述性统计和可视化看看这种机制是否在指标上有所体现。数据只是工具判断一个董事网络指标是否“好用”最终标准还是它能否帮你把经济故事讲扎实。祝研究顺利。