第 13 讲 · 社交网络

社交网络把用户或机构作为顶点,把好友、关注、通话或共现作为边。最先要说明的是边的语义:好友关系通常无向,关注关系有向,互动次数可以作为权重;多种关系同时存在时形成异构网络。

网络不是自动存在的,要从数据中抽取

网络可以来自用户明确关系、交互日志,或对象在网页和内容中的共现。不同抽取规则会得到不同图:一次共同出现是否算边,边权按次数还是时间衰减,都会影响后续结论。

得到图后可用邻接矩阵表示,再把节点属性、文本内容和关系结构结合起来。课件区分两条路线:社交网络分析主要挖掘结构,内容挖掘处理文本、关键词和情感;实际任务经常同时使用二者。

三种中心性回答三种“重要”

大作业引入了三种节点指标:

  • 度中心性高:直接联系多,适合第一轮广泛触达;
  • 接近中心性高:到其他节点的平均最短距离小,信息能较快到达全网;
  • 介数中心性高:大量最短路经过该点,像连接不同群体的桥梁。

它们没有天然的统一排名。高连接的社区内部明星可能度数高,但跨社区桥接者介数更高。是否有“传播能力”,还取决于传播机制、边方向、权重和用户活跃度。

分类和链接预测的输出不同

节点分类给定部分用户标签,预测其他用户的类别,例如兴趣或点击倾向;链接预测则给出最可能新增关系的节点对,例如好友推荐。二者都可利用共同邻居、邻接向量相似性和节点属性,但监督目标不同。

使用邻居行为预测用户行为时,要保留训练与验证边界。若直接用待预测时刻之后的行为构造特征,或让标签只是输入的反编码,模型即使输出很“确定”也没有预测意义。

社区检测寻找内部稠密、外部稀疏的节点组

课件介绍了几类方法:

  • 基于可达子图,如 kk-clique、kk-club;
  • 把邻接向量视为特征,用余弦或 Jaccard 相似性后聚类;
  • 图分割最小化社区间割边,同时要防止退化成单点社区;
  • 密度聚类用 Eps 邻域和 MinPts 区分核心点、边界点与噪声点。

严格“结构等价”要求两节点连接完全相同的对象,现实中太苛刻,所以通常使用连续相似度。K-means 假设簇围绕中心,DBSCAN 更适合非球形簇并能标记噪声;选择方法取决于表示空间,而不是算法名字越复杂越好。

两种传播模型的随机性来源不同

阈值模型中,节点在活跃邻居影响超过自身阈值后被激活,强调群体累积压力。独立级联模型中,新激活节点沿每条边只有一次独立尝试,强调概率性接触。

干预可以删除关键节点、切断关键边或改变传播概率。比较策略时不能只看一次模拟,应重复实验并报告最终传播规模、到达时间或轮数等清楚指标;不同指标可能给出不同“最佳”策略。

社交网络分析最容易犯的错误,是把结构相关性说成因果。中心位置可能带来影响力,也可能只是活跃用户更容易同时拥有高中心性和传播量;要判断因果,还需要时间顺序、对照或额外实验设计。

评论