每篇稿件过五个工位 · 判定口径公开 · 判不准的说判不准
媒 体 星 图
MEDIA SIMILARITY MAP · 位置是算出来的
同一片语料的另一个切面:事件宇宙问的是「一件事有几家在说」,
这一张问的是「这些媒体,写的东西有多像」。
每家媒体的全部收录稿件先算成一个内容画像(字符 bigram 的 TF-IDF 向量),
两两取余弦相似度,再用力导向布局把这张相似度矩阵铺到平面上——
相似度越高的两家,图上离得越近。所以图上的每一段距离都是量出来的,
不是我们摆的。这一页不给媒体打分、不排名,
媒体档案那条纪律在这里同样有效。
当前:静态表格版
回到星图版 →
相似度图暂未就绪
这张图是离线预计算的(整库分词 + 两两余弦 + 布局迭代), 按 12 小时一轮重算,不在页面打开时现算——所以这一页永远秒开, 代价是偶尔会像现在这样,赶上两轮之间的空档。 下面的表格是同一批媒体的实时数字,一行不少。
表格版 · 同一份数据
按本站收录篇数排序。收录量多少不代表任何褒贬,只代表它更新得勤。 「内容最相似的三家」是同一套 TF-IDF 余弦相似度算出来的,与上图完全一致。 (表格可左右滑动查看完整列)
这张图是怎么算出来的
- 取语料。只取本站爬取收录的公开报道,每篇取标题 + 正文前 600 字。 全站共 — 个来源署名, 其中 — 家有独立媒体档案页; 另外 — 家是演示种子或一两篇的零星署名, 没有档案页可点,所以不进这张图——画一颗点开是 404 的星, 比不画更糟。
- 建内容画像。每篇稿切成字符 bigram,按 TF-IDF 加权成向量并归一化, 再对同一家媒体的所有稿件取平均(质心)。 先归一化再平均这一步是关键:否则发稿量最大的那家会跟谁都「最像」, 那量到的是体量不是内容。 词表两道闸:出现在超过 25% 文章里的词(全站共有的套话) 和只出现在 3 篇以下的词(错别字、一次性专名)都剔除。 本次词表 — 个 bigram, 语料 — 篇。
- 两两算余弦相似度。— 家共 — 对。 连线只画 ≥40% 的那些, 另外 — 对相似度较低没画—— 这张图不是全部关系,全部数值在上面的表格里。
- 铺到平面上。把相似度矩阵交给一个力导向布局:每一对之间连一根弹簧, 理想长度 = 1 − 相似度(越像拉得越近),同时所有点互相排斥以免叠在一起, 迭代 600 步收敛。 初始位置是固定的均匀圆环、全程不用随机数,所以同一批数据每次跑出来是同一张图。
- 已知性质,必须说明。覆盖题材越广的媒体,它的内容画像越靠近全站平均, 于是跟谁都偏像、在图上偏中央。那是这个算法真实的几何,不是它「在跟所有人发一样的东西」。 同理,样本越少的媒体画像越不稳,所以少于 20 篇的 在图上打虚线环、表里标「样本较少」。
- 不用向量大模型。这一层刻意只用 TF-IDF —— 它的每一个数字读者都能拿纸笔复算, 而这一页的全部说服力就建立在「你可以自己验」上面。