AutoNews 新闻检测站 NEWS INSPECTION STATION
信源
数据
营销词
情绪
标题
0 累计已检 · 检测线就绪
每篇稿件过五个工位 · 判定口径公开 · 判不准的说判不准
问一句

媒 体 星 图

MEDIA SIMILARITY MAP · 位置是算出来的
同一片语料的另一个切面:事件宇宙问的是「一件事有几家在说」, 这一张问的是「这些媒体,写的东西有多像」
每家媒体的全部收录稿件先算成一个内容画像(字符 bigram 的 TF-IDF 向量), 两两取余弦相似度,再用力导向布局把这张相似度矩阵铺到平面上—— 相似度越高的两家,图上离得越近。所以图上的每一段距离都是量出来的, 不是我们摆的。这一页不给媒体打分、不排名, 媒体档案那条纪律在这里同样有效。
当前:静态表格版 回到星图版 →
相似度图暂未就绪

这张图是离线预计算的(整库分词 + 两两余弦 + 布局迭代), 按 12 小时一轮重算,不在页面打开时现算——所以这一页永远秒开, 代价是偶尔会像现在这样,赶上两轮之间的空档。 下面的表格是同一批媒体的实时数字,一行不少。

表格版 · 同一份数据

按本站收录篇数排序。收录量多少不代表任何褒贬,只代表它更新得勤。 「内容最相似的三家」是同一套 TF-IDF 余弦相似度算出来的,与上图完全一致。 (表格可左右滑动查看完整列)

媒体 收录 已评分 质量分均值 报道内容最相似的三家(文本相似度)
汽车之家 395 395 98.1 待预计算
和讯汽车 340 340 97.6 待预计算
新浪汽车 231 231 90.9 待预计算
第一电动 128 128 95.9 待预计算
太平洋汽车 103 103 87.6 待预计算
36氪 48 48 99.4 待预计算
电池网 20 20 93.2 待预计算
新华网汽车 20 20 85.7 待预计算
汽车之心 样本较少 18 18 71.0 待预计算
爱卡汽车 样本较少 10 10 83.5 待预计算
每日经济新闻 样本较少 5 5 100.0 待预计算

这张图是怎么算出来的

  1. 取语料。只取本站爬取收录的公开报道,每篇取标题 + 正文前 600 字。 全站共 个来源署名, 其中 家有独立媒体档案页; 另外 — 家是演示种子或一两篇的零星署名, 没有档案页可点,所以不进这张图——画一颗点开是 404 的星, 比不画更糟。
  2. 建内容画像。每篇稿切成字符 bigram,按 TF-IDF 加权成向量并归一化, 再对同一家媒体的所有稿件取平均(质心)。 先归一化再平均这一步是关键:否则发稿量最大的那家会跟谁都「最像」, 那量到的是体量不是内容。 词表两道闸:出现在超过 25% 文章里的词(全站共有的套话) 和只出现在 3 篇以下的词(错别字、一次性专名)都剔除。 本次词表 个 bigram, 语料 篇。
  3. 两两算余弦相似度。— 家共 — 对。 连线只画 ≥40% 的那些, 另外 — 对相似度较低没画—— 这张图不是全部关系,全部数值在上面的表格里。
  4. 铺到平面上。把相似度矩阵交给一个力导向布局:每一对之间连一根弹簧, 理想长度 = 1 − 相似度(越像拉得越近),同时所有点互相排斥以免叠在一起, 迭代 600 步收敛。 初始位置是固定的均匀圆环、全程不用随机数,所以同一批数据每次跑出来是同一张图
  5. 已知性质,必须说明。覆盖题材越广的媒体,它的内容画像越靠近全站平均, 于是跟谁都偏像、在图上偏中央。那是这个算法真实的几何,不是它「在跟所有人发一样的东西」。 同理,样本越少的媒体画像越不稳,所以少于 20 篇的 在图上打虚线环、表里标「样本较少」。
  6. 不用向量大模型。这一层刻意只用 TF-IDF —— 它的每一个数字读者都能拿纸笔复算, 而这一页的全部说服力就建立在「你可以自己验」上面。
说明与免责 本页的媒体内容相似度由本站收录的公开报道正文经 TF-IDF 与余弦相似度自动计算,只呈现可复算的文本重合度,不含任何人工判断,也不指向任何一方的主观意图, 不构成对任何机构或个人的评价、定性或指控。自动判定会出错,结果仅供参考,请以原文与官方口径为准。
对这条记录有异议?我要申诉 →
问一句 行情
选车库 尺寸对比 3D 算钱计算器 召回查询
媒体
媒体档案 媒体星图 媒体月报
封存馆
封存馆 承诺账本 成绩单 自己验
方法
方法与成绩 判定口径与准确率 数据浏览器 开放数据集 数据总览 设计系统 系统中心
登录 注册
Esc
输入关键词,边打边出结果;↑↓ 选中,回车直达