AutoNews 新闻检测站 NEWS INSPECTION STATION
信源
数据
营销词
情绪
标题
0 累计已检 · 检测线就绪
每篇稿件过五个工位 · 判定口径公开 · 判不准的说判不准
问一句

方法与成绩

我们对着人工金标跑过哪些评测、每一次跑出什么数、这些数够不够格 把结论当定论说。页面上每个数字都是此刻从库里数出来的, 没有写死的值;跑得不好的那几项也在这一页上,位置和好的一样大。 想看判定口径怎么定的去 算法说明, 想看流水线此刻在不在跑去 系统中心

判定准确率 对着人工金标抽检出来的

准确率算不出来——它要人工金标,所以这个数只认 make audit_stance GOLD=1 真跑一次写出的那份结果文件, 和算法说明页、全站角标是同一个出处,全站只有这一个准确率。

56.5% 表述倾向判定准确率 金标 57 条 · 口径 glm-4-flash/stance-v4.1 · 抽检于 2026-08-09 · 上线线 80.0%(未过线,所以全站每处倾向结论旁边都挂着「倾向抽检中」角标)
只在真正表了态的样本上算(占 74.5%),准确率是 49.5%——比总分更低,因为「无法判断」那一层拉高了总分。
另有 1 条判出了倾向却没留下可核的原句。
表述倾向抽检准确率 56.5% 阈值 ≥ 80.0% · 样本 57 条 未过线
未过线,所以全站每一处倾向结论旁边都挂着「倾向抽检中」角标,月报和媒体档案一律标注「不作定论」。过线后角标自动消失。
金标多数类基线 33.3% 阈值 准确率须 > 33.3% · 样本 57 条 已过线
金标里最大的一类占 33.3%,一个「全部猜这一类」的傻子分类器不用任何判断就能拿到 33.3%。我们的 56.5% 赢过它,说明这个数量的是判别力而不是类别占比——但它仍然没到 80% 的上线线。

一个总的 56.5% 看不出它是均匀地不准、还是某一层特别差。 逐层拆开才知道该去改哪儿——占比最大的两层恰恰是最差的两层

判定层金标条数判对 本层准确率占全库比例
正向 19 10 52.6% 38.5%
中性 15 6 40.0% 30.5%
无法判断 12 9 75.0% 23.4%
负向 10 8 80.0% 5.5%
弃判 1 1 100.0% 2.0%
看这个数是怎么算的、金标怎么定的 →

评测运行记录 三项评测,各跑过多少次、每次什么数

三张表不合并:它们量的东西完全不同(车型报告跑不跑得通 / 引用站不站得住 / 合成样本抓不抓得到),并排塞进一张表只会逼你自己去分辨 哪一列对哪一行有意义。灰底那几行是口径说明—— 指标为 0 有两种含义,「真的一个都没抓到」和「压根没有样本可抓」, 后者那个 0 是恒等式不是成绩,必须当面说清。

车型报告回归评测 共跑过 32 次,列出最近 8 次

运行时间车型数通过失败通过率平均耗时
2026-08-11 08:50 10 10 0 100.0% 13 ms
2026-08-10 20:59 10 10 0 100.0% 34 ms
2026-08-09 14:13 12 12 0 100.0% 13 ms
2026-08-08 14:16 12 12 0 100.0% 34 ms
2026-08-08 08:12 12 12 0 100.0% 19 ms
2026-08-07 14:09 12 12 0 100.0% 12 ms
2026-08-07 08:28 12 12 0 100.0% 14 ms
2026-08-06 23:16 12 12 0 100.0% 12 ms

这一项量的是「跑不跑得通」不是「判得准不准」:热/温/冷三档车型各出一份报告, 检查流程不报错、字段齐全、耗时正常。全绿只说明管道没断。

引用核验评测 共 0 期

尚未运行。make cite_eval 后出现。

红蓝对抗 共 9 轮

30累计合成样本 只数真跑过样本的 6 轮
10.0% 累计绕过率(漏检) 3 / 30 条没被抓到
20累计负样本 误报率的分母。样本量这么小,「误报 0 次」说明不了误报低
轮次运行时间合成样本检出漏检检出率负样本误报
第 9 轮 2026-08-10 21:23 5 5 0 100.0% 5 0
第 8 轮 2026-08-10 20:14 0 0 0 5 0
这一轮一个样本都没合成,检出率 0% 是空集上的恒等式,不是成绩
第 7 轮 2026-08-10 20:08 0 0 0 5 0
这一轮一个样本都没合成,检出率 0% 是空集上的恒等式,不是成绩
第 6 轮 2026-07-29 19:04 5 5 0 100.0% 5 0
第 5 轮 2026-07-29 18:43 5 5 0 100.0% 5 0
第 4 轮 2026-07-29 18:22 5 5 0 100.0% 5 0
第 3 轮 2026-07-28 00:00 5 3 2 60.0% 0 0
这一轮没有负样本,「误报 0」的分母是 0——没测过误报,不等于没有误报
第 2 轮 2026-07-27 20:24 5 4 1 80.0% 0 0
这一轮没有负样本,「误报 0」的分母是 0——没测过误报,不等于没有误报

对抗样本是我们自己合成的,所以这个绕过率只说明「我们想得到的那几种改写骗不过检测」, 不说明真实世界里没有别的改写方式能绕过去。样本量(30 条) 也远不足以给出一个能写进结论的数——摆出来是为了让这条曲线有个起点,不是为了报喜。

看这些评测所在流水线此刻的状态 →

事件聚类评测 对着作者标定的金标准,算两两配对的 P / R / F1

口径是两两配对:把「同一件事」表示成文章的两两组合,算法判为同一事件的配对 和金标准的配对比对。这个数和 make eval_cluster 打出来的必然一样—— 页面跑的就是那条命令的同一份代码,不是抄的公式。

100.0%准确率 P 算法说是同一件事的 48 对里,48 对真是
35.8%召回率 R 真是同一件事的 134 对里,找出 48 对,漏并 86 对
52.7%F1 误并 0 对(不该并却并了,会脏了事件卡)
11.0%金标覆盖率 只在 147 / 1342 篇上量过——这三个分数不代表全库

上面那个 P 好看,但它只在被金标覆盖的 147 篇上成立, 全库还有一千多篇没被这把尺量过——不说覆盖率,这个数就是在暗示全库都对。 金标现有 62 组正例、161 组易混负例; 关键词按标题唯一命中来解析,库一涨就会有几个不再唯一,本次有 9 个没能唯一命中被跳过,所以这些组数会随库变、 别当常量抄进论文。
另一件相关的事:全库并进了多家报道的只有 264 篇(19.7%),其余是单家独报—— 交叉验证、核验章、事件脉络这些功能只在那 19.7% 上成立。

去事件页看聚类结果长什么样 →

标注集现状 标了多少、几个人标的、一致性够不够、有多少真能用

「标了 0 条」和「0 条里 0 条能进数据集」是两个数,这里都给。 只报前一个就是在虚报数据资产规模——而被闸掉的那一半,闸的理由 恰恰是这一页最该让人看见的东西。

0已标注条数 0 位标注人 · 覆盖 0 / 1342 篇报道
0能进数据集的条数 占 None%——其余被下面几道闸拦下了
0标在演示稿上,已排除 拿自己造的稿子训模型、算准确率,问一句「这篇哪来的」就穿了
0标记为待复核 标注人自己拿不准的,不进训练集也不进一致性计算

标注一致性 κ 两位标注人对同一批稿判得一不一致

维度这一维在量什么κ重叠样本门槛 0.6
兼容三分类 把上面两维折成一维的旧口径,给早期评测和模型继续用 算不出 0 条 重叠样本不足
正文维度 正文本身是客观报道还是宣传性稿件 算不出 0 条 重叠样本不足
标题维度 标题与正文相符 / 夸张但有支撑 / 严重不符 算不出 0 条 重叠样本不足

κ 衡量的是「扣掉瞎猜也能蒙对的部分之后,两个人还剩多少一致」。 现在这个数就是随机水平——说明两个人量的根本不是同一把尺。 后果写在这里:口径对齐之前不扩大标注量(按现在的尺标到 3000 条就是 3000 条噪声),也不拿这批标注去训模型(测试集只能是人工标注, 尺没校准就量不出模型好坏)。这个数和 make kappa 打出来的是同一个。

去标注台看题目长什么样 数据集的完整现状与开放门槛 →

人工覆盖留痕 质量分被人改过几条

这一节回答的是「你们会不会偷偷改数」。答案不能是一句「不会」, 只能是一个可以点进去数的计数器——而它现在是 0。0 也照印:「一条都没改过」是可核对的事实, 「我们从不改」是空话。

0被人工覆盖的判定 共 1342 条已评分,占 0.0%;勾了这个开关后自动打分不再覆盖本条
0 后台改动流水 Django 自己记的操作日志,和上面那个开关两个数一起看才完整: 只看开关会漏掉「改了分但没勾锁」
0收到的申诉
自己拿一篇稿子复算一次判定 → 发现哪个判定不对,走申诉通道 →

本页数据生成于 2026-08-29 17:47,缓存 5 分钟。 发现哪个数字对不上?告诉我们

问一句 行情
选车库 尺寸对比 3D 算钱计算器 召回查询
媒体
媒体档案 媒体星图 媒体月报
封存馆
封存馆 承诺账本 成绩单 自己验
方法
方法与成绩 判定口径与准确率 数据浏览器 开放数据集 数据总览 设计系统 系统中心
登录 注册
Esc
输入关键词,边打边出结果;↑↓ 选中,回车直达