开放数据集
一条完整的数据生命线:数据从哪来(来源与合规口径)、 在我们手里经过了什么(标注协议与一致性)、 最后会以什么形式交出去(两个自建数据集)。 两个数据集都还没到可发布规模,所以这一页没有下载按钮—— 当前规模、开放门槛、还差多少都写在下面,攒够了这一页自己会变。
来源与合规
爬回来的每一篇都留着出处爬虫只抓公开发布的新闻,每篇落库时记来源和原文链接; 爬取稿在站内只展示摘要 + 回原文的链接,不做全文搬运。
- 守 robots。 只抓允许抓取的路径,按各站的抓取间隔限速,不绕反爬、不伪装身份。
- 注明来源。 每篇都带来源媒体名和原文链接,详情页第一屏就能点回原文核对。
- 控制频率。 定时任务一天两轮、单轮单源有上限;实测日均抓取量和这个上限的对照写在数据来源页上。
标注协议与一致性
人怎么标、标得一不一致、不一致怎么办标注台一次只出一条、不亮出算法的判断——先给结论再让人标, 人会跟着结论走,标出来的东西就没法当尺用。同一篇允许多人各标一次, 重叠的那部分用来算一致性。
| 维度 | 可选项 |
|---|---|
| 正文属性 | 客观报道 / 宣传性稿件 |
| 标题—正文关系 | 标题正常、与正文相符 / 标题夸张,但正文有支撑 / 标题与正文严重不符 |
这两组选项是直接从标注台的字段定义读出来的,不是在这一页抄的一份—— 标注台改了选项,这里跟着变,两边永远是同一套口径。
| 维度 | κ | 重叠样本 | 过没过门槛 |
|---|---|---|---|
| 兼容三分类 | 算不出 | 0 条 | 重叠样本不足 |
| 正文维度 | 算不出 | 0 条 | 重叠样本不足 |
| 标题维度 | 算不出 | 0 条 | 重叠样本不足 |
争议条怎么处理,三条都写在这儿:
① 标注人自己拿不准的可以勾「待复核」——现有
0 条,不进训练集、也不进一致性计算;
② 标在演示稿上的标注一律剔除,现有 0 条——
拿自己造的稿子训模型、算准确率,被问一句「这篇哪来的」就穿了;
③ 整批不合格的标注人会被导出闸拦下(满
30 条才评判;单一标签占比超过
90% 就没有判别力;相邻两条间隔中位数低于
5.0 秒就读不完一篇稿)。
两个自建数据集
都还在筹备中——所以这里没有下载按钮
引用格式先摆出来,是为了让人知道将来该怎么引;
每条 BibTeX 的 note 字段里都写着「筹备中、当前多少条、
达到什么条件才开放」——抄走的人会连着这句话一起抄走,
这样它就不会变成一条假引用。
正文属性(客观 / 宣传性)与标题—正文关系(相符 / 夸张但有支撑 / 严重不符)二维人工标注
当前进度 0.0%。
- 规模:0 / 3000 条,还差 3000 条
- 标注一致性:重叠样本不足,κ 还算不出来
引用格式(BibTeX)
@misc{autonews3k,
title = {AutoNews-3K: 中文汽车新闻质量标注数据集},
author = {AutoNews 新闻检测站},
year = {2026},
note = {筹备中,尚未发布;当前 0 条,达到 3000 条且标注一致性 κ >= 0.6 后开放下载},
howpublished = {\url{https://chejianlu.cn/datasets/}}
}
承诺原文摘录 + 可判定性分级(明确日期 / 模糊时限 / 无限期)+ 到期核验三态(兑现 / 未兑现 / 证据不足)
当前进度 0.0%。
- 人工复核:0 / 50 条——模型上写着「首期 50 条全部人工复核后才对外展示」,这是写在字段 help_text 里的承诺,不是这一页临时定的
- 归属核验:0 / 82 条判定为车企官方发言,其余是二手转述或来源未标注,不能算作「车企承诺」
引用格式(BibTeX)
@misc{autopromise,
title = {AutoPromise: 中文车企公开承诺数据集},
author = {AutoNews 新闻检测站},
year = {2026},
note = {筹备中,尚未发布;v0.1 内部版 47 条,首期 50 条全部人工复核后开放下载},
howpublished = {\url{https://chejianlu.cn/datasets/}}
}
本页数据生成于 2026-08-29 17:50,缓存 5 分钟。 发现哪个数字对不上?告诉我们。