埃安N60夺冠,大模型叙事失灵了吗?
第一电动 媒体档案 本站收录 157 篇 近 180 天 156 篇 营销维度扣分 22/n=157 篇 在档更正 0 次 查看档案 →8月15日,第一电动网主办的第二届智驾大赛贵阳站,预赛冠军是广汽埃安N60:全程零接管,综合得分117.81(满分120),打破了开赛30站以来的历史纪录。
读原文 · 第一电动 →信源数 1家
同一件事有几家不同来源报道过。≥3 家才够本站的「已核验」。
第一电动
具名引用 0处
正文里点名到的信源(机构 / 人名 / 公告)。判决里没有这一项的老稿留空。
判决里这一项是空的——正文没点名到可核的信源。
情绪强度 0分
情绪化表述的扣分,0 = 没量到情绪词。
一定完全
独有数字 —
本篇写了、同事件另一家没写的关键数字。不代表对方漏了,只是这篇多给了。
这篇没有这一项:它不在任何多源事件簇里(孤篇)。
正文重合 —
与同源最相似那篇的正文重合度。高不等于抄——同一场发布会出来的稿子,本来就会用同一批数字和同一段官方表述。
这篇没有这一项:它不在任何多源事件簇里(孤篇)。
为什么是这个分?(点开看判定依据)
这个分怎么自己复算
- 口径版本
- quality-rules-v1+3e8acca1e74a
- 原文指纹
- a2f603d0e6ad1e91d021a8a9132abe41…
- 判决方式
- 规则版 —— 逐位复现:同一条原文、同一个口径版本, 任何人都该跑出一模一样的四维扣分和总分。
- 复算命令
- python manage.py recompute_verdict 1499
这条命令不写库、不调模型、不联网:拿着这个仓库和那条原文就能跑。 口径参数表在 判定口径 页上, 和上面这个版本号是同一份。
这篇全文共 153 句 —— 逐句过检结果:
「有据」= 句中有具名信源或带单位的可核查数据;「无据断言」= 用了绝对化说法但整句既无信源也无数据。 自动判定会出错,这只是对句子用词的机器观测,不是对内容真伪的结论。
镜下逐句 · 这几句被判到了
决赛,它依然是第一名。
但在全程直播的公开比赛里,唯一可行的作弊方式是提前多跑几遍路线,而这对一段式端到端的模型来说,用处不大(后文会展开)。
彼时国内几家头部玩家都已宣传自己上了一段式端到端,但回国后他把这些车重新开了一遍,发现跟FSD V13完全是两种体验。
文远最强的模型目前跑在L4 Robotaxi上,用双Thor-X。
文远知行能力最强的模型,依然运行在更高算力的平台之上。
但这次夺冠至少揭示了,单纯的堆硬件参数,并不一定能转化为更优的智驾表现。
Robotaxi数据的价值就在这里——文远是几家智驾方案商里唯一有Robotaxi车队的。
虽然它不一定比人驾数据多,但在质量和后处理成本上占据优势。
只列前 8 句; 本站不转载爬取稿全文,以上为按评论目的引用的句子,完整内容请读原文。
你也判一下:这篇写得客观吗?
先说你的判断,再看 AI 判了什么——我们不写谁对谁错。
两边不一样很正常——本站表述倾向抽检准确率 只有 56.5%, AI 的判定不是标准答案。你的判断记在读者信号里, 与人工金标分开存放;是否纳入训练要等标注口径会定。
这篇稿子对你有价值吗?
一键投票即可;这是读者意见,不替代人工质量标注。
0 人投票, 0% 认为有价值