返回首页 >

AI坐上文本裁判席,真的靠谱吗

2026-09-08 13:32   科技日报

  不过,这些数据主要来自企业自己的测试,第三方独立评估还不够。同时,检测模型和生成模型都在快速迭代,今天表现良好的模型,明天可能就会面临新的挑战。检测器给出的数字,不能直接当作事实。

  “96% AI”不等于96%由AI写成

  《自然》杂志曾拿Frontiers出版社科研诚信总监埃琳娜·维卡里奥的一篇文章去作检测。维卡里奥表示,文章初稿和想法完全由自己完成,只在修改过程中让AI润色了一下,之后又经过了人工编辑。然而,Pangram旧版本将这篇文章判定为100% AI生成,升级后的Pangram 4仍给出了96% AI的比例。

  但这里的“96% AI”,并不是说文章中96%的内容都是AI完成的。检测器给出的“AI比例”,与作者实际使用AI的程度,并不是一回事。

  Pangram解释称,“100% AI”并不是说文章中的每一个词都是AI写的。系统会把文章切分成不同片段,分别判断这些片段更接近AI、人类还是两者混合,再根据这些判断计算整体比例。因此,“96% AI”更准确的含义是,检测器认为这篇文本具有很强的AI生成特征,而不是认定作者有96%的内容由AI完成。

  今天的写作早已不是“人写”与“AI写”的二元对立。一位作者可能独立完成初稿,仅用AI修改措辞;也可能让AI生成框架,再逐段重写;还可能经过翻译、润色、人工修订等多道工序。然而,从检测器的视角看,这些参与程度完全不同的写作方式,最终产出的文本却可能呈现相似的AI特征。

  检测结果本身也并非完全稳定。《自然》的测试发现,同一段文字,单独检测和放在完整文章中检测时,分数可能不一样。《连线》的测试也发现,对文本进行一些修改后,检测分数可能随之改变。

猜你喜欢

热点新闻

{$loop_num=0}