大四下学期,我的论文知网AIGC检测改了三遍都没过。第一遍换同义词,知网AI疑似率从三十五降到了三十二。第二遍换句式,从三十二降到了三十。第三遍我把能想到的方法全试了,结果知网AIGC检测的AI疑似标记又反弹回了三十五。后来学长打开我的论文看了一眼说了一句话:“你读一下这段,是不是每一句差不多长?”我数了一下,连续八句话都在22到27个字之间。学长说:“AI写的文章就长这样,每句都差不多长。真人写东西长短不一的。”
回去之后我专门改句长,两天知网AI疑似率从三十五降到了十二。
知网AIGC检测最敏感的一个指标:句长标准差
很多人以为知网AIGC检测看的是你用词像不像AI,其实它最敏感的是句子长度的均匀程度。
AI生成的文字有个明显毛病:每句话都差不多长,二十到三十个字一句,节奏像节拍器。知网AIGC检测升级到3.0版本后,专门做“句式节奏分析”,AI写的文本句长标准差通常在1到2之间,人写的文本句长标准差一般在4到6之间。你写得太工整、每句都差不多长,系统直接判AI。反过来,你每句话长度差别很大,系统就认为你像真人写的。
“突发性”(Burstiness)是AI检测器判断文本是否由人写的核心指标之一。人类写作的句子长短不一、结构变化更多,AI文本的句子长度和结构则相对统一。制造句长波动,是降知网AIGC率最有效的单一手段。
具体怎么操作
第一步:找出句长均匀的段落。 打开你的论文,找那些每句话都在20到30字之间的段落。这种段落最危险。选一段五六句话的,标出来。
第二步:选一句拆成两句。 原来写“本研究采用问卷调查法收集数据并进行了统计分析”,拆成“数据是用问卷调查法收的。收完之后做了统计分析。”第一句11个字,第二句11个字,但节奏已经变了。
第三步:选一句合并成长句。 找两个相邻的短句合并成一个长复合句。比如“该算法引入了注意力机制。这有效解决了梯度消失问题。”合并成“该算法通过引入注意力机制,有效解决了长序列建模中的梯度消失问题。”一句话从十几个字拉到三十多个字。
第四步:插入一个极短句。 在一段话中间插入一句十个字以内的短句。比如“这个结果有点意思”“值得单独拎出来说”。一句话三五个字,AI一般不会这么写。
第五步:调整段落内句子的顺序。 不一定要把第一句放第一句。把最长的那句挪到开头,或者把最短的那句挪到中间。打乱排列顺序,句长的变化会更加参差不齐。
实操对比
改之前:
本研究通过问卷调查的方式收集了相关数据,并采用统计软件对数据进行了分析处理,最终得出了具有一定参考价值的研究结论。——这一句40个字。下一句“样本量共计320份,回收有效问卷298份,有效回收率为93.1%”——27个字。再下一句“数据表明该教学方法对提升学生成绩具有显著效果”——23个字。三句话40、27、23,节奏太均匀了。
改之后:
数据靠问卷收上来的。回收之后先做了一轮清洗,剔掉了填写时间少于60秒的无效卷,剩下的用SPSS跑了信效度。这一步返工了两次,因为第一批样本里研三学生占比过高,不得不补发了一轮。第一句9个字,第二句29个字,第三句30个字,第四句24个字。9、29、30、24——长短交替,节奏乱了,知网AIGC检测系统就不认了。
为什么这个方法比换词管用
换同义词,骨架没动,句长没变,系统照样判AI。制造句长波动,是从根本上改变文本的“节奏感”。AI生成文本最大的特征就是规律性,而人类写作最大的特征就是不规律。你写的句子长短不一、节奏忽快忽慢,知网AIGC检测系统就认为你更像人。
改了一个月降不下来,试试只改句长。两天就能看到明显变化。
一些注意事项
不要把所有句子都拆成短句。 全是短句也是一种均匀,系统照样能识别。要的是“长短交替”,不是“全部变短”。
改完之后出声读一遍。 默默看可能觉得改得挺好的,但读出来就会发现有些句子还是太“顺”了。读一遍觉得别扭的地方,往往就是AI痕迹没去干净的地方,继续改。
一个段落改完,数一下句子长度。 最长的和最短的相差至少15个字以上。如果发现改完之后所有句子还是差不多长,重新来。
优先改知网AIGC检测报告里标红的那几段。 不是所有段落都需要改,知网AIGC检测报告会告诉你哪几段问题最严重。只改标红的段落,不用全文平推。
先改知网AIGC打破规整感,再改查重替换高频术语。顺序对了不用白忙活。
