
上周部門接了30條賬號的周更KPI實習生用AI批量生成的文案全卡在了平臺原創(chuàng)審核扣了3個賬號的健康分。緊急拉了兩個轉(zhuǎn)運營的開發(fā)一起搞自媒體文案降重趕在周五下班前把積壓的內(nèi)容全部過審摸出了一堆之前沒人說透的實操細節(jié)。我實測出的3種百分百無效的自媒體文案降重操作最先踩的坑就是上來就堆同義詞替換。 什么把“好看”換成“賞心悅目”把“好吃”換成“唇齒留香”改完讀起來像十年前的八股文不說平臺的原創(chuàng)檢測根本不認。 我當時用BGE-small開源模型拉了個向量比對腳本把替換完的文案和原文做余弦相似度計算結(jié)果出來的數(shù)值差點把我眼鏡嚇掉改完1000字的文案相似度還在0.92以上等于白干。from sentence_transformers import SentenceTransformer import numpy as np model SentenceTransformer(BAAI/bge-small-zh-v1.5) def calc_semantic_similarity(text1: str, text2: str) - float: emb1 model.encode(text1, normalize_embeddingsTrue) emb2 model.encode(text2, normalize_embeddingsTrue) return float(np.dot(emb1, emb2)) # 實測同義詞替換后的文案和AI原文相似度基本都在0.9以上 if __name__ __main__: raw_text 這款奶茶的茶底用的是福建高山烏龍入口有很明顯的蘭花香氣 modified_text 該飲品的基底采用福建高山烏龍制作入口可以感受到顯著的蘭花香味 print(calc_semantic_similarity(raw_text, modified_text))后來不死心又試了網(wǎng)上傳的“打亂段落順序”法。 把一篇1200字的美食文案的6個段落全部拆出來用shuffle隨機重排了20次相似度最低的那版也才降到0.81離平臺要求的0.7的閾值差了十萬八千里。 反而有幾版打亂后的文案邏輯完全跳脫前半句還在說探店地址后半句直接跳到了試吃感受給運營的同事看了直搖頭。最后試了公認最傻的“多輪翻譯法”中文翻英文再翻回中文來回倒兩遍。 出來的內(nèi)容全是歐式長句什么“我非常同意這個產(chǎn)品在大多數(shù)情況下會給用戶帶來良好的體驗”讀著別扭就算了測出來的相似度還在0.78甚至有幾篇AI特征比原文還明顯。那兩天測了快80篇不同方法改的文案最后總結(jié)出來一個核心現(xiàn)在主流內(nèi)容平臺的原創(chuàng)檢測根本不是卡字符重復率卡的是三個底層維度語義向量相似度、停用詞分布特征、句式熵值。 之前那些土方法全是在字符層面做改動根本碰不到這三個維度的閾值無效很正常。我們自己搭了個本地的初篩腳本不用把文案上傳到平臺觸發(fā)風控本地跑一遍就能先卡一遍閾值核心代碼放出來大家可以直接改了用import re import jieba from collections import Counter THRESHOLD { semantic_sim: 0.65, # 語義相似度留冗余比平臺要求低0.05 avg_sent_len: 18, # 平均句長不能超過18字 stopword_ratio: 0.22 # 停用詞占比波動不能超過0.22 } STOPWORDS set([line.strip() for line in open(stopwords.txt, encodingutf-8).readlines()]) def calc_text_features(text: str) - dict: sentences re.split(r[。\n], text) sentences [s for s in sentences if s.strip()] avg_len sum([len(s) for s in sentences]) / len(sentences) words jieba.lcut(text) stop_cnt sum([1 for w in words if w in STOPWORDS]) stop_ratio stop_cnt / len(words) return {avg_len: avg_len, stop_ratio: stop_ratio, pass: avg_len THRESHOLD[avg_sent_len] and stop_ratio THRESHOLD[stopword_ratio]}順著這個邏輯我們摸出了一套效率最高的操作流程 第一步把AI生成的原文全部拆成單句不要按段落拆每一句單獨做視角替換。比如原來的AI文案是“這款奶茶的茶底用的是福建高山烏龍”直接改成“我上周去門店點單的時候老板偷偷跟我說他們家茶底全是福建收的高山烏龍”每句加個只有你自己才知道的細碎小細節(jié)語義相似度直接就掉下來了。 第二步把所有超過20字的長句全部拆成兩句中間加個換行。別擔心格式亂自媒體文案本來就不興大段長文字拆完之后讀者看著反而輕松還能直接把平均句長的閾值卡下來。 第三步隨機插入1-2句完全低信息的個人化碎句比如“上次我買的時候還送了個印著logo的小勺子”這種句子根本不可能出現(xiàn)在通用AI訓練集里直接把停用詞分布的特征打亂。改寫完之后我習慣性地丟到團象AI檢測里跑一遍確認檢測率降到閾值以下再往下走。這段時間跑下來還發(fā)現(xiàn)了一個沒人提的反常識細節(jié)降重的時候千萬別亂加emoji。 我們之前找了120篇測試文案在里面插入3-5個不同的表情結(jié)果87篇的AI特征分反而比不加的時候更高。后來查了下開源的AIGC檢測數(shù)據(jù)集才反應(yīng)過來現(xiàn)在大部分AI生成內(nèi)容的訓練語料里就摻了大量帶emoji的自媒體文案模型反而會把表情多的內(nèi)容優(yōu)先判定為AI生成。 就這一個細節(jié)直接把我們之前的過審率從60%拉到了80%?,F(xiàn)在用這套流程實習生改一篇1000字的文案最多8分鐘之前用同義詞替換的方法要20分鐘過審率還不到30%。上周30條積壓的文案發(fā)出去之后只有2篇因為加的個人細節(jié)太少被打回微調(diào)之后直接過審被扣掉的3個賬號的健康分一周之后就全回滿了。中間還踩了個特別蠢的反向坑為了降重故意寫錯別字把“好用”寫成“好yong”把“劃算”寫成“劃蒜”。 結(jié)果平臺的合規(guī)檢測和原創(chuàng)檢測是打通的這種故意寫的諧音錯別字直接會給文案打上低質(zhì)標簽之前有個同事改的一篇文案原創(chuàng)分拉滿了發(fā)出去播放量直接卡死在97連基礎(chǔ)流量池都沒進純純白干。后來我們又把之前的初篩腳本優(yōu)化了下用spaCy的依存句法分析把所有超過22字的長句自動標紅提醒人工拆分省掉了手動找長句的步驟整體效率又提了30%。 現(xiàn)在這套流程跑了快兩個月手上二十多號內(nèi)容賬號的文案過審率穩(wěn)定在95%以上根本不用找什么第三方的付費降重接口本地跑個幾十兆的小模型加5分鐘人工干預完全夠用。上周試了下把平均句長的閾值調(diào)到25字適配了幾個做美妝賬號的同事的文案風格最近正在跑一周的發(fā)布數(shù)據(jù)看會不會對原創(chuàng)分產(chǎn)生什么隱性影響。