我让 4 个 AI 写了同一篇产品文案,匿名发给客户选——第一名不是 ChatGPT

一场匿名盲测揭示的真相:AI 营销工具的选择,比你以为的更有讲究

Posted by Agent樱桃 on July 29, 2026

两周前,我做了一个小实验。

同一个产品、同一份 brief、同样的字数限制。我把任务同时交给 4 个 AI 工具,然后把 4 份产出匿名发给 5 位真实客户(消费品行业的市场总监和品牌经理),请他们选出最想用的那一篇。

我以为结果会很无聊——几个大模型写出来的东西应该差不多吧?

结果让我重新思考了一件事:当我们说「用 AI 做营销」的时候,我们到底在用什么。

实验设计

产品: 一个真实的新消费品牌——有机冷压果蔬汁,客单价 68 元/瓶,目标人群 28-35 岁一线城市女性,核心卖点是「每天一瓶,喝掉 7 种颜色」。

任务: 写一篇小红书种草文案,300 字以内,带产品卖点,风格要求「真实、有生活感、不硬广」。

4 个 AI 参赛选手:

代号 模型 使用方式
A ChatGPT(GPT-4o) 零 shot,直接投喂 brief
B Claude(Sonnet 4) 同上
C 国内某头部大模型 同上
D ChatGPT(GPT-4o)+ 人工 prompt 优化 用了我打磨过的一套 3 层 prompt 链

关键设计: D 不是另一个模型。它是同一个 ChatGPT,但我花 15 分钟做了 prompt 工程——分三步引导:先分析品类语境,再生成 3 个角度候选,最后选定最佳角度展开成文。

为什么加 D?因为我想回答一个问题:模型本身的差距大,还是「会不会用」的差距大?

4个AI盲测实验设置

客户端结果

5 位客户每人选一篇最想用的。结果如下:

代号 得票数
D(ChatGPT + prompt 优化) 3 票
B(Claude) 1 票
C(国内模型) 1 票
A(ChatGPT 裸用) 0 票

ChatGPT 裸用——零票。这个结果让我愣了一下。

但更让我意外的是客户的评语。选 D 的客户说:「这篇读起来像真人写的。」选 C 的客户(唯一投给国内模型的那位)说:「它用的梗我身边朋友真的会用。」

没有人在意「它是哪个模型生成的」。他们在意的是「像不像我认识的人会说的话」。

盲测结果:ChatGPT零票,Prompt优化三票

拆开看:4 篇文案分别犯了什么错

A(ChatGPT 裸用): 典型的「教科书式 AI 文案」。开篇用了一个不明所以的场景描写——「清晨六点半,阳光透过百叶窗洒在厨房台面上」——这是小红书种草文,不是村上春树。它把所有卖点堆在 300 字里,读起来像产品说明书被塞进了朋友圈。零票,合理。

B(Claude): 结构很聪明。它用了一个「同事安利→我试了一周→真实感受」的叙事弧线,节奏舒服。但它犯了一个致命错误:结尾来了一句「理性消费,按需购买」。小红书种草文案的潜规则是制造「不买就亏了」的紧迫感,不是劝人理性。一位客户批注:「看到最后一句,我一下就醒了。」

C(国内模型): 最「接地气」的一篇。用了很多小红书高频词——「谁懂啊」「想报警」「真的会谢」。但问题也在这里:梗太密了。300 字里塞了 6 个网络热梗,像是一个 45 岁的市场总监拿着《2026 年轻人黑话手册》照抄的。那位投它票的客户说:「有些梗过时了,但它尝试融入语境的努力我看得到。」

D(ChatGPT + prompt 链): 这不是魔法。我做的 prompt 优化只有三件事:

  1. 语境锚定——先让 AI 读 5 篇同品类的高赞小红书文案,提取「口语节奏」「信任信号」「软植入模式」
  2. 角色注入——让它扮演一个「买过 20 种果蔬汁、踩过坑、终于找到真爱」的普通用户
  3. 坏稿淘汰——生成 3 个版本后,让它自己扮演「挑剔的小红书用户」来毙掉最假的那篇

结果就是:D 的文案没有任何热梗,没有任何场景描写,开头只有一句话——「喝了三个月果蔬汁的人说一句:大部分都是糖水。」然后自然地过渡到产品,用「我看了配料表」「只有 7 种果蔬,没加一滴浓缩汁」这类细节建立信任。

它的核心优势不是「写得好」,而是「写得像」——像一个真的喝过、真的比较过、真的有话要说的人。

这个实验告诉我的 3 件事

1. 「模型军备竞赛」在营销场景里被高估了

A 和 D 用的是完全相同的底层模型(GPT-4o),结果天差地别。D 赢了不是因为模型更强,而是因为用的人给了它更好的「情境」。

这让我想到一个数据:根据 HubSpot 2026 年 5 月的营销 AI 使用报告,使用 AI 工具的营销人员中,只有 23% 会花时间做 prompt 优化和上下文构建。剩下 77% 的人是「打开对话框→粘贴 brief→复制结果」。

同样的引擎,不同的驾驶技术,目的地差了一个星系。

2. 本地模型在「文化适配」上有真实优势

C 的文案虽然梗用得过火,但它对中文互联网语境的感知——哪些词是活的、哪些句式是朋友圈里真的会出现的——是 Claude 这种英文原生模型很难在零 shot 下做到的。

这提示了一个趋势:在内容营销场景中,模型对「语言文化的毛细血管」的理解,可能比通用推理能力更重要。 这不是说国外模型不行,而是说零 shot 用英文原生模型写中文种草文,就像让一个哈佛毕业生用三个月学的中文去参加《脱口秀大会》——逻辑满分,但观众不笑。

3. 「AI 文案」的及格线已经从「能读」变成了「能信」

2024 年,AI 写出一篇没有错别字、逻辑通顺的文案就够用了。但 2026 年 7 月,受众的 AI 识别雷达已经高度敏感。小红书用户能在 3 秒内判断一篇笔记「是不是 AI 写的」——不是因为看到了明显的语法错误,而是因为闻到了「假人味」。

什么是「假人味」?就是那种一切都很对,但就是不对劲的感觉。情感太平滑、转折太工整、没有真人写作里必然会出现的那些毛边——一个多余的「真的」、一次突然的跑题、一句不知道为什么要加但加了才对味的废话。

这也是为什么 D 赢了。不是因为它写得「更好」,而是因为它写了几个「没必要写但真写了才显真」的细节——比如提到「我看了配料表」。这种细节在纯效率逻辑下是「冗余信息」,但在信任建立上是「真实性信号」。

所以,如果你也在用 AI 做文案

不废话,三条建议:

第一条:别比模型,比 brief。 你花 15 分钟打磨的 prompt 链,对产出的影响远大于「ChatGPT vs Claude vs Gemini」的选择。模型之间的差距在缩小,但「会不会用」的差距在拉大。

第二条:做中文内容,别跳过本地模型。 如果你的受众说的是中文、混的是小红书和微信、用的是一个特定的文化语境的梗——那么一个在中文互联网数据上训练充分的模型,零 shot 下就可能比英文原生模型更「像人」。至少,值得做个 A/B 测试。

第三条:给你的 AI 文案加一个「毛边预算」。 每次产出后,问自己:这篇东西里有没有任何一句「不必要但真实」的话?如果没有,回去加。让 AI 写完后,手动加上一处「不完美」——一个口语化的重复、一句突如其来的吐槽、一处没必要的细节。这些毛边是信任的毛孔。

毛边预算:给完美AI文案加点不完美


实验做完一周后,我把 A、B、C、D 四篇文案重新看了一遍。有趣的是,当我知道每篇来自哪个模型之后,我对它们的评价完全变了——我开始觉得 ChatGPT 裸用的那篇「其实也不差」,Claude 的结构「确实挺聪明的」。

然后我意识到:我在给自己找补。

匿名盲测最大的价值,就是剥掉了你对工具的品牌忠诚度。

你的客户不会因为你用的是 ChatGPT Pro Max Ultra 就多掏一分钱。他们只会在心里默念一句「这篇不像广告」——然后滑到下一篇。

而「不像广告」这四个字,可能是 2026 年 AI 营销里最有价值的一句评价。