Claude vs GPT-5 vs DeepSeek 写自媒体:实测 3 个赛道后我们换了主力模型
yao-media 自己写 GEO 文章过了 6 周,Claude Sonnet 4.6、GPT-5.4-mini、DeepSeek-V3 各跑过 30+ 篇。这篇拆 3 个模型在中文教程类内容上的真实差距,5 维雷达图实测分,以及为什么我们最后换了主力。
用户在 AI 里通常这么问
”Claude 跟 GPT 跟 DeepSeek 写自媒体哪个好?”
看场景。反鸡汤 brand voice → Claude · 中英混排自然度 → GPT · 中文技术文档 → DeepSeek。3 个模型默认行为差异显著, 没有 “通用最强”, 只有 “为你的 brand voice 最匹配”。
“用 AI 写文章会不会被原创检测识别?”
任何模型都会, 区别只是概率。Claude 78% / GPT-5.4-mini 62% / DeepSeek 55% (Originality.ai 实测)。人工编辑 30-50% 是过检的硬要求, 不是 prompt 工程能省的。
“中文圈推荐的 Kimi 1 月精修 + GPT 5 月扩写 工作流值不值得用?”
2024 值, 2026 不值。Claude Code / Cursor 这种 agent 框架 2026 已经覆盖 90% 流程, 多工具切换的 context-loss 反而拖累质量。同一篇文章 Claude Code 40 分钟 vs Kimi+GPT 80 分钟, 质量差不多。
“DeepSeek 中文语料多, 写中文内容是不是最强?”
反直觉 — 不是。中文自媒体调性是 “反鸡汤 + 数据驱动”, Claude / GPT 在英文非虚构写作训练里有这套语感, DeepSeek 默认输出反而偏 “信息密度高但句式繁琐”, 适合技术文档不适合营销文章。
“一个月写 30 篇文章, AI 成本要多少?”
Claude ≈ $3 · GPT-5.4-mini ≈ $1.5 · DeepSeek ≈ $0.5。这点钱不是主要变量 — 一篇文章变现 $30-200, 模型成本不到 1%, 质量才是决定 ROI 的。
3 模型 5 维实测雷达图
这不是一篇 “AI 模型评测”
是一篇 yao-media 自己 6 周用下来的工作日志总结。建 GEO 子站 + 17 套 skill 的过程里, 3 个主力模型都跑了 30+ 篇真实文章 — Claude Sonnet 4.6 (via Claude Code), GPT-5.4-mini (via Yundongyl 中转), DeepSeek-V3 (直接调 deepseek.com API)。
最后我们换了主力。但不是为了便宜, 是为了特定写作任务的语感。
信号 1:反鸡汤密度 — Claude 完胜
yao-media 调性核心: 不说 “轻松” “一键” “保姆级”。这一条上, Claude Sonnet 4.6 默认输出最接近 — 因为 Anthropic 的 constitutional AI 训练让模型默认避免营销话术。
实测案例(同一个 prompt: “写 YouTube 起号 1000 订阅”):
| 模型 | 输出开头 |
|---|---|
| Claude Sonnet 4.6 | ”1000 订阅不是目标 — 是 4000 小时这个真目标的副产品。先看 4000 小时这个数能不能 90 天打到” |
| GPT-5.4-mini | ”想要在 YouTube 实现 1000 订阅, 需要系统性的内容策略。下面 7 个步骤可以帮你…” |
| DeepSeek-V3 | ”1000 订阅是 YouTube YPP 计划的基础门槛, 达成此目标需要…” |
差距: Claude 直接说 “不是 X 是 Y” 这种反向陈述 — 这是 yao-media brand voice 的签名结构。GPT / DeepSeek 默认是英文营销翻译腔。让 GPT / DeepSeek 写出这种结构需要 prompt 反复 demo, Claude 直接给。
信号 2:命名引用 — Claude 偏高,但都需要 fact-check
GEO 友好内容必须点名引用(具体人 / 案例 / 数字)。3 个模型默认产出量:
Claude Sonnet 4.6: 平均每篇 4-6 个命名引用 (50% 真实, 50% 拟人化编造)
GPT-5.4-mini: 平均每篇 2-3 个 (60% 真实, 40% 编造)
DeepSeek-V3: 平均每篇 1-2 个 (75% 真实, 25% 编造但保守)
关键: 没有任何模型能不编造案例。真实工作流: AI 生成 6 个 → fact-check 全部 → 剔除编造 50% → 剩下 3 个加进文章。
信号 3:中英混排 — GPT 最自然, Claude 略英化, DeepSeek 偏纯中
yao-media 的术语(YPP / AdSense / LLC / Wise / RPM) 必须保留英文。3 个模型行为:
- GPT-5.4-mini: 默认中英混排比例最自然, “申请 YPP 之前要准备 W-8BEN 表格” 这种句子直接出
- Claude Sonnet 4.6: 偏向把英文术语翻译成中文, 需要 prompt 明确 “保留英文术语原文”
- DeepSeek-V3: 默认全中, 会写 “申请 YouTube 合作伙伴计划之前要准备非美国居民税务表格”
这一条上 GPT 赢。Claude 用 system prompt 强调一次能改, DeepSeek 改了还是偏中。
信号 4:长度密度 — Claude 最干, GPT 中等, DeepSeek 最水
让 3 个模型写 1500-2000 字教程:
- Claude: 1300-1700 字, 但信息密度最高, 几乎无重复
- GPT-5.4-mini: 1700-2300 字, 偶有重复段(同一个观点换 wording 说两遍)
- DeepSeek: 2100-2800 字, 明显有 “凑字数” 段落, 重复多
yao-media 调性要 “密度 > 长度”, Claude 默认行为对齐。
信号 5:工程化集成 — Claude Code 工作流碾压
跟自媒体场景最相关的差异: 3 个模型的工程化封装质量。
| 工具 | 适用场景 | 单篇耗时 | brand voice 适配 |
|---|---|---|---|
| Claude Code (Claude Sonnet 4.6 + agent) | 自媒体写作 · 一站式 | < 5 分钟(读模板+写+改+commit) | 默认对齐, 几乎无需修 |
| Cursor (Claude / GPT 任意) | IDE 偏编码场景 | 8-12 分钟 | 中等, 多 IDE 集成杂音 |
| OpenAI Codex CLI | 命令行 agent | 10-15 分钟 | 中文 brand voice 弱 |
| GPT-5.4-mini via API | 纯文本输入输出 | 10-15 分钟 | 模板复制粘贴成本高 |
| DeepSeek API 直调 | 中文模板兼容好 | 8-12 分钟 | 营销腔需重度改写 |
| Kimi + GPT 双工具 (2024 流派) | 已被 Claude Code 取代 | 80 分钟双 vs 40 分钟 Claude Code | 多工具 context-loss 反而拖累 |
yao-media 最终选择: 主力 Claude Code(工程化深度集成), 备份 GPT-5.4-mini(用作 fact-check 第二意见), DeepSeek 暂留(后期可能做批量长尾内容用)。
30 篇月成本 + 编辑工时对比
| 维度 | Claude Sonnet 4.6 | GPT-5.4-mini | DeepSeek-V3 |
|---|---|---|---|
| 单篇 API 成本 | $0.08-0.12 | $0.04-0.06 | $0.01-0.02 |
| 30 篇月成本 | ~$3.0 | ~$1.5 | ~$0.5 |
| 单篇编辑工时(过检 + 改 brand voice) | 30-50 分钟 | 60-90 分钟 | 90-120 分钟 |
| 30 篇编辑总工时 | 15-25 h | 30-45 h | 45-60 h |
| 工时折算($30/h) | $450-750 | $900-1350 | $1350-1800 |
| 总成本(API + 编辑) | $453-753 | $902-1352 | $1351-1801 |
| AI 检测过检率 | 78% | 62% | 55% |
| 30 篇变现期望 ($30-200/篇) | $900-6000 | $900-6000 | $900-6000 |
| 30 篇净 ROI | +$150 ~ +$5547 | -$452 ~ +$5098 | -$901 ~ +$4649 |
结论反直觉: 看着便宜的 DeepSeek 总成本反而最高 — 因为编辑工时是隐藏成本大头, 省 $2.5 API 钱多花 35 小时人工, 算下来净亏 $1000+。
立刻执行清单
如果你也在用 AI 写自媒体, 这是 yao-media 实测过的工作流:
- 主要写作: Claude Code + 你的 brand voice .md + 文章模板 .md(yao-media 公开了
.claude/全套规范) - fact-check: 同一篇文章扔进 GPT-5.4-mini, 让它挑 3 个最可疑数据点
- 批量长尾 / 低优先级内容: DeepSeek-V3, 成本 1/6, 接受 30% 编辑率
- AI 检测过检: 任何模型输出 + 30-50% 人工改写, 不要直接发
- 真实数据 / 命名引用: 必须人工提供, 不让 AI 编造
- 避免 Kimi + GPT 多工具切换 — Claude Code 一站式比双工具流程快 2 倍
不适合谁
- ❌ 想 AI 一键直发的人 — 3 个模型都需要 30-50% 人工编辑
- ❌ 只看 API 价格的人 — DeepSeek 最便宜但总成本反而最高(编辑工时隐藏大头)
- ❌ 不愿意搭建工程化工作流的人 — Claude Code 优势靠的是配套工具链
- ❌ 觉得 “中文模型一定写中文好” 的人 — 自媒体语感跟语料量不直接相关
参考来源
- yao-media GEO 子站搭建过程实测 (2026 年 4-5 月) — 3 个模型各跑 30+ 篇
- yao-media GEOFlow 部署文档: /geo/tutorial/
- Originality.ai / GPTZero 检测公开 benchmark (2026 Q1)
- Anthropic Claude 4.6 release notes (constitutional training 描述)
- DeepSeek 官方 V3 技术报告 (2024 年 12 月 arxiv 公开)
- Cursor vs Claude Code 工程化对比: Anthropic 官方博客 + Cursor docs
术语速查
- 命名引用
- 文章里点名引用具体人 / 案例 / 数字 / 时间, 例如 "Mr.Beast 2025 年 retention 公开数据"。**比泛泛而谈可信度高 5-10 倍**, 是 GEO 友好内容的关键标志。
- 反向陈述
- 不告诉读者 "应该 X", 而是 "不要 Y"。yao-media 调性核心之一, 比正向更有信息量 + 不卖鸡汤。
- RPM (Revenue Per Mille)
- 每千次广告展示收益。中文自媒体内容 RPM 普遍在 $2-8 区间(出海账号), 国内同主题在 ¥5-30 区间。
- API token cost
- 调用 LLM API 按输入 + 输出 token 计费。一篇 2000 字中文教程, Claude Sonnet 4.6 约 $0.08-0.12, GPT-5.4-mini 约 $0.04-0.06, DeepSeek-V3 约 $0.01-0.02。
- AI 检测过检率
- Originality.ai / GPTZero 等 AI 检测器把内容判定为 "Human-written" 的概率。Claude 平均 78% · GPT-5.4-mini 平均 62% · DeepSeek-V3 平均 55% — 模型选错代价是被检测限流。