用8分钟在同一任务上公平对比 Claude Opus 和 GPT-5
按5个标准做盲测A/B测试,不带偏见,不在评论区吵架
- 1.为两个模型准备相同的提示词任务。将方括号中的字段替换为你自己的内容,并先从文本中删除任何机密信息:客户姓名、受NDA保护的公司名称、内部数据、个人信息。
⚠️ 发送到第三方服务前请检查:任务文本中不应包含你不愿意公开到博客上的数据。使用概括性表述:用「物流领域的B2B初创公司」代替公司名称,用「销售部门负责人」代替员工姓名。
提示词你是一位资深文案撰稿人。请写一封150词的邮件,说服[受众描述,例如「小企业主」]尝试[产品类别,例如「一款项目管理工具」],因为[典型场景,例如「他们的团队每周在状态会议上浪费5小时以上」]。语气:友好但专业。结尾使用单一明确的行动号召。不要使用「revolutionary」或「game-changing」这两个词。
这个提示词的作用英文提示模板任务:写一封150词的邮件。将[general audience description]替换为不包含公司名称的受众类型,[generic product category]替换为产品类别,[generic situation]替换为典型问题。这三个字段都是去标识化的描述,不包含你工作中的真实名称和数据。 - 4.按5个标准对两个方案打分(1到5分):1)符合指定长度(150词),2)保持「friendly but professional」语气,3)没有使用禁用词(「revolutionary」、「game-changing」),4)行动号召的力度,5)语言自然、没有套话。在每个方案旁边记录分数。
用任意在线字数统计工具统计每个回复的词数 - 模型经常超出限制。用Ctrl+F / Cmd+F搜索禁用词。
- 5.汇总每个方案的总分。总分更高的方案 - 就是你这个任务的赢家。现在可以打开对话查看A和B分别是哪个模型了。
结果取决于任务类型。用其他类型的提示词(代码、分析、翻译)做同样的测试,排名可能会变化。保存提示词和评分表以供未来对比使用。
💰 跟着做需要花多少钱价格截至 2026-07
- 免费Claude(免费账户)免费使用Sonnet模型,消息数量限制视负载而定,使用Opus需要$20/月的Pro订阅。
- 免费ChatGPT(免费账户)免费使用GPT-4o并有消息限制,使用GPT-5需要$20/月的ChatGPT Plus订阅。
试一试,做第一个打卡的人
为什么是今天
2
48 小时内博主发布的视频
2
来源频道
2910
总播放量
每周攻略发到邮箱
AI 服务变化很快 - 界面和免费额度可能与描述有所不同。