结论先行:约束条件决定答案,能力排行不决定
在小红书搜「workbuddy codex」,能翻出几十篇对比笔记。挑出其中 10 篇对比属性最强、评论量最高的(单篇评论 27~441 条,合计逾 2000 条),按点赞排序抽样读完评论区,会看到一个和跑分榜完全不同的图景:
能力上,评论区基本承认 Codex 更强;但大多数人并不因此选 Codex。
他们真正在权衡的是另一组问题——哪个我今天就能用上、用得起、并且知道会花多少钱。WorkBuddy 赢在「可达性」,Codex 赢在「确定性」。而评论区里最有生产力的一派已经不选边了。
(说明:以下引用均来自高赞评论抽样,反映主流观点,长尾小众意见可能被漏掉。)
一、Codex 强在「一遍过」,WorkBuddy 强在「今天就能用」
智能水平是分歧最小的一项
用户用了大量比喻描述这个差距,其中点赞最高的一条(151 赞)是:「一个是稍微简陋的毛坯房,但是能力很强;一个是精装房,但是水平一般般」。还有「codex 像学霸,说得到做得到;workbuddy 像普通学生,说一步做一步还会做错」。
但真正有分量的是带实测细节的对比。一位做 Excel 清洗和 PPT 的深度用户说:「buddy 数据方面可以做,但不能像 codex 那样智能地思考,需要我在清洗过程中提示;ppt 更别提了,美观性差很多」。另一位说得更直接:「周额度用完了,说用 workbuddy 撑一撑,结果最后验收都通不过,还是只能去买个日抛完成最后收尾」。
注意抱怨的落点——「验收」和「返工」。用户衡量的不是单点智商,是「我要盯多久」。「简单办公可以用 workbuddy,但是复杂点的项目真的一言难尽」(51 赞)、「workbuddy 也不算差,如果你不是深度用户的话也够用了,就是要耐心去修正它的错误」。
使用门槛才是 WorkBuddy 起量的真正原因
在一篇讨论「日活怎么就 1300 万」的笔记下,被博主置顶的最高赞回答只有一句话:「因为简单吧,装上微信登陆就能用……不会科学上网,看不到外面精彩的世界」。
Codex 那 20 刀的标价从来不是全部成本。评论区反复在算这笔账:「codex 要 20 刀,还要翻墙才能用,意思是你要花两份钱」「codex 不还得考虑 vpn 的钱」「翻墙、国外账号、信用卡已经能劝退大部分人了」。长期使用还要额外承担封号焦虑——机场 IP 乱跳、频繁换设备登录都是风险点。
对应地,WorkBuddy 的好评几乎全部落在同一点上:下载即用、不用魔法、对国内软件和数据源有适配。
二、标价便宜 ≠ 实际便宜:真正该比的是成本可预测性
标价上 WorkBuddy 明显占优(70 元 vs 20 刀 ≈ 135 元),这是争议最大的一项,因为评论区反复推翻它:
- 「workbuddy 一个月的积分也就相当于 codex plus 会员的一周额度」(16 赞)
- 「同一个任务,wb 用 kimi k3 耗了 1800 积分,codex plus 耗了 9% 周额度」
- 「搞了几个专家团,结果一个问题 700 积分烧完,所有产出都是未完成,让我赶紧充钱」(63 赞)
- 有人甚至已经把应对方案工程化了:「我给它加了运行条件,遇到重复的情况出现 5 次就自动停止,不然就是个积分黑洞」
这里的关键洞察是:用户怕的不是贵,是不可预测。 Codex 的周额度是一个封顶的、可感知的池子;积分制在失败重试时会静默放大成本——而失败重试恰恰是上一节里的高频场景。两个问题在这里叠加了,这才是「积分黑洞」焦虑的真正来源。
天平另一侧是免费额度,这是相当一部分人留下的直接原因:「现在还不要钱,赶紧薅羊毛」「每天签到 100 积分」。
一条被博主点赞的评论把账算得最干净:「如果 70 元就能解决你的问题,没必要花 135 元;如果 70 元解决不了你的问题,那你也没得选。」
三、生态分工:一个主外,一个主内
被公认为对差异概括最精准的一条(68 赞):
「有 openAI 的 API 当然是 Codex 好,国内模型 workbuddy 好,主要是链接的插件和技能一个主外一个主内,看你工作环境需要。我是一起用互相修的。」
另一条 104 赞给出了明确分工:「WB 干办公室活很好,执行基础工作可以,连接器多,生态链好,不要指望它写计划写代码,这些交给 codex」。
真实用例高度集中在国内工具链上——腾讯 ima 知识库、微信、腾讯文档、cnb 代码托管、微信小程序、公众号。有人用它做法律案件分析并把结论沉淀回 ima 知识库;有人做了「每周自动抓取小红书热点发送至邮箱 + 自动补充知识库」的定时任务链。
短板同样集中:生图和 PPT 审美。「ppt 做出来是真丑」「生图肯定是 GPT 要好用非常多」,以及一条能力层面的硬伤——「自带的模型都没有多模态能力」。这是用户从 WorkBuddy 流向 Codex 的具体触发点。
四、老手的判断:真正的分水岭在背后的模型
一批经验用户认为把两个产品直接对比就问错了:
「不是产品的问题,要看后面接的模型啊。我试过 codex 接 gpt5.5、workbuddy 接 deepseek v4,差距不大甚至更好;接 minimax 一坨。」
于是「客户端当壳 + 自配 API」成了出现频率极高的成熟玩法:「我是免费的 workbuddy,智商不够就加点智商的 DeepSeek API 接上,充个 20 用很久了」(40 赞)、「140 的中转放在 Workbuddy 用,又是国内生态,又是强大模型」。
最高赞(98)的一条把这层意思挑明了:「有 workbuddy 这么好用又原生适配国内模型的平台,为什么要费劲去搞 codex 中转接 deepseek?」
言下之意:客户端的产品价值(连接器 + skill + 国内生态)和它自带模型的能力,在用户心里是可以拆开定价的。 一个能自由换模型的壳,能力上限由你自己决定。
五、对号入座:按你的约束条件选
把评论区被提及的频率与点赞加权排序,用户真正在意的依次是:
| 优先级 | 关注点 | 谁占优 |
|---|---|---|
| 1 | 交付确定性(要盯多久、返工几次) | Codex |
| 2 | 可达性(翻墙 / 信用卡 / 封号风险) | WorkBuddy |
| 3 | 成本可预测性(怕的是积分黑洞) | Codex(封顶额度) |
| 4 | 与国内工作流打通(微信 / 腾讯文档 / 小程序) | WorkBuddy |
| 5 | 模型自由度(能否自接 API) | 打平 |
| 6 | 过程可见与可控 | WorkBuddy |
| 7 | 多模态与审美(生图、PPT) | Codex |
| 8 | 数据安全 | 未有定论 |
据此可以给出四条明确建议:
- 纯办公、不搞开发、不想折腾环境 → WorkBuddy 够用。评论区原话:「比来比去没意义,就和你问 mac 和 Windows 哪个好用一样,你就拿来办公没区别」。
- 写代码、跑复杂多步骤项目、要求一遍过 → Codex,把翻墙和信用卡成本算进预算。
- 主力工作在国内工具链上,但对模型能力有要求 → 用国内客户端做壳,自己接 API 换脑子,这是老手的默认解。
- 企业文件、合规数据 → 先解决数据流向问题再谈选型。评论区只出现过一次但很尖锐:有人把供应商合规表格丢给 Codex 自动填,立刻被追问「工作上的文件不怕数据泄露嘛?」——对企业用户这可能是比前七条都重的一票否决项。
关于第 6 点补充一句:过程可见性是被低估的差异。「codex 做设计反而没那么顺手,比较喜欢闷头干,没有过程」。对非技术用户来说,看得见它在干什么既是安全感来源,也是识破偷工减料的手段——有人就发现国产模型 1 分半做完的活,追问之下承认「我以为……的确疏忽」。
六、组合用法已经跑出来了,缺的是交接
最有建设性的一派已经不问「选哪个」了,他们的核心洞察是:规划和执行应该拆开,分别交给擅长的一方。
- 「让 GPT 架构、审查和改进计划,buddy 执行。各有各的优点,结合来做效果异常的好!」(40 赞)
- 「用 codex 指导 workbuddy,效率堪比一个博后带了一组硕士生」(44 赞)
- 「workbuddy 搞不定的就 codex 先跑通,再把 skill 交给 workbuddy」
- 「用 20 刀的 Codex 做设计和规划,跑通的 skill 就交给 Workbuddy 去执行,这样组合下来,不是重度用户基本够用」
这派人的困惑已经推进到下一层了。评论区有人弱弱地问:「怎么做移交呢,两个平台的切换?」
至今没人给出好答案。这是一个真实存在、尚未被产品化的需求。
七、比「选哪个」权重更高的一件事
全部样本中点赞最高的评论(810 赞),根本没在比产品——它在说「你不会用」。
在一篇吐槽 WorkBuddy 不稳定的笔记下:
「一看你就是刚用,没理解怎么使用,把它当豆包用了。你要给它建立记忆文件,立规矩,比如两次不成功就要转别的方法;要建立独立的工作空间,同类的在空间里它会一并记住,处理就会越来越聪明;还要建立各个任务的衔接流程,建立中转层;用定时任务、专项任务来解决重复性的内容,搭建只读知识库用于处理表格、发票、事件,然后就可以追剧了!」
同一人的补充(357 赞)给出了完整架构:
根基层(SOUL / USER / MEMORY)定规则、记偏好,跨项目生效 → 执行层(独立工作空间)每个空间干一件事,并行不打架 → 中转层跨空间递文件,解耦协作 → 记忆系统(日志 + 长期记忆)保证每次醒来知道接着干啥。
本质:把 AI 助手当成一个可配置、可扩展、有记忆的系统来搭,而不是每次从头聊天。
呼应的声音很多:「它是实习生,实习生干活不好,指导老师自我思考一下」(39 赞)、「前期很愚蠢,要不停地返工调教,调教一段时间越用越顺手」、「很多人其实话都说不好,更不能准确地对 AI 表达自己的需求,导致很多无用功在消耗 token 和时间」。
结论:在这个以非程序员为主的语境里,「WorkBuddy 还是 Codex」这道题的实际权重,低于「你有没有把它当成一个要长期搭建的系统来用」。同样一款产品,在「当豆包用」的人手里是不稳定的玩具,在建了记忆文件、工作空间和定时任务的人手里是能自动跑的工作台。
顺带一提,评论区里点赞最高的那一派其实在反对这场对比本身(106 赞):「你需要关注的是你的问题,而不是你解决问题用哪种工具更高级。砍树的人关心的是自己每天的产量,而不是自己用哪把斧子更帅。」
如果你要的是「国内可达 + 模型自由 + 能沉淀成系统」
上面拆出来的几个真实痛点——交接空白、积分黑洞、模型被绑死、想搭系统却没人教——正是 NewMax 在解的问题。几条具体的推荐理由:
1. 模型自由度写在产品结构里。 NewMax 基于 Claude Code 生态,同时接入 NewMax Gateway,DeepSeek、GLM、豆包、Kimi 等国内模型可直接调用,也支持自配 API。壳和脑子分开选,这正是第四节里老手的默认解。
2. 成本按 token 明算,不搞黑箱积分。 N币是通用消费额度,100 N币 = ¥1,每个模型的单价(N币/百万 tokens)和倍率都能查到,跑完就知道花了多少。具体规则见 N币是什么?怎么用到 NewMax 的模型上。
3. 多工作区 + Skill 体系 = 那条 810 赞评论说的架构,开箱即有。 每个工作区独立上下文和记忆,跑通的流程直接沉淀成 Skill 复用,Skill 市场可一键安装他人验证过的方案。第六节里「跑通的 skill 交给谁执行」的交接问题,在同一个客户端内不需要跨平台移交。
4. 连接器主场在国内。 微信、飞书、GitHub、企查查、抖音 / TikTok / 小红书 / 视频号数据接口都在 MCP 连接器里。说个实在的:这篇文章的数据源,就是用 NewMax 的小红书连接器采集的——搜笔记、拉评论、按赞排序,整个链路在客户端里跑完。
5. 过程全程可见。 工具调用、思考过程、文件改动逐步展开,它在干什么一眼看得到。这是非技术用户把真实工作交出去的前提。
6. 中文优先,装上就能用。 桌面客户端(macOS / Windows),不用翻墙、不用信用卡、不用配环境。
小结
Codex 和 WorkBuddy 的能力差距是真的,但它在你的决策里未必排第一。把你的约束条件按「能不能用上 → 会花多少钱 → 通不通国内工作流 → 要盯多久」过一遍,答案通常会自己浮出来。
而无论最后选了哪个,都别忘了那 810 赞的提醒:先给它建记忆文件、分工作区、立规矩、设定时任务。工具之间的差距,往往小于「会用」和「不会用」之间的差距。