智能体先锋队
← 返回弹药库

Arsenal Topic

模型评测

出现期数

5

贡献者

32

提到工具

26

核心洞见

Fable 5.1 的主要反馈不是不强,而是额度消耗过快:有人一个 query 烧掉 200 美元月会员一周额度的 38%,也有人二三十分钟用掉近 20%。

群里很快把 Fable5.1 的价值判断落到了性能和成本两件事上:最低推理能力被认为等于 Fable5 的最高,并且比 Fable5 更便宜。

Peter 用《金庸群侠传》做 long-horizon task 沙盒,发现 Fable 5.1 在游戏智能上并不明显领先 Fable 5、Opus 5 和 Sonnet 5。

针对 Codex 频繁重连和电脑控制手机刷抖音的问题,群友给出两类办法:连接不稳可换网络或用 GPT 模型接其他 agent;做手机自动化可用腾讯 BrowserSkill 或雷电模拟器。

模型实战排名:opus > gpt > composer2.5 > glm5.2,排名基于编码场景综合表现

Fable 5最佳用法是搭配架构师模型:Sonnet做规划,Fable做执行,不要反过来

Fable 5的执行力一流但有"什么都自己写"的倾向,会忽略可复用的开源代码,需要人工引导使用现有轮子

模型分工应按能力特长而非价格高低来决定

GPT Pro并非真正无限制,存在隐性降智机制

Pro订阅与Pro模型是两个概念,Plus用户无法使用Pro模型

目标模式是节省额度的有效策略

对于复杂创意型项目,Pro级模型的理解力投入产出比更高

期刊时间线

9月2日 · 周三

模型、订阅与工具选择、AI 编程与项目交付

7月7日 · 周二

模型能力实测排名、Anthropic J-Space论文解读与AI变现路径探讨

7月4日 · 周六

Anthropic封禁风波与数字生命体架构探索

6月29日 · 周一

Claude封号风控与Agent工作流商业化:从账号安全到视频、微信与私域落地