Skill 执行度
有没有让场景和书内证据推动理解变化;是否把“张力、回流、x/R/f/E”等后台语言直接搬进成品。
BREAKTHROUGH ADVERTISING · QUALITATIVE MINI-EVAL
把同一份《突破性广告》交给不同模型与运行环境,公开比较它们是否真正理解任务、语言是否自然,以及有没有接住整本书。
VENDOR × AGENT
纵轴是模型厂商,横轴是 Agent;每个交叉格内再按具体模型型号分组。调用渠道与 Agent 分开,已确认的渠道直接标在输出卡片上。
显示 24 份输出
渠道是可选的调用路径记录,不等同于 Agent。当前已确认渠道:DeepSeek 官方 Key、OpenCode Go。
没有符合条件的输出。
HOW TO READ
Agent 不单独打一个总分,而是在同一底层模型内观察下列三项分别发生了什么变化。
有没有让场景和书内证据推动理解变化;是否把“张力、回流、x/R/f/E”等后台语言直接搬进成品。
同样内容下,句子是否自然、具体、有节奏,是否减少模板化的 AI 腔。
是否覆盖大众渴望、顾客认知、市场成熟度与正文信念建立,而不是只抽一个点展开。