Lljg-book mini eval

BREAKTHROUGH ADVERTISING · QUALITATIVE MINI-EVAL

同一本书,
24 种拆法。

把同一份《突破性广告》交给不同模型与运行环境,公开比较它们是否真正理解任务、语言是否自然,以及有没有接住整本书。

24
原始输出
18
批注版本
3
单篇维度
13
Agent 类型

VENDOR × AGENT

厂商 × Agent 总矩阵

纵轴是模型厂商,横轴是 Agent;每个交叉格内再按具体模型型号分组。调用渠道与 Agent 分开,已确认的渠道直接标在输出卡片上。

显示 24 份输出

渠道是可选的调用路径记录,不等同于 Agent。当前已确认渠道:DeepSeek 官方 Key、OpenCode Go。

模型厂商 ↓Agent → CodexCoworkClaude CodeGrok BuildAGY(Antigravity)PIQoderKimi CodeKimi WorkWorkBuddyDPSHZCode豆包专业版
OpenAI1 个型号 · 3 份

GPT-5.6 SOL

查看输出 08-13 12:04 · 4 节

GPT-5.6 SOL

查看输出 08-13 14:42 · 4 节

GPT-5.6 SOL

查看输出 08-13 15:40 · 5 节
Anthropic2 个型号 · 3 份

Claude Opus 4.6

查看输出 08-13 06:35 · 3 节

Claude Opus 4.6

查看输出 08-13 12:20 · 4 节

Claude Opus 5

查看输出 08-13 12:45 · 5 节
Google1 个型号 · 1 份

Gemini 3.1 Pro

查看输出 08-13 13:01 · 3 节
xAI2 个型号 · 2 份

Grok

查看输出 08-13 01:47 · 4 节

Grok 4.5

查看输出 渠道 · OpenCode Go 08-13 12:48 · 4 节
DeepSeek2 个型号 · 6 份

DP V4 Flash

查看输出 08-13 13:20 · 3 节

DP V4 Flash

查看输出 08-13 12:18 · 4 节

DP Pro

查看输出 08-13 01:51 · 4 节

DP V4 Flash

查看输出 08-13 14:19 · 4 节

DP V4 Flash

第 1 次 渠道 · DeepSeek 官方 Key 08-13 21:44 · 3 节 第 2 次 渠道 · OpenCode Go 08-13 21:37 · 4 节
智谱 AI2 个型号 · 2 份

GLM 5.2

查看输出 渠道 · OpenCode Go 08-13 12:18 · 6 节

GLM 5.3

查看输出 08-14 23:28 · 4 节
阿里云1 个型号 · 1 份

Qwen 3.8

查看输出 08-13 12:20 · 4 节
Moonshot AI1 个型号 · 2 份

Kimi

查看输出 08-13 12:20 · 4 节

Kimi

查看输出 08-14 23:17 · 4 节
小米1 个型号 · 1 份

MiMo Pro

查看输出 渠道 · OpenCode Go 08-13 12:51 · 5 节
腾讯1 个型号 · 1 份

HY3

查看输出 渠道 · OpenCode Go 08-13 14:02 · 4 节
字节跳动1 个型号 · 1 份

Doubao 2.1 Code

查看输出 08-13 14:04 · 5 节
小红书1 个型号 · 1 份

dots-3-note-prev

查看输出 08-14 13:09 · 6 节

HOW TO READ

比较时看什么

Agent 不单独打一个总分,而是在同一底层模型内观察下列三项分别发生了什么变化。

01

Skill 执行度

有没有让场景和书内证据推动理解变化;是否把“张力、回流、x/R/f/E”等后台语言直接搬进成品。

02

文字易读性

同样内容下,句子是否自然、具体、有节奏,是否减少模板化的 AI 腔。

03

内容完备性

是否覆盖大众渴望、顾客认知、市场成熟度与正文信念建立,而不是只抽一个点展开。

查看完整评分规约 →