大模型评测
我们用同一套测试集实测每个主流图像模型:指令遵循、文字渲染、图像编辑与照片真实感。
更新于 2026-07-02
| # | 模型 | 综合 | 指令遵循 | 文字渲染 | 图像编辑 | 照片真实感 | 速度 | 单图价格 | 适用场景 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-Image-2 OpenAI | 9.2 | 9.5 | 9.4 | 9.0 | 8.8 | 18s | $0.07 | Posters, layered exports, text-heavy design work |
| 2 | Nano Banana Pro Google | 9.0 | 9.2 | 9.1 | 9.3 | 8.9 | 12s | $0.05 | Image editing, character consistency, multi-image fusion |
| 3 | FLUX.2 Black Forest Labs | 8.6 | 8.4 | 7.8 | 8.2 | 9.3 | 8s | $0.03 | Photorealism, open-weights workflows, ComfyUI pipelines |
| 4 | Midjourney v8 Midjourney | 8.4 | 7.9 | 7.2 | 7.5 | 9.0 | 30s | Sub | Art direction, stylized illustration, mood boards |
| 5 | Seedream 4.0 ByteDance | 8.2 | 8.3 | 8.6 | 8.0 | 8.4 | 10s | $0.03 | CJK text rendering, e-commerce assets at volume |
评测方法
每个模型都运行同一套 60 条提示词的测试集,覆盖四个维度。分数为 0–10 分,取三位编辑的平均值。速度为生成时间中位数,价格为官方公布的 API 价格。