大模型評測
我們用同一套測試集實測每個主流圖像模型:指令遵循、文字渲染、圖像編輯與照片真實感。
更新於 2026-07-02
| # | 模型 | 綜合 | 指令遵循 | 文字渲染 | 圖像編輯 | 照片真實感 | 速度 | 單圖價格 | 適用場景 |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-Image-2 OpenAI | 9.2 | 9.5 | 9.4 | 9.0 | 8.8 | 18s | $0.07 | Posters, layered exports, text-heavy design work |
| 2 | Nano Banana Pro Google | 9.0 | 9.2 | 9.1 | 9.3 | 8.9 | 12s | $0.05 | Image editing, character consistency, multi-image fusion |
| 3 | FLUX.2 Black Forest Labs | 8.6 | 8.4 | 7.8 | 8.2 | 9.3 | 8s | $0.03 | Photorealism, open-weights workflows, ComfyUI pipelines |
| 4 | Midjourney v8 Midjourney | 8.4 | 7.9 | 7.2 | 7.5 | 9.0 | 30s | Sub | Art direction, stylized illustration, mood boards |
| 5 | Seedream 4.0 ByteDance | 8.2 | 8.3 | 8.6 | 8.0 | 8.4 | 10s | $0.03 | CJK text rendering, e-commerce assets at volume |
評測方法
每個模型都運行同一套 60 條提示詞的測試集,覆蓋四個維度。分數為 0–10 分,取三位編輯的平均值。速度為生成時間中位數,價格為官方公佈的 API 價格。