模型选型

七大模型, 实测网页制作能力。

让每个模型从需求理解、设计、前端、后端到维护(SEO、GEO),走完一遍做站流程。每一步产物都能点开看。

想省事就照这个用:新页面交给 Gemini 3 Flash,成型之后的调整换 Deepseek v4 Flash。

为什么是这 7 个

合适的活,交给合适的模型

同样四道题,各自实际花了多少,取自账单。六个开放档位里,最省的只花最贵的二十四分之一。

6.0积分

四道题共花

Deepseek v4 Flash

DeepSeek省钱

最省的一档,智力到一线水平。页面成型后的后续调整交给它。

  • 页面成型后的后续调整
  • 改文案、换图片、调间距
17.2积分

四道题共花

MiMo V2.5 Pro

小米高性能

设计能力第一梯队,Design Arena 网站生成榜排到第 21;缺点是慢,四道题跑了 34 分半。

  • 对视觉要求高,又不想按最贵的一档付费
  • 首页、落地页初稿
19.2积分

四道题共花

GPT-5.6 Luna

OpenAI高性能

四道题里有两道跑出全场最快(新增详情页 80 秒、SEO 96 秒);遇到会影响用户流程的取舍,它会先问一句再动手。

  • 想尽快看到能点的东西
  • 需求里有含糊的地方,希望它先确认再做
24.3积分

四道题共花

Deepseek v4 Pro

DeepSeek高性能

七个模型里只有它和 Gemini 3.7 Flash 把 robots、站点地图、给 AI 读的摘要三样都写了。代价是慢,四道题跑了 38 分钟,全场最慢。

  • 一次把事情做齐,不想来回补
  • 愿意多等,换更完整的产物
97.5积分

四道题共花

Gemini 3 Flash

Google价格基准

设计稳定、有个性,做新页面的首选。其余模型的花费都以它为参照。

  • 从零生成第一版页面
  • 新增页面、改版式
147.2积分

四道题共花

Gemini 3.7 Flash

Google高性能

第三方设计榜上七个里排第二(Website 榜 #7)。信息密度和收尾最完整,代价是比基准档贵一半。

  • 要信息密度高、一次成型的初稿
  • 涉及用户数据的功能需人工复核后端
179.6积分

四道题共花

Kimi k3

月之暗面标杆Creght 暂未开放

Design Arena 网站生成榜第 1,也是这里最贵的一档——同样四道题它花掉 179.6 积分,榜单方自己记录的平均生成耗时 627.9s。

暂未对外开放,放在这里只作天花板参照——它在 Design Arena 网站生成榜上排第 1,看过它的产物再回头看开放档位,才知道差距有多大、值不值那个价。

  • 本页的天花板参照
  • 暂无法选用

条形按对数刻度绘制,仅用于感知量级差异,单位为积分6179.6

第三方

公开榜单供参考

全部引自第三方公开榜单,Creght 未参与评测。点标题可回原站核对。

Design Arena · 网站生成

众包盲测投票得出的 Elo 评分,专门评测「生成网站」这一类任务,与本页场景最接近。

Kimi k31352
#1/161
Gemini 3.7 Flash1313
#7/161
MiMo V2.5 Pro1271
#25/161
GPT-5.6 Luna1245
#38/161
Deepseek v4 Pro1233
#48/161
Deepseek v4 Flash1187
#77/161
Gemini 3 Flash1180
#82/161

快照日期2026-08-18

共 161 个模型参评。数据为 2026-08-18 快照,非实时。

条形按该榜单实际区间绘制7831364

Artificial Analysis · 智力指数

由 9 项评测合成的通用能力指数,衡量推理、知识、数学与代码,不代表视觉设计能力。

Kimi k360
Gemini 3.7 Flash56
Deepseek v4 Pro53
Deepseek v4 Flash52
GPT-5.6 Luna52
MiMo V2.5 Pro43
Gemini 3 Flash39

快照日期2026-08-18

通用智力指数,与「页面好不好看」不是同一回事,看设计请看左侧一列。

条形按该榜单实际区间绘制(0–100)

实测

实测选题覆盖完整的网页制作周期

相同选题,实测七个模型的能力如何。

01

从零生成首页

考设计。刻意不给配色、字体、排版任何指示。

题目原文

为一家做手冲咖啡豆的独立烘焙工作室做一个单页官网首页,包含:品牌主视觉区、三款主推豆子的介绍、烘焙流程说明、门店地址与营业时间、底部联系方式。文案你来写,中文。
02

新增详情页

考它能不能把需求拆开做,而且新页面要接得上原来那套设计。

题目原文

在现有站点上新增「豆子详情」页,为三款豆子各生成一个详情页,首页三款豆子的卡片分别链接到对应详情页;同时在导航栏加入「豆子」入口,移动端菜单也要能进。
03

后端与登录

考编码是否严谨。会不会用平台的后端和登录,还是把数据塞在页面里假装存下来了。

题目原文

给站点加一个「预订豆子」的功能:访客选好豆子、填写数量和手机号后提交预订,提交成功后显示预订编号。预订记录要真正存下来,不能只留在页面上——刷新或者换个浏览器打开也要还在。另外加一个「我的预订」页面,只有登录后才能看到自己提交过的预订,没登录就引导去登录。
04

SEO 与 GEO

考智力。题面不给答案,看它自己想到该做什么。

题目原文

帮我做一下 SEO 和 GEO 优化。我希望目标客户不管是在搜索引擎里搜,还是直接问 AI 助手,都能找到我们这家店。

一张表看完

七个模型,同样四道题

每格是那一步实际花掉的积分与耗时,取自账单,不是估算。点模型名跳到它自己那一段。

模型1 从零生成首页2 新增详情页3 后端与登录4 SEO 与 GEO四步合计
Deepseek v4 Flash1.43m 52s1.13m 19s2.76m 9s0.82m 36s6.015m 56s
MiMo V2.5 Pro2.43m 51s5.214m 15s3.54m 35s6.111m 49s17.234m 30s
GPT-5.6 Luna3.01m 54s2.21m 20s7.92m 53s6.11m 36s19.27m 43s
Deepseek v4 Pro6.010m 20s6.37m 19s7.211m 47s4.88m 42s24.338m 8s
Gemini 3 Flash9.51m 10s30.42m 18s29.91m 48s27.71m 51s97.57m 7s
Gemini 3.7 Flash14.22m 38s25.91m 56s42.92m 31s64.23m147.210m 5s
Kimi k330.34m 51s52.26m 53s46.95m 48s50.25m 41s179.623m 13s

Kimi k3 带锁的一行暂未对外开放,放在表里只作天花板参照。一点口径要说明:Deepseek v4 Flash 这一档在跑完之后涨价了一倍,它这一行是按涨价前的价目实扣的,按今天的价目算大约要翻倍。表里的数字一律是当时账单上的实扣值,没有按新价折算。

跳到某个模型

Deepseek v4 Flash

DeepSeek省钱

最省的一档,智力到一线水平。页面成型后的后续调整交给它。

榜单版本提醒

这个模型上游有过更新,榜单条目对不齐:Design Arena 同时挂着「DeepSeek-V4-Flash」和更新的「DeepSeek-V4-Flash-0731」(后者排第 38、Elo 1245),本页取的是前者;Artificial Analysis 只收录 0731 那一版。左边这一列请当作参考下限,本页的实跑产物才对应你实际会用到的版本。

Design Arena 网站生成
1187#77/161
Artificial Analysis 智力指数
52
Deepseek v4 Flash 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    1.43m 52s
    • 写了 11 个文件、857 行,先定主题色再写页面。
    • 主动说明地址电话都是占位的,提醒上线前替换。
  2. 2

    新增详情页

    1.13m 19s
    • 三个详情页用一个模板承载,还顺手建了豆单列表页。
    • 详情页内容全部取自已有资料,没有编新信息。
  3. 3

    后端与登录

    2.76m 9s
    • 先问了一句题面没交代清楚的地方,再动手。
    • 预订记录存在服务端,未登录直接调后端会被挡回来。
  4. 4

    SEO 与 GEO

    0.82m 36s
    • 只花 0.8 积分,是全部二十八步里最便宜的一步。
    • 加了结构化数据和常见问答,用真实域名;没有真坐标就明说不编。

MiMo V2.5 Pro

小米高性能

设计能力第一梯队,Design Arena 网站生成榜排到第 21;缺点是慢,四道题跑了 34 分半。

Design Arena 网站生成
1271#25/161
Artificial Analysis 智力指数
43
MiMo V2.5 Pro 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    2.43m 51s
    • 7 个文件、790 行,先定主题色再写页面。
    • 首屏做成纯排版,没有用主视觉大图。
  2. 2

    新增详情页

    5.214m 15s
    • 改动量是全场单条最大的一轮,抽出了三个共享组件。
    • 跑了 14 分钟,这一步最慢;详情页配图里印着别家咖啡品牌的包装。
  3. 3

    后端与登录

    3.54m 35s
    • 题目说访客可以直接提交,它把提交也挡在登录后面了,而且没问。
    • 预订记录存在服务端,登录和后端都用的平台能力。
  4. 4

    SEO 与 GEO

    6.111m 49s
    • 首页和每个豆子页都加了结构化数据,另加一块看得见的常见问答。
    • 跑了将近 12 分钟,这一步最慢。

GPT-5.6 Luna

OpenAI高性能

四道题里有两道跑出全场最快(新增详情页 80 秒、SEO 96 秒);遇到会影响用户流程的取舍,它会先问一句再动手。

Design Arena 网站生成
1245#38/161
Artificial Analysis 智力指数
52
GPT-5.6 Luna 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    3.01m 54s
    • 先弹了一张问卷问客群和品牌气质,再动手。
    • 定下品牌名「拾光烘焙」,自己加了滚动动画和图片悬停。
  2. 2

    新增详情页

    2.21m 20s
    • 每个详情页写了产地、风味、处理法和冲煮建议,还补了手机端菜单。
    • 三个页面的标题还是首页那一个,没有分开写。
  3. 3

    后端与登录

    7.92m 53s
    • 先问「访客要不要先登录才能提交」,拿到答复才动手。
    • 导航里「我的预订」点过去是 404,链接和真实页面地址没对上。
  4. 4

    SEO 与 GEO

    6.11m 36s
    • 1 分半跑完,这一步最快;顺手把详情页标题分开写了。
    • 首页加了一块看得见的常见问答,网址用的是真实域名。

Deepseek v4 Pro

DeepSeek高性能

七个模型里只有它和 Gemini 3.7 Flash 把 robots、站点地图、给 AI 读的摘要三样都写了。代价是慢,四道题跑了 38 分钟,全场最慢。

榜单版本提醒

正式版 2026-08-13 才发布,两个榜单还没对齐:Artificial Analysis 收录的是当天的「DeepSeek V4 Pro 0813」,Design Arena 的条目没有版本标识、很可能仍是更早的预览版。左边这一列请当作参考下限。

Design Arena 网站生成
1233#48/161
Artificial Analysis 智力指数
53
Deepseek v4 Pro 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    6.010m 20s
    • 整页没用一张图片,靠字体、色块和一枚会转的印章撑起来。
    • 10 分 20 秒才出第一版,七个模型里最慢的一版。
  2. 2

    新增详情页

    6.37m 19s
    • 三个详情页各有各的标题,还顺手建了一个豆单列表页。
    • 交付前自己去线上把新页面打开核对了一遍。
  3. 3

    后端与登录

    7.211m 47s
    • 预订记录存在服务端,未登录直接调后端会被挡回来。
    • 它把提交预订也设成了要先登录,并主动把这个改动拎出来问你要不要。
  4. 4

    SEO 与 GEO

    4.88m 42s
    • 和 Gemini 3.7 Flash 是仅有的两个把 robots、站点地图、给 AI 读的摘要都写全的。
    • 首页多了一块看得见的常见问答,网址用的是站点真实域名。

Gemini 3 Flash

Google价格基准

设计稳定、有个性,做新页面的首选。其余模型的花费都以它为参照。

Design Arena 网站生成
1180#82/161
Artificial Analysis 智力指数
39
Gemini 3 Flash 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    9.51m 10s
    • 70 秒出第一版,七个模型里最快的一版。
    • 配色、字体、版式全是它自己定的,题面一个字没提。
  2. 2

    新增详情页

    30.42m 18s
    • 三个详情页加导航下拉一次做完,路径用了更规范的写法。
    • 手机上也能从菜单点进详情页。
  3. 3

    后端与登录

    29.91m 48s
    • 预订和登录都接了平台自带的能力,记录存在服务端。
    • 未登录直接调后端会被挡回来,不是只把界面藏起来。
  4. 4

    SEO 与 GEO

    27.71m 51s
    • 首页和每个豆子页都加了结构化数据,另加一块看得见的常见问答。
    • 把网址写成了一个不存在的域名,上线前得改;这一步也是四档里最贵的。

Gemini 3.7 Flash

Google高性能

第三方设计榜上七个里排第二(Website 榜 #7)。信息密度和收尾最完整,代价是比基准档贵一半。

Design Arena 网站生成
1313#7/161
Artificial Analysis 智力指数
56
Gemini 3.7 Flash 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    14.22m 38s
    • 信息密度最高的一版:每支豆子带风味评分条,还多做了一整块冲煮指南。
    • 配色全靠硬编码,页面里散着 107 个色值,换品牌色要改几百处。
  2. 2

    新增详情页

    25.91m 56s
    • 四步里唯一比基准档又快又便宜的一步。
    • 五个页面共用同一个标题,没分开写;这一项要到第 4 步才补上。
  3. 3

    后端与登录

    42.92m 31s
    • 七个里只有它和 Kimi k3 分对了「谁需要登录」:访客能提交,只有「我的预订」要登录。
    • 但它多做的「凭编号查单」接口没做登录校验,上线前要补。
  4. 4

    SEO 与 GEO

    64.23m
    • 和 Deepseek v4 Pro 一样把 robots、站点地图、给 AI 读的摘要三样都写了。
    • 但补出来的页面标题里品牌名重复了两遍,六个页面全中;这一步也是全场最贵的一步。

Kimi k3

月之暗面标杆这个模型暂未开放

Design Arena 网站生成榜第 1,也是这里最贵的一档——同样四道题它花掉 179.6 积分,榜单方自己记录的平均生成耗时 627.9s。

暂未对外开放,放在这里只作天花板参照——它在 Design Arena 网站生成榜上排第 1,看过它的产物再回头看开放档位,才知道差距有多大、值不值那个价。

Design Arena 网站生成
1352#1/161
Artificial Analysis 智力指数
60
Kimi k3 四步跑完之后的站点首页看它四步跑完的站点
  1. 1

    从零生成首页

    30.34m 51s
    • 豆单给到产地、海拔、处理法、冲煮参数,还标了价格。
    • 七个模型里唯一会检查配图链接能不能打开的。
  2. 2

    新增详情页

    52.26m 53s
    • 交付前真的自己打开页面看了一遍,顺手修掉一处显示重复。
    • 全页单条最贵的一轮;三个页面的标题还是首页那一个。
  3. 3

    后端与登录

    46.95m 48s
    • 七个里只有它和 Gemini 3.7 Flash 分对了「谁需要登录」:访客能提交,只有「我的预订」要登录。
    • 表单细节最多:备注、单笔上限、实时合计、写明取豆时门店付款。
  4. 4

    SEO 与 GEO

    50.25m 41s
    • 把给 AI 读的站点摘要从 12 行链接改写成 33 行分组事实。
    • 收尾自己去线上抓文件核对,确认机制真的生效了。

链接指向该步骤当时的版本快照,不会随站点后续改动而变化

总结

四条拿去就能用的建议

  1. 01

    差距最大的是从零生成那一步

    同一句需求,各家产物的配色、字体、版式几乎没有共同点。这一步最值得你按自己的眼光挑。

  2. 02

    新页面用基准档,后续调整换最省的

    从零生成和新增页面这两步交给 Gemini 3 Flash,页面成型后的调整换 Deepseek v4 Flash——后者跑同样四道题只花它的十几分之一。

  3. 03

    要下单、登录这类功能,直接说就行

    不用另外找开发。实测这一步,模型都接上了平台的登录和后端,记录真的存在服务端——刷新、换浏览器、换台电脑都还在。想验证很简单:提交完刷新一下,看记录还在不在。

  4. 04

    顺手让它做 SEO 和 GEO

    一句话就够。站点地图、robots.txt 这些平台自带,不用你操心;AI 补的是结构化数据和 FAQ——这正是别人问 AI 助手「附近哪家咖啡店靠谱」时,它会拿去引用的内容。

还是不确定选哪个?

开放的几档在 Creght 里都能直接选来用,跑一遍最快。想要更细的选型建议,文档里按任务类型分了档。

Render diagnostics