四道题共花
Deepseek v4 Flash
DeepSeek省钱最省的一档,智力到一线水平。页面成型后的后续调整交给它。
- 页面成型后的后续调整
- 改文案、换图片、调间距
模型选型
让每个模型从需求理解、设计、前端、后端到维护(SEO、GEO),走完一遍做站流程。每一步产物都能点开看。
想省事就照这个用:新页面交给 Gemini 3 Flash,成型之后的调整换 Deepseek v4 Flash。
为什么是这 7 个
同样四道题,各自实际花了多少,取自账单。六个开放档位里,最省的只花最贵的二十四分之一。
四道题共花
最省的一档,智力到一线水平。页面成型后的后续调整交给它。
四道题共花
设计能力第一梯队,Design Arena 网站生成榜排到第 21;缺点是慢,四道题跑了 34 分半。
四道题共花
四道题里有两道跑出全场最快(新增详情页 80 秒、SEO 96 秒);遇到会影响用户流程的取舍,它会先问一句再动手。
四道题共花
七个模型里只有它和 Gemini 3.7 Flash 把 robots、站点地图、给 AI 读的摘要三样都写了。代价是慢,四道题跑了 38 分钟,全场最慢。
四道题共花
设计稳定、有个性,做新页面的首选。其余模型的花费都以它为参照。
四道题共花
第三方设计榜上七个里排第二(Website 榜 #7)。信息密度和收尾最完整,代价是比基准档贵一半。
四道题共花
Design Arena 网站生成榜第 1,也是这里最贵的一档——同样四道题它花掉 179.6 积分,榜单方自己记录的平均生成耗时 627.9s。
暂未对外开放,放在这里只作天花板参照——它在 Design Arena 网站生成榜上排第 1,看过它的产物再回头看开放档位,才知道差距有多大、值不值那个价。
条形按对数刻度绘制,仅用于感知量级差异,单位为积分(6–179.6)
第三方
全部引自第三方公开榜单,Creght 未参与评测。点标题可回原站核对。
众包盲测投票得出的 Elo 评分,专门评测「生成网站」这一类任务,与本页场景最接近。
快照日期2026-08-18
共 161 个模型参评。数据为 2026-08-18 快照,非实时。
条形按该榜单实际区间绘制(783–1364)
由 9 项评测合成的通用能力指数,衡量推理、知识、数学与代码,不代表视觉设计能力。
快照日期2026-08-18
通用智力指数,与「页面好不好看」不是同一回事,看设计请看左侧一列。
条形按该榜单实际区间绘制(0–100)
实测
相同选题,实测七个模型的能力如何。
考设计。刻意不给配色、字体、排版任何指示。
题目原文
为一家做手冲咖啡豆的独立烘焙工作室做一个单页官网首页,包含:品牌主视觉区、三款主推豆子的介绍、烘焙流程说明、门店地址与营业时间、底部联系方式。文案你来写,中文。
考它能不能把需求拆开做,而且新页面要接得上原来那套设计。
题目原文
在现有站点上新增「豆子详情」页,为三款豆子各生成一个详情页,首页三款豆子的卡片分别链接到对应详情页;同时在导航栏加入「豆子」入口,移动端菜单也要能进。
考编码是否严谨。会不会用平台的后端和登录,还是把数据塞在页面里假装存下来了。
题目原文
给站点加一个「预订豆子」的功能:访客选好豆子、填写数量和手机号后提交预订,提交成功后显示预订编号。预订记录要真正存下来,不能只留在页面上——刷新或者换个浏览器打开也要还在。另外加一个「我的预订」页面,只有登录后才能看到自己提交过的预订,没登录就引导去登录。
考智力。题面不给答案,看它自己想到该做什么。
题目原文
帮我做一下 SEO 和 GEO 优化。我希望目标客户不管是在搜索引擎里搜,还是直接问 AI 助手,都能找到我们这家店。
一张表看完
每格是那一步实际花掉的积分与耗时,取自账单,不是估算。点模型名跳到它自己那一段。
| 模型 | 1 从零生成首页 | 2 新增详情页 | 3 后端与登录 | 4 SEO 与 GEO | 四步合计 |
|---|---|---|---|---|---|
| Deepseek v4 Flash | 1.43m 52s | 1.13m 19s | 2.76m 9s | 0.82m 36s | 6.015m 56s |
| MiMo V2.5 Pro | 2.43m 51s | 5.214m 15s | 3.54m 35s | 6.111m 49s | 17.234m 30s |
| GPT-5.6 Luna | 3.01m 54s | 2.21m 20s | 7.92m 53s | 6.11m 36s | 19.27m 43s |
| Deepseek v4 Pro | 6.010m 20s | 6.37m 19s | 7.211m 47s | 4.88m 42s | 24.338m 8s |
| Gemini 3 Flash | 9.51m 10s | 30.42m 18s | 29.91m 48s | 27.71m 51s | 97.57m 7s |
| Gemini 3.7 Flash | 14.22m 38s | 25.91m 56s | 42.92m 31s | 64.23m | 147.210m 5s |
| Kimi k3 | 30.34m 51s | 52.26m 53s | 46.95m 48s | 50.25m 41s | 179.623m 13s |
Kimi k3 带锁的一行暂未对外开放,放在表里只作天花板参照。一点口径要说明:Deepseek v4 Flash 这一档在跑完之后涨价了一倍,它这一行是按涨价前的价目实扣的,按今天的价目算大约要翻倍。表里的数字一律是当时账单上的实扣值,没有按新价折算。
最省的一档,智力到一线水平。页面成型后的后续调整交给它。
榜单版本提醒
这个模型上游有过更新,榜单条目对不齐:Design Arena 同时挂着「DeepSeek-V4-Flash」和更新的「DeepSeek-V4-Flash-0731」(后者排第 38、Elo 1245),本页取的是前者;Artificial Analysis 只收录 0731 那一版。左边这一列请当作参考下限,本页的实跑产物才对应你实际会用到的版本。
设计能力第一梯队,Design Arena 网站生成榜排到第 21;缺点是慢,四道题跑了 34 分半。
四道题里有两道跑出全场最快(新增详情页 80 秒、SEO 96 秒);遇到会影响用户流程的取舍,它会先问一句再动手。
七个模型里只有它和 Gemini 3.7 Flash 把 robots、站点地图、给 AI 读的摘要三样都写了。代价是慢,四道题跑了 38 分钟,全场最慢。
榜单版本提醒
正式版 2026-08-13 才发布,两个榜单还没对齐:Artificial Analysis 收录的是当天的「DeepSeek V4 Pro 0813」,Design Arena 的条目没有版本标识、很可能仍是更早的预览版。左边这一列请当作参考下限。
看它四步跑完的站点从零生成首页
6.010m 20s新增详情页
6.37m 19s后端与登录
7.211m 47sSEO 与 GEO
4.88m 42s设计稳定、有个性,做新页面的首选。其余模型的花费都以它为参照。
第三方设计榜上七个里排第二(Website 榜 #7)。信息密度和收尾最完整,代价是比基准档贵一半。
看它四步跑完的站点从零生成首页
14.22m 38s新增详情页
25.91m 56s后端与登录
42.92m 31sSEO 与 GEO
64.23mDesign Arena 网站生成榜第 1,也是这里最贵的一档——同样四道题它花掉 179.6 积分,榜单方自己记录的平均生成耗时 627.9s。
暂未对外开放,放在这里只作天花板参照——它在 Design Arena 网站生成榜上排第 1,看过它的产物再回头看开放档位,才知道差距有多大、值不值那个价。
看它四步跑完的站点从零生成首页
30.34m 51s新增详情页
52.26m 53s后端与登录
46.95m 48sSEO 与 GEO
50.25m 41s链接指向该步骤当时的版本快照,不会随站点后续改动而变化
总结
同一句需求,各家产物的配色、字体、版式几乎没有共同点。这一步最值得你按自己的眼光挑。
从零生成和新增页面这两步交给 Gemini 3 Flash,页面成型后的调整换 Deepseek v4 Flash——后者跑同样四道题只花它的十几分之一。
不用另外找开发。实测这一步,模型都接上了平台的登录和后端,记录真的存在服务端——刷新、换浏览器、换台电脑都还在。想验证很简单:提交完刷新一下,看记录还在不在。
一句话就够。站点地图、robots.txt 这些平台自带,不用你操心;AI 补的是结构化数据和 FAQ——这正是别人问 AI 助手「附近哪家咖啡店靠谱」时,它会拿去引用的内容。
Render diagnostics