OpenDesign公司本周对13款人工智能模型进行了相同的设计任务测试,结果显示,DeepSeek最新发布的V4.1 Flash模型在性能上几乎追平OpenAI的旗舰模型GPT-6 Astra,而成本仅为其1.4%。
据OpenDesign Arena公布的评测数据,测试涵盖网页应用、仪表板、移动界面及落地页等日常设计工作,满分100分。其中30分考察输出是否符合需求,70分评测布局、层级、色彩与风格等设计质量。
图为Myriad平台关于英伟达9月股价预测的互动提示。在评测中,GPT-6 Astra以平均82.7分位居榜首,单次设计耗时11.1分钟,成本1.61美元;DeepSeek V4.1 Flash得分81.2,耗时5.3分钟,成本仅0.023美元;Claude Fable 5.1得80.3分,成本3.66美元。
在参测的13款模型中,除GPT-6 Astra外,其余11款(包括Grok 4.6、Qwen 3.8-Max、Kimi K3等)得分均低于DeepSeek V4.1 Flash且运行成本更高。DeepSeek技术报告揭示,V4.1 Flash总参数达5520亿,但仅激活80亿参数处理输入、160亿参数生成输出,采用“因果编码器-解码器”设计实现高效推理。
OpenDesign的测试仅对可渲染为可用网页的输出评分,因此侧重可靠交付而非通用推理。GPT-6 Astra交付率60%,DeepSeek V4.1 Flash为57.7%,Claude Fable 5.1为56.7%。尽管OpenAI新模型写作能力曾受质疑,其仍保持最高综合分。
