中欧平台是关注游戏体验的内容站点,借助核心要点呈现角色养成的不同侧面,中欧娱乐平台以成为实用的游戏阅读平台为目标,持续关注隐藏内容的讨论话题,理解关卡设计的过程不必赶进度,先从入门步骤中找到自己的兴趣点,希望读者更清楚地认识单机体验,所以在内容中梳理基础概念。

Home- Blog- Blog Details

在深圳,一家仅有十名员工的AI创业公司,日常工作高度依赖AI完成——每天有数百个Agent(智能体)同时运作,分别执行代码编写和研究任务。这些Agent的驱动力此前一直来自OpenAI的GPT系列模型。

但随着团队分配给Agent的任务日益增多,林舟发现GPT已无法满足需求——他们当时使用的GPT5.6,一次只能并行处理两三个任务。“GPT能处理的并发任务有限,这会拖慢我们的工作进度。”林舟表示,团队开始寻找能支持更多任务并行、且调用成本更低的模型。

DeepSeek V4.1 Flash成为了新的选择。自9月起,团队试用过Claude及多款国产模型,最终选定V4.1 Flash:它能够完成当前的开发工作,响应更快,调用成本也更低。林舟认为,这是他们目前“性价比最优”的方案。

今年早些时候,Google CEO Sundar Pichai在Google I/O大会上透露,据他所知,有些公司到5月时,全年的Token预算已基本耗尽。以Google自身为例,其内部AI编程工具每日消耗的Token从3月的5000亿增至5月的超过3万亿。

正是在这次大会上,Google推出了速度更快、成本更低的Gemini 3.5 Flash,瞄准更日常的开发与工作场景——今年以来,OpenClaw掀起的“龙虾”热潮,使普通用户也开始用Agent处理各类工作事务,这比编程更贴近日常、门槛更低、需求更频繁。

与此同时,越来越多的小参数模型涌现。由于任务量增加,模型调用更加频繁,若使用几千亿甚至两三万亿参数的旗舰模型,用户需承担高昂成本;并且大参数模型的速度也难以提升,会显著增加用户等待时间。

模型厂商,尤其是中国模型厂商,纷纷推出Flash版本的小参数模型,争夺的正是那些原本由旗舰模型完成的日常需求。 Flash,意为“闪电”。模型厂商通常以此命名表示更快、价格更低的版本:它每次运行调用的参数较少,适合反复处理日常任务;而复杂问题仍可交由Pro等旗舰模型处理。

7月31日,DeepSeek发布V4 Flash正式版;8月26日,阿里Qwen团队的Qwen3.8-Flash-Next与智谱的GLM-5.3-Flash同日亮相;9月,DeepSeek又推出V4.1 Flash。这几款模型参数大小不一,均在千亿级别(从100B至500B的参数区间),远小于当前旗舰模型的万亿级别参数。

两个月前,当DeepSeek V4 Flash正式发布后,有开发者将它的评测成绩与完成任务的成本绘制在一张图上,提出了所谓“斩杀线”:那些性能不如V4 Flash,但执行相同任务成本更高的模型,就这样被“斩杀”。

灰色区域内的模型被DeepSeek V4 Flash“斩杀”,来源:Artificial Analysis

8月下旬,美国编程Agent平台Cline开始免费提供一款未公开身份的模型。Cline称,不到一周,这款模型承担了平台超过11%的推理量。随后,智谱认领了这款模型,正是后来推出的GLM-5.3-Flash。此前,智谱创始人唐杰在业绩会上谈到下一代模型时表示,公司“不会做一个大而无用的模型”。

事实上,“小模型”阵营还在持续扩大。智能涌现了解到,月之暗面和腾讯混元,都在推进Flash模型版本的开发。

另一方面,今年以来,资本市场已对中国模型公司押下高额赌注,在此背景下,商业化成为更现实的问题。

公开数据显示,截至今年8月,智谱的ARR(年化收入)约为16亿美元,其市销率高达46倍;尚未上市的DeepSeek,估值更是达到其预估年化收入的163倍。而大洋彼岸的Anthropic,市销率约为20倍。中国模型公司在商业化上仍有很长的路要走。

因此,中美模型竞争也出现了另一条主线:在继续追求AGI、争夺模型能力上限的同时,谁能用性价比更高的模型完成更多真实任务、服务更多用户?谁能凭借高性价比模型打开更大市场、创造更多营收?

01 一场模型效率革命

切换模型后,林舟的一大体验改善是模型的响应速度明显加快。

团队经常需要几十个Agent同时写代码,他会边观察进展边调整指令;发现方向不对,立即让模型修改。此前使用Codex时,他常需等待模型输出一长段内容才能介入纠正。“无论用CLI格式还是原生App,响应时间都很长。”而一旦遇到长项目,模型需要整理之前的对话内容,使用GPT-5.6时,又需再等一阵。“但切换到V4.1 Flash后,你跟它说什么,它都能立刻回应。”

今年以来,Scaling Law仍是大模型研发的主线。今年发布的Qwen3.8-Max总参数达2.4T(T表示万亿个参数),Kimi K3达2.8T。根据Elon Musk今年4月披露的对比推算,当时的Claude Opus约有5T,尽管Anthropic未确认这一数字。

这些超级模型固然触及了更高的智能,但更大的底座需要更多训练和部署资源;在Agent场景下反复调用模型时,使用成本也会指数级增加。

换用V4.1 Flash后,林舟另一个明显感受是调用成本大幅下降。 他举了团队开发小应用的例子:一名同事独自完成开发,“差不多三四美金,就成了一个小App出来”。

模型服务平台Requesty 8月的周榜单显示,DeepSeek V4 Flash占平台上实际Token用量约三分之一,位居所有模型之首。 而在此前的第三方评测中,它与美国GPT-5.6 Luna高推理版本的综合得分接近,但完成同组任务的成本低约六成。

“模型公司也开始更关注真实市场需求,更多地倾听开发者的声音。”一位基模研究员对智能涌现表示。小模型一轮训练所需的时间和资源更少,能更快让用户验证模型运行结果的可行性,并判断是否需要调整。“用小模型搞开发,可以更快进行版本迭代,更快获取认知。”

在日常工作中,这位研究员也会根据任务需求选择模型。他举例说,修改实验脚本这类简单但工作量大的任务,交给GPT处理可能需要20分钟,而使用DeepSeek V4 Flash只需2分钟。“既然任务难度不高,我就只希望模型尽快完成这件事。”

正是在这样的用户场景驱动下,近期各家发布的Flash模型大多在400B以下(B表示十亿个参数):DeepSeek V4 Flash总参数284B;GLM-5.3-Flash总参数320B;Qwen3.8-Flash-Next的主模型为125B。

“从训练角度来看,300B和更大一些的模型,在能力上可能相差不大。”这位研究员说,他做过不同尺寸的训练实验。在他使用的数据和训练方案下,约300B的模型已能学习更大模型输出的长推理链。

2025年发表于《Nature Machine Intelligence》的一项研究分析了51个开源模型,发现要在知识、推理、数学和代码等五项测试中取得相近成绩,所需的参数越来越少。研究者称之为“能力密度”提高:同样大小的模型,能完成更多任务。

Qwen3.8-27B是一个近期例子。在Qwen公布的同组测试中,它在编程测试SWE-bench Pro中得61.7分,上一代同尺寸模型为53.5分;在长程办公测试CoWorkBench中得70.7分,上一代为61.0分。

模型需要解决的问题也随用户变化。这位研究员举例说,编程产品常回答程序员如何写代码、管理项目;到了办公场景,问题变成了“我Excel公式记不住怎么办”“怎么把这篇论文写了”。

底层工作仍可能是写代码,但实际要完成的工作复杂度可能降低。从Code到Work,一场模型的效率和成本革命正在发生。

02 从“编程”到“日常办公”

“我觉得会是两条路。”对于当下Agent分化出的“编程”和“办公”两种产品,一位Code Agent创业者这样评价道。编程和办公产品都需要模型理解指令、写代码、调用工具,但面向的用户群体不同。他认为,面向普通人的办公产品,“一定需要极致省钱,极致性价比。”

今年1月,腾讯混元负责人姚顺雨在AGI-Next峰会上谈到用户需求的差异:企业进行生产力任务时仍愿使用能力最强的模型,但普通用户多数时候不需要。

两类用户选择模型的方式也不同。“程序员会自己分辨哪些任务用更贵的模型,哪些用更便宜的。”普通用户未必知道处理表格、撰写报告需要多强的模型。上述创业者说:“这是办公Agent的产品经理需要想办法解决的问题。”

今年1月,Anthropic推出Claude Cowork,使原本主要辅助写代码的Agent也能处理桌面办公任务。OpenAI随后推出ChatGPT Work,让用户直接交代一项工作,而无需在对话框中逐步提问。

与此同时,国内产品也从编程走向办公。3月,腾讯云CodeBuddy团队推出WorkBuddy;8月,阿里整合QoderWork、悟空和MuleRun,推出千问办公;而在差不多时间,字节将飞书、TRAE Work等产品的办公能力整合到豆包,推出“豆包工作”。

QuestMobile报告显示,2026年7月,腾讯WorkBuddy有658.2万月活跃用户;PC客户端用户当月人均使用19次。

面对数百万用户反复交办的日常任务,办公Agent不能只按复杂编程的标准选择模型。在一些WorkBuddy用户社区中,有用户这样评价DeepSeek V4 Flash和GLM-5.3-Flash:“有这两个Flash干活基本够用。”而在企业端,一位接近智谱的人士表示,GLM-5.3-Flash发布后,不少企业客户对这款总参数320B的模型表现出浓厚兴趣。

而在真实的办公Agent使用场景里,执行任务的模型甚至可以更小,小到百亿级别。

聚焦办公Agent的创业公司元空智能,已在元空AI Work中使用几十B的模型。团队基于开源模型进行后训练,使其处理更垂直的任务;通用任务则调用云端的混合模型。

用户交办任务,产品替他选择模型,在这样的模式下,元空团队观察到用户对交互速度非常敏感。一位团队成员说:“我们现在系统稍微慢一点点,一分钟之内一堆用户马上就找过来了。

事实上,一些办公任务甚至不需要用到DeepSeek Flash的最高思考强度。一位元空团队成员说,这样做对他们的部分任务“其实是过剩的,会输出非常多的Token,产生大量成本浪费”。

元空智能在权衡任务效果和Token消耗,千问办公也将任务分为两档:标准模式处理日常办公,高级模式应对更难的问题。8月底,千问办公将Qwen3.8-Flash应用于标准模式。

按千问办公公布的测试结果,标准模式完成单项任务的速度提高约一倍,平均Token消耗减少75%;这一模式可完成其定义的约95%的日常任务,更难的任务则交由高级模式。

03 更大,但也更卷的市场

几个月前,美国创业公司Lindy宣布开始使用一款中国模型——将平台管理的大部分日常工作Agent调用,从Claude Sonnet、Gemini切换至DeepSeek V4 Flash。公司披露,切换后这部分调用的模型费用下降约九成。

“这是公司成立以来,对成本结构影响最大的一次调整,产品质量未受影响。”Lindy创始人Flo Crivello这样说道。

8月下旬,一款名为Ox-Alpha的匿名模型进入海外编程Agent平台OpenCode和模型平台OpenRouter,立即引发广泛讨论。

美国编程Agent公司Cline用自家代码库中的真实故障进行了测试:Ox-Alpha和另一款模型都修复了问题,但前者消耗的输出Token只有后者的约三分之一。

这款被中国用户戏称为“牛来”的模型,上线不到一周,仅在OpenCode就有约50万人使用;8月26日,智谱认领了这款模型——GLM-5.3-Flash。“牛来”模型与智谱的旗舰GLM-5.3形成了高低搭配——难题依靠旗舰,日常任务则交给Flash版本。

开发者的免费试用只是第一步。显然,中国模型公司希望借助Flash的能力和价格,进入全球Agent产品, 让用户的更多日常任务转向自己的模型。

这几乎是一个由DeepSeek带动的市场。全球范围内,DeepSeek在V4 Flash发布后调用量一直居高不下。OpenRouter 6月数据显示,DeepSeek占该平台Token用量的份额,从年初的9%升至6月初的18%;增长主要来自Agent任务。到5月底,V4 Flash已占DeepSeek系列Agent任务Token用量的70%。

DeepSeek让其他模型厂商看到,在300B至500B区间的Flash模型,拥有巨大市场潜力——这是一个被拓宽的新市场。

不同类型的模型针对不同定位的市场,模型厂商赚钱的概率也会提升。

从市场角度看,旗舰模型和Flash模型正在形成不同的战场。但在大模型研发团队看来,这似乎并非两个对立的策略。

一位业内人士表示,旗舰模型仍有继续训练的价值。他将其比作车企的赛车:“它不一定能量产,但会有一些技术下放。”在他看来,旗舰探索出的能力和训练经验,最终可进入服务更广泛用户的小模型。

例如,智谱上周披露,一个由GLM-5.3驱动的Infra Agent,参与了GLM-5.3-Flash推理服务的搭建与优化,并成功将GLM-5.3-Flash部署到国产芯片上。从初步适配到投入生产,不到两周;经过优化,同一套服务处理请求的能力提升至最初的三倍。

另一方面,Flash模型也成为下一代模型的试验场。Qwen先在Qwen3.8-Flash-Next上使用计划用于Qwen4的新架构;据团队介绍,这款模型的训练算力消耗约为Qwen3.7-Plus的九分之一。

这场竞争不仅发生在中国厂商之间,美国模型公司也参与其中。

价格战已经打响。

7月,OpenAI将较轻量的GPT-5.6 Luna价格下调80%。在OpenAI公布的客户反馈中,美国办公Agent公司Dust表示,换用Luna处理同类任务后,速度提高40%,费用降低40%。显然,在全球范围内,模型厂商们都在试图用更小的模型,凭借速度和价格优势争取Agent客户。

OpenAI首席财务官Sarah Friar写道:“只要质量够用,低价模型就会被用于更多任务。”而“模型处理更多任务”给模型公司带来的收入反馈,我们或将在下一季度见到。

文中林舟为化名

在此背景下,中欧平台也观察到,小模型在提升任务效率与降低成本方面的潜力正逐步显现,成为连接技术应用与商业化的重要桥梁。