谷歌 Gemini 4 Argon 出手:18 项基准 13 项登顶,输出上限拉到 100 万 token,营销人该盯什么? 北京时间 9 月 30 日晚间,谷歌正式发布新一代旗舰模型 Gemini 4 Argon。官方给它的定位是"前沿智能的新阶段",主打复杂长周期工作流里的深度推理。这也是谷歌放弃原计划的 Gemini 3.5 Pro、直接跳级进入 Gemini 4 时代的第一款旗舰。 对营销人来说,大模型厂商打架不是新闻,但每次旗舰换代,都值得认真看一次。因为模型的边界,决定了下半年你的 AI 工具能帮你干多少活。 先说背景。谷歌在 AI 前沿竞争里落后了大半年,今年 7 月,皮查伊在投资者电话会上承认了这一点,同时把 Gemini 4 定义为追赶的关键。原计划中的 Gemini 3.5 Pro 一直没落地,谷歌索性跳过它,直接发了 Argon。所以这一代不只是"例行升级",是谷歌重新抢回"前沿"这张牌的第一击。昨天刚发的消息,今天就值得写——因为它可能是接下来几个月,你手上所有 AI 工具能力上限的一次集体抬高。 PART 01|18 项基准 13 项登顶:强在哪,弱在哪? 先看成绩单。谷歌公布的数据里,Gemini 4 Argon 在 18 项基准测试中拿下了 13 项第一或并列第一,其中知识型工作和长上下文推理是它的强项。 几个具体数字: - Vals Index(通用智能评测)68.9%,领先 Claude Opus 5.5 的 67.0%; - Vals Finance Agent v2(金融智能体评测)65.4%,领先 Fable 5.1 约 6.5 个百分点; - Harvey's Legal Agent Benchmark(法律智能体评测)19.6%,大约是 Fable 5.1 得分的三倍。 知识工作领先,编程能力却"参差不齐":在 DeepSWE v1.1 软件工程测试上,Argon 以 77.9% 登顶,领先 OpenAI 的 Astra 和 Anthropic 的 Opus 大约 3 到 4 个百分点;但在 FrontierSWE v2 上只有 55.0%,落后 Astra 的 65.5%;在 Terminal-bench 4.0 上 57.4%,落后 Opus 5.5 的 66.4%。 这里要提醒一句:这些基准不是完全同一实验条件下跑的,谷歌用了自己的 mini-swe agent 框架,竞争对手的数据来自公开排行榜,直接比较要谨慎。但"知识工作领先、编程有强有弱"这个整体画像,和官方定位是一致的。 PART 02|100 万 token 输出上限:一次能干完一整条任务链 技术规格里最值得注意的。是输出 token 上限从上一代的 6.4 万,直接拉到 100 万。 输出上限大意味着什么?意味着模型可以在一次运行里,生成数十万字的完整内容,不用中途"翻页"、不用分段重来。谷歌把这个设计和深度推理挂钩:生成空间更大,模型才能完成更复杂的任务链。 谷歌披露的几个内部案例能说明问题: - 数据中心内存优化:Argon 智能体分析集群性能遥测数据并实施优化,释放了超过 300 TiB 内存; - 代码迁移:参与把 C/C++ 代码迁移到 Rust 的工程,涉及 re2 等核心库,以及 Fuchsia 系统 Zircon 内核超过 80 万行代码; - 视频解码库 libgav1 迁移:Argon 替换了 3.2 万行 SIMD 代码,最终解码器运行速度比此前 Rust 移植版本快 2.7 倍; - 量子计算优化:Argon 协助优化了一个子程序的时空资源,改进幅度达到 40%。 对营销人来说,100 万 token 输出上限直接对应的场景是:把一整份品牌资料、一整年投放数据、几十个竞品分析喂进去,让 AI 一次性产出完整报告,而不是拆成几十次对话来回拼。长上下文加知识工作领先。这个组合对"用 AI 做行业研究和内容生产"的人,是实打实的利好。 PART 03|定价 2 美元入场,推广期过了翻倍 价格方面,谷歌给 Argon 定了推广期价:每百万输入 token 2 美元、每百万输出 10 美元,缓存输入享受 95% 折扣。推广期结束后,价格翻倍到输入 4 美元、输出 20 美元。 对比一下同行: - OpenAI 的 GPT-6 Astra、Anthropic 的 Claude Fable 5.1,标准价都是输入 10 美元、输出 50 美元,是 Argon 推广期价格的五倍; - Claude Opus 5.5 定价输入 4 美元、输出 20 美元,和 Argon 推广期后的价格持平; - OpenAI 昨天刚发布的 GPT-6.1 Sol,定价和 Argon 推广期一样,都是输入 2、输出 10。 看出来了吧:旗舰模型的"千 token 价格",正在集体往 2 到 4 美元这个区间挤。价格战从"普惠小模型"打到了"旗舰大模型",对使用者是好事,对靠差价吃饭的中间层是压力。 PART 04|先给网络安全公司用:安全,成了旗舰的"准入门票" 这次发布最特殊的点,不在性能,在节奏。 Gemini 4 Argon 目前只向特定的网络安全防御公司和组织开放,普通开发者和企业用户还得等。谷歌给出的理由是:让防御者先修补系统漏洞、修复模型发现的缺陷,然后再广泛发布。模型内部也加了新防护:监控功能可以在模型越界执行超出用户预期的任务时捕获并终止。 这个节奏,和 OpenAI 那边的操作几乎同步。就在这两天,OpenAI 因为安全标准不达标暂停了 GPT-6.1 阿斯特拉的发布。两家头部公司,不约而同地,把"安全"放在"抢发"前面。 对营销人这不是远方的新闻。它说明三件事:第一,AI 生成内容的可靠性,正在成为平台和监管最关心的点;第二,你用的 AI 工具背后模型的安全表现,会直接影响你的内容能不能被平台收录、被 AI 引用;第三,无论工具多强,人工把关那一环,短时间内在营销行业里只会更值钱,不会更便宜。 PART 05|营销人该盯什么:三句话收尾 第一,工具的上限在往上走。长上下文、知识工作、100 万 token,意味着今年内"让 AI 帮你做深度分析"的成本会明显下降,该把重复性研究类工作往 AI 上迁移了。 第二,价格战利好应用层。模型越来越便宜,真正值钱的是"会拿模型解决具体问题"的人。营销团队的差异化,会从"用没用 AI"变成"用 AI 解决了什么问题"。 第三,安全合规是底线。旗舰模型的发布节奏都在为安全让路,我们的内容生产更没有理由跳过人工校验。AI 出稿,人把关,这条路不会变。 最后多说一句:模型再强,也只是"工具的上限";真正决定内容质量的,还是用工具的人怎么提问、怎么校验、怎么把 AI 的产出变成对客户负责的交付物。谷歌这一代的定位是"帮你干完整条任务链",那我们就更要把"人"放在任务链的最后一环——这也是我们一直说的,AI 提效、人工把关。