市场矩阵 - 国际黄金原油外汇股指门户网站

资讯流  宏观  直播  策略  日历  |  原油  黄金  美指  外汇  股指  商品  |  教育  知否  |  经纪商  全能投资账户  期货开户

要闻频道,市场要闻,市场矩阵,市场矩阵国际要闻,国际经济新闻

 

市场矩阵网专业版服务

美国股市

Gemini 4来了:谷歌炫耀其基准测试,但内部对其实际表现仍存疑虑


要点:

●  谷歌(Alphabet)开始部署其备受期待的人工智能旗舰模型(AI Model)Gemini 4 Argon,但该公司面临内部对其在编程等关键领域表现的疑虑。

●  该公司称,Gemini 4在多項基准测试中取得突出分数,在一项衡量安全技能的测试中甚至超过了OpenAI的Astra模型。

●  卡武克库奥卢在科技新闻网站The Information主办的一次会议上表示:“我对团队有最大信心。对我来说,我们将始终处于最前沿,这是确定的。”

   

道指行情走势分析,道琼斯指数收盘价格,收盘报告,美国股指走势分析,技术分析,价格目标,纳斯达克指数走势,最新报价,最新消息,道指交易策略   

 (美国股指期货)道指频道编辑张立东 | 市场矩阵 | 原创内容

编辑:张立东  发布时间:2026.10.01 18:27

谷歌(Alphabet)开始部署其备受期待的人工智能旗舰模型(AI Model)Gemini 4 Argon,但该公司面临内部对其在编程等关键领域表现的疑虑。

周三,谷歌在一个由网络安全领域可信合作伙伴组成的小范围群体中展示了该模型,并宣布将在进行额外测试后扩大访问权限,首先从付费订阅用户开始。该公司称,Gemini 4在多項基准测试中取得突出分数,在一项衡量安全技能的测试中甚至超过了OpenAI的Astra模型。

然而,一些专家称这些指标并未反映完整现实。据直接接触该项目的人士称,尽管Gemini 4在用于评估模型效力最常用的对比测试中表现良好,但当员工在实际中使用时,其表现下降。这些人士因讨论内部事务而要求匿名,他们表示该模型难以处理某些编码任务。

公司宣布后,Alphabet股价在盘后交易中上涨近1.7%。在常规交易时段结束时,彭博社(Bloomberg)报道员工对该模型持怀疑态度后,该股回吐了周三早前的部分涨幅。

▌Gemini 4如何收复失地

谷歌最近一直努力开发能够与Anthropic和OpenAI竞争的模型。据知情人士透露,该公司原计划在6月发布一个不同版本,名为Gemini 3.5 Pro,但放弃了该项目。

谷歌表示,称Gemini 4在编程等领域表现较差是不准确的。该公司让彭博社参考谷歌DeepMind负责人科拉伊·卡武克库奥卢上周的评论,他对该模型的表现表示满意。

卡武克库奥卢在科技新闻网站The Information主办的一次会议上表示:“我对团队有最大信心。对我来说,我们将始终处于最前沿,这是确定的。”

谷歌内部存在广泛意见分歧。一些员工认为,Anthropic的Fable模型和OpenAI的Astra模型改进速度超过Gemini。他们认为,Gemini 4即使在其最佳版本中,在某些方面仍将落后于这些模型。其他员工则认为,下一个版本已经达到主要人工智能实验室的水平。

一位熟悉模型开发的谷歌员工称,公司内部对于Gemini 4处于前沿存在“广泛共识”。该人士指出,公司对模型进行了严格测试,并否认这些模型在处理复杂且真实的编程任务时存在困难。

谷歌迫切需要Gemini 4取得成功。该模型的各版本支撑着公司几乎所有的商业化产品,从搜索结果显示中的人工智能回答——谷歌的主要收入来源——到地图、Gmail和Chrome。这些产品每个都拥有超过10亿用户,这是公司一些竞争对手所缺乏的分发优势。

但OpenAI和Anthropic正在停止销售模型,转而专注于开发自己的产品,包括编程代理。如果谷歌未能提供前沿模型,其竞争对手将有更多时间说服消费者、开发者和企业,搜索和软件的未来应该在其平台上发展。

在回应彭博社提问时,谷歌表示,尽管其最新的Pro模型于2月发布,但公司自那以来在人工智能产品方面实现了增长,包括Gemini的企业版、面向消费者的聊天机器人应用以及谷歌搜索中的AI模式,后两者用户已超过10亿。

▌谷歌的Gemini 3.5 Pro发生了什么?

去年11月,谷歌推出了Gemini 3,该模型广受好评,被视为公司努力跟上OpenAI和Anthro-pic的转折点。5月,在其I/O大会上,谷歌宣布了新版本Gemini 3.5 Pro,并承诺在下个月发布。然而,该期限未能兑现,据知情人士称,公司已放弃开发3.5 Pro版本。

除了阻碍谷歌在人工智能领域的雄心外,这一决定可能让公司在时间和金钱上付出高昂代价。据彭博行业研究分析师曼迪普·辛格称,开发此类模型所需的训练成本可能高达4亿美元。使用高薪人工智能研究人员可能进一步推高价格。

现在谷歌在Gemini 4上面临各种挑战。据熟悉该模型内部评估的人士称,其编码能力不稳定。一位消息人士评论说,Gemini在界面设计方面并不特别擅长,而界面设计决定应用和网站的外观及用户体验。这代表潜在的严重挫折,因为谷歌在竞争激烈的人工智能编码工具市场中一直难以竞争。

此外,据一位熟悉其开发的人士称,这是一个非常大的模型。通常,大型模型维护成本高昂,这可能对谷歌的利润率构成压力。

▌为什么内部对Gemini 4持续存疑?

据专家称,谷歌可能正遭受行业偏重基准测试的趋势,这一现象被称为“benchmaxxing”,即工程师更专注于获得好分数,而非创造正常运作的产品。人工智能实验室通常这样做,因为客户往往根据基准分数评判模型。据两位熟悉该模型的人士称,Gemini 4似乎受到这一过程影响。

人工智能初创公司Surge AI创始人埃德温·陈表示,依赖基准可能导致实验室专注于创建用特定语言编写代码的模型,而非创建易于使用或设计良好的应用。

陈说:“一个类比是:‘是的,我孩子在SAT考试中得了高分’,但SAT并不能转化为现实世界的表现。这是一个极其有害的问题。”

据一位熟悉此事的人士称,Gemini 4模型拥有优势,突出表现在其解释文本之外信息的能力,例如从视频中提取元数据。同时,它还强调了其安全性、网络安全以及清晰自然沟通的能力。

谷歌内部的挫败感显而易见。为彭博社此前一篇文章接受采访的研究人员指责过度官僚主义,试图将技术整合到谷歌几乎所有的产品中,并表示任务和优先事项的变化使专注于连贯战略变得困难。

与此同时,一批知名人工智能研究人员离开了谷歌,包括传奇工程师杰夫·迪恩、诺贝尔奖得主约翰·江珀以及诺姆·沙泽尔,后者参与发明了支撑人工智能大部分繁荣的技术。8月,长期领导公司人工智能研究的德米斯·哈萨比斯担任新职务,出任董事长,并将DeepMind的日常运营交给老搭档卡武克库奥卢。

周三,谷歌宣布Gemini 4专为软件工程、金融、法律和网络安全领域的长期复杂任务设计。据谷歌称,它可以比前代生成更长的回答:一次最多100万个token,或约75万个单词。

当该公司努力追赶时,其竞争对手仍在阔步前进,尽管有传言称,在一系列人工智能代理入侵外部组织的事件后,一些前沿模型的开发出现放缓。本月早些时候,Meta平台公司推出了Muse,这是一种人工智能代理,该公司称其可以完成在线购物和预约等日常任务。该应用迅速登上下载榜榜首。
美国股市 >>

 


主题:人工智能新模型观察  | 新闻源:Bloomberg-Stock


---END---

 

 

 

市场矩阵网专业版 MarketMatrix Pro+

① 彭博终端资讯精选(包含中国经济与市场指标)
② 托米丽司:华尔街顶流人工智能投顾增强(专注于事件驱动)
③ 来库古斯:市场矩阵分析师团队策略增强(专注于海龟交易)
④ AI投顾咨询:1次/试用版,3次/正式版

摩根大通揭秘:亿万富豪家族如何投资?这些是他们最青睐的资产

微信扫码支付

▪ 30元:试用一个月

▪ 298元:VIP年卡(每日仅0.8元)

付款后添加微信【Chris222609】

 

 

 

网站首页

• 资讯流 

• 宏观要闻

• 市场直播

• 交易策略

• 财经日历

• 投资教育

• 专家问答

• 交易主题

原油频道

• 天然气

黄金频道

• 比特币

美指频道

债券频道

股指频道

• 道指期货

• 德指期货

• 恒指期货

商品频道

 

外汇频道

• 欧元

• 英镑

• 日元

• 加元

• 澳元

• 纽元

• 瑞郎

关于我们

• 加入我们

• 联系方式

• 广告业务

• 友情链接

 

MarketMatrix.net

市场矩阵 - - 期货及衍生品交易研究中心