9月1日头部厂商密集发布新模型,前沿模型更迭竞争再提速

进不了网站?换个网络试试!

当地时间9月1日, 宣布推出Fable 5.1, 宣布推出5.1, 宣称其为世界上最先进的编程和知识工作模型。

作略慢一步的那种表示, 最新的模型Astra将很快发布, 不过会把最先进的网络安全功能限定于一小部分测试人员去运用。Astra属于被指定为此的第一个抵达其关键网络安全能力阈值的模型。

另据市场传来的消息, 谷歌此刻正在着手开发一款新型的, 具备更强编码能力的人工智能模型, 目的是要去缩小存在于某两者之间的差距。

同一时间窗口, 头部厂商密集释放新模型信号, 预示着前沿模更新换代竞争在暂歇后再度加快节奏。不同于以往单纯较量基准测试得分, 本轮竞赛另一条主线渐趋明朗: 随着模型能力靠近网络安全关键界限, 厂商正共同把安全部署从后台话题推向显著突出位置。

9月1日头部厂商密集发布新模型,前沿模型更迭竞争再提速插图

新模型性能跃升

通过榜单数据证明性能提升仍旧是常规动作。

数据来自第三方测评平台, Fable 5.1在人工智能分析算出的智能指数里处于比较靠前的位置。尽管缓存读取代价已经下降了百分之七十五, 然而每一次任务所需要的费用依旧比Fable 5要高出百分之二十。

前沿智能测试的各项基准中, Fable 5.1 均有提升, 智能指数方面, 相比 Fable 5 提高了 4 分, HLE 测试得分是 59.1%, 超越了 Fable 5 之前创下的 55.5%最高分, -Bench v2.1 测试取得该平台迄今见过的最高分, 分数是 91.4%, 另一项(62.0%)测试同样获取了最高分, τ³ - 测试里, 相比 Fable 5 提升了 9 分。

在价格相关方面, 把缓存读取(命中)价格大幅降低了, 从每百万token 1美元, 大幅度下调到了0.25美元, 这样一算降幅达到了75% , 而标准定价是没有改变的 , 具体这标准定价情况是 , 输入每百万token 10美元 , 输出是50美元 , 缓存写入是12.5美元 , 这种价格方面的调整 , 那显然是可以非常显著把代理工作负载的成本去降低的。

智能指数任务在以Fable 5.1(最高难度)运行时, 单次成本为3.76美元这事, 并未因缓存降价使单次任务成本同步下降, 它相较于Fable 5, 单次成本高出20%, 主要原因在于, 它的输出token用量达到了Fable 5的1.7倍。

在智能体评估里, 缓存读取降价能为每次任务节省约1.40美元, 此场景下大部分输入token源于缓存命中。在xhigh难度时Fable 5.1单次任务成本降至2.72美元, 得分为65, 相比最高难度低1.04美元。然而从横向比较来看, 其仍高于Opus 5在最高难度下的2.34美元(得分设为63)。

折射出前沿模型成本逻辑正发生微妙变化的这一价格结构是: 输入侧缓存降价的意图在于降低智能体场景的调用门槛, 然而模型本身更强的推理深度代表着更长的输出链, 最终致使单次任务的总成本不但没有下降反而上升了。

对那些企业用户来说, 他们重度依赖智能体工作流, 缓存命中率会成为关键变量, 这个变量能决定实际使用要花费的成本。

9月1日头部厂商密集发布新模型,前沿模型更迭竞争再提速插图1

模型行业开始集体部署安全能力

依照Fable 5.1, 以及5.1之后的情况, 把更多的表达倾向, 放置在了网络安全问题之上。

山姆·奥尔特曼声称, 在整个夏天之中, 团队都在全力去推进对于安全方面的工作。当下, 能力以及安全保障措施的同步有所提升, 比以往任何给定的时候, 都显得越发重要起来。他与此同时还承认, 新模型Astra的训练工作已然完成了一段特定时间, 然而后续型号出于需求而放慢了相应进度, 以此来确保能够充分地开展关于安全性以及适配性方面的工作。

官方宣称, Astra已然达成准备框架范畴内的关键网络安全能力阈值, 这所蕴含的意味着, 于有着恰当工具以及访问权限的情形之下, 它能够发觉先前未曾知晓的安全漏洞, 还能够研发出在多个受保护系统内运用这些漏洞的法子, 并且无需人工对每个步骤作出指导。这是被认定的首个达到这般级别的模型, 所以在开发进程当中以及发布之前需要更加严格的安全保障举措。

在过去的几周时间里, Astra的部分开发工作被推迟了, 而且其发布工作也被推迟了之。之所以这样做, 是为了能够加强针对网络滥用情况的防护措施, 同时还要对其针对未经授权的模型操作的防护措施进行测试。Astra虽然并没有卷入之前发生的Face事件当中, 不过它表示已将该事件所带来的经验教训融入到了安全策略里, 并且为Astra实施了更为严格的安全措施, 这些措施当中包括让训练模型能够更加可靠地拒绝有害网络请求, 还要增加防止滥用行为的保护措施, 以及通过监控来阻止潜在的未经授权的活动。

也都在加大安全建设方面的投入, 依据官方所披露的情况来看, 这家公司正针对近期发生的两起安全事件, 展开深入的分析工作, 并且还制定了计划, 要与METR合作去开展独立审查, 期望能够保证两项调查都达到全面且彻底的要求, 而且会在接下来的几周时间内, 公布更多相关信息。

法国人工智能安全中心, 也就是CeSIA的执行主任, 是查贝尔·拉斐尔, 他表示, 刚刚宣布暂停高风险强化学习环境的开发, 这很可能是受近期模型安全事件影响, 从而被迫采取的措施。在他看来, 这跟8月18日宣布暂停前沿强化学习训练的情况相类似。而更进一步来讲, 他们希望尽快建立一种合法、可验证的机制。

行业层面的集体行动也在同步往前推进, 当地时间8月27日, 发布了题为《呼吁开展网络防御的集体行动》的公开信, 联合了亚马逊云服务、谷歌、微软等百余家机构, 共同发出警告, 当下全球各地模型能力一直在不断提升, 由人工智能发起的网络攻击将会变得越发广泛且复杂, 留给各方强化网络防御的时间窗口是有限的。

公开信着重指出, 医院面临着安全威胁, 水处理厂面临着安全威胁, 电网面临着安全威胁, 互联网基础设施面临着安全威胁等关键公共服务正面临着日益迫近的那种不安全且有危险的状况。

安全议题热度升高, 然而并没有减弱厂商在能力赛道上的竞争状态。奥尔特曼在近些日子一场访谈里称, 团队自始至终都想着推动编程业务, 可是就优先级层面而言, 还是错失了这般机会。他与此同时着重指出, 在任何一个阶段处于落后状况并非具有灾难性的, 能够借助更为优良的模型前去奋力追赶。

从凭借Fable 5.1刷新多项编程基准, 凭借Astra叩开“关键级”网络安全门槛, 到谷歌暗地里加大编程模型追赶力度, 头部厂商之间的竞争依旧处于加速状态。而在这个时候, 模型行业正尝试给这场竞速装上安全刹车装置。能力与安全同向推进, 渐渐会演变成下一阶段前沿模型竞争的核心命题。

本站候鸟号已成立4年,主要围绕财经资讯类,分享日常的保险、基金、期货、理财、股票等资讯,帮助您成为一个优秀的财经爱好者。本站温馨提示:股市有风险,入市需谨慎。

相关推荐

暂无评论

发表评论