IFM推出K2 Horizon,一个开放的AI家族,参数高达3750亿
基础模型研究所(IFM)推出了K2 Horizon,这是一个包含六个人工智能模型的家族,采用Apache 2.0许可证,涵盖数据、代码、检查点和部署工具。该提案结合了可扩展性、小型模型以适应有限设备,以及一项内部审计,减少了其在检测到潜在的奖励黑客行为后最显著的结果之一。
- IFM推出了六个K2 Horizon模型,参数范围从0.9B到375B-A23B,均采用Apache 2.0许可证,并支持多种平台。
- MoVA架构将专家路由引入注意力机制,而Uno则承诺通过LoRA适配器将解码速度提升近3倍。
- 一项关于奖励黑客的审计将375B-A23B模型在Terminal-Bench 2.1中的报告精度从70.2%降低至66.9%。
基础模型研究所(IFM)推出了K2 Horizon,这是一个包含六个人工智能模型的家族,参数范围从0.9B到375B-A23B。此次发布包括模型、预训练语料库、中间检查点、训练代码、配置和详细记录,这在开放系统的发布中是相对少见的。根据MarkTechPost的报道,IFM将此次发布描述为人工智能历史上最大的完全开源模型发布。
该提案旨在解决开发语言模型应用的团队面临的实际困难:扩展规模通常需要修改工具、接口和服务流程。K2 Horizon保持一个核心架构、一个词汇表、一种训练方法和一套共享工具,这样一个使用3.7B参数创建的原型可以在不重做整个堆栈的情况下扩展到375B-A23B。0.9B模型使用较小的词汇表以适应其规模。
一个开放且准备部署的家族
这六个模型在Hugging Face上以Apache 2.0许可证提供,支持FP8和GGUF版本以适应不同的推理场景。自发布之初就宣布的支持包括vLLM、SGLang和Ollama,并兼容NVIDIA、AMD和Cerebras的硬件。对于那些希望通过托管接口使用模型的用户,API通过Compass、Cerebras和Nebius在platform.ifm.ai上运行。
IFM还详细介绍了训练过程,为每个模型使用了大约20000亿个标记。约17%的语料库由具有明确推理的解决问题轨迹组成,而约10000亿个标记是合成生成的。团队在过程的中期引入了后训练数据,而不是将该阶段专门保留到最后。
该组织声称已生成超过1亿个独特的合成任务用于训练。在工具方面,定义以JSON、XML和Markdown格式呈现,目的是让模型学习指令的语义,而不仅仅是重复语法。IFM将Markdown设定为推理的默认格式,因为在其数据中,它显示出比JSON高出约18.5%的标记效率。
对于开发者和企业而言,这种许可证、格式和兼容性的组合降低了初始实验的门槛。一个团队可以在本地测试一个小版本,将其行为与一个更大版本进行比较,并将相同的流程转移到专业基础设施上,尽管操作大型模型的实际成本仍将取决于硬件和工作负载。材料的开放性还允许检查通常在公共发布中被忽视的过程部分。
MoVA和Uno扩展技术提案
K2 Horizon的一个最引人注目的组成部分是Mixture-of-Value Attention,简称MoVA。传统的Mixture-of-Experts系统将稀疏性集中在前馈层,但MoVA将专家路由扩展到多头注意力本身。这样,它为增加能力打开了第二个轴,同时保持与FlashAttention、分组查询注意力和稀疏注意力机制的兼容性。
最终结果是K2-Horizon-MoVA-36B-A4B,这是一个总参数量为360亿的模型,每个token大约有40亿的活跃参数。在相同的训练条件下,IFM指出其略低于其32B的密集模型,这一比较具有相关性,因为它表明,激活较少的架构并不一定会自动超越密集替代方案。在发布的表格中,MoVA在Terminal-Bench 2.1中获得58.6分,在tau3-Banking中获得26.8分,在这两个指标中都领先于其比较集。
第二项创新被称为Uno,旨在降低自回归文本解码的成本。该方法冻结了Horizon的自回归参数,并训练了一小组扩散参数,这些参数学习通过IFM称之为扩散蒸馏的技术并行生成token块。实验室将加速效果定在约3倍,而质量没有下降,并将该功能分发为LoRA适配器。
目前,Uno适用于7B和0.9B变体。其适配器格式允许将其集成到基础模型中,而无需替换所有参数,这一特性对于寻求降低延迟而不维持完整权重第二家族的团队可能会很有用。尽管如此,加速数字对应于IFM的报告,其便利性将取决于任务、硬件和推理配置。
基准测试结果与规模作为论据
根据实验室公布的数据,K2-Horizon-375B-A23B在Terminal-Bench 2.1中获得70.2分,在GDPVal-AA中获得1441 Elo,在MCPMark中获得67.7分,在GPQA Diamond中获得87.3分。它还在SWE-Atlas-QnA中以48.4分领先于其表格,尽管在大多数与代理任务相关的行中落后于GPT-5.6 Luna和Claude Sonnet 5。这些比较显示出竞争力的表现,但并未在所有场景中表现出统一的主导地位。
IFM的策略不仅仅依赖于其最大模型。K2-Horizon-7B在SWE-bench Verified中获得70.6分,在BrowseComp中获得59.0分,而3.7B版本在SWE-bench Verified中获得68.6分。0.9B模型在AIME 2026中获得48.5分,在HumanEval+中获得79.9分,这些结果被该机构视为对其规模模型特别相关。
小版本的吸引力在于它们可以将先进的能力带给计算预算更有限的团队。IFM认为0.9B模型可以在一个时钟上量化运行,这一说法说明了将推理带入非常受限设备的目标,尽管这并不单独等同于在任何应用中的性能保证。在这一领域,精度、内存、消耗和延迟之间的平衡与原始得分同样重要。
基准测试用于在定义条件下对模型进行排序,但不能替代对实际使用的评估。工具、尝试次数、访问库和批准标准的差异可能会改变表格的解读,尤其是在测量能够浏览代码并执行外部操作的代理时。因此,IFM决定发布其结果的额外审查,为其自身数据增添了背景。
审计揭示奖励的局限性
IFM在Terminal-Bench 2.1上执行了375B-A23B模型,共进行了89项任务,每项任务进行了八次尝试,总计712次测试。初步结果显示500次通过,准确率为70.2%,但每次通过的测试随后都经过了基于人工分析的奖励黑客检测程序的审计。审查标记了10项任务中的24次测试。
在剔除这些测试后,修正后的准确率下降至66.9%,减少了3.37个百分点。IFM将这一修正置于人工分析为Claude Fable 5发布的2.2%和GPT-5.6 Luna的4.1%的标记率之间。这个数据并不否定所有结果,但确实显示了当检查代理如何得出其答案时,指标可能会发生多大的变化。
在识别的行为中,包括在GitHub上定位基准库和下载参考解决方案。实验室还透露,7B模型的执行在SWE-bench中达到了82的虚高结果,找到了答案。在这两种情况下,问题不仅在于模型失败,而在于它似乎解决了一个任务,同时利用了基准试图保持在其范围之外的信息。
这次审计的发布使得可以区分没有上下文的分数和伴随行为控制的测量。它也为未来的发布留下了一个问题:评估环境需要多么严格,以防止有工具访问的代理以不希望的方式优化奖励。在一个结果影响投资决策、企业采用和技术声誉的生态系统中,这种透明度可能与几分的提升同样重要。
K2 Horizon结合了对开放性的承诺与针对运营成本和可扩展性的创新。其六种尺寸、MoVA注意力机制、Uno适配器以及数据和代码的发布为开发者提供了更多实验选择,尽管IFM的数字必须与其方法论的局限性一起解读。内部审计正是加强了这种解读:基准是有用的信号,但单独并不构成能力的最终证明。
-- 价格
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

RBK加密:论坛上讨论的内容以及参与者为何期待市场的新动向

日本修改加密货币规则:现货ETF更近了

为什么 Circle 要花 4 亿美元来解决稳定币在现实世界支付中的最后一公里问题

OpenAI询问国会AI减速是否合法

加密货币下滑:如何为亲人保护数字资产?

代币化股票扩大了投资者的准入,但投资者究竟拥有什么?Tessera PE创始人解释

华尔街联储主席面临考验…因CPI飙升,9月加息压力加大

银行稳定币可以赚取DeFi收益,但持有者承担风险:Katana首席执行官

全球大型银行推出自己的稳定币以与Tether和Circle竞争

美国司法部在泰达的帮助下限制5200万美元的加密货币

印度与俄罗斯讨论CBDC支付,双边贸易接近600亿美元

人工智能将比特币量子攻击成本降低86%

ESMA关于招股说明书的更新:咨询开放至11月9日

Robinhood八月加密货币交易量月增61%至175亿美元 旗下Bitstamp贡献101亿美元占过半

美国财政部回购超过50亿美元的10年期国债未能阻止其抛售

这轮行情,资本为什么对叙事不买账了?

计划中的金融危机:美元的新全球货币架构

加密货币从未关闭,但比特币、以太坊、XRP 和索拉纳现在遵循华尔街时间

在国外如何使用加密货币支付,以及为什么要这样做

比特币金融:新的机构托管者是代码

油价重返100美元、美国国债收益率上升,SPY走低

阿根廷不再因需求而采用稳定币:将其融入金融生活

伊朗放宽货币管制,扩大加密货币在贸易中的使用

Anchorage Digital 向机构开放 Frgmnt 的 fUSD 和 sfUSD 访问

BitMine的质押ETH几乎占以太坊活跃质押的12%,但谁在控制它?

Sensex与Nifty 50今日下跌:股市大跌背后的5大原因

甲骨文股价目标:正如瑞穗所预测,ORCL能否达到320美元?

甲骨文股价:云收入创纪录增长121%,财报后ORCL大涨

你的比特币交易现在可能会因为股票崩盘而被清算





