Quasar-10B震撼发布:SILX AI打造200万+ tokens超长上下文大模型,彻底革新AI推理体验

【免费下载链接】Quasar-10B 【免费下载链接】Quasar-10B 项目地址: https://ai.gitcode.com/hf_mirrors/silx-ai/Quasar-10B

Quasar-10B是由SILX AI开发的高性能基础模型,基于Qwen3.5-9B-Base架构进行了根本性的重新设计,支持超过200万tokens的超长上下文推理,同时保持高效的计算性能。这一突破性的大模型采用创新的混合门控线性注意力(GLA)架构,彻底改变了传统Transformer模型的注意力机制,为AI推理体验带来革命性提升。

模型概述:突破上下文限制的架构革新

核心技术参数

模型名称:Quasar-10B
开发组织:SILX AI
基础模型:Qwen3.5-9B-Base
上下文长度:原生支持2,097,152(200万+)tokens
架构类型:Hybrid Gated Linear Attention (GLA)

从Softmax到GLA:架构的颠覆性进化

Quasar-10B最显著的突破在于将传统的Softmax注意力机制全面升级为混合门控线性注意力(GLA) 架构。这一变革带来了两大核心优势:

  1. 线性计算复杂度:相比传统Transformer的O(n²)复杂度,GLA实现了O(n)的线性扩展,使模型能够高效处理超长文本序列
  2. 无限递归能力:通过移除传统的RoPE(旋转位置嵌入),采用NOPE(无位置嵌入)技术,消除了位置偏差,实现了对百万级tokens的原生外推能力

技术亮点:GLA架构的选择确保了与Quasar 22B MoE设计的精确架构兼容性,是从silx-ai/Quasar-V1-Base-Stage1直接演进而来,利用Quasar连续时间注意力进行状态轨迹优化。

双阶段训练方法论:打造超长上下文能力

阶段1:结构蒸馏(100亿tokens)

为确保新的GLA层正确继承原始Qwen头的能力,模型首先经过严格的结构蒸馏:

  • 过程:分层结构蒸馏,使用Qwen3.5权重初始化学生模型,并将特定层替换为GLA单元
  • 损失函数:结合MSE(隐藏状态模拟)和交叉熵(语言建模)的混合损失
  • 数据量:100亿tokens的高质量推理数据
  • 目标:最小化结构差异,将预训练的世界知识转移到新的线性状态中

阶段2:原生200万上下文扩展(200亿tokens)

在结构稳定后,模型被推向极端序列长度:

  • 位置编码:完全移除RoPE,替换为NOPE(无位置嵌入)
  • 上下文长度:在2,097,152(200万)序列长度上进行原生训练
  • 数据量:200亿tokens的超长文本数据
  • 硬件优化:针对B200 HBM效率进行优化,利用子分块顺序处理维持200万token的活动状态

Quasar-10B核心优势:重新定义AI推理体验

无限递归能力

GLA架构使模型能够以线性复杂度处理远超训练窗口的序列,理论上支持无限长度的文本输入,特别适合处理书籍、代码库、科学论文等超长文档。

卓越推理性能

模型在Nemotron-Pretraining-Specialized-v1混合数据集上训练,专注于数学、STEM和以代码为中心的推理任务,在复杂逻辑推理和问题解决方面表现出色。

B200硬件优化

针对NVIDIA Blackwell硬件进行了专门优化,可实现最大吞吐量,为企业级部署提供高效的计算性能支持。

技术意义与未来展望

Quasar-10B代表了我们技术栈中第一个"循环基础模型",成功弥合了Transformer规模预训练与RNN式线性效率之间的鸿沟。通过移除位置嵌入,模型完全依靠内部状态轨迹来维持时间连贯性,为下一代大模型设计开辟了新方向。

战略目标:Quasar-10B被设计为基础高上下文引擎,将专门用于为即将推出的Quasar 22B MoE蒸馏知识和生成合成推理数据,确保更大的混合专家模型继承这一全线性基础模型的卓越长上下文连贯性和精细的逻辑状态轨迹。

快速开始:体验Quasar-10B的强大能力

要开始使用Quasar-10B,您可以通过以下步骤克隆仓库并加载模型:

git clone https://gitcode.com/hf_mirrors/silx-ai/Quasar-10B

模型使用标准的transformers库加载,配置文件位于config.jsongeneration_config.json,tokenizer配置可在tokenizer_config.json中找到。

Quasar-10B的发布标志着超长上下文AI推理的新时代,无论是处理学术研究、企业文档还是复杂代码库,都能提供前所未有的连贯理解和精准推理能力。随着SILX AI持续推进更大规模和更深层次的MoE集成,我们期待看到更多基于这一创新架构的突破性应用。

【免费下载链接】Quasar-10B 【免费下载链接】Quasar-10B 项目地址: https://ai.gitcode.com/hf_mirrors/silx-ai/Quasar-10B

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐