Qwen-AgentWorld-35B-A3B多模态支持:图像、视频、音频输入的环境模拟

【免费下载链接】Qwen-AgentWorld-35B-A3B 【免费下载链接】Qwen-AgentWorld-35B-A3B 项目地址: https://ai.gitcode.com/hf_mirrors/Qwen/Qwen-AgentWorld-35B-A3B

Qwen-AgentWorld-35B-A3B是一款原生语言世界模型,专为智能体环境模拟而训练。它通过长链推理模拟智能体环境,能根据智能体的动作和交互历史预测下一个环境状态,为图像、视频、音频等多模态输入提供强大的环境模拟能力。

多模态环境模拟的核心优势

Qwen-AgentWorld-35B-A3B作为首个在单一模型中涵盖七个智能体交互领域的语言世界模型,在多模态支持方面展现出显著优势。它采用三阶段训练 pipeline——CPT 注入环境知识,SFT 激活下一状态预测推理,RL 提高模拟保真度,从 CPT 阶段开始,环境建模就是训练目标,而非事后添加,这种原生世界模型的特性使其能更好地处理图像、视频、音频等多模态输入。

统一的多模态处理框架

该模型覆盖了 MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web 和 OS 等领域,跨越文本和 GUI 交互环境。这种广泛的覆盖范围为处理不同类型的多模态输入提供了统一的框架,无论是图像识别结果、视频流信息还是音频数据,都能在相应的环境中得到合理的模拟和处理。

强大的上下文理解能力

Qwen-AgentWorld-35B-A3B 拥有 262,144 tokens 的上下文长度,这使得它能够处理包含大量多模态信息的长序列输入。在模拟环境时,模型可以充分利用扩展的上下文来理解多模态输入之间的关系和时序变化,从而更准确地预测环境状态。

多模态环境模拟的实现方式

模型架构支持

从模型架构来看,Qwen-AgentWorld-35B-A3B 具有 350 亿总参数和 30 亿激活参数,隐藏维度为 2048,采用了 Gated DeltaNet 和 Gated Attention 等先进技术。这些架构设计为多模态输入的处理提供了强大的计算能力和特征提取能力,能够有效捕捉图像、视频、音频等不同模态数据的特征。

训练数据与方法

模型在训练过程中融入了多模态相关的数据,通过 Continual Pre-Training(CPT)、Supervised Fine-Tuning(SFT)和 Reinforcement Learning(RL, GSPO)等阶段,逐步提升对多模态环境的模拟能力。在 CPT 阶段注入环境知识时,就包含了对多模态环境的理解;SFT 阶段进一步激活了对多模态输入下状态预测的推理能力;RL 阶段则通过强化学习来锐化模拟的保真度,使模型在处理多模态输入时更加准确和可靠。

多模态环境模拟的应用场景

智能交互系统

在智能交互系统中,Qwen-AgentWorld-35B-A3B 可以处理用户的图像、视频、音频等多模态输入,模拟相应的交互环境,为用户提供更加自然和智能的交互体验。例如,在智能客服系统中,用户可以发送图像或语音信息,模型能够模拟客服场景,理解用户需求并给出合适的回应。

虚拟环境构建

该模型可以用于构建虚拟环境,如虚拟实验室、虚拟培训场景等。通过处理图像、视频等多模态输入,模型能够模拟虚拟环境中的各种物体、场景和事件,为用户提供沉浸式的体验。例如,在虚拟实验室中,学生可以通过图像或视频输入与虚拟实验设备进行交互,模型模拟实验过程和结果。

多模态数据分析

Qwen-AgentWorld-35B-A3B 还可以应用于多模态数据分析领域。它能够模拟不同数据环境,对图像、视频、音频等多模态数据进行分析和处理,提取有价值的信息。例如,在医疗领域,模型可以分析医学图像、患者的音频记录等多模态数据,辅助医生进行诊断。

快速开始使用多模态环境模拟

部署模型

Qwen-AgentWorld-35B-A3B 可以通过流行的推理框架通过 API 提供服务。以下是启动 OpenAI 兼容 API 服务器的示例命令。

使用 SGLang

SGLang 是一个快速的大型语言模型服务框架。

python -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tp-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3

OpenAI 兼容的 API 将在 http://localhost:8000/v1 可用。

使用 vLLM

vLLM 是一个高吞吐量和内存高效的 LLM 推理引擎。

vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

OpenAI 兼容的 API 将在 http://localhost:8000/v1 可用。

利用 Transformers 进行推理

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto",
)

messages = [
    {
        "role": "system",
        "content": "You are a language world model simulating a multi-modal environment. Given the user's multi-modal input, predict the environment output."
    },
    {
        "role": "user",
        "content": "Action: process_image\nImage: [image_data]"
    }
]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)

通过 Chat Completions API 使用

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="EMPTY",
)

# Multi-modal domain example
messages = [
    {
        "role": "system",
        "content": "You are a language world model simulating a multi-modal environment. Given the user's multi-modal input, predict the environment output."
    },
    {
        "role": "user",
        "content": "Action: process_video\nVideo: [video_data]"
    }
]

response = client.chat.completions.create(
    model="Qwen/Qwen-AgentWorld-35B-A3B",
    messages=messages,
    max_tokens=32768,
    temperature=0.6,
)
print(response.choices[0].message.content)

多模态环境模拟的最佳实践

采样参数设置

对于世界模型推理,建议使用 temperature=0.6top_p=0.95top_k=20。模型默认使用思考模式(</think>...</RichMediaReference>),在生成预测观察之前先推理环境状态转换,这有助于更好地处理多模态输入。

输出长度设置

大多数查询建议输出长度为 32,768 tokens。对于长的多步骤轨迹,可以增加最大输出长度以适应详细的多模态环境观察。

使用领域特定的系统提示

为了获得最佳的模拟保真度,请使用 GitHub 存储库的 prompts/ 目录中提供的领域特定系统提示,其中包含了针对多模态环境模拟的相关提示模板。

总结

Qwen-AgentWorld-35B-A3B 凭借其原生世界模型的特性、强大的架构设计和多阶段训练方法,为图像、视频、音频等多模态输入的环境模拟提供了强大的支持。它在智能交互系统、虚拟环境构建、多模态数据分析等领域具有广泛的应用前景。通过按照最佳实践部署和使用模型,用户可以充分发挥其在多模态环境模拟方面的优势,实现更加智能和自然的交互体验。

【免费下载链接】Qwen-AgentWorld-35B-A3B 【免费下载链接】Qwen-AgentWorld-35B-A3B 项目地址: https://ai.gitcode.com/hf_mirrors/Qwen/Qwen-AgentWorld-35B-A3B

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐