首页
学习
活动
专区
圈层
工具
发布

【Agent】 哪个本地部署模型适合跑 Agent?

随着智能体(Agent)应用的落地,如何在本地环境中高效部署大模型成为开发者关注的焦点。

近期一项针对Qwen3.5全系列模型的严格测试显示,在Agent核心的工具调用能力上,参数规模为27B的稠密模型(Dense)表现优于参数量高达397B的混合专家模型(MOE)。

01测试背景与框架设计

为了准确评估不同参数量级模型在Agent场景下的实际表现,测试者构建了一套标准化的评估框架。该框架设定了15个具体场景,配置了12种不同的工具,并严格控制温度为0,使用模拟响应。这种设计消除了随机性,确保了实验结果的稳定与可复现,专门用于测试本地模型的工具调用准确性。

02实测结果:27B模型通过率最高

Qwen3.5系列模型工具调用测试结果对比

测试结果显示,参数较小的27B稠密模型是唯一通过全部测试的型号。相比之下,参数量更大的MOE模型(35B、122B、397B)均出现了不同程度的失误。部分参数更小的模型甚至出现了死循环超时的情况。

03失败案例分析:工具调用的信任危机

导致所有大参数MOE模型“全军覆没”的关键测试题为:“搜索冰岛的人口并计算其中2%是多少”。在这个简单的计算任务中,35B、122B和397B模型均无视了搜索工具返回的精确数据,转而调用记忆中的概略数字进行计算。这表明大模型虽然调用了工具,却并不信任工具的输出。

模型表现对比

27B Dense模型

倾向于编造数据(幻觉)

能够忠实地传递工具数据

将实际搜索结果展示给用户

大参数MOE模型

倾向于无视工具数据

过度依赖内部记忆数据

使用概略数字替代精确结果

04技术原理:MOE与Dense的结构差异

测试结果的核心原因在于模型架构的差异。Qwen3.5系列分为Dense(稠密)和MOE(混合专家)两种架构。Dense模型在生成每个Token时,全部参数都会参与计算;而MOE模型虽然总参数量巨大,但每次推理只激活其中一小部分专家网络。

Dense与MOE架构关键参数对比

虽然397B的MOE模型参数量惊人,但实际参与推理的参数仅约17B。在需要精确追踪上下文和数据传递的Agent场景中,若关键时刻所需专家未被激活,就会导致错误。相比之下,27B的Dense模型“全员出动”,实际参与计算的参数量更多,且层数更深、注意力机制占比更大,天然在追踪上下文方面具有结构性优势。

05选购建议:复杂任务首选稠密模型

MOE模型优势:生成速度更快,推理更省算力,适合日常简单任务。

Dense模型优势:在指令识别、上下文保持和数据传递准确性上表现更好,适合执行复杂的Agent任务。

目前公认在Agent领域表现最强的闭源模型Claude以及本次测试中表现最好的开源模型,均采用的是Dense稠密架构。这表明在处理复杂逻辑和工具调用时,稠密模型具有不可忽视的结构性优势。

附录:Agent背景下几个DS比较

简单尝试几个DeepSeek本地模型,效果都不好

结合自己的硬件性能

网上推荐Agent模型

Qwen3.6技术选型:27B稠密对比35B MoE怎么选?

在复杂编程与 Agent 场景,27B 稠密模型依然是首选;如果更看重本地硬件利用率和响应速度,35B-A3B MoE 用极低的激活参数就逼近了前者的表现,效率非常出众。

架构差异:两种计算哲学的体现

要理解这两款模型,得先看它们的参数调度方式。

Qwen3.6-27B 是标准的稠密结构,270 亿参数在每一次前向计算时全量参与。可以想象成一支满编乐团,不论演奏什么曲目,所有乐手都会协同发声。好处是任何知识、推理路径随时可用,不存在“没叫到”的专家。

Qwen3.6-35B-A3B 则走了 MoE 路线。总参数量有 350 亿,但每次推理仅激活大约 30 亿参数。内部包含 256 个专家模块,每个 token 只路由到其中 8 个外加一个共享专家。这好比一个庞大的专家顾问池,每次任务只按需调配几位核心成员,大幅降低了计算开销。

稠密模型的强项在于参数利用效率极高,稠密激活让模型在各种陌生任务上表现更稳。MoE 的精髓不在于单次更强,而在于用更少的实际算力实现了丰富的多能力组合——用约 30 亿激活参数就跑出了接近 270 亿稠密模型的性能,这才是它最吸引人的地方。

基准评测:能力差距反映在哪些任务上

光看架构还不够,直接拉官方及社区基准数据。

编程与 Agent 能力

这一块是两款模型拉开距离的核心区域。复杂编程和工具调用要求模型兼具意图理解、路径规划和长程执行能力,稠密模型的优势很明显。

SWE-bench Verified:27B 拿到 77.2%,35B-A3B 为 73.4%,差距 3.8 个百分点。

Terminal-Bench 2.0:27B 达 59.3%,35B-A3B 为 51.5%,差距 7.8 个百分点。

SkillsBench 平均分:27B 为 48.2%,35B-A3B 仅 28.7%,差距近 20 个百分点,说明在强 Agent 任务上稠密模型的规划与工具编排能力更为扎实。

Claw-Eval Pass³:27B 取得 60.6%,35B-A3B 停留在 50.0%。

显然,越需要深度推理和复杂操作的场景,27B 越能站住脚。

知识与推理

在语言理解、学科知识及数学推理等任务上,两者差距缩小,但 27B 依然小幅领先。

MMLU-Pro:27B 86.2% 对 35B-A3B 85.2%

C-Eval:91.4% 对 90.0%

GPQA Diamond:87.8% 对 86.0%

AIME 2026:94.1% 对 92.7%

LiveCodeBench v6:83.9% 对 80.4%

第三方综合评测平台给出的分数也印证了这一点:27B 综合得分 73,35B-A3B 为 67,约 6 分的整体差距。差距主要集中在 Agent 和编码维度,多模态能力则旗鼓相当。

实测速度:量化部署后的真实体感

对于把模型跑在本地的开发者,生成速度直接决定使用体验。基于 4-bit 量化(如 Q4_K_M),两张卡都能塞进 24GB 显存,但出字速率完全不同。

在 RTX 3090 上:

35B-A3B Q4 量化模型生成速度约 50–65 tok/s,经优化参数可拉到 90 tok/s 以上,显存占用约 21 GB。

27B Q4 量化约 32–40 tok/s,显存占用约 17 GB。

升级到 RTX 4090:

35B-A3B Q4 速度普遍落在 100–122 tok/s,仍约 21 GB 显存。

27B Q4 约 32 tok/s 左右。

RTX 5090 凭借更大带宽,27B Q4 可跑到约 80 tok/s,但 35B-A3B 的响应依然快出一大截。

总体来看,同等条件下 MoE 模型的推理速度大约是稠密模型的三倍,这与它每次只激活 30 亿参数直接相关。速度优势在日常交互、批量任务场景感受极其明显。

选型建议与便捷接入

基于以上对比,选择并不复杂:

侧重 27B 稠密模型 的场景:

重型编程、多步 Agent 工作流

需要深层推理和精确规划

对生成延迟容忍度较高,更看重输出质量

侧重 35B-A3B MoE 模型 的场景:

需要快速实时交互

任务相对标准化、轻量级

硬件资源有限,想在消费级显卡甚至 MacBook 上流畅运行

优先考虑吞吐量而非极限质量

有社区反馈印证了这一取向:从 35B 换到 27B 的开发者提到,“35B 任务完成更快,但 27B 对项目结构的理解明显更深”;反之,追求日常查询响应速度的用户则认为 35B 完全够用。本质上就是在“6 分的综合能力差”和“约 3 倍速度差”之间做权衡。

Qwen本地模型选型

最佳模型

fuliucansheng/qwen3.6-27b-bf16:latest

适合Mac

最佳上下文

satgeze/qwen36-35b-uncensored-1m:q4_k_m-no-mtp

通用官方版本

gngai8/qwen3.6-27b-instruct:latest

Qwen 官方发布的通用版本。虽然可以使用,但它的推荐参数(如温度、top_p)和上下文窗口设置可能需要你根据自己的硬件手动调整,以确保在24GB显存上稳定运行。

最佳适配显卡

这是一个“懒人包”。作者专门为24GB显存的RTX 4090调整了最佳实践参数,它的目标就是让你开箱即用,无需自己调参。

ollama run odytrice/qwen3.6:4090-27b

移除限制

Jarcgon/qwen3.6-abliterated-27b:latest

和通用官方的主要区别是

fredrezones55/Qwen3.6-27B-Uncensored-HauhauCS-Balanced:IQ4_XS

纯文本

science, instruction-following, and mathematics.

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-GGUF:latest

Q — 质量递增

richardyoung/qwen3.6-27b-abliterated:Q8_0

去除审查

its_the_jisoo/qwen3.6-27b-uncensored-hauhaucs-aggressive:latest

its_the_jisoo/qwen3.6-27b-uncensored-hauhaucs-balanced:latest

VladimirGav/Qwen3.6-27B-16GB-VRAM-Uncensored:latest

——The  End——

记得点赞、分享,让更多的朋友一起探索这个IT世界的新篇章!

AIGC周边正在发布,关注生活,冻龄青春

推荐阅读

【Agent】Dify,来自中国的AI框架明星

【Agent】从0到1带你入门Dify工作流

【Agent】最新的Agent模型选用建议

【Agent】什么是智能体?浅显易懂讲明白

【Agent】医院agent:具有可进化医疗agent的医院模拟器

【Agent】COZE应用的灵魂,90+高质量prompt,一次带走

【Agent】AI智能体(Agent)能力定义与分级:L0-L5,揭秘AI智能体的进化之路

【Agent】Coze(扣子)一个国内版的类GPTs,使用指南(入门篇)

【Skill实战】使用ppt-master技能把文档一键做成能改的真PPT

【苹果世家】从0到1带你速通Codex,成就Vibe Coding

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O2U3NuSNWB_yrRv0QDWCDmsA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券