一、不要先从最大参数开始

模型选择的第一步不是比较排行榜,而是写清楚任务:输入有多长、输出要多准确、是否调用工具、是否处理代码、并发有多少、可接受的时延是多少。若这些问题没有答案,直接选择最大模型往往只会放大存储和部署成本。

二、轻量档适合验证流程

Qwen3 0.6B 与 1.7B 更适合教学、端侧可行性和工具链联调;4B 与 8B 可以承担更完整的通用生成、代码和知识工作原型。较小模型有利于尽快建立评测集、发现数据和交互问题,再决定是否需要升级。

三、中大型档要比较真实增益

14B 和 32B 是稠密模型,参数会持续参与计算;30B-A3B 与 235B-A22B 是混合专家模型,总参数和激活参数含义不同。MoE 的激活参数较少,不代表只需下载或加载激活部分,完整专家权重仍影响存储、内存、启动和传输。

四、上下文长度不能只看最高数字

Qwen3 多个档位原生上下文为 32,768 tokens,部分模型卡说明可使用 YaRN 扩展到最高 131,072 tokens。扩展需要正确配置,也会影响内存、速度和输出质量。若业务材料大多只有几千 tokens,不应为极端上限提前承担全部成本。

五、用同一套样本做阶梯评测

先用最小可行档跑真实任务,记录正确率、人工修改量、首 Token 时延、总时长、内存峰值和失败类型;然后只在效果不足时升级一档。思考模式与非思考模式也应分开测试,因为它们在复杂度、时延和 Token 消耗上不同。

六、部署结论必须落到目标环境

精度、量化、上下文、批量、并发、推理框架和 CPU/GPU 卸载都会改变资源需求。网上的单一显存数字只能作为线索,不能替代在目标格式、真实提示词和实际硬件上的测量。

官方资料:https://huggingface.co/Qwen/Qwen3-8B