模型
可咨询
DeepSeek-V4.1-Flash
DeepSeek-V4.1-Flash 将图像理解与长上下文推理放入同一 MoE 模型,采用因果编码器—解码器与压缩稀疏注意力。卡片区分 552B 主干参数和附加条件记忆,适合关注大量输入、工具调用和多轮工作流的团队。
- 来源
- deepseek-ai
- 访问
- 公开
- 许可
- mit
- 榜单快照
- Trending #2
- 上游文件
- 88 个 · 475.27 GB
聚合主流发布方与 Hugging Face Trending 资源,记录固定版本、README 中文译介、文件元数据、许可和访问状态。官网不下载或托管第三方文件。
DeepSeek-V4.1-Flash 将图像理解与长上下文推理放入同一 MoE 模型,采用因果编码器—解码器与压缩稀疏注意力。卡片区分 552B 主干参数和附加条件记忆,适合关注大量输入、工具调用和多轮工作流的团队。
GLM-5.3-Flash 是 GLM-5 系列原生多模态模型,结合稀疏与线性注意力处理长上下文。卡片说明约 320B 总参数、18B 激活参数,面向图文理解与智能体任务。
MiniCPM5-2B 是面向端侧与资源受限场景的稠密语言模型,重点覆盖代码、数学、工具调用和长上下文任务。发布方同时开放了对应的代码、智能体 SFT 与 RL 数据,便于研究训练链路。
PhysicalAI-Autonomous-Vehicles 提供多传感器驾驶数据。当前卡片描述约 1700 小时、306152 个 20 秒片段,包含多摄像头及部分片段的激光雷达和雷达数据。
Qwen3.8-27B 是千问发布的稠密视觉语言模型,接收图像、视频与文本,面向编程、研究和多步骤任务。仓库提供后训练权重,可作为本地多模态助手与工具调用的候选。
UltraData-SFT-Agent-2609 提供约 50 万条智能体指令训练样本,覆盖工具、搜索、代码与通用任务,是 MiniCPM5-2B 后训练数据的一部分。轨迹包含环境反馈、验证和错误恢复过程。
核对作者、原始仓库、许可证和用途限制。
区分上游资源公开、需申请、私有或已失效。
说明本站可咨询、可处理、暂停或不可提供。