中文简介
AngelSlim/Hy3-GGUF 是 AngelSlim 在 Hugging Face 发布的模型仓库,当前卡片主要关联文本生成与推理。本站固定记录上游版本 31b453f4d9b6,同步到 17 个文件,文件元数据合计 1.43 TB;访问状态为“公开”,许可证字段为“apache-2.0”。
上游模型卡 / 数据集卡
【README 卡片中文译介】
以下内容依据上游仓库 AngelSlim/Hy3-GGUF 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。
【资源概览】
AngelSlim/Hy3-GGUF 是 AngelSlim 在 Hugging Face 发布的模型仓库,当前卡片主要关联文本生成与推理。本站固定记录上游版本 31b453f4d9b6,同步到 17 个文件,文件元数据合计 1.43 TB;访问状态为“公开”,许可证字段为“apache-2.0”。
【适用方向】
适合在真实样本上评估文本生成与推理能力,并比较质量、时延和资源消耗。 建议先用小规模样本验证推理框架、输入输出格式和任务指标,再决定是否进入完整权重获取、量化或部署评估。
【版本与规格】
固定版本:31b453f4d9b6。 任务标签:文本生成与推理。 上游标注的基础模型:tencent/Hy3。 上游页面记录的最近更新时间:2026-07-21。
【文件信息】
上游 API 返回 17 个文件,文件元数据合计 1.43 TB。 已保存文件清单中的主要扩展名:.gguf 8 个、.txt 4 个、.png 2 个、无扩展名 2 个、.md 1 个。 当前较大的文件包括:Hy3-Q4_K_M-mtp.gguf(171.98 GB);Hy3-Q4_K_M.gguf(169.81 GB);Hy3-Q3_K_M-mtp.gguf(127.08 GB)。
【运行或处理环境】
仓库文件元数据合计 1.43 TB。 实际显存与内存由精度、量化方式、上下文长度、批量、并发、MoE 专家加载方式和推理框架共同决定,不能只凭参数名或仓库大小作部署承诺;应在目标格式和目标硬件上实测。
【使用边界】
许可证显示为“apache-2.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 模型输出、工具调用和生成内容可能出现错误、偏见或安全风险,面向业务前应建立任务级评测、权限隔离和人工确认。
Dedicated to building a more intuitive, comprehensive, and efficient LLMs compression toolkit. 📖 Documentation    |   🤗 Hugging Face    |   🤖 ModelScope    |   💬 WeChat Hy3 llama.cpp Quantization Low-bit quantized **Hy3 (hy_v3)** GGUFs for llama.cpp — ready to run out of the box, with MTP self-speculative decoding. This repo ships the quantized models, plus the mixed-precision recipes to build your own from a calibration set. Two parts below: **Deploy** (build & run) and **Quantization**. Quick Start Build Clone the latest llama.cpp (must include the `hy_v3` support merged in PR #25395 — i.e. any commit after `505b1ed`; the current `master` is fine) and build it following the official build guide: Binaries land in `llama.cpp-hyv3/build/bin/`. **Already downloaded an older GGUF?** Earlier GGUFs here were built against a patched llama.cpp and won't load correctly on today's upstream. To build and run those, follow the previous README (the `setup_hyv3_llama.sh` + patches flow) instead. Run Recommended setups | GPUs | build | MTP | `-c` (context) | KV cache | |---|---|---|---|---| | 1× H20 (96 GB) | IQ1_M | no | `-c 65536` | `-ctk q8_0 -ctv q8_0` | | 2× H20 (192 GB) | IQ1_M | yes | / (default) | / (f16) | | 2× H20 (192 GB) | Q4_K_M | yes | `-c 65536` | `-ctk q8_0 -ctv q8_0 -ctkd q8_0 -ctvd q8_0` | | 4× H20 (384 GB) | Q4_K_M | yes | / (default) | / (f16) | Weights: IQ1_M ~83 GiB, Q4_K_M ~166 GiB (MTP adds ~2 GiB plus a draft KV cache). 1 card fits only IQ1_M, and tightly — shrink context, quantize KV, no MTP. 2 cards run IQ1_M+MTP with room to spare (drop `-c`/KV flags), but Q4_K_M+MTP is tight, so keep `-c 65536` and q8_0 KV (main + draft). 4 cards run Q4_K_M+MTP comfortably. Quantize with Your Own Data If you have a calibration set, you can compute your own importance matrix and quantize the model yourself. All steps use stock llama.cpp tools; the mixed-precision recipes are shipped in this folder. The mixed-precision rec
适用场景
适合在真实样本上评估文本生成与推理能力,并比较质量、时延和资源消耗。 建议先用小规模样本验证推理框架、输入输出格式和任务指标,再决定是否进入完整权重获取、量化或部署评估。
模型参数
固定版本:31b453f4d9b6。 任务标签:文本生成与推理。 上游标注的基础模型:tencent/Hy3。 上游页面记录的最近更新时间:2026-07-21。
文件说明
上游 API 返回 17 个文件,文件元数据合计 1.43 TB。 已保存文件清单中的主要扩展名:.gguf 8 个、.txt 4 个、.png 2 个、无扩展名 2 个、.md 1 个。 当前较大的文件包括:Hy3-Q4_K_M-mtp.gguf(171.98 GB);Hy3-Q4_K_M.gguf(169.81 GB);Hy3-Q3_K_M-mtp.gguf(127.08 GB)。
上游文件元数据
.gitattributes1.96 KBassets/benchmark.png122.92 KBassets/logo-en.png64.32 KBHy3-IQ1_M-mtp.gguf85.45 GBHy3-IQ1_M.gguf83.30 GBHy3-Q2_K_XL-mtp.gguf94.60 GBHy3-Q2_K_XL.gguf93.26 GBHy3-Q3_K_M-mtp.gguf127.08 GBHy3-Q3_K_M.gguf125.35 GBHy3-Q4_K_M-mtp.gguf171.98 GBHy3-Q4_K_M.gguf169.81 GBLICENSE11.33 KB
硬件建议
仓库文件元数据合计 1.43 TB。 实际显存与内存由精度、量化方式、上下文长度、批量、并发、MoE 专家加载方式和推理框架共同决定,不能只凭参数名或仓库大小作部署承诺;应在目标格式和目标硬件上实测。
注意事项
许可证显示为“apache-2.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 模型输出、工具调用和生成内容可能出现错误、偏见或安全风险,面向业务前应建立任务级评测、权限隔离和人工确认。
获取、校验与交付
咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。
- 大模型获取与国内转存服务
- 大模型怎么下载:Hugging Face 官方方式与国内交付完整指南
- 国内下载 Hugging Face 模型很慢或经常中断怎么办
- DeepSeek、ChatGPT、豆包、Kimi 能否下载到本地
本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。