模型

Hy3-GGUF

AngelSlim/Hy3-GGUF

查看上游原文 ↗
上游访问:公开 本站服务:可咨询 内容检查:AI 辅助整理并检查 许可证:apache-2.0 上游版本:31b453f4d9b6

中文简介

AngelSlim/Hy3-GGUF 是 AngelSlim 在 Hugging Face 发布的模型仓库,当前卡片主要关联文本生成与推理。本站固定记录上游版本 31b453f4d9b6,同步到 17 个文件,文件元数据合计 1.43 TB;访问状态为“公开”,许可证字段为“apache-2.0”。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

【README 卡片中文译介】

以下内容依据上游仓库 AngelSlim/Hy3-GGUF 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。

【资源概览】
AngelSlim/Hy3-GGUF 是 AngelSlim 在 Hugging Face 发布的模型仓库,当前卡片主要关联文本生成与推理。本站固定记录上游版本 31b453f4d9b6,同步到 17 个文件,文件元数据合计 1.43 TB;访问状态为“公开”,许可证字段为“apache-2.0”。

【适用方向】
适合在真实样本上评估文本生成与推理能力,并比较质量、时延和资源消耗。 建议先用小规模样本验证推理框架、输入输出格式和任务指标,再决定是否进入完整权重获取、量化或部署评估。

【版本与规格】
固定版本:31b453f4d9b6。 任务标签:文本生成与推理。 上游标注的基础模型:tencent/Hy3。 上游页面记录的最近更新时间:2026-07-21。

【文件信息】
上游 API 返回 17 个文件,文件元数据合计 1.43 TB。 已保存文件清单中的主要扩展名:.gguf 8 个、.txt 4 个、.png 2 个、无扩展名 2 个、.md 1 个。 当前较大的文件包括:Hy3-Q4_K_M-mtp.gguf(171.98 GB);Hy3-Q4_K_M.gguf(169.81 GB);Hy3-Q3_K_M-mtp.gguf(127.08 GB)。

【运行或处理环境】
仓库文件元数据合计 1.43 TB。 实际显存与内存由精度、量化方式、上下文长度、批量、并发、MoE 专家加载方式和推理框架共同决定,不能只凭参数名或仓库大小作部署承诺;应在目标格式和目标硬件上实测。

【使用边界】
许可证显示为“apache-2.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 模型输出、工具调用和生成内容可能出现错误、偏见或安全风险,面向业务前应建立任务级评测、权限隔离和人工确认。

已有简体中文译文 · Codex 基于固定版本 README 与上游元数据生成中文结构化译介 · 2026-07-26 00:51

Dedicated to building a more intuitive, comprehensive, and efficient LLMs compression toolkit. 📖 Documentation &nbsp&nbsp | &nbsp&nbsp🤗 Hugging Face &nbsp&nbsp | &nbsp&nbsp🤖 ModelScope &nbsp&nbsp | &nbsp&nbsp💬 WeChat Hy3 llama.cpp Quantization Low-bit quantized **Hy3 (hy_v3)** GGUFs for llama.cpp — ready to run out of the box, with MTP self-speculative decoding. This repo ships the quantized models, plus the mixed-precision recipes to build your own from a calibration set. Two parts below: **Deploy** (build & run) and **Quantization**. Quick Start Build Clone the latest llama.cpp (must include the `hy_v3` support merged in PR #25395 — i.e. any commit after `505b1ed`; the current `master` is fine) and build it following the official build guide: Binaries land in `llama.cpp-hyv3/build/bin/`. **Already downloaded an older GGUF?** Earlier GGUFs here were built against a patched llama.cpp and won't load correctly on today's upstream. To build and run those, follow the previous README (the `setup_hyv3_llama.sh` + patches flow) instead. Run Recommended setups | GPUs | build | MTP | `-c` (context) | KV cache | |---|---|---|---|---| | 1× H20 (96 GB) | IQ1_M | no | `-c 65536` | `-ctk q8_0 -ctv q8_0` | | 2× H20 (192 GB) | IQ1_M | yes | / (default) | / (f16) | | 2× H20 (192 GB) | Q4_K_M | yes | `-c 65536` | `-ctk q8_0 -ctv q8_0 -ctkd q8_0 -ctvd q8_0` | | 4× H20 (384 GB) | Q4_K_M | yes | / (default) | / (f16) | Weights: IQ1_M ~83 GiB, Q4_K_M ~166 GiB (MTP adds ~2 GiB plus a draft KV cache). 1 card fits only IQ1_M, and tightly — shrink context, quantize KV, no MTP. 2 cards run IQ1_M+MTP with room to spare (drop `-c`/KV flags), but Q4_K_M+MTP is tight, so keep `-c 65536` and q8_0 KV (main + draft). 4 cards run Q4_K_M+MTP comfortably. Quantize with Your Own Data If you have a calibration set, you can compute your own importance matrix and quantize the model yourself. All steps use stock llama.cpp tools; the mixed-precision recipes are shipped in this folder. The mixed-precision rec

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

适用场景

适合在真实样本上评估文本生成与推理能力,并比较质量、时延和资源消耗。 建议先用小规模样本验证推理框架、输入输出格式和任务指标,再决定是否进入完整权重获取、量化或部署评估。

模型参数

固定版本:31b453f4d9b6。 任务标签:文本生成与推理。 上游标注的基础模型:tencent/Hy3。 上游页面记录的最近更新时间:2026-07-21。

文件说明

上游 API 返回 17 个文件,文件元数据合计 1.43 TB。 已保存文件清单中的主要扩展名:.gguf 8 个、.txt 4 个、.png 2 个、无扩展名 2 个、.md 1 个。 当前较大的文件包括:Hy3-Q4_K_M-mtp.gguf(171.98 GB);Hy3-Q4_K_M.gguf(169.81 GB);Hy3-Q3_K_M-mtp.gguf(127.08 GB)。

上游文件元数据

  • .gitattributes1.96 KB
  • assets/benchmark.png122.92 KB
  • assets/logo-en.png64.32 KB
  • Hy3-IQ1_M-mtp.gguf85.45 GB
  • Hy3-IQ1_M.gguf83.30 GB
  • Hy3-Q2_K_XL-mtp.gguf94.60 GB
  • Hy3-Q2_K_XL.gguf93.26 GB
  • Hy3-Q3_K_M-mtp.gguf127.08 GB
  • Hy3-Q3_K_M.gguf125.35 GB
  • Hy3-Q4_K_M-mtp.gguf171.98 GB
  • Hy3-Q4_K_M.gguf169.81 GB
  • LICENSE11.33 KB

硬件建议

仓库文件元数据合计 1.43 TB。 实际显存与内存由精度、量化方式、上下文长度、批量、并发、MoE 专家加载方式和推理框架共同决定,不能只凭参数名或仓库大小作部署承诺;应在目标格式和目标硬件上实测。

注意事项

许可证显示为“apache-2.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 模型输出、工具调用和生成内容可能出现错误、偏见或安全风险,面向业务前应建立任务级评测、权限隔离和人工确认。

获取、校验与交付

咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。

第三方资源声明

本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。