ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

100+ 开源中文大模型完整清单:从选型到本地跑通

2026/9/7 9:31:20 拓冰建站 浏览量
100+ 开源中文大模型完整清单:从选型到本地跑通 100 开源中文大模型完整清单从选型到本地跑通【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLMAwesome-Chinese-LLM 是一份持续更新的开源中文大模型清单收录 100 个可私有化部署的底座模型、垂直领域微调模型、数据集与教程。想挑一个真正能跑起来的中文大语言模型从这份清单开始最省事。它把散在各处的资源整理成一张地图底座怎么选、法律医疗金融方向用了什么数据、哪个框架部署快查表即可。快速上手从克隆到跑通 硬件与软件要求最低与推荐两档最低档8GB 显存显卡 32GB 内存。6B 模型做 4bit 量化后可部署没有显卡也能用清单收录的 JittorLLMs 等 CPU 方案先跑通流程。推荐档24GB 显存3090/4090 级别 64GB 内存。6B 全精度流畅对话13B 量化版也能跑。软件栈Python 3.8、PyTorch 与匹配的 CUDA 版本再装一个推理框架vLLM 或 LMDeploy。克隆与安装步骤本仓库是资源索引本身没有依赖要装克隆下来当目录用git clone https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM打开 README.md按目录定位目标模型再到对应模型仓库按说明装好推理框架。清单里的 vLLM、LMDeploy 等框架均附独立安装文档照做即可。第一次调用最短跑通路径选清单里标注可商用、部署门槛低的 ChatGLM2-6B一行命令启动推理服务vllm serve THUDM/chatglm2-6b服务默认监听 8000 端口。接上清单收录的 GPT Academic 图形界面。输入帮我起草一份租房合同的违约条款就能看到流式回复。第一次跑通到这一步就够了。模型/工具选型全景 先看项目收录的分类图谱底座与垂类关系一目了然以法律方向为例清单收录了从 7B 到 33B 的完整梯队模型名称基础底座发布时间核心差异点獬豸 LawGPT_zhChatGLM-6B2023-04-09200K 真实律师问答 92K 法条情景问答LoRA 轻量微调LaWGPTChinese-Alpaca-Plus-7B2023-04-12扩展法律专有词表裁判文书网等官方数据预训练LexiLawChatGLM-6B2023-05-1650k 法律文书 华律网 20k 问答多源数据混合Lawyer LLaMAChinese-Alpaca-Plus-13B2023-05-24大规模法律语料继续预训练主打法考场景推理韩非 HanFeiBLOOMZ-7B2023-05-31国内首个全参数训练的法律模型60G 领域语料ChatLawZiya-LLaMA-13B / Anima-33B2023-06-2893w 判决案例相似度匹配提问可直连法条选型建议资源有限选 6B/7B 档LawGPT_zh、LexiLaw8GB 显卡量化即可部署专业级上 ChatLaw-13B 或 LaWGPT答案可溯源要求高就叠加 ChatLaw-Text2Vec 检索模块。核心能力拆解 底座模型对照表ChatGLM、LLaMA、Baichuan、Qwen 等 13 个底座系列附参数量、上下文长度、商用授权对照规模从 2B 端侧模型到 456B MoE 全覆盖按显存预算对号入座商用标注明确如 LLaMA 标为部分可商用避开授权坑八大垂直领域微调模型覆盖医疗、法律、金融、教育、科技、电商、网络安全、农业每个模型都注明训练数据构成、算力配置与开源协议仅医疗方向就近 20 个含 XrayGLM 等多模态医学模型数据集与微调框架预训练、SFT、偏好三类数据集如 Huatuo-26M2600 万医疗问答、COIGDeepSpeed Chat、LLaMA/ChatGLM Efficient Tuning 支持 LoRA、QLoRALMFlow 标注单张 3090、5 小时即可微调一个 7B 定制模型推理部署与中文评测vLLM、LMDeploy、AirLLM 等 10 推理框架适用场景各有说明C-Eval、OpenCompass、CMMLU 等中文基准模型跑完可顺手评测教程从提示工程到实战营非科班背景也能跟上落地场景谁在怎么用 场景一企业法务搭类案检索与文书初筛角色企业法务或律师日常被法条查询和类案检索消耗大量时间。做法从清单法律板块选 ChatLaw 或 DISC-LawLLM 私有化部署用 ChatLaw-Text2Vec 把用户提问与法条、相似判决做向量匹配日常问答交给 LexiLaw 或 LawGPT_zh 承接。效果93w 条判决案例与法条库一次建成提问可直接返回匹配法条与相似文书初步检索不再依赖外部商业数据库。场景二医疗团队搭问诊知识库角色医院信息科或健康产品团队要做症状问答或报告解读辅助。做法选 ChatMed 或 DoctorGLM 作为底座模型训练与评测数据直接用清单收录的 Huatuo-26M2600 万医疗问答和中文医疗对话数据集。效果79 万条、覆盖 7 个科室的医患问答开箱即用内科 22 万条、外科 11.5 万条2600 万条问答语料省去自建数据集的时间。边界与风险提醒 ⚠️结果仅供参考垂直模型的输出不能替代执业律师或医生的正式意见关键决策必须人工复核。授权差异各模型协议不同如 LaWGPT 为 GPL-3.0、ChatLaw 为 AGPL-3.0商用前逐条核对 License。知识时效模型知识截止于训练数据新法条和司法解释不会自动同步需检索增强补齐。算力门槛多数模型训练需 8×A100 级配置个人一般只能跑推理微调前先看清单里的算力说明。资源索引与进阶路线 底座选型先读 doc/LLM.md按底座系谱快速定位可微调的模型垂类细节看 doc/Legal.md、doc/Medical.md、doc/Financial.md训练数据与算力明细齐全各垂类架构图源文件在 src/ 目录可离线查看进阶路线先跑通一个 6B 模型 → 精读目标垂类的 doc 明细 → 用 vLLM 部署成服务 → 再用 LoRA 微调出领域版本。发现清单未收录的模型可按 README 的贡献格式发起 PR。清单还在持续更新相当于一张中文大模型选型的活地图。挑一个 6B 模型先跑起来选型这件事就没有那么难了。【免费下载链接】Awesome-Chinese-LLM整理开源的中文大语言模型以规模较小、可私有化部署、训练成本较低的模型为主包括底座模型垂直领域微调及应用数据集与教程等。项目地址: https://gitcode.com/GitHub_Trending/aw/Awesome-Chinese-LLM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考