ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

ChatGLM-6B 部署与微调完全指南:从环境安装、量化推理到 P-Tuning v2 高效参数微调

2026/9/30 6:47:51 拓冰建站 浏览量
ChatGLM-6B 部署与微调完全指南:从环境安装、量化推理到 P-Tuning v2 高效参数微调 大模型人工智能NLP本地部署微调模型推理服务【免费下载链接】ChatGLM-6B-codeChatGLM-6B: An Open Bilingual Dialogue Language Model | 开源双语对话语言模型项目地址https://gitcode.com/zai-org/ChatGLM-6B-code点击查看免费下载导读ChatGLM-6B 是智谱 AI 开源的 62 亿参数中英双语对话语言模型基于 GLMGeneral Language Model架构采用与 ChatGPT 相似的技术路线针对中文问答与对话做了专门优化。本文以仓库根目录 README.md 为核心结合 cli_demo.py、web_demo.py、api.py、utils.py 与 ptuning/ 目录下的真实源码与配置系统讲解从环境安装与代码调用、网页/命令行/API 三种部署形态到 INT4/INT8 量化、CPU、Mac、多卡等低成本部署方案再到基于 P-Tuning v2 的高效参数微调全流程。读完本文你将掌握 ChatGLM-6B 在消费级显卡上的完整落地路径。模型概览与开源形态ChatGLM-6B 是开源的、支持中英双语的对话语言模型具有62 亿6B参数。它基于 General Language ModelGLM架构经过约 1T 标识符的中英双语训练并辅以监督微调、反馈自助、人类反馈强化学习RLHF等对齐技术能够生成相当符合人类偏好的回答。其最核心的工程价值在于低门槛本地部署结合模型量化技术用户可以在消费级显卡上运行模型——INT4 量化级别下推理最低只需 6GB 显存。同时为了方便下游开发者针对自身应用场景定制模型项目实现了基于 P-Tuning v2 的高效参数微调方法使用指南见 ptuning/README.mdINT4 量化级别下最低只需 7GB 显存即可启动微调。注意ChatGLM-6B 权重对学术研究完全开放在填写问卷进行登记后亦允许免费商业使用。代码遵循 Apache-2.0 协议模型权重需遵循 Model License。硬件需求一览官方在 README.md 中给出了明确的显存需求表格这是规划部署硬件的第一步量化等级最低 GPU 显存推理最低 GPU 显存高效参数微调FP16无量化13 GB14 GBINT88 GB9 GBINT46 GB7 GB可以看出推理与微调的显存门槛由量化等级决定选择 INT4 量化可以将门槛压缩到消费级显卡如 6GB/7GB 显存即可满足。环境安装使用 pip 安装依赖pip install -r requirements.txtrequirements.txt 中锁定的关键依赖包括protobuf transformers4.27.1 cpm_kernels torch1.10 gradio mdtex2html sentencepiece accelerate其中transformers库版本推荐为4.27.1但理论上不低于4.23.1即可。此外如果需要在 CPU 上运行量化后的模型还需要安装gcc与openmp。多数 Linux 发行版默认已安装Windows 可在安装 TDM-GCC 时勾选openmpWindows 测试环境 gcc 版本为 TDM-GCC 10.3.0Linux 为 gcc 11.3.0MacOS 上的安装方式可参考 FAQ.md。代码调用最小可运行示例通过 Hugging Face Transformers 的AutoTokenizer与AutoModel即可加载模型进行对话 from transformers import AutoTokenizer, AutoModel tokenizer AutoTokenizer.from_pretrained(THUDM/chatglm-6b, trust_remote_codeTrue) model AutoModel.from_pretrained(THUDM/chatglm-6b, trust_remote_codeTrue).half().cuda() model model.eval() response, history model.chat(tokenizer, 你好, history[]) print(response) 你好!我是人工智能助手 ChatGLM-6B,很高兴见到你,欢迎问我任何问题。 response, history model.chat(tokenizer, 晚上睡不着应该怎么办, historyhistory) print(response) 晚上睡不着可能会让你感到焦虑或不舒服,但以下是一些可以帮助你入睡的方法: 1. 制定规律的睡眠时间表:保持规律的睡眠时间表可以帮助你建立健康的睡眠习惯,使你更容易入睡。尽量在每天的相同时间上床,并在同一时间起床。 2. 创造一个舒适的睡眠环境:确保睡眠环境舒适,安静,黑暗且温度适宜。可以使用舒适的床上用品,并保持房间通风。 3. 放松身心:在睡前做些放松的活动,例如泡个热水澡,听些轻柔的音乐,阅读一些有趣的书籍等,有助于缓解紧张和焦虑,使你更容易入睡。 4. 避免饮用含有咖啡因的饮料:咖啡因是一种刺激性物质,会影响你的睡眠质量。尽量避免在睡前饮用含有咖啡因的饮料,例如咖啡,茶和可乐。 5. 避免在床上做与睡眠无关的事情:在床上做些与睡眠无关的事情,例如看电影,玩游戏或工作等,可能会干扰你的睡眠。 6. 尝试呼吸技巧:深呼吸是一种放松技巧,可以帮助你缓解紧张和焦虑,使你更容易入睡。试着慢慢吸气,保持几秒钟,然后缓慢呼气。 如果这些方法无法帮助你入睡,你可以考虑咨询医生或睡眠专家,寻求进一步的建议。关键点说明trust_remote_codeTrue是必须的因为 ChatGLM-6B 的模型实现随 checkpoint 一起托管在 Hugging Face 上需要允许 transformers 执行远端代码。.half()以 FP16 精度加载.cuda()将模型放到 GPU后续的model.eval()切换到推理模式。model.chat(tokenizer, prompt, historyhistory)返回(response, history)history需要回传以维持多轮对话上下文。固定模型实现版本模型的实现仍在变动中如果希望固定使用的模型实现以保证兼容性可以在from_pretrained调用中增加revisionv1.1.0参数。v1.1.0是当前最新的版本号对应本地仓库可用git checkout v1.1.0固定。从本地加载模型上述代码会由transformers自动下载模型实现和参数。如果网络环境较差导致下载缓慢或失败可以先将模型下载到本地再从本地加载# 先安装 Git LFS然后克隆完整模型仓库 git clone https://huggingface.co/THUDM/chatglm-6b # 若只想下载模型实现跳过 LFS 大文件可执行 GIT_LFS_SKIP_SMUDGE1 git clone https://huggingface.co/THUDM/chatglm-6b对于第二种方式需要手动下载模型参数文件并将下载的文件替换到本地的chatglm-6b目录下。之后将代码中的THUDM/chatglm-6b替换为本地chatglm-6b文件夹的路径即可。后续所有的部署方式量化、CPU、Mac、多卡都支持本地路径加载只需替换THUDM/chatglm-6b为本地路径。Demo 与 API 部署仓库提供了三种可直接运行的交互形态全部基于 Gradio 或 FastAPI 构建网页版 Demo安装 Gradiopip install gradio后运行 web_demo.pypython web_demo.py程序会启动一个 Web Server 并输出地址浏览器打开即可使用。该 Demo 实现了打字机效果速度体验大幅提升。从 web_demo.py 的源码可以看到其核心predict函数调用的是model.stream_chat(tokenizer, input, history, max_lengthmax_length, top_ptop_p, temperaturetemperature)以流式方式逐 token 输出界面侧通过parse_text将 markdown 代码块转换为 HTML 高亮源码参考自 ChuanhuChatGPT。关于公网访问由于国内 Gradio 网络访问较慢启用demo.queue().launch(shareTrue, inbrowserTrue)时所有网络会经过 Gradio 服务器转发导致打字机体验大幅下降因此默认启动方式已改为shareFalse如有公网访问需求可修改为shareTrue启动。界面默认参数可在 web_demo.py 中看到max_length默认 2048、top_p默认 0.7、temperature默认 0.95。命令行 Demo运行 cli_demo.pypython cli_demo.py程序在命令行中进行交互式对话输入指示回车即可生成回复输入clear清空对话历史输入stop终止程序。从源码看它使用model.stream_chat流式生成每生成 8 个 token 刷新一次屏幕cli_demo.py并注册了SIGINT信号处理器支持 CtrlC 中断流式输出。API 部署首先安装额外依赖pip install fastapi uvicorn然后运行 api.pypython api.py默认部署在本地 8000 端口通过 POST 方法调用curl -X POST http://127.0.0.1:8000 \ -H Content-Type: application/json \ -d {prompt: 你好, history: []}返回值为{ response:你好我是人工智能助手 ChatGLM-6B很高兴见到你欢迎问我任何问题。, history:[[你好,你好我是人工智能助手 ChatGLM-6B很高兴见到你欢迎问我任何问题。]], status:200, time:2023-03-23 21:38:40 }从 api.py 的源码可以看到更多实现细节接口接收prompt、history、max_length、top_p、temperature五个字段其中后三个可选默认值分别为 2048、0.7、0.95服务端在每次请求后调用torch_gc()api.py主动清空 CUDA 缓存并执行ipc_collect以缓解长时间服务导致的显存碎片化uvicorn.run(app, host0.0.0.0, port8000, workers1)监听所有网卡可通过0.0.0.0:8000对外提供服务。低成本部署模型量化默认情况下模型以 FP16 精度加载运行需要约 13GB 显存。如果显存有限可以尝试量化加载目前只支持 4/8 bit 量化# 按需修改目前只支持 4/8 bit 量化 model AutoModel.from_pretrained(THUDM/chatglm-6b, trust_remote_codeTrue).quantize(8).half().cuda()显存占用实测情况进行 2 至 3 轮对话后8-bit 量化下 GPU 显存占用约为 10GB4-bit 量化下仅需 6GB。随着对话轮数增多显存占用也随之增长。由于采用了相对位置编码理论上 ChatGLM-6B 支持无限长的 context-length但总长度超过 2048训练长度后性能会逐渐下降。另外两点需要注意量化会带来一定性能损失但经过测试ChatGLM-6B 在 4-bit 量化下仍能进行自然流畅的生成量化过程需要在内存中首先加载 FP16 格式的模型消耗约 13GB 内存。如果内存不足可以直接加载官方提供的量化后模型INT4 量化后的模型仅需约 5.2GB 内存# INT8 量化的模型将THUDM/chatglm-6b-int4改为THUDM/chatglm-6b-int8 model AutoModel.from_pretrained(THUDM/chatglm-6b-int4, trust_remote_codeTrue).half().cuda()CPU 部署没有 GPU 时也可以在 CPU 上推理速度更慢需要约 32GB 内存model AutoModel.from_pretrained(THUDM/chatglm-6b, trust_remote_codeTrue).float()内存不足时直接加载量化模型# INT8 量化的模型将THUDM/chatglm-6b-int4改为THUDM/chatglm-6b-int8 model AutoModel.from_pretrained(THUDM/chatglm-6b-int4, trust_remote_codeTrue).float()如果遇到报错Could not find module nvcuda.dll或RuntimeError: Unknown platform: darwinMacOS请改用从本地加载模型的方式。Mac 部署MPS 后端对于搭载 Apple Silicon 或 AMD GPU 的 Mac可以使用 MPS 后端在 GPU 上运行。需要参考 Apple 官方说明安装 PyTorch-Nightly正确版本号应为2.1.0.dev2023xxxx而不是 2.0.0。目前在 MacOS 上只支持从本地加载模型使用 mps 后端model AutoModel.from_pretrained(your local path, trust_remote_codeTrue).half().to(mps)注意两点加载半精度模型需要约 13GB 内存。内存较小的机器如 16GB 内存的 MacBook Pro在空余内存不足时会使用硬盘虚拟内存导致推理速度严重变慢此时可使用chatglm-6b-int4等量化模型由于 GPU 上量化的 kernel 使用 CUDA 编写无法在 MacOS 上使用因此 Mac 上量化模型只能使用 CPU 推理.float()并需单独安装 OpenMP见 FAQ.md以充分使用 CPU 并行。多卡部署如果有多张 GPU 但单张显存不足以容纳完整模型可以将模型切分到多张 GPU 上。首先安装acceleratepip install acceleraterequirements.txt 中已包含然后通过 utils.py 提供的工具加载from utils import load_model_on_gpus model load_model_on_gpus(THUDM/chatglm-6b, num_gpus2)从 utils.py 源码可以看到其实现原理auto_configure_device_map(num_gpus)将模型按层切分transformer.word_embeddings、transformer.final_layernorm、lm_head固定放在第 0 张卡28 层transformer.layers按每张卡30 / num_gpus层的比例均匀分配到各卡分配时特意将transformer.word_embeddings、final_layernorm、lm_head都放在第一张卡上这是为了规避 Linux 下torch.embedding的 weight 与 input 不在同一 device 导致的 RuntimeError代码注释中说明了该 bugfix底层使用accelerate.dispatch_model完成实际的模型分发默认均匀切分也可以通过device_map参数自定义分配。num_gpus可改为你希望使用的 GPU 数量。基于 P-Tuning v2 的高效参数微调为了针对下游应用场景定制模型项目实现了基于 P-Tuning v2 的高效参数微调完整指南见 ptuning/README.md。P-Tuning v2 将需要微调的参数量减少到原来的0.1%再通过模型量化、Gradient Checkpoint 等方法最低只需 7GB 显存即可运行微调。下面以 ADGEN广告生成数据集为例介绍完整流程。软件依赖运行微调需要4.27.1版本的transformers。除 ChatGLM-6B 的依赖之外还需要安装pip install rouge_chinese nltk jieba datasets数据集格式ADGEN 数据集的任务是根据输入content生成一段广告词summary单条数据形如{ content: 类型#上衣*版型#宽松*版型#显瘦*图案#线条*衣样式#衬衫*衣袖型#泡泡袖*衣款式#抽绳, summary: 这件衬衫的款式非常的宽松利落的线条可以很好的隐藏身材上的小缺点穿在身上有着很好的显瘦效果。领口装饰了一个可爱的抽绳漂亮的绳结展现出了十足的个性配合时尚的泡泡袖型尽显女性甜美可爱的气息。 }下载处理好的 ADGEN 数据集后将解压后的AdvertiseGen目录放到 ptuning/ 目录下。训练P-Tuning v2运行以下指令进行训练bash train.shptuning/train.sh 中的PRE_SEQ_LEN和LR分别是soft prompt 长度和训练学习率可以调节以取得最佳效果PRE_SEQ_LEN128 LR2e-2 CUDA_VISIBLE_DEVICES0 python3 main.py \ --do_train \ --train_file AdvertiseGen/train.json \ --validation_file AdvertiseGen/dev.json \ --prompt_column content \ --response_column summary \ --overwrite_cache \ --model_name_or_path THUDM/chatglm-6b \ --output_dir output/adgen-chatglm-6b-pt-$PRE_SEQ_LEN-$LR \ --overwrite_output_dir \ --max_source_length 64 \ --max_target_length 64 \ --per_device_train_batch_size 1 \ --per_device_eval_batch_size 1 \ --gradient_accumulation_steps 16 \ --predict_with_generate \ --max_steps 3000 \ --logging_steps 10 \ --save_steps 1000 \ --learning_rate $LR \ --pre_seq_len $PRE_SEQ_LEN \ --quantization_bit 4关键参数说明P-Tuning v2 方法会冻结全部模型参数只训练 soft promptPrefixEncoder部分可通过调整quantization_bit来控制原始模型的量化等级4 或 8不加此选项则为 FP16 精度加载在默认配置quantization_bit4、per_device_train_batch_size1、gradient_accumulation_steps16下INT4 的模型参数被冻结一次训练迭代以 1 的批处理大小进行 16 次累加的前后向传播等效为 16 的总批处理大小此时最低只需 6.7G 显存若想在同等批处理大小下提升训练效率可在二者乘积不变的情况下加大per_device_train_batch_size但这会带来更多显存消耗请根据实际情况酌情调整如果想要从本地加载模型可将train.sh中的THUDM/chatglm-6b改为本地模型路径。全参数 Finetune如果需要全参数 Finetune需要安装 DeepSpeed然后运行bash ds_train_finetune.sh对应配置文件为 ptuning/deepspeed.json训练脚本为 ptuning/ds_train_finetune.sh。推理评估P-Tuning v2 训练时模型只保存 PrefixEncoder 部分的参数因此推理时需要同时加载原 ChatGLM-6B 模型以及 PrefixEncoder 的权重需在 ptuning/evaluate.sh 中指定--model_name_or_path THUDM/chatglm-6b --ptuning_checkpoint $CHECKPOINT_PATH仍然兼容旧版全参保存的 Checkpoint只需跟之前一样设定--model_name_or_path $CHECKPOINT_PATH评测指标为中文 Rouge score 和 BLEU-4。生成的结果保存在./output/adgen-chatglm-6b-pt-8-1e-2/generated_predictions.txt。微调效果示例以 ADGEN 数据为例微调前后对比详见 ptuning/README.md示例 1Input:类型#上衣*材质#牛仔布*颜色#白色*风格#简约*图案#刺绣*衣样式#外套*衣款式#破洞Output[微调前]: 这件上衣的材质是牛仔布,颜色是白色,风格是简约,图案是刺绣,衣样式是外套,衣款式是破洞。Output[微调后]: 这是一款简约的牛仔外套,破洞设计,将牛仔布破洞,带来一种随意与个性。破洞的牛仔外套,展现出时尚气息,带来一种休闲感。同时,刺绣图案,让整件外套更加立体。示例 2Input:类型#裙*版型#显瘦*风格#文艺*风格#简约*图案#印花*图案#撞色*裙下摆#压褶*裙长#连衣裙*裙领型#圆领Output[微调前]: 类型#裙*版型#显瘦…逐条罗列属性机械复述输入Output[微调后]: 这是一款文艺范的连衣裙,以印花为元素,采用简约的印花,既能够突出文艺气质,又能够展现简约风。在印花的同时又有领子和裙摆的压褶设计,更加凸显文艺气质。简约而不会过于单调,搭配出街,穿着十分舒适。可以看出微调前模型倾向于机械复述输入属性微调后能够生成自然、有风格的广告文案。评估结果与实验设置官方在 ptuning/README.md 中给出了三种微调方式在 ADGEN 上的对比结果FinetuneP-tuning v2LoRABLEU-48.018.107.62Rouge-131.2331.1230.60Rouge-27.367.116.96Rouge-l25.0824.9724.80Training Loss3.003.743.32实验设置max_source_length64、max_target_length64、max_steps3000下各方法的超参数如下P-tuning v2pre_seq_len128、learning_rate2e-2、quantization_bit4、per_device_train_batch_size16、gradient_accumulation_steps1Finetunelearning_rate1e-4、fp16、num_gpus4、per_device_train_batch_size4、gradient_accumulation_steps1LoRAlearning_rate5e-4、per_device_train_batch_size16、gradient_accumulation_steps1微调后模型部署首先载入 Tokenizerfrom transformers import AutoConfig, AutoModel, AutoTokenizer tokenizer AutoTokenizer.from_pretrained(THUDM/chatglm-6b, trust_remote_codeTrue)情况一加载新 Checkpoint只包含 PrefixEncoder 参数config AutoConfig.from_pretrained(THUDM/chatglm-6b, trust_remote_codeTrue, pre_seq_len128) model AutoModel.from_pretrained(THUDM/chatglm-6b, configconfig, trust_remote_codeTrue) prefix_state_dict torch.load(os.path.join(CHECKPOINT_PATH, pytorch_model.bin)) new_prefix_state_dict {} for k, v in prefix_state_dict.items(): if k.startswith(transformer.prefix_encoder.): new_prefix_state_dict[k[len(transformer.prefix_encoder.):]] v model.transformer.prefix_encoder.load_state_dict(new_prefix_state_dict)注意pre_seq_len需要改成你训练时的实际值若是从本地加载模型需将THUDM/chatglm-6b改为本地模型路径注意不是 checkpoint 路径。情况二加载旧 Checkpoint包含 ChatGLM-6B 及 PrefixEncoder 参数或全参数微调结果直接加载整个 Checkpoint 即可model AutoModel.from_pretrained(CHECKPOINT_PATH, trust_remote_codeTrue)之后根据需求进行量化和使用# Comment out the following line if you dont use quantization model model.quantize(4) model model.half().cuda() model.transformer.prefix_encoder.float() model model.eval() response, history model.chat(tokenizer, 你好, history[])另外也可以直接运行支持加载 P-Tuning v2 checkpoint 的 ptuning/web_demo.pybash web_demo.sh可能需要修改 ptuning/web_demo.sh 的内容以符合实际的 checkpoint 情况。使用自己的数据集修改train.sh和evaluate.sh中的train_file、validation_file和test_file为你自己的 JSON 格式数据集路径并将prompt_column和response_column改为 JSON 文件中输入文本和输出文本对应的 KEY。可能还需要增大max_source_length和max_target_length来匹配数据集中的最大输入输出长度。多轮对话数据集微调如需使用多轮对话数据微调可以提供聊天历史例如以下是一个三轮对话的训练数据JSON lines 格式{prompt: 长城h3风扇不转。继电器好的。保险丝好的传感器新的风扇也新的这是为什么。就是继电器缺一个信号线, response: 用电脑能读数据流吗水温多少, history: []} {prompt: 95, response: 上下水管温差怎么样啊空气是不是都排干净了呢, history: [[长城h3风扇不转。继电器好的。保险丝好的传感器新的风扇也新的这是为什么。就是继电器缺一个信号线, 用电脑能读数据流吗水温多少]]} {prompt: 是的。上下水管都好的, response: 那就要检查线路了一般风扇继电器是由电脑控制吸合的如果电路存在断路或者电脑坏了的话会出现继电器不吸合的情况, history: [[长城h3风扇不转。继电器好的。保险丝好的传感器新的风扇也新的这是为什么。就是继电器缺一个信号线, 用电脑能读数据流吗水温多少], [95, 上下水管温差怎么样啊空气是不是都排干净了呢]]}训练时需要指定--history_column为数据中聊天历史的 key此例中为history训练脚本会自动把聊天历史拼接注意超过输入长度max_source_length的内容会被截断。可参考运行bash train_chat.shptuning/train_chat.sh 中PRE_SEQ_LEN128、LR1e-2max_source_length/max_target_length均为 256比单轮广告生成任务预留了更长的上下文空间。能力示例仓库 examples/ 目录提供了若干使用web_demo.py得到的示例截图展示了 ChatGLM-6B 在以下场景的表现自我认知self-introduction.png、提纲写作blog-outline.png、文案写作ad-writing-2.png 与 comments-writing.png、邮件写作助手email-writing-1.png 与 email-writing-2.png、信息抽取information-extraction.png、角色扮演role-play.png、评论比较sport.png以及旅游向导tour-guide.png。局限性说明由于 ChatGLM-6B 的小规模其能力仍有较多局限官方在 README.md 中明确列出了以下问题仓库 limitations/ 目录保存了对应的失败截图模型容量较小6B 的小容量决定了其相对较弱的模型记忆和语言能力。面对许多事实性知识任务时可能生成不正确的信息如 factual_error.png也不擅长逻辑类问题如数学、编程的解答如 math_error.png可能产生有害或有偏见的内容它只是一个初步与人类意图对齐的语言模型英文能力不足训练时使用的指示/回答大部分是中文英文回复质量远不如中文甚至可能出现中英夹杂的情况易被误导、对话能力较弱模型的自我认知存在问题很容易被误导并产生错误的言论如 self-confusion_google.jpg、self-confusion_openai.jpg、self-confusion_tencent.jpg 所示。版本更新与相关项目仓库 UPDATE.md 记录了完整更新历史PROJECT.md 整理了更多基于或使用 ChatGLM-6B 的开源项目。对本文而言值得注意的版本脉络是2023/05/15 更新 v1.1 版本 checkpoint训练数据增加了英文指令微调数据以平衡中英文数据比例解决了英文回答中夹杂中文词语的现象2023/06/14 发布 WebGLM支持利用网络信息生成带准确引用的长回答2023/06/25 发布 ChatGLM2-6B将上下文长度由 2K 扩展到 32K并引入 Multi-Query Attention 提升推理效率2023/07/25 发布 CodeGeeX2基于 ChatGLM2-6B 的代码生成模型。引用与协议本仓库代码依照 Apache-2.0 协议LICENSE开源ChatGLM-6B 模型权重需遵循 Model License。如果你觉得本项目有帮助官方建议引用 GLM 团队论文arXiv:2406.12793引用格式见 README.md。总结从本文的完整梳理可以看出ChatGLM-6B 的工程价值集中体现在低门槛三个字INT4 量化推理最低 6GB 显存、INT4 量化微调最低 7GB 显存配合 CPU、Mac、多卡多种部署路径以及 P-Tuning v2 将微调参数量压缩至 0.1% 的高效方案使得 6B 级别的中英双语对话模型能够在消费级硬件上完成从部署到定制化的完整闭环。动手实践时建议从 web_demo.py 起步验证推理效果再按 ptuning/README.md 的流程完成领域定制。赞分享大模型人工智能NLP本地部署微调模型推理服务【免费下载链接】ChatGLM-6B-codeChatGLM-6B: An Open Bilingual Dialogue Language Model | 开源双语对话语言模型项目地址https://gitcode.com/zai-org/ChatGLM-6B-code点击查看免费下载相关推荐Home Assistant telegram_bot.edit_caption 完全指南修改 Telegram 机器人已发送媒体消息的说明文字Home Assistant telegram_bot.edit_caption 完全指南修改 Telegram 机器人已发送媒体消息的说明文字 本文围绕 H大模型人工智能交互助手本地部署微调NLPAudacity 免费多轨音频编辑从降噪到第一次导出成品的完整指南Audacity 免费多轨音频编辑从降噪到第一次导出成品的完整指南 你刚录完的采访里全是电流声音量忽大忽小今晚又要交一版干净的成片。Audacity 是一音频处理桌面应用音视频ChatGLM-6B模型P-Tuning v2微调技术详解ChatGLM 6B模型P Tuning v2微调技术详解 引言 在大型语言模型的应用中微调 Fine tuning 是使预训练模型适应特定任务的关键技术。本大模型人工智能交互助手本地部署微调NLP上一篇albert与云服务同步跨设备保持一致体验下一篇Boss Show Time从时间迷雾到机会明灯一个求职者的智能导航器创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考