ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

中文LLaMA/Alpaca 系列 Notebook 全流程实战指南:从 LoRA 预训练、指令精调到 C-Eval 评测与量化部署

中文LLaMA/Alpaca 系列 Notebook 全流程实战指南:从 LoRA 预训练、指令精调到 C-Eval 评测与量化部署 大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载本文以 notebooks/README.md 为骨架系统梳理 Chinese-LLaMA-Alpaca 项目提供的 5 个核心 Jupyter Notebook 示例C-Eval 评测、模型转换与量化、LoRA 预训练、LoRA 指令精调、Gradio Web Demo及其遗留旧版脚本并结合仓库内的合并脚本、训练脚本、评测脚本与配置文件讲清每一条命令的底层原理与可复用的参数组合。读完本文你将能够在本地 GPU 或 Colab 环境中完整走通「合并 LoRA 权重 → 预训练 / 指令精调 → 评测 → 量化 → 网页对话」的整条链路。一、Notebook 家族总览一条完整的模型生命周期链路notebooks/目录是项目面向快速上手的实战入口覆盖了中文 LLaMA/Alpaca 模型从产出到验证再到部署的全部关键环节。目录结构如下Notebook 文件对应生命周期环节一句话定位pretrain_chinese_llama_lora.ipynb二次预训练在 LLaMA 基座之上用中文语料做 LoRA 增量预训练finetune_chinese_alpaca_lora.ipynb指令精调SFT在中文 Alpaca LoRA 之上继续做指令精调ceval_example_for_chinese_alpaca.ipynb效果评测在 C-Eval 数据集上解码并统计准确率convert_and_quantize_chinese_llama_and_alpaca.ipynb合并与量化合并 LoRA 权重再用 llama.cpp 产出 4-bit 量化模型gradio_web_demo.ipynb部署演示一行命令拉起本地/云端网页对话界面legacy/convert_and_quantize_chinese_alpaca_plus.ipynb合并与量化旧版Alpaca-Plus 多 LoRA 合并与量化仅参考不再更新legacy/convert_and_quantize_chinese_llama.ipynb合并与量化旧版早期 LLaMA 版本转换仅参考不再更新其中前 5 个为当前维护版本legacy/下两个旧版 notebook 官方已明确标注仅供流程参考不会再更新见 notebooks/README.md。之所以能串联成一条链路是因为它们共享同一套底层脚本合并脚本 scripts/merge_llama_with_chinese_lora.py 与低内存版 scripts/merge_llama_with_chinese_lora_low_mem.py、预训练脚本 scripts/training/run_clm_pt_with_peft.py、精调脚本 scripts/training/run_clm_sft_with_peft.py、评测脚本 scripts/ceval/eval.py 以及推理演示脚本 scripts/inference/gradio_demo.py。二、C-Eval 评测示例合并模型后在中文基准上解码打分C-Eval 示例 notebook 演示的是用Chinese-Alpaca-Plus-7B在 C-Eval 数据集上完成评测的完整流程共分三步合并模型 → 在 valid set 上解码 → 用官方脚本统计效果。notebook 元数据中记录的运行环境为 A100 GPU作者同时提示实际 7B 模型用 V100 应该也是可以的因此这一节的所有命令都围绕单卡 GPU 展开。2.1 第一步合并基座模型与 LoRA 权重评测前首先要得到基座 LoRA的完整模型。notebook 使用的命令如下!pip install torch1.13.1 !pip install transformers4.30.2 !pip install peft0.3.0 !pip install sentencepiece !git clone https://github.com/ymcui/Chinese-LLaMA-Alpaca!python ./Chinese-LLaMA-Alpaca/scripts/merge_llama_with_chinese_lora_low_mem.py \ --base_model elinas/llama-7b-hf-transformers-4.29 \ --lora_model ziqingyang/chinese-llama-plus-lora-7b,ziqingyang/chinese-alpaca-plus-lora-7b \ --output_type huggingface \ --output_dir alpaca-combined-hf关键点在于--lora_model一次传入了两个LoRA先写chinese-llama-plus-lora-7b二次预训练增量再写chinese-alpaca-plus-lora-7b指令精调增量这正是 Plus 系列双 LoRA合并的标准姿势。--output_type huggingface指定输出为 HF 格式与后续 llama.cpp 量化场景常用pth区分详见第四节。对应脚本的完整参数见 scripts/merge_llama_with_chinese_lora_low_mem.py--base_model与--lora_model均为必填--output_type可选pth/huggingface默认pth--output_dir默认./merged_model。2.2 第二步在 C-Eval valid set 上运行预测先下载 C-Eval 数据并解压到评测脚本约定的data/目录!cd ./Chinese-LLaMA-Alpaca/scripts/ceval wget https://huggingface.co/datasets/ceval/ceval-exam/resolve/main/ceval-exam.zip \ mkdir data unzip ceval-exam.zip -d data随后调用 scripts/ceval/eval.py 执行解码!cd ./Chinese-LLaMA-Alpaca/scripts/ceval CUDA_VISIBLE_DEVICES0 python eval.py \ --model_path /content/alpaca-combined-hf \ --cot False \ --few_shot False \ --with_prompt True \ --constrained_decoding True \ --temperature 0.2 \ --n_times 1 \ --ntrain 5 \ --do_save_csv False \ --do_test False \ --output_dir /content/ceval-output对照 eval.py 的参数定义逐项说明--model_path合并后模型路径HF 格式目录。--cot/--few_shot/--with_prompt分别控制是否使用思维链Chain-of-Thought、少样本示例、是否拼接指令提示词均以字符串True/False传入脚本内部统一转换为布尔值见 eval.py。本示例是zero-shot 带 prompt 无 CoT的解码配置。--constrained_decoding是否约束解码只输出A/B/C/D选项。脚本中当其为True时会强制n_times至少为 1见 eval.py因为约束解码下结果更稳定。--temperature解码温度默认0.2值越低输出越确定。--n_times重复运行次数默认1每个take会生成独立的take{i}输出目录见 eval.py 与main循环 eval.py。--ntrain-k少样本示例个数默认5仅在few_shotTrue时生效eval.py 中读取 dev 集。--do_testFalse时评测data/val下的*_val.csvTrue时改用data/test下的*_test.csveval.py。--do_save_csv是否逐科目保存预测明细 CSV。--output_dir评测输出根目录最终summary.json会写入{output_dir}/take{i}/。2.3 第三步查看汇总结果运行!cat ./ceval-output/take0/summary.json即可查看每个科目的得分。notebook 中展示了一次运行的结果片段{ All: { score: 0.36701337295690933, num: 1346, correct: 494.0 } }即 zero-shot 准确率约36.7%与该模型技术报告中汇报的数值一致。生成逻辑位于 eval.py脚本按subject_mapping.jsonscripts/ceval/subject_mapping.json中的分组信息将科目归并为STEM / Social Science / Humanities / Other四类最后聚合出All总分、总题数与总正确数。注意事项解码存在随机性若希望结果更稳定可将n_times调大如 35最终取多次take{i}/summary.json的平均值。三、LoRA 预训练与指令精调Colab 上的最小可复现训练闭环pretrain_chinese_llama_lora.ipynb与finetune_chinese_alpaca_lora.ipynb是两份结构对称的简化版训练教程二者都明确说明除训练步数只跑 100 步与数据集使用仓库自带的示例数据外其余设置均遵循官方 Wiki 的训练脚本配置。这意味着你可以直接把 notebook 里的命令换成仓库中 scripts/training/run_pt.sh 与 scripts/training/run_sft.sh 的正式参数跑完整训练。3.1 环境与数据准备两份 notebook 共用!pip install transformers4.28.1 !pip install githttps://github.com/huggingface/peft.git13e53fc !pip install datasets !pip install sentencepiece !pip install deepspeed !git clone https://github.com/ymcui/Chinese-LLaMA-Alpaca.git注意这里 peft 是从 GitHub 固定 commit13e53fc安装的以保证 LoRA 适配层行为与训练脚本兼容——这也是 requirements.txt 中githttps://github.com/huggingface/peft.git13e53fc的由来。仓库根目录的 requirements.txt 还固定了torch1.13.1、transformers4.30.0、sentencepiece0.1.97可作为本地复现的版本基线。预训练 notebook 使用data/pt_sample_data.txt由data/alpaca_data_zh_51k.json构建的示例语料作为训练数据!mkdir Chinese-LLaMA-Alpaca/pt_data !cp Chinese-LLaMA-Alpaca/data/pt_sample_data.txt Chinese-LLaMA-Alpaca/pt_data精调 notebook 则直接使用完整指令数据集!mkdir Chinese-LLaMA-Alpaca/sft_data !cp Chinese-LLaMA-Alpaca/data/alpaca_data_zh_51k.json Chinese-LLaMA-Alpaca/sft_data两份示例数据均位于仓库 data/ 目录下正式训练时可用 scripts/training/build_dataset.py 按需构造更大规模的数据集。3.2 预训练命令逐项拆解!cd Chinese-LLaMA-Alpaca/scripts torchrun --nnodes 1 --nproc_per_node 1 run_clm_pt_with_peft.py \ --deepspeed ds_zero2_no_offload.json \ --model_name_or_path decapoda-research/llama-7b-hf \ --tokenizer_name_or_path ziqingyang/chinese-llama-lora-7b \ --dataset_dir /content/Chinese-LLaMA-Alpaca/pt_data \ --data_cache_dir data_cache \ --validation_split_percentage 0.001 \ --per_device_train_batch_size 1 \ --do_train \ --fp16 \ --seed $RANDOM \ --max_steps 100 \ --lr_scheduler_type cosine \ --learning_rate 2e-4 \ --warmup_ratio 0.05 \ --weight_decay 0.01 \ --logging_strategy steps \ --logging_steps 10 \ --save_strategy steps \ --save_total_limit 3 \ --save_steps 50 \ --gradient_accumulation_steps 1 \ --preprocessing_num_workers 8 \ --block_size 512 \ --output_dir /content/output_model \ --overwrite_output_dir \ --ddp_timeout 30000 \ --logging_first_step True \ --lora_rank 8 \ --lora_alpha 32 \ --trainable q_proj,v_proj,k_proj,o_proj,gate_proj,down_proj,up_proj \ --modules_to_save embed_tokens,lm_head \ --lora_dropout 0.05 \ --torch_dtype float16 \ --gradient_checkpointing \ --ddp_find_unused_parameters False与 run_pt.sh 对照可发现除max_steps100正式脚本用num_train_epochs 1、gradient_accumulation_steps1正式脚本为 8、save_steps50正式脚本为 200三处为演示加速而简化外其余参数完全一致。要点归纳LoRA 超参lora_rank8、lora_alpha32、lora_dropout0.05--trainable覆盖全部 7 个注意力/前馈投影q_proj,v_proj,k_proj,o_proj,gate_proj,down_proj,up_proj并用--modules_to_save embed_tokens,lm_head额外训练词嵌入与输出头——这是因为中文词表扩充后embed_tokens与lm_head也需要同步适配。训练策略learning_rate2e-4、warmup_ratio0.05、weight_decay0.01、cosine 学习率调度fp16gradient_checkpointing用于压显存torch_dtype float16指定模型加载精度。分布式torchrun --nnodes 1 --nproc_per_node 1单机单卡即可运行多卡时把--nproc_per_node改为卡数并配套 scripts/training/ds_zero2_no_offload.json 的 DeepSpeed ZeRO-2 配置。数据处理block_size 512控制预训练样本截断长度preprocessing_num_workers 8并行预处理。训练完成后需要整理 LoRA 产物关键步骤!mkdir output_model/peft_model !mv output_model/pytorch_model.bin output_model/peft_model/adapter_model.bin即把保存的pytorch_model.bin重命名为 PEFT 规范文件名adapter_model.bin并在peft_model下手动创建adapter_config.json填入lora_rank、lora_alpha等超参格式可参考 Chinese-LLaMA-LoRA 系列模型仓库中的同名文件。之后该目录即可被PeftModel或后续合并脚本直接读取。3.3 指令精调命令与差异点!cd Chinese-LLaMA-Alpaca/scripts torchrun --nnodes 1 --nproc_per_node 1 run_clm_sft_with_peft.py \ --deepspeed ds_zero2_no_offload.json \ --model_name_or_path decapoda-research/llama-7b-hf \ --tokenizer_name_or_path ziqingyang/chinese-alpaca-lora-7b \ --dataset_dir /content/Chinese-LLaMA-Alpaca/sft_data \ --validation_split_percentage 0.001 \ --per_device_train_batch_size 1 \ --do_train \ --fp16 \ --seed $RANDOM \ --max_steps 100 \ --lr_scheduler_type cosine \ --learning_rate 1e-4 \ --warmup_ratio 0.03 \ --weight_decay 0 \ --logging_strategy steps \ --logging_steps 10 \ --save_strategy steps \ --save_total_limit 3 \ --save_steps 50 \ --gradient_accumulation_steps 1 \ --preprocessing_num_workers 8 \ --max_seq_length 512 \ --output_dir /content/output_model \ --overwrite_output_dir \ --ddp_timeout 30000 \ --logging_first_step True \ --torch_dtype float16 \ --peft_path ziqingyang/chinese-alpaca-lora-7b \ --gradient_checkpointing \ --ddp_find_unused_parameters False与预训练命令对比SFT 场景有四处关键差异与 run_sft.sh 一致新增--peft_path ziqingyang/chinese-alpaca-lora-7b从已有 LoRA 权重继续训练notebook 明确说明是continue training the Chinese-Alpaca-LoRA而不是从零初始化 LoRA 层。--max_seq_length 512取代--block_size指令数据按最大序列长度截断而非预训练的固定块长。学习率更低learning_rate1e-4预训练为 2e-4warmup_ratio0.03weight_decay0——精调阶段希望更保守地微调。tokenizer 用精调版tokenizer_name_or_path指向chinese-alpaca-lora-7b而非chinese-llama-lora-7b。正式的 run_sft.sh 还会额外启用--do_eval、--evaluation_strategy steps、--eval_steps 100与--validation_file在验证集上周期性评估notebook 为简化演示省略了验证环节。训练产物的整理方式与预训练相同重命名为adapter_model.bin 手写adapter_config.json。四、模型合并与 4-bit 量化面向 CPU/低配 GPU 的部署前处理convert_and_quantize_chinese_llama_and_alpaca.ipynb 是社区使用频率最高的 notebook它把合并 LoRA → llama.cpp 转 ggml → 4-bit 量化串成一条流水线最终产出可直接在 CPU 上运行的量化模型。notebook 开头给出了明确的内存门槛提示7B 模型RAM 15G13B 模型RAM 18G33B 模型RAM 22G并给出了 Colab 实操经验免费用户默认约 12G 内存不足以完成转换实测选择 TPU 运行时有机会随机分配到 35G 内存Pro() 用户应在代码执行程序 → 更改运行时类型中选择高 RAM若内存仍不足可把 GPU/TPU 也一并选上碰运气分配更高规格的机器。转换完成后记得断开运行时以节省计算单元配额。4.1 依赖安装与代码克隆!pip install torch1.13.1 !pip install transformers4.30.2 !pip install peft0.3.0 !pip install sentencepiece !git clone https://github.com/ymcui/Chinese-LLaMA-Alpaca !git clone https://github.com/ggerganov/llama.cpp这里额外克隆了 llama.cpp——量化环节依赖它的convert.py、quantize与main三个工具。4.2 合并模型以 Alpaca-7B 为例!python ./Chinese-LLaMA-Alpaca/scripts/merge_llama_with_chinese_lora_low_mem.py \ --base_model elinas/llama-7b-hf-transformers-4.29 \ --lora_model ziqingyang/chinese-alpaca-lora-7b \ --output_type pth \ --output_dir alpaca-combined与 C-Eval 示例的区别在于--output_type pth后续要交给 llama.cpp 量化因此输出原版 LLaMA 风格的consolidated.*.pth权重。若使用 Plus 系列模型--lora_model需同时传入 llama 与 alpaca 两个 LoRA顺序为 llama 在前、alpaca 在后若本地内存吃紧可在旧版合并脚本 scripts/merge_llama_with_chinese_lora.py 中增加--offload_dir ./offload_temp参数将部分权重临时卸载到磁盘以缓解 RAM 压力低内存合并脚本merge_llama_with_chinese_lora_low_mem.py同样支持。4.3 用 SHA256 校验合并结果!sha256sum alpaca-combined/consolidated.*.pth合并得到的全量权重必须与项目发布的 SHA256.md 逐条比对防止下载到损坏或不合规的权重。notebook 中 Alpaca-7B 的标准值为fbfccc91183169842aac8d093379f0a449b5a26c5ee7a298baf0d556f1499b90比对一致即代表合并无误。这是模型安全与可复现性的关键一步切勿跳过。4.4 llama.cpp 转换与量化三连第一步编译 llama.cpp。!cd llama.cpp make第二步整理目录并转为 ggml FP16 格式。!cd llama.cpp mkdir zh-models mv ../alpaca-combined zh-models/7B !mv llama.cpp/zh-models/7B/tokenizer.model llama.cpp/zh-models/ !cd llama.cpp python convert.py zh-models/7B/要点tokenizer.model必须从alpaca-combined目录挪到zh-models/顶层13B/33B 可直接复用 7B 的 tokenizerAlpaca 与 LLaMA 的tokenizer.model不能混用。这里7B只是目录名与转换过程本身无关。第三步FP16 模型量化为 4-bit新版 Q4_K 方法。!cd llama.cpp ./quantize ./zh-models/7B/ggml-model-f16.bin ./zh-models/7B/ggml-model-q4_K.bin q4_K第四步可选测试量化模型能否正常对话。!cd llama.cpp ./main -m ./zh-models/7B/ggml-model-q4_K.bin --color -p 详细介绍一下北京的名胜古迹 -n 128至此ggml-model-f16.binFP16与ggml-model-q4_K.bin4-bit 量化都存放在llama.cpp/zh-models/7B/下可按需下载使用。4-bit 量化版即可在纯 CPU 环境下流畅运行——这正是 examples/ 目录中 q4 系列示例如 examples/q4_7b-13b/README.md所依赖的模型形态。4.5 遗留旧版Alpaca-Plus 转换与高内存机器参考表legacy/convert_and_quantize_chinese_alpaca_plus.ipynb 是 Plus 系列转换的早期版本流程与 4.24.4 完全同构仅模型名不同--base_model decapoda-research/llama-7b-hf、双 LoRAchinese-llama-plus-lora-7b,chinese-alpaca-plus-lora-7b使用普通版合并脚本 scripts/merge_llama_with_chinese_lora.py。其价值还在于提供了一张高 RAM运行时规格下的实测设备配置参考表硬件加速器RAM硬盘None25GB225GBTPU35GB225GBGPU标准T425GB166GBGPU高性能V10025GB166GBGPU高性能A10080GB166GB该表仅反映 notebook 作者在 Pro 订阅下的单次实测结果存在随机性但可作为规划转换任务时选择运行时规格的参考转换 7B 级别模型约需 25G 内存13B 级别需 35GA100 档位的 80GB 内存可覆盖到更大规模模型。五、Gradio Web Demo一行命令启动网页对话gradio_web_demo.ipynb 提供最轻量的部署体验——把模型推理封装成 Gradio 网页应用。流程为克隆仓库 → 安装依赖 → 下载基座与 LoRA 权重 → 运行启动命令。依赖安装在仓库 requirements.txt 基础上追加 peft 与 gradio!pip install -r Chinese-LLaMA-Alpaca/requirements.txt !pip install peft0.3.0 !pip install gradio !pip install sentencepiece下载演示所需的权重notebook 默认加载 Chinese-Alpaca-7B!git clone https://huggingface.co/ziqingyang/chinese-alpaca-lora-7b !git clone https://huggingface.co/elinas/llama-7b-hf-transformers-4.29启动命令T4 机器加--load_in_8bit无 GPU 加--only_cpuV100/A100 可都不加!pip install bitsandbytes !python Chinese-LLaMA-Alpaca/scripts/inference/gradio_demo.py \ --base_model llama-7b-hf-transformers-4.29 \ --lora_model chinese-alpaca-lora-7b \ --load_in_8bit对照 scripts/inference/gradio_demo.py 的命令行参数可进一步掌握部署细节--base_model必填与--lora_model基座与 LoRA 路径若--lora_model为None则直接在基座上推理。--load_in_8bit启用 8-bit 量化推理需要安装bitsandbytes--only_cpu纯 CPU 推理脚本会自动清空 GPU 设置见 gradio_demo.py。--gpus默认0多卡可传0,1,...--share默认开启 Gradio 公网分享链接--port默认19324。--max_memory最大输入 prompt 长度默认 256超长时模型只接收prompt[-max_memory:]。--alphaNTK 缩放因子可为浮点数或auto——脚本启动时会调用 scripts/inference/patches.py 中的apply_attention_patch开启 memory-efficient attention与apply_ntk_scaling_patch对模型打补丁以支持长文本场景gradio_demo.py。注意notebook 中默认加载的 LLaMA 基座权重由第三方转换官方明确提示本项目不对其合规性和正确性负责若想切换其他模型如 13B、Plus 或量化版请先阅读项目 README 中的模型合并与转换说明。六、串联成完整工作流的推荐实践将五个 notebook 组合起来即可形成一条覆盖训练 → 评测 → 部署的完整生产线建议按以下顺序执行产出模型用pretrain_chinese_llama_lora.ipynb做中文增量预训练产出chinese-llama系 LoRA再用finetune_chinese_alpaca_lora.ipynb做指令精调产出chinese-alpaca系 LoRA。正式训练时把 notebook 中的 100 步演示配置替换为 run_pt.sh / run_sft.sh 的完整参数含--do_eval验证环节。验证效果用ceval_example_for_chinese_alpaca.ipynb在 C-Eval valid set 上做 zero-shot / few-shot 评测多跑几次n_times取平均得到可引用的量化分数。合并与量化用convert_and_quantize_chinese_llama_and_alpaca.ipynb把 LoRA 合并回全量权重经 SHA256 校验后由 llama.cpp 产出 FP16 与 4-bitQ4_K两种形态后者可直接用于 CPU 部署。对话部署GPU 环境用gradio_web_demo.ipynb一键拉起网页对话若已产出量化模型也可参考 examples/ 中各量化档位的运行示例examples/f16-p7b-p13b-33b/README.md、examples/q8_7b-13b-p7b/README.md 等在本地 CPU 上做多轮对话验证。全套 notebook 与脚本的对应关系可归纳为下表便于按需跳转目标Notebook核心依赖脚本/配置LoRA 二次预训练notebooks/pretrain_chinese_llama_lora.ipynbscripts/training/run_clm_pt_with_peft.py、run_pt.sh、ds_zero2_no_offload.jsonLoRA 指令精调notebooks/finetune_chinese_alpaca_lora.ipynbscripts/training/run_clm_sft_with_peft.py、run_sft.shC-Eval 评测notebooks/ceval_example_for_chinese_alpaca.ipynbscripts/ceval/eval.py、llama_evaluator.py、subject_mapping.json合并 量化notebooks/convert_and_quantize_chinese_llama_and_alpaca.ipynb旧版见notebooks/legacy/scripts/merge_llama_with_chinese_lora_low_mem.py、merge_llama_with_chinese_lora.py、SHA256.md网页对话notebooks/gradio_web_demo.ipynbscripts/inference/gradio_demo.py、patches.py需要强调的是以上 notebook 均为流程演示性质其中涉及的模型权重下载地址、版本号与硬件配置要求以 notebook 内记录为准在正式项目中建议始终以仓库 scripts/ 目录下的脚本与 requirements.txt 固定版本为准进行复现并先在小规模数据上跑通全流程再扩展到完整训练与部署。赞分享大模型人工智能预训练微调LoRA本地部署NLP模型评测【免费下载链接】Chinese-LLaMA-Alpaca中文LLaMAAlpaca大语言模型本地CPU/GPU训练部署 (Chinese LLaMA Alpaca LLMs)项目地址https://gitcode.com/gh_mirrors/ch/Chinese-LLaMA-Alpaca点击查看免费下载相关推荐中文LLaMA与Alpaca大模型实战指南词表扩充、LoRA合并、CPU/GPU本地量化部署与训练精调Chinese-LLaMA-Alpaca中文LLaMA与Alpaca大模型实战指南词表扩充、LoRA合并、CPU/GPU本地量化部署与训练精调Chinese LLaMA Alpaca 本文以开源大模型人工智能预训练微调LoRA本地部署NLP模型评测从训练到部署ONNX量化感知训练全流程实战指南从训练到部署ONNX量化感知训练全流程实战指南 量化感知训练模型优化的新范式 在机器学习部署中你是否遇到过这些痛点模型体积过大导致移动端加载缓慢推理速人工智能机器学习深度学习Chinese-LLaMA-Alpaca 技术解析中文词表扩充、LoRA 二次预训练与本地 CPU/GPU 部署全指南Chinese LLaMA Alpaca 技术解析中文词表扩充、LoRA 二次预训练与本地 CPU/GPU 部署全指南 本指南以 README_EN.md h大模型人工智能预训练微调LoRA本地部署NLP模型评测上一篇Botkit Facebook 适配器完全指南botbuilder-adapter-facebook 类参考与实战开发下一篇3DS FBI LinkMac用户如何高效无线传输3DS游戏文件创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表