大语言模型量化方法对比：GPTQ、GGUF、AWQ

2023-11-17 微信公众号 DeepHub IMBA

在过去的一年里，大型语言模型(llm)有了飞速的发展，在本文中，我们将探讨几种(量化)的方式，除此以外，还会介绍分片及不同的保存和压缩策略。

大语言模型量化方法对比：GPTQ、GGUF、AWQ

说明：每次加载LLM示例后，建议清除缓存，以防止出现OutOfMemory错误。

del model, tokenizer, pipe
 
 import torch
 torch.cuda.empty_cache()

如果在jupyter中无法释放显存，请重启这个jupyter notebook。

模型加载

加载LLM的最直接、最普通的方式是通过

关键词：大语言点击(6)

声明：本站部分内容来自互联网,如有版权侵犯或其他问题请与我们联系，我们将立即删除或处理。

▍相关推荐

更多大语言相关>>>

Copyright @ 简易百科 V 2.0 京ICP备14042104号