Dont use exllama on fail

2025-06-05 21:59:24 +02:00 · 2023-08-10 19:34:08 +02:00
parent 9c7ebe3b04
commit 2628726e1c
1 changed files with 4 additions and 1 deletions
--- a/modeling/inference_models/gptq_hf_torch/class.py
+++ b/modeling/inference_models/gptq_hf_torch/class.py
@@ -354,7 +354,10 @@ class model_backend(HFTorchInferenceModel):
                auto_gptq.modeling._base.AutoConfig = hf_bleeding_edge.AutoConfig
                auto_gptq.modeling._base.AutoModelForCausalLM = hf_bleeding_edge.AutoModelForCausalLM

-                model = AutoGPTQForCausalLM.from_quantized(location, model_basename=Path(gptq_file).stem, use_safetensors=gptq_file.endswith(".safetensors"), device_map=device_map)
+                try:
+                    model = AutoGPTQForCausalLM.from_quantized(location, model_basename=Path(gptq_file).stem, use_safetensors=gptq_file.endswith(".safetensors"), device_map=device_map)
+                except:
+                    model = AutoGPTQForCausalLM.from_quantized(location, model_basename=Path(gptq_file).stem, use_safetensors=gptq_file.endswith(".safetensors"), device_map=device_map, disable_exllama=True)

                # Patch in embeddings function
                def get_input_embeddings(self):