This commit is contained in:
2026-06-04 15:27:07 +07:00
parent 669b6075c0
commit 047104efa0
+3 -2
View File
@@ -205,7 +205,7 @@ def load_model(model_id: str, load_in_8bit: bool = True) -> None:
global _model, _tokenizer
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
print(f"\n🔄 Loading model: {model_id}")
print(f" Quantization : {'INT8 (bitsandbytes)' if load_in_8bit else 'auto (float16/bfloat16)'}")
@@ -221,10 +221,11 @@ def load_model(model_id: str, load_in_8bit: bool = True) -> None:
if load_in_8bit:
# INT8 quantization via bitsandbytes — fits ~72 GB for a 72B model
quantization_config = BitsAndBytesConfig(load_in_8bit=True)
_model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
load_in_8bit=True,
quantization_config=quantization_config,
trust_remote_code=True,
torch_dtype=torch.float16,
)