Açık Kaynak LLM'lerin Donanım Gereksinimleri ve Local Kurulum
Localhost'ta Kendi ChatGPT'nizi Çalıştırmak: GPU ve VRAM İhtiyaçları
OpenAI veya Anthropic gibi kapalı kaynak API hizmetlerine aylık ücret ödemek istemeyen veya veri gizliliği nedeniyle şirket dışına veri çıkartamayan kurumlar/geliştiriciler açık kaynaklı LLM (Büyük Dil Modelleri) dünyasına yöneliyor. Meta Llama 3, Mistral, Gemma gibi modelleri yerelde çalıştırmak artık çok popüler. Peki donanım tarafında neye ihtiyacımız var?
Model Boyutları ve VRAM İlişkisi
Dil modellerinin boyutu "Parametre" sayısıyla ölçülür (Örn: 8B = 8 Milyar Parametre). Bir modeli saf haliyle (FP16 - 16 bit) ekran kartına yüklemek çok VRAM (Video RAM) ister. Ancak Quantization (Kuantalama) adı verilen sıkıştırma teknolojileri (GGUF, AWQ, EXL2 formatları) sayesinde modellerin kalitesinden çok az ödün vererek boyutları 4-bit seviyelerine indirilebiliyor.
7B - 8B Modeller (Llama 3 8B, Mistral 7B): 4-bit kuantize edilmiş hali yaklaşık 4.5 GB - 5 GB VRAM kaplar. Sistemin çalışması (Context Window) için ekstra 2 GB VRAM gerekir. Yani 8 GB VRAM'e sahip bir ekran kartı (Örn: RTX 3060, RTX 4060) bu modelleri saniyede 50+ token hızıyla muazzam akıcılıkta çalıştırır.
13B - 14B Modeller (Qwen 14B): Minimum 12 GB VRAM (Örn: RTX 3060 12GB veya RTX 4070) gerektirir.
30B - 70B Modeller (Llama 3 70B, Mixtral 8x7B): Kurumsal seviyedir. 4-bit hali bile 40+ GB VRAM gerektirir. Genellikle 2 adet RTX 3090 / 4090 (24GBx2) veya doğrudan sunucu tipi Nvidia A100/H100 kartlarda çalıştırılırlar.
Nasıl Çalıştırılır?
Yazılım tarafında komut satırıyla uğraşmak istemiyorsanız, LM Studio veya Ollama arayüzlerini bilgisayarınıza kurarak tek tıkla modelleri indirip tıpkı ChatGPT arayüzü gibi kullanmaya başlayabilirsiniz. Sisteminizde hangi GPU var ve hangi modelleri test ettiniz?
Llama 3 modelini 4-bit kuantalama ile RTX 4060 ekran kartında sorunsuz çalıştırıyorum. Yerel LLM'lerin bu hıza ulaşması inanılmaz.
Cevap yazmak için giriş yapmalısınız.
Giriş Yap