llama.cpp Nedir? Yapay Zeka Modellerini Kurma ve Çalıştırma
Bu sayfayı ekleyen: #Netler
llama.cpp, Meta'nın LLaMA ve benzeri Büyük Dil Modellerini (LLM) sıradan tüketici bilgisayarlarında, sunucularda veya mobil cihazlarda yüksek performans ve düşük kaynak tüketimiyle çalıştırmak için C/C++ diliyle geliştirilmiş açık kaynaklı bir yapay zeka motorudur.
Georgi Gerganov tarafından başlatılan bu proje, ağır Python kütüphanelerine (PyTorch vb.) veya pahalı ekran kartı (GPU) kümelemelerine olan ihtiyacı ortadan kaldırarak yerel yapay zeka alanında bir devrim yaratmıştır.
🚀 Temel Özellikler
- Sıfır Bağımlılık (Pure C/C++): Python mimarisine veya harici ağır kütüphanelere bağımlı kalmadan doğrudan işletim sistemi seviyesinde çalışır.
- GGUF Formatı & Kuantalama (Quantization): Modelleri 16-bit hassasiyetten 4-bit veya 2-bit seviyelerine kadar küçülterek bellek (RAM/VRAM) kullanımını %70'e varan oranlarda azaltır.
- Donanım Optimizasyonu:
- CPU: AVX, AVX2, AVX-512 ve ARM NEON komut setlerini tam verimle kullanır.
- Apple Silicon: M serisi (M1/M2/M3/M4) işlemcilerdeki Metal API ve Birleşik Bellek (Unified Memory) mimarisini mükemmel şekilde destekler.
- GPU Desteği: NVIDIA (CUDA), AMD (ROCm/CLBlast), Intel (SYCL) ve Vulkan desteği sayesinde hesaplama yükünü GPU'ya kaydırabilir (GPU Offloading).
- Dahili HTTP Server & OpenAI Uyumlu API: Dahili web sunucusu sayesinde OpenAI REST API standartlarıyla uyumlu çalışır. Kendi uygulamalarınızı kolayca bağlayabilirsiniz.
🛠️ Kurulum ve Hızlı Başlangıç
1. Kaynak Koddan Derleme
Linux / macOS:
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
makeCUDA (NVIDIA GPU) Desteği ile Derleme:
make LLAMA_CUDA=12. Model İndirme (GGUF Formatı)
llama.cpp doğrudan GGUF formatındaki modellerle çalışır. Modelleri Hugging Face üzerinden indirebilirsiniz (Örn: Llama-3, Mistral, Gemma modelleri).
Örnek olarak Hugging Face CLI veya curl ile bir model indirin:
curl -L -o llama-3-8b-instruct.Q4_K_M.gguf https://huggingface.co/lmstudio-community/Meta-Llama-3-8B-Instruct-GGUF/resolve/main/Meta-Llama-3-8B-Instruct-Q4_K_M.gguf3. Modeli Çalıştırma
Komut Satırı (CLI) Üzerinden İstem (Prompt) Gönderme:
./main -m llama-3-8b-instruct.Q4_K_M.gguf -p "Yapay zekanın geleceği hakkında kısaca bilgi ver:" -n 256Modeli GPU'ya Yükleyerek Çalıştırma (-ngl parametresi):
./main -m llama-3-8b-instruct.Q4_K_M.gguf -p "Merhaba!" -ngl 33(Buradaki 33 değeri model katmanlarının kaç tanesinin GPU'ya aktarılacağını belirler.)
4. API / Web Sunucusunu Başlatma
Özel uygulamanızla veya bir arayüzle entegre etmek için sunucuyu başlatın:
./server -m llama-3-8b-instruct.Q4_K_M.gguf --port 8080Sunucu çalıştıktan sonra http://localhost:8080 adresinden web arayüzüne ulaşabilir veya OpenAI API formatında http://localhost:8080/v1/chat/completions uç noktasına istek gönderebilirsiniz.
💡 Neden llama.cpp Tercih Etmelisiniz?
- Gizlilik ve Güvenlik: Verileriniz internete çıkmaz, tamamen kendi cihazınızda işlenir.
- Çevrimdışı (Offline) Çalışma: İnternet bağlantısı olmayan ortamlarda kesintisiz çalışır.
- Maliyet Avantajı: Bulut tabanlı API ücretleri ödemeden kendi donanımınızda LLM çalıştırabilirsiniz.
- Eko-sistem Desteği: Ollama, LM Studio, Jan.ai gibi popüler birçok masaüstü uygulama arka planda engine olarak
llama.cppkullanmaktadır.
🌐 Bağlantılar ve Kaynaklar
- Resmi Depo: GitHub - ggerganov/llama.cpp
- Kılavuz & Dokümantasyon: llamacpp.trkod.tr
Yorumlar (0)
Henüz yorum yok. İlk yorumu siz yapın!
Yorum Yap
Yorum yapmak için giriş yapın veya kayıt olun.