Inference
Inference İçin GPU Seçimi
Inference, eğitilmiş veya uyarlanmış bir modeli gerçek istekler karşısında çalıştırmaktır. Chatbot, OCR, sınıflandırma, arama, embedding, görsel üretim ve ses çözümleme servisleri bu kapsama girer. Doğru GPU seçimi, “model açılıyor mu?” sorusundan daha geniştir: ilk yanıtın ne kadar sürede geldiği, saniyede kaç isteğin taşındığı ve yoğun anda kaç kullanıcının bekletildiği birlikte ölçülmelidir.
Önce servis hedefini tanımlayın
Bir iç ekip aracı ile müşteriye açık API'nin beklentisi aynı değildir. İç araçta birkaç saniyelik gecikme kabul edilebilirken canlı destek botunda kullanıcı bekleme süresi daha kritik olabilir. Başlangıçta aşağıdaki hedefleri yazın:
- İlk token veya ilk sonuç için kabul edilebilir gecikme
- Ortalama ve yoğun saatlerde beklenen eşzamanlı istek sayısı
- İstek başına yaklaşık giriş ve çıkış token miktarı
- Kesintisiz çalışma, bakım penceresi ve hata toleransı beklentisi
- Modelin güncellenme sıklığı ve yeni sürüme geçiş yöntemi
VRAM hesabı yalnızca ağırlık boyutu değildir
Model ağırlıkları, KV cache, aktivasyonlar, tokenizer, framework ve işletim payı aynı GPU belleğini paylaşır. Uzun bağlam veya yüksek concurrency KV cache'i büyütür. Quantization bellek ihtiyacını azaltabilir; fakat hız, kalite ve araç uyumluluğu modelden modele değişir. Bu nedenle model dosyası 20 GB ise 24 GB kart kesin yeterlidir demek risklidir. Her zaman ölçülebilir bir güvenlik payı bırakın.
RTX 4090, A100 ve H100 nasıl ayrılır?
RTX 4090, düşük veya orta trafik, prototip ve daha küçük quantized modeller için maliyet açısından iyi bir başlangıç olabilir. A100 80GB, daha büyük ağırlıklar, uzun context, daha yüksek batch ve kurumsal süreklilik beklentilerinde daha geniş alan sunar. H100 ise zaman hassasiyeti, yoğun trafik veya yüksek hesaplama kapasitesinin doğrudan ürün değerine dönüştüğü ortamlarda değerlendirilir.
Bu sınıflandırma kesin bir model tablosu değildir. Aynı GPU'da farklı serving motorları ve batch ayarları farklı sonuç verir. CPU, RAM, NVMe ve ağ da modelin yüklenme süresini ve veri hazırlama darboğazını etkiler.
Benchmark senaryosu hazırlayın
- Üretimde kullanılacak model sürümünü ve quantization biçimini sabitleyin.
- Gerçek prompt'lara benzeyen kısa ve uzun örneklerden bir test kümesi oluşturun.
- Tek kullanıcı, hedef concurrency ve yoğunluk artışı senaryolarını ayrı çalıştırın.
- İlk sonuç süresi, toplam throughput, VRAM, CPU ve hata oranını kaydedin.
- Model yeniden yüklendiğinde ve sunucu yeniden başladığında süreyi tekrarlayın.
Operasyon da kapasitenin parçasıdır
Inference ortamında model sunucusunun logları, health check'leri, kaynak limitleri ve gerektiğinde geri dönüş planı olmalıdır. Kullanıcı trafiği büyüdüğünde yalnızca daha güçlü bir GPU almak yerine batching, cache, quantization veya birden fazla replica seçenekleri karşılaştırılabilir. Bu kararları baştan belgelemek, kapasite artışında paniği azaltır.
Ölçüm sırasında maliyet başına işi de takip edin. Bir kart daha hızlı olabilir, fakat düşük trafik dönemlerinde kaynak boşa kalıyorsa daha küçük bir kart veya otomatik ölçekleme daha iyi sonuç verebilir. Tersine, kuyrukta bekleyen isteklerin müşteri deneyimine ve ekip verimliliğine etkisi yüksekse daha pahalı GPU toplam operasyon maliyetini azaltabilir. Kararı tek bir benchmark sayısına değil, kullanım profilinin tamamına bağlayın.
Son olarak, test verisini gerçek üretim verisinin hassasiyetini ihlal etmeden seçin. Maskelenmiş örnekler ve temsil edici trafik, performans ölçümünü güvenli tutarken kapasite planının gerçekçi kalmasına yardımcı olur.
Kısa cevap: Inference GPU'su model belleği, gecikme, throughput ve concurrency birlikte ölçülerek seçilir. OMAY'a model adı, hedef trafik, yanıt süresi ve veri lokasyonunu iletin; kart sınıfını benchmark'a göre planlayalım.
Inference Planı İste