Entegrasyon rehberleri · 2026-10-04

Kolibri'yi kendi sunucunuzda çalıştırmak: donanım, vLLM ve bağlam ayarları

Aleph Alpha Kolibri-1'i vLLM ile kendi altyapınızda sunmak için gereken GPU'lar, kurulum komutu, akıl yürütme ve araç çağırma ayarları ile 1M bağlam seçeneği.

Kolibri vLLM kurulumu için asgari ve önerilen GPU seçeneklerini ve bağlam ayarını gösteren, LLMTR tarafından hazırlanan açıklayıcı şema.

Kısa yanıt: ne gerekir?

Kolibri-1'i çalıştırmak için üç şey gerekir: modelin FP8 ağırlıklarını taşıyacak kadar GPU belleği, Aleph Alpha'nın vLLM eklentisini içeren aleph-alpha-inference paketi ve bağlam uzunluğu için bir karar. Bu yazıdaki komutlar ve değerler Aleph Alpha'nın 3 Ekim 2026 tarihli model kartından alınmıştır. LLMTR bu kurulumu kendi ortamında çalıştırmadı; aşağıdakiler üreticinin talimatlarının Türkçe özetidir.

Ağırlıklar Apache 2.0 lisansıyla yayımlandı, yani modeli ticari bir ürünün parçası olarak da çalıştırabilirsiniz. Lisans, Hugging Face deposunda yayımlanan ağırlıkları ve dosyaları kapsar.

Donanım

Model kartı ağırlıkların bellekte yaklaşık 78 GB yer kapladığını yazıyor ve iki kademe veriyor. Bellek hesabında yalnızca ağırlıkları düşünmeyin: kalan bellek KV önbelleğine, yani bağlamdaki tokenların ara durumlarına gider. Aynı anda kaç isteğe ve ne uzunlukta bağlama hizmet edebileceğinizi bu pay belirler; Aleph Alpha bu nedenle KV önbelleğini de FP8 olarak çalıştırmayı öneriyor.

MoE mimarisi yüzünden tüm uzmanlar bellekte durmalıdır. Token başına yalnızca 3,46 milyar parametre çalışsa da 78,1 milyar parametrenin tamamı yüklenir. Kolibri'yi hesaplama ihtiyacı küçük, bellek ihtiyacı büyük bir model olarak planlayın.

Kolibri-1 donanım gereksinimi, 3 Ekim 2026 itibarıyla Aleph Alpha model kartı
KademeGPU seçenekleri
Asgari2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 veya 1× B300
Önerilen2× H100 SXM5, 2× H200, 1× B200 veya 1× B300
Ağırlık belleğiYaklaşık 78 GB (FP8)

vLLM ile kurulum

Kolibri, Aleph Alpha'nın vLLM eklentisini gerektirir. aleph-alpha-inference paketi eklentiyi ve desteklediği vLLM sürümünü birlikte kurar; isterseniz Aleph Alpha'nın ghcr.io/aleph-alpha/aleph-alpha-inference konteyner imajını da kullanabilirsiniz. Aşağıdaki komut model kartındakiyle aynıdır ve akıl yürütme ile araç çağırmayı açık başlatır.

Sunucu açıldığında OpenAI uyumlu bir uç nokta sunar. Mevcut OpenAI istemcinizin adresini bu sunucuya yöneltip model alanına Aleph-Alpha/Kolibri-1 yazmanız yeterlidir.

İlk denemede akıl yürütmeyi kapatıp kısa bir Almanca ya da İngilizce soru göndermek, sunucunun doğru yüklendiğini görmenin en hızlı yoludur. Ardından aynı soruyu yüksek akıl yürütme seviyesiyle tekrarlayın: vLLM'in akıl yürütme ayrıştırıcısı düşünme metnini nihai yanıttan ayrı bir alana koyar, yani ayrıştırıcı doğru yüklendiyse düşünme metni yanıtın içine karışmaz.

Kolibri-1'i vLLM ile başlatma (Aleph Alpha model kartı)

pip install 'aleph-alpha-inference>=1'

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

Akıl yürütme ve araç çağırma

Akıl yürütme seviyesi sohbet şablonu üzerinden verilir. OpenAI istemcisinde extra_body içindeki chat_template_kwargs alanına reasoning_effort olarak low, medium ya da high yazılır. none değeri ya da enable_thinking alanının false gönderilmesi düşünmeyi tamamen kapatır ve model doğrudan yanıt verir. Basit sınıflandırma ve çıkarım işlerinde düşünmeyi kapatmak yanıt süresini kısaltır; çok adımlı görevlerde ise yüksek seviye daha uygundur.

Araç çağırma Hermes biçimindedir ve sunum komutundaki otomatik araç seçimi bayrağıyla açılır. Model, tanımladığınız fonksiyonlar için standart tool_calls alanını döndürür; fonksiyonu sizin uygulamanız çalıştırır ve sonucu tool rolüyle geri gönderir. Aleph Alpha, araç sonuçlarının çağıran sistem tarafından doğrulanmasını öneriyor.

Bağlam: 262 bin mi, 1 milyon mu?

Kolibri 262.144 tokenlık bağlamla eğitildi. Konum kodlaması yalnızca kayan pencereli katmanlarda uygulandığı için bağlam, konum ölçeklemesi gerekmeden bunun ötesine uzatılabiliyor; Aleph Alpha kaliteyi ve sunum verimliliğini 1.048.576 tokena kadar doğruladı. Bu uzunluğu açmak için sunum komutuna --max-model-len 1048576 ve max_position_embeddings değerini 1048576 yapan --hf-overrides parametresi eklenir.

Uzun bağlamın bedeli bellektir. KV önbelleği bağlamla birlikte büyür; 1 milyon token açmak aynı GPU'da aynı anda hizmet verebileceğiniz istek sayısını düşürür. Aleph Alpha da gecikmeye ya da verime duyarlı kurulumlarda ve karmaşık görevlerde 262.144 token sınırında kalmayı öneriyor. Uzun belgeyi tek seferde vermek yerine parçalayıp araç çağırmayla getirmek çoğu durumda daha ucuzdur.

Örnekleme ayarları ve kendi sunucusunu işletmek istemeyenler

Model kartının önerdiği örnekleme değerleri temperature 1.0, top_p 0.97 ve top_k 128 şeklindedir. Bu değerler Aleph Alpha'nın değerlendirmelerindeki genel kullanım içindir; kesin ve tekrarlanabilir çıktı isteyen işlerde kendi örneklerinizle ayrıca deneyin.

GPU altyapısını işletmek her ekip için uygun değildir: bellek planlaması, sürüm güncellemeleri ve kapasite takibi ayrı bir iş yüküdür. Kolibri-1, LLMTR API'sinde tesseracted/kolibri-1 kimliğiyle 9 Ekim 2026 23:59'a (TSİ) kadar ücretsiz kullanılabilir; bu tarihten sonra erişim kapanır, model sayfası açık kalır.

Sık sorulan sorular

Kolibri tek GPU'da çalışır mı?

Evet. Model kartı tek bir H200, B200 ya da B300'ü asgari donanım olarak listeliyor. A100 80 GB ya da H100 kullanıyorsanız iki GPU gerekir.

Kolibri'yi Ollama ya da llama.cpp ile çalıştırabilir miyim?

Model kartında belgelenen yol, aleph-alpha-inference eklentisiyle vLLM'dir. 3 Ekim 2026 itibarıyla model kartında başka bir çalıştırma ortamı için talimat yok.

Kolibri'de akıl yürütmeyi nasıl kapatırım?

chat_template_kwargs içinde reasoning_effort değerini none yapın ya da enable_thinking değerini false gönderin. Model bu durumda düşünme adımı olmadan doğrudan yanıt verir.

İlgili yazılar