Model karşılaştırma · 2026-08-23
Nemotron 3 Ultra 550B A55B 262K: NVIDIA'nın açık ağırlıklı MoE modeli
NVIDIA Nemotron 3 Ultra 550B A55B 262K modelinin seyrek MoE mimarisi, 262K bağlam penceresi, 8.192 tokenlık bloklarla çalışan prompt cache, kapatılabilir düşünme ve fiyatlaması anlatılıyor.
Nemotron 3 Ultra 550B A55B nedir?
Nemotron 3 Ultra 550B A55B, NVIDIA'nın en büyük açık ağırlıklı Nemotron modelidir. Seyrek bir Mixture-of-Experts mimarisi kullanır: 550 milyar parametresinin token başına yalnızca 55 milyarı çalışır. Addaki A55B tam olarak bunu anlatır — aktif parametre sayısı.
Model zor akıl yürütme görevleri, orkestrasyon, kodlama ajanları ve uzun soluklu kurumsal akışlar için tasarlanmıştır. Açık ağırlıklı olması, aynı modelin farklı sağlayıcılar üzerinden sunulabilmesi ve gerektiğinde kendi altyapınıza taşınabilmesi anlamına gelir; tek bir satıcıya bağlı kalmazsınız.
Yalnızca metin kabul eder ve yalnızca metin üretir. Bağlam penceresinin altında ayrı bir çıktı tavanı yoktur; yani çıktı uzunluğunuzu sınırlayan tek şey pencerenin kendisidir.
Katalogda iki Nemotron 3 Ultra satırı var: hangisi size uygun?
LLMTR kataloğunda bu modelin iki ayrı satırı bulunur ve ikisi farklı ürünlerdir. Adları birbirine yakın olduğu için karıştırılması kolaydır, o yüzden farkı en baştan netleştirmek gerekir.
Birincisi ücretsiz katmanda sunulan Nemotron 3 Ultra 550B A55B satırıdır. Günlük kotayla çalışır, ücret alınmaz ve denemeler, prototipler ile düşük hacimli işler için uygundur. Kotaya takıldığınızda istek reddedilir.
İkincisi bu yazının konusu olan Nemotron 3 Ultra 550B A55B 262K satırıdır. Ölçümlü, yani kullandığınız token kadar ödediğiniz bir satırdır; kota sınırı yerine bakiyeniz geçerlidir. 262K bağlam penceresi ve prompt cache indirimi bu satırda sunulur. Üretim yükü taşıyan, öngörülebilir kapasite isteyen akışlar için doğru seçim budur.
Model listesinde ikisini ad ve durum rozetiyle ayırt edersiniz. Kod tarafında ayrım model kimliğindedir: ücretsiz satır nvidia/nemotron-3-ultra-550b-a55b, ölçümlü satır nvidia/nemotron-3-ultra-550b-a55b-262k şeklinde çağrılır.
| Özellik | Değer | Not |
|---|---|---|
| Toplam parametre | 550 milyar | Seyrek Mixture-of-Experts |
| Aktif parametre | Token başına 55 milyar | Çıkarım maliyetini belirleyen sayı |
| Bağlam penceresi | 262.144 token | Pencerenin altında ayrı çıktı tavanı yok |
| Giriş fiyatı | 1M token başına 0,50 USD | Standart girdi |
| Cache okuma | 1M token başına 0,10 USD | 8.192 tokenlık tam bloklar |
| Çıkış fiyatı | 1M token başına 2,20 USD | Düşünme tokenları dahil |
| Modalite | Yalnızca metin | Görsel, ses ve video girdisi yok |
Prompt cache 8.192 tokenlık bloklar hâlinde çalışır
Prompt cache bu modelde kendiliğinden devrededir; açmak için bir ayar göndermeniz gerekmez. Tekrarlanan bir önek saklanır ve indirimli cached input fiyatından faturalanır. Giriş 0,50 USD iken cache okuma 0,10 USD olduğuna göre, tutan bir önek maliyeti beşte birine indirir.
Ancak mekanizmanın önemli bir ayrıntısı var: saklama 8.192 tokenlık tam bloklar hâlinde yapılır. Önekinizin yalnızca tam blokları oluşturan kısmı cache'ten okunur, artan kısım standart girdi fiyatından işlenir.
Bunun pratik sonucu şudur: 10.000 tokenlık sabit bir sistem isteminiz varsa, ilk 8.192 token cache'ten, kalan 1.808 token tam fiyattan gelir. Sabit öneki 8.192'nin katlarına yaklaştırmak — örneğin 16.384 tokene tamamlamak — cache'ten yararlanan oranı artırır. Küçük ve sık değişen önekler ise blok eşiğini hiç geçemeyebilir ve cache'ten hiç yararlanamaz.
Düşünme varsayılan açık ve çıktı olarak faturalanıyor
Bu modelde adım adım düşünme varsayılan olarak açıktır. Yani hiçbir ayar göndermeden yaptığınız kısa bir istek bile düşünme tokeni harcar. Düşünce zinciri yanıttan ayrı döner, ancak faturalamada çıkış tokeni sayılır.
Çıkış fiyatı 1 milyon token başına 2,20 USD'dir ve giriş fiyatının dört katından fazladır. Dolayısıyla bu modelde maliyetin ağırlık merkezi çıkış tarafındadır ve düşünme uzunluğu doğrudan faturaya yansır.
İyi haber şu: Hy3'ün aksine burada düşünme istek bazında kapatılabilir. Bunu iki yoldan yapabilirsiniz: model kimliğine :fast soneki ekleyerek ya da istek gövdesinde reasoning alanını false göndererek. Sınıflandırma, biçimlendirme veya kısa çıkarım gibi akıl yürütme gerektirmeyen işlerde düşünmeyi kapatmak hem gecikmeyi hem maliyeti düşürür. Zor akıl yürütme gereken işlerde ise açık bırakın; modelin bu görevler için tasarlandığı yer tam olarak orasıdır.
max_tokens değerini düşünme açıkken cömert verin. Çok düşük bir tavan, model düşünme aşamasını bitiremeden yanıtı keser ve elinizde kullanılamayan bir çıktı kalır.
Aynı iş yükünde iki mod: sınıflandırmada düşünme kapalı, analizde açık
import os
from openai import OpenAI
client = OpenAI(
base_url="https://llmtr.com/v1",
api_key=os.environ["LLMTR_API_KEY"],
)
MODEL = "nvidia/nemotron-3-ultra-550b-a55b-262k"
# Basit siniflandirma: dusunmeye gerek yok, kapatmak maliyeti dusurur.
# Govdede reasoning=false ile ayni sonuc alinir.
etiket = client.chat.completions.create(
model=MODEL + ":fast",
messages=[{"role": "user", "content": "Bu destek talebi hangi kategoriye girer: fatura, teknik, iade?"}],
max_tokens=64,
)
# Zor analiz: dusunme acik kalsin, max_tokens comert olsun.
analiz = client.chat.completions.create(
model=MODEL,
messages=[{"role": "user", "content": "Bu mimari kararin uzun vadeli risklerini degerlendir."}],
max_tokens=8192,
)
print(etiket.usage.completion_tokens, analiz.usage.completion_tokens)
Araç çağrısı ve yapılandırılmış çıktı
Model yerel araç çağrısı, JSON nesne modu ve JSON Schema ile şema zorlamalı çıktı sunar. Bu üçünün birlikte bulunması, modeli ajan akışlarında ve dış sistemlere bağlanan boru hatlarında kullanılabilir kılar.
Bir kısıt vardır ve bilinmesi gerekir: tool_choice alanını auto veya required ile kullanın. Belirli bir fonksiyonu ada göre zorlamak bu dağıtımda uygulanmaz — model istediğiniz aracı değil, prompt'a uyan aracı çağırır. Bu yüzden adlandırılmış seçimi bir kısıt olarak kullanmayın ve akışınızı yanlış aracın çağrılabileceğini varsayarak kurun.
Şema zorlamalı çıktıda böyle bir kısıt yoktur; JSON Schema verdiğinizde model şemaya uyan çıktı üretir. Yapılandırılmış veri çıkarımı gereken işlerde araç çağrısı yerine doğrudan şema kullanmak daha öngörülebilir bir yoldur.
- Yerel araç ve fonksiyon çağrısı desteklenir.
- JSON nesne modu desteklenir.
- JSON Schema ile şema zorlamalı çıktı desteklenir.
- tool_choice ile ada göre zorlama uygulanmaz; auto veya required kullanın.
LLMTR üzerinden erişim ve veri notu
Erişim OpenAI uyumlu istemcilerle çalışır: taban adresi https://llmtr.com/v1 yapın, model kimliği olarak nvidia/nemotron-3-ultra-550b-a55b-262k verin. İstemci kodunuzun geri kalanı değişmez.
Model yurt dışındaki üçüncü taraf altyapı üzerinde çalışır. İstemler ve tamamlamalar sağlayıcı tarafından günlüğe kaydedilebilir; Türkiye'de barındırılan bir LLMTR modeli değildir. Kişisel veri içeren istemler için katalogdaki Türkiye'de barındırılan satırları değerlendirin.
LLMTR model fiyatlarına marj eklemez; platform marjı yalnızca kredi yüklemesinde geçerlidir. Yukarıdaki rakamlar sağlayıcı tarifesinin aynısıdır.
Sık sorulan sorular
Nemotron 3 Ultra'nın ücretsiz sürümü ile 262K sürümü arasındaki fark nedir?
Ücretsiz satır günlük kotayla çalışır ve denemeler için uygundur. 262K satırı ölçümlüdür: kullandığınız token kadar ödersiniz, kota sınırı yerine bakiyeniz geçerlidir ve 262.144 tokenlık bağlam penceresi ile prompt cache indirimi bu satırda sunulur.
A55B ne anlama geliyor?
Token başına aktif parametre sayısını gösterir. Model 550 milyar parametre taşır ama seyrek Mixture-of-Experts mimarisi sayesinde her token için yalnızca 55 milyarı çalışır. Çıkarım maliyetini belirleyen sayı budur.
Prompt cache neden bazen hiç indirim getirmiyor?
Saklama 8.192 tokenlık tam bloklar hâlinde yapılır. Sabit önekiniz bu eşiğin altındaysa hiçbir blok tamamlanmaz ve cache devreye girmez. Önekinizi 8.192'nin katlarına yaklaştırmak cache'ten yararlanan oranı artırır.
Düşünmeyi kapatabilir miyim?
Evet, bu modelde düşünme istek bazında kapatılabilir; varsayılan olarak açıktır. Model kimliğine :fast soneki ekleyerek ya da istek gövdesinde reasoning alanını false göndererek kapatırsınız. Sınıflandırma ve biçimlendirme gibi akıl yürütme gerektirmeyen işlerde kapatmak hem gecikmeyi hem maliyeti düşürür, çünkü düşünme tokenları çıkış fiyatından faturalanır.