Nemotron 3 Ultra 550B A55B 262K
Nemotron 3 Ultra 550B A55B, NVIDIA'nın en büyük açık ağırlıklı Nemotron modelidir: 550 milyar parametresinin token başına 55 milyarını çalıştıran seyrek bir Mixture-of-Experts mimarisi. Zor akıl yürütme, orkestrasyon, kodlama ajanları ve uzun soluklu kurumsal akışlar için tasarlanmıştır. nvidia/nemotron-3-ultra-550b-a55b-262k canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.
| Model | Bağlam | Giriş / Çıkış ($/1M) | Cached giriş ($/1M) |
|---|---|---|---|
nvidia/nemotron-3-ultra-550b-a55b-262k | 262.144 | 0,50 / 2,20 | 0,10 |
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "nvidia/nemotron-3-ultra-550b-a55b-262k", "messages": [ { "role": "user", "content": "Bir dağıtık kuyruk tasarımının artı ve eksilerini kısaca özetle." } ], "max_tokens": 1024 }'Ücretsiz Nemotron 3 Ultra ile karıştırmayın
Section titled “Ücretsiz Nemotron 3 Ultra ile karıştırmayın”Katalogda aynı kontrol noktası adını taşıyan iki ayrı model vardır ve bunlar farklı ürünlerdir:
nvidia/nemotron-3-ultra-550b-a55b | nvidia/nemotron-3-ultra-550b-a55b-262k | |
|---|---|---|
| Ücret | Ücretsiz, günlük kota | Ölçümlü, tokene göre |
| Bağlam | 1.000.000 | 262.144 |
| Prompt cache | Yok | Var |
| Düşünme | Varsayılan kapalı | Varsayılan açık, kapatılabilir |
Kota dolduğunda ücretsiz satır istekleri sınırlar; bu sayfadaki ölçümlü satır o kotadan etkilenmez ve tersi de geçerlidir.
Düşünme modu varsayılan açıktır
Section titled “Düşünme modu varsayılan açıktır”Bu modelde adım adım düşünme varsayılan olarak açıktır. Hiçbir parametre göndermeseniz bile yanıt message.reasoning_content alanında ayrı bir düşünme izi taşır ve bu tokenlar completion_tokens içinde sayılıp çıktı fiyatından faturalanır.
Pratik sonucu: kısa bir soru bile düşünme tokeni harcar. max_tokens değerini buna göre verin, aksi halde yanıt düşünme aşamasında kesilebilir.
Düşünmeyi kapatmak için isteğe reasoning: false ekleyin veya :fast suffix'ini kullanın:
{ "model": "nvidia/nemotron-3-ultra-550b-a55b-262k:fast", "messages": [{ "role": "user", "content": "137 çarpı 42 kaçtır?" }], "max_tokens": 256 }
// Veya istek gövdesinde reasoning alanı{ "model": "nvidia/nemotron-3-ultra-550b-a55b-262k", "reasoning": false, "messages": [{ "role": "user", "content": "137 çarpı 42 kaçtır?" }], "max_tokens": 256 }Düşünme kapatıldığında reasoning_content boş döner ve yanıt doğrudan sonucu verir.
reasoning_effort parametresi bu modelde desteklenmez. Kademeler ölçüldüğünde birbirine göre sıralanmadığı için gateway bu parametreyi 400 ile reddeder; var olmayan bir kademeyi kabul edip sessizce yok saymak yerine hatayı açıkça döndürür.
Prompt cache
Section titled “Prompt cache”Tekrarlanan istem önekleri kendiliğinden önbelleğe alınır, ayrı bir parametre göndermeniz gerekmez. Önbellek 8.192 tokenlık tam bloklar halinde saklanır; artan kısım standart giriş fiyatından işlenir.
Aynı öneki ikinci kez gönderdiğinizde yanıtın usage alanı isabet eden token sayısını bildirir:
{ "usage": { "prompt_tokens": 52275, "completion_tokens": 32, "prompt_tokens_details": { "cached_tokens": 49152 } }}Bu örnekte 49.152 token (tam altı blok) indirimli cached giriş fiyatından, kalan 3.123 token standart giriş fiyatından faturalanır. Önbellekten yararlanmak için değişmeyen içeriği (sistem istemi, doküman gövdesi, örnekler) istemin başına koyun; ilk farklı token'dan sonrası önbelleğe girmez.
Araç çağrısı
Section titled “Araç çağrısı”Araç çağrısı yereldir. tool_choice alanında auto ve required doğru çalışır; dönen tool_calls argümanları geçerli JSON'dur. Ayrıntı için Araç Çağrısı sayfasına bakın.
curl "$LLMTR_BASE_URL/v1/chat/completions" \ -H "Authorization: Bearer llmtr-your_key" \ -H "Content-Type: application/json" \ -d '{ "model": "nvidia/nemotron-3-ultra-550b-a55b-262k", "messages": [{ "role": "user", "content": "İstanbulda hava nasıl?" }], "tools": [{ "type": "function", "function": { "name": "get_weather", "description": "Bir şehrin güncel hava durumunu getirir", "parameters": { "type": "object", "properties": { "city": { "type": "string" } }, "required": ["city"] } } }], "tool_choice": "auto" }'Adlandırılmış tool_choice uygulanmaz
Section titled “Adlandırılmış tool_choice uygulanmaz”Belirli bir fonksiyonu ada göre zorlamak ("tool_choice": { "type": "function", "function": { "name": "..." } }) bu dağıtımda bir kısıt olarak işlemez ve sessizce başarısız olur: istek 200 döner, ancak model istediğiniz aracı değil prompt'a uyan aracı çağırır.
Ölçüm (2026-08-19), iki araçlı bir listede:
| İstenen ad | Soru | Çağrılan araç |
|---|---|---|
get_time | hava durumu | get_weather (3/3) |
get_weather | saat | get_time (2/2) |
Ad yine de doğrulanır: tools listesinde bulunmayan bir ad gönderirseniz 422 alırsınız. Yani parametre okunur, sonra kısıt olarak göz ardı edilir.
Adlandırılmış seçim yalnızca istediğiniz araç modelin zaten seçeceği araçla çakıştığında doğru görünür. Bu yüzden bu modelde adlandırılmış seçime güvenmeyin; akışınızı auto veya required üzerine kurun, tek bir aracın çağrılması şartsa tools listesini o tek araca indirin.
Yapılandırılmış çıktı
Section titled “Yapılandırılmış çıktı”response_format alanı hem json_object hem json_schema biçimini kabul eder:
{ "response_format": { "type": "json_schema", "json_schema": { "name": "person", "strict": true, "schema": { "type": "object", "properties": { "name": { "type": "string" }, "age": { "type": "integer" } }, "required": ["name", "age"], "additionalProperties": false } } }}json_object modunda modelin nesne döndürmesini istiyorsanız sistem isteminde bunu açıkça belirtin; aksi halde düşünme adımlarını geçerli ama beklediğinizden farklı bir JSON yapısı olarak döndürebilir.
Sınırlar
Section titled “Sınırlar”- Bağlam penceresi 262.144 token. Ürün sayfasındaki "1M bağlam" ifadesi kontrol noktasının mimari üst sınırıdır; bu dağıtım 262.144 tokenın üzerindeki istekleri reddeder.
- Ayrı bir çıktı tavanı yoktur.
max_tokensiçin bağlam penceresi dışında bir sınır uygulanmaz. - Adlandırılmış
tool_choiceuygulanmaz. Yukarıdaki bölüme bakın. - Görsel, ses ve video girdisi desteklenmez. Model yalnızca metin kabul eder ve yalnızca metin üretir.
reasoning_effortdesteklenmez.