İçeriğe geç

Nemotron 3 Ultra 550B A55B 262K

Nemotron 3 Ultra 550B A55B, NVIDIA'nın en büyük açık ağırlıklı Nemotron modelidir: 550 milyar parametresinin token başına 55 milyarını çalıştıran seyrek bir Mixture-of-Experts mimarisi. Zor akıl yürütme, orkestrasyon, kodlama ajanları ve uzun soluklu kurumsal akışlar için tasarlanmıştır. nvidia/nemotron-3-ultra-550b-a55b-262k canonical model kimliği ile /v1/chat/completions üzerinden çağrılır.

ModelBağlamGiriş / Çıkış ($/1M)Cached giriş ($/1M)
nvidia/nemotron-3-ultra-550b-a55b-262k262.1440,50 / 2,200,10
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-ultra-550b-a55b-262k",
"messages": [
{ "role": "user", "content": "Bir dağıtık kuyruk tasarımının artı ve eksilerini kısaca özetle." }
],
"max_tokens": 1024
}'

Ücretsiz Nemotron 3 Ultra ile karıştırmayın

Section titled “Ücretsiz Nemotron 3 Ultra ile karıştırmayın”

Katalogda aynı kontrol noktası adını taşıyan iki ayrı model vardır ve bunlar farklı ürünlerdir:

nvidia/nemotron-3-ultra-550b-a55bnvidia/nemotron-3-ultra-550b-a55b-262k
ÜcretÜcretsiz, günlük kotaÖlçümlü, tokene göre
Bağlam1.000.000262.144
Prompt cacheYokVar
DüşünmeVarsayılan kapalıVarsayılan açık, kapatılabilir

Kota dolduğunda ücretsiz satır istekleri sınırlar; bu sayfadaki ölçümlü satır o kotadan etkilenmez ve tersi de geçerlidir.

Bu modelde adım adım düşünme varsayılan olarak açıktır. Hiçbir parametre göndermeseniz bile yanıt message.reasoning_content alanında ayrı bir düşünme izi taşır ve bu tokenlar completion_tokens içinde sayılıp çıktı fiyatından faturalanır.

Pratik sonucu: kısa bir soru bile düşünme tokeni harcar. max_tokens değerini buna göre verin, aksi halde yanıt düşünme aşamasında kesilebilir.

Düşünmeyi kapatmak için isteğe reasoning: false ekleyin veya :fast suffix'ini kullanın:

{ "model": "nvidia/nemotron-3-ultra-550b-a55b-262k:fast", "messages": [{ "role": "user", "content": "137 çarpı 42 kaçtır?" }], "max_tokens": 256 }
// Veya istek gövdesinde reasoning alanı
{ "model": "nvidia/nemotron-3-ultra-550b-a55b-262k", "reasoning": false, "messages": [{ "role": "user", "content": "137 çarpı 42 kaçtır?" }], "max_tokens": 256 }

Düşünme kapatıldığında reasoning_content boş döner ve yanıt doğrudan sonucu verir.

reasoning_effort parametresi bu modelde desteklenmez. Kademeler ölçüldüğünde birbirine göre sıralanmadığı için gateway bu parametreyi 400 ile reddeder; var olmayan bir kademeyi kabul edip sessizce yok saymak yerine hatayı açıkça döndürür.

Tekrarlanan istem önekleri kendiliğinden önbelleğe alınır, ayrı bir parametre göndermeniz gerekmez. Önbellek 8.192 tokenlık tam bloklar halinde saklanır; artan kısım standart giriş fiyatından işlenir.

Aynı öneki ikinci kez gönderdiğinizde yanıtın usage alanı isabet eden token sayısını bildirir:

{
"usage": {
"prompt_tokens": 52275,
"completion_tokens": 32,
"prompt_tokens_details": { "cached_tokens": 49152 }
}
}

Bu örnekte 49.152 token (tam altı blok) indirimli cached giriş fiyatından, kalan 3.123 token standart giriş fiyatından faturalanır. Önbellekten yararlanmak için değişmeyen içeriği (sistem istemi, doküman gövdesi, örnekler) istemin başına koyun; ilk farklı token'dan sonrası önbelleğe girmez.

Araç çağrısı yereldir. tool_choice alanında auto ve required doğru çalışır; dönen tool_calls argümanları geçerli JSON'dur. Ayrıntı için Araç Çağrısı sayfasına bakın.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "nvidia/nemotron-3-ultra-550b-a55b-262k",
"messages": [{ "role": "user", "content": "İstanbulda hava nasıl?" }],
"tools": [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Bir şehrin güncel hava durumunu getirir",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
}],
"tool_choice": "auto"
}'

Belirli bir fonksiyonu ada göre zorlamak ("tool_choice": { "type": "function", "function": { "name": "..." } }) bu dağıtımda bir kısıt olarak işlemez ve sessizce başarısız olur: istek 200 döner, ancak model istediğiniz aracı değil prompt'a uyan aracı çağırır.

Ölçüm (2026-08-19), iki araçlı bir listede:

İstenen adSoruÇağrılan araç
get_timehava durumuget_weather (3/3)
get_weathersaatget_time (2/2)

Ad yine de doğrulanır: tools listesinde bulunmayan bir ad gönderirseniz 422 alırsınız. Yani parametre okunur, sonra kısıt olarak göz ardı edilir.

Adlandırılmış seçim yalnızca istediğiniz araç modelin zaten seçeceği araçla çakıştığında doğru görünür. Bu yüzden bu modelde adlandırılmış seçime güvenmeyin; akışınızı auto veya required üzerine kurun, tek bir aracın çağrılması şartsa tools listesini o tek araca indirin.

response_format alanı hem json_object hem json_schema biçimini kabul eder:

{
"response_format": {
"type": "json_schema",
"json_schema": {
"name": "person",
"strict": true,
"schema": {
"type": "object",
"properties": {
"name": { "type": "string" },
"age": { "type": "integer" }
},
"required": ["name", "age"],
"additionalProperties": false
}
}
}
}

json_object modunda modelin nesne döndürmesini istiyorsanız sistem isteminde bunu açıkça belirtin; aksi halde düşünme adımlarını geçerli ama beklediğinizden farklı bir JSON yapısı olarak döndürebilir.

  • Bağlam penceresi 262.144 token. Ürün sayfasındaki "1M bağlam" ifadesi kontrol noktasının mimari üst sınırıdır; bu dağıtım 262.144 tokenın üzerindeki istekleri reddeder.
  • Ayrı bir çıktı tavanı yoktur. max_tokens için bağlam penceresi dışında bir sınır uygulanmaz.
  • Adlandırılmış tool_choice uygulanmaz. Yukarıdaki bölüme bakın.
  • Görsel, ses ve video girdisi desteklenmez. Model yalnızca metin kabul eder ve yalnızca metin üretir.
  • reasoning_effort desteklenmez.