Fiyat ve benchmark · 2026-08-28
Muse Spark 1.2 Contributor maliyeti: cache ve reasoning hesabı
Muse Spark 1.2 Contributor maliyetini gerçek usage alanlarından hesaplayın; cache okumasını ayırın, reasoning tokenlarını iki kez ücretlendirmeyin.
Maliyet hangi üç kalemden oluşur?
Muse Spark 1.2 Contributor maliyeti, cache dışındaki giriş tokenları, önbellekten okunan giriş ve reasoning’i içeren toplam çıktı üzerinden hesaplanır. Görünen yanıtı saymak eksik, cache tokenlarını tam girişe ayrıca eklemek fazla tutar üretir.
28 Ağustos 2026 kontrolünde Meta’nın model ve fiyat belgeleri oturum istedi; güncel sayısal tarife bağımsız doğrulanamadı. Bu rehber oran uydurmaz. Hesaba başlamadan Contributor için geçerli giriş, cache okuma ve çıktı fiyatlarını USD/1M token birimiyle doğrulayın; tarihini kaydedin.
Contributor uyarısı: Bu katmanda istem ve yanıtların Meta model eğitiminde kullanılmasına izin verilir. Gizli, kişisel veya müşteri verisi göndermeyin. Aşağıdaki örnek yalnızca genel bir soru kullanır.
Usage alanlarını birbirine eklemeyin
P toplam giriş, C bunun cache’ten okunan bölümü, O toplam çıktı olsun. Hesap: ((P − C) × giriş fiyatı + C × cache okuma fiyatı + O × çıktı fiyatı) / 1.000.000.
C, P’nin içindedir; ayrıca normal giriş olarak ücretlendirilmez. R de O’nun içindedir; O + R kullanmak reasoning’i iki kez sayar. Token toplamını tek bir fiyatla çarpmak, farklı birim tarifeleri birbirine karıştırır.
| Alan | Sembol | Hesaptaki rolü |
|---|---|---|
| prompt_tokens | P | Cache dahil toplam giriş |
| prompt_tokens_details.cached_tokens | C | P’den ayrılan cache okuması |
| completion_tokens | O | Reasoning dahil toplam çıktı |
| completion_tokens_details.reasoning_tokens | R | Çıktının alt kırılımı; ek ücret kalemi değil |
Cache için önce isabetsiz bütçe kurun
Aynı öneki yeniden göndermek cache isabetini garanti etmez. Sabit talimatları başta, değişen soruyu sonda tutmak tekrar kullanılabilecek bir önek oluşturur; indirim kararını yine yanıttaki gerçek C değeri verir.
Planlamada C = 0 senaryosunu ayrıca hesaplayın. Sabit P ve O için olası tasarruf C × (giriş fiyatı − cache fiyatı) / 1.000.000 olur. Bu bir hesaplama ilişkisidir, ölçülmüş tasarruf iddiası değildir. Trafik büyümeden önce küçük, hassas veri içermeyen bir değerlendirmede gerçekleşen cache oranını inceleyin.
Reasoning için görünen yanıtı saymayın
LLMTR’nin Muse Spark rehberine göre reasoning tokenları completion_tokens içinde döner. Kısa bir sonuç, düşük çıktı tüketimi anlamına gelmez. reasoning_effort seçimini değiştirirken hem O değerini hem görevin doğru tamamlanıp tamamlanmadığını karşılaştırın.
max_tokens çok küçükse bütçe düşünme sırasında tükenebilir; görünen içerik boş, finish_reason değeri length olabilir. Bu durumda boş metni ücretsiz sonuç sanmayın. Sürekli aynı isteği yeniden göndermek yerine bütçeyi ve eforu birlikte değerlendirin. Düşük eforun her görevde daha ucuz veya yeterli olacağını varsaymayın.
Python ile tek yanıtın kullanımını hesaplayın
LLMTR_BASE_URL değişkenini /v1 dahil tam API tabanı, LLMTR_API_KEY değişkenini LLMTR anahtarınız olarak ayarlayın. Üç MUSE fiyat değişkenini doğruladığınız Contributor tarifeleriyle doldurun; bunlar örneğin hesaplama girdileridir.
Kod çalıştırıldığında POST /v1/chat/completions üzerinden tek ücretli istek gönderir. Bu yazı için canlı çağrı yapılmadı. Örnek, kullanım alanı eksikse durur; eksik cache sayısını sıfır diye uydurmaz. Yalnızca hesaplanan tutarı ve bitiş nedenini yazdırır, istem veya yanıt içeriğini loglamaz.
Doğrulanmış birim fiyatlarla kullanım hesabı; örnek çıktı üretilmemiştir
import json
import os
from decimal import Decimal
from urllib.request import Request, urlopen
names = (
"MUSE_INPUT_USD_PER_1M",
"MUSE_CACHE_USD_PER_1M",
"MUSE_OUTPUT_USD_PER_1M",
)
pi, pc, po = (Decimal(os.environ[name]) for name in names)
if any(not rate.is_finite() or rate < 0 for rate in (pi, pc, po)):
raise ValueError("Invalid rate")
payload = {
"model": "meta/muse-spark-1.2-contributor",
"messages": [{"role": "user", "content": "Explain binary search."}],
"reasoning_effort": "low",
"max_tokens": 4096,
"stream": False,
}
request = Request(
os.environ["LLMTR_BASE_URL"].rstrip("/") + "/chat/completions",
data=json.dumps(payload).encode("utf-8"),
headers={
"Authorization": "Bearer " + os.environ["LLMTR_API_KEY"],
"Content-Type": "application/json",
},
method="POST",
)
with urlopen(request, timeout=90) as response:
result = json.load(response)
usage = result["usage"]
p = usage["prompt_tokens"]
c = usage["prompt_tokens_details"]["cached_tokens"]
o = usage["completion_tokens"]
if any(type(n) is not int or n < 0 for n in (p, c, o)) or c > p:
raise ValueError("Inconsistent usage")
cost = (Decimal(p - c) * pi + Decimal(c) * pc + Decimal(o) * po)
cost /= Decimal(1_000_000)
print(json.dumps({
"estimated_usd": str(cost),
"finish_reason": result["choices"][0]["finish_reason"],
}))
Başarılı iş başına maliyeti izleyin
Hesaplanan tutar, seçtiğiniz tarifenin kullanım değerlerine uygulanmasıdır; tek başına fatura doğrulaması değildir. Aynı tarih ve model için LLMTR kullanım kaydıyla karşılaştırın. Model token fiyatına platform marjı eklemeyin; kredi yükleme maliyetini ayrı değerlendirin.
Bir iş birden fazla çağrı gerektiriyorsa yalnızca son yanıtı saymayın. Ölçüm dönemindeki ilgili tüm çağrı maliyetlerini toplayıp kabul ölçütünüzü geçen iş sayısına bölün. Böylece ucuz görünen fakat çok tekrar gerektiren bir ayar saklanmaz.
- Model kimliği, tarife tarihi, token kırılımı ve bitiş nedenini kaydedin.
- Kesilen yanıtları ve yeniden denemeleri sonuç değerlendirmesinden çıkarmayın.
- İstemleri, yanıtları ve müşteri içeriğini maliyet günlüklerine koymayın.
Sık sorulan sorular
Contributor için güncel dolar fiyatı neden verilmedi?
Meta’nın ilgili resmi sayfası 28 Ağustos 2026’da oturum istedi. Eski bir katalog rakamını güncel resmi tarife diye sunmamak için hesap, sizin doğruladığınız oranları kullanıyor.
Cache tokenlarını prompt_tokens üzerine eklemeli miyim?
Hayır. Bunlar toplam girişin içindedir. C miktarını normal girişten ayırın ve yalnızca cache okuma fiyatını uygulayın.
Reasoning için ayrıca çıktı ücreti eklenir mi?
Hayır. Bu modelde reasoning, completion_tokens toplamına dahildir. reasoning_tokens alanını maliyetin neden arttığını anlamak için inceleyin; toplama yeniden eklemeyin.
Boş yanıtın maliyeti sıfır mıdır?
Bunu boş metinden çıkaramazsınız. Gerçek usage alanlarını ve finish_reason değerini kontrol edin; düşünme tokenları üretilmiş olabilir.