Inception Labs / inception/mercury-2

Mercury 2 - LLMTR üzerinden erişim

Mercury 2, Inception Labs'in difüzyon tabanlı dil modelidir (dLLM). Token'ları tek tek sırayla üretmek yerine birden fazla token'ı paralel üretip adım adım netleştirir; bu yaklaşım aynı sınıftaki modellere göre belirgin biçimde düşük gecikme sağlar ve modeli gerçek zamanlı sohbet, sesli akış ve yüksek hacimli otomasyon gibi hız duyarlı işler için uygun kılar. 128.000 token bağlam penceresi sunar ve tek yanıt en fazla 50.000 token olabilir. Araç/fonksiyon çağrısını destekler (sıralı; paralel çağrı henüz yoktur) ve `response_format` ile şema zorlamalı JSON çıktısı üretir. Tekrarlanan istem ön eklerinde prompt cache okuması yapılır ve cache'ten okunan giriş token'ları normal giriş fiyatının onda birine faturalanır. Yalnızca metin kabul eder; görsel ve ses girdisi yoktur. Model varsayılan olarak akıl yürütür ve akıl yürütme token'ları çıktı olarak faturalanır; dört seviye `:minimal`, `:low`, `:medium` ve `:high` sonekleriyle seçilir, varsayılan `medium`'dur. Gecikmenin en düşük olması gereken işlerde `:minimal` seviyesini kullanın.

Teknik özellikler

Canonical IDinception/mercury-2
SağlayıcıInception Labs
Context penceresi128.000 tokens
OperasyonlarCHAT_COMPLETIONS
Modalitelertext

Fiyatlandırma

Kredi yüklemede %8 platform marjı uygulanır; model kullanım fiyatları ayrıca yükseltilmez.

OperationMetricUnitPrice
CHAT_COMPLETIONSINPUT_TEXTPER_1M_TOKENS$0.250000
CHAT_COMPLETIONSCACHE_READPER_1M_TOKENS$0.025000
CHAT_COMPLETIONSOUTPUT_TEXTPER_1M_TOKENS$0.750000

Örnek kullanım

Mevcut OpenAI SDK akışında yalnızca base URL ve model kimliğini değiştirirsiniz.

curl https://llmtr.com/v1/chat/completions \
  -H "Authorization: Bearer llmtr-your_key" \
  -H "Content-Type: application/json" \
  -d '{"model":"inception/mercury-2","messages":[{"role":"user","content":"Hello"}]}'

İlgili modeller