İçeriğe geç

LLMTR Muse Glimmer 30B (Türkiye)

Muse Glimmer 30B, Meta'nın Apache 2.0 lisansıyla yayınladığı açık ağırlıklı modelin Türkiye'de barındırdığımız sürümüdür. llmtr/muse-glimmer-30b-tr canonical model kimliği ile /v1/chat/completions üzerinden çağrılır. Verilerin Türkiye'de işlenmesi gereken ajan akışları, araç kullanan iş akışları ve akıl yürütme gerektiren görevler için uygundur.

ÖzellikDeğer
Model kimliğillmtr/muse-glimmer-30b-tr
Bağlam penceresi131.072 token (128K)
Fiyat (input / output / cache read)2.00 / 5.00 / 0.50 $ per 1M token
Görsel girdiVar (yalnızca base64 data URL)
Araç çağırmaVar
Prompt cacheVar
Düşünme (reasoning)Var, her zaman açık — kapatılamaz
Ses / video girdisiYok
Görsel üretimiYok
Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "llmtr/muse-glimmer-30b-tr",
"messages": [
{ "role": "user", "content": "Bu kod parcasindaki hatayi bul." }
],
"max_tokens": 2048
}'

Model yanıt vermeden önce adım adım düşünür ve bu düşünme message.reasoning_content alanında size döner. Bu davranış kapatılamaz; :fast gibi bir seçici yoktur.

Düşünme tokenları max_tokens bütçenizden harcanır ve çıktı olarak faturalanır. Kısa bir cevap beklediğinizde bile bütçenin bir kısmının düşünmeye gideceğini hesaba katın; çok küçük bir max_tokens değerinde bütçe düşünmede tükenir ve content boş dönebilir.

Model görselleri okur, ancak görseli yalnızca base64 data URL olarak kabul eder. Uzak bir https:// adresi gönderirseniz istek 400 unsupported_input döner.

{
"model": "llmtr/muse-glimmer-30b-tr",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu gorselde ne var?" },
{
"type": "image_url",
"image_url": { "url": "data:image/png;base64,iVBORw0KGgo..." }
}
]
}
],
"max_tokens": 2048
}

Görsel tokenları normal input tokenı olarak faturalanır; ayrı bir görsel tarifesi yoktur.

Model standart OpenAI tools şemasını destekler ve gerçek tool_calls döndürür:

{
"choices": [
{
"message": {
"role": "assistant",
"content": "",
"tool_calls": [
{
"id": "call_1",
"type": "function",
"function": { "name": "get_weather", "arguments": "{\"city\":\"Ankara\"}" }
}
]
},
"finish_reason": "tool_calls"
}
]
}

Çok adımlı akışlarda assistant mesajını tool_calls ve reasoning_content alanlarıyla birlikte geçmişe ekleyin.

Tekrar eden istem başlangıçları önbellekten karşılanır. Önbellekten gelen tokenlar prompt_tokens_details.cached_tokens alanında raporlanır ve input yerine cache read tarifesinden faturalanır:

"usage": {
"prompt_tokens": 1096,
"completion_tokens": 12,
"prompt_tokens_details": { "cached_tokens": 1080 }
}

Bu örnekte 1080 token 0.50 $/1M, kalan 16 token 2.00 $/1M üzerinden ücretlendirilir. Önbellek isabeti aynı zamanda gecikmeyi belirgin şekilde düşürür.

Kısa bir süre içinde birebir aynı istek gövdesi tekrarlandığında önceki yanıt aynen dönebilir. Bu durumda yanıt neredeyse anında gelir ancak içerik değişmez — temperature değeri yüksek olsa bile.

Her çağrıda farklı bir yanıt bekliyorsanız istek gövdesine değişen bir öğe ekleyin. Tekrarlanan yanıtlar da normal tarifeden faturalanır.

Katalogda aynı model ailesinden iki satır bulunur. Bu sayfadaki satır Türkiye'de barındırılır ve llmtr/muse-glimmer-30b-tr kimliğiyle çağrılır. Diğer satır için Meta Muse Glimmer sayfasına bakın.

İki kimlik birbirinin yerine geçmez; entegrasyonunuzda hangisini kullandığınızı açıkça belirtin.