Model karşılaştırma · 2026-08-23
Tencent Hy3 nedir? 295B MoE modelin API ile kullanımı ve fiyatı
Tencent Hy3'ün 295B Mixture-of-Experts mimarisi, gerçek 192K bağlam sınırı, low/high düşünme modları, araç çağrısı davranışı ve 1M token fiyatları teknik ayrıntılarıyla açıklanıyor.
Tencent Hy3 nedir?
Tencent Hy3, 295 milyar parametreli bir Mixture-of-Experts (MoE) modelidir. MoE mimarisinin ayırt edici yanı şudur: parametrelerin tamamı her token için çalışmaz. Hy3'te token başına yaklaşık 21 milyar parametre etkinleşir. Pratik sonucu, 295 milyarlık bir modelin bilgi kapasitesini yaklaşık 21 milyarlık bir modelin çıkarım maliyetine yakın bir bütçeyle sunabilmesidir.
Model kod ajanları, uzun doküman analizi, çok turlu diyalog ve çok adımlı araç akışları için konumlandırılmıştır. Yalnızca metin kabul eder ve yalnızca metin üretir; görsel, ses veya video girdisi desteklenmez. Görsel işleme gerekiyorsa katalogdaki multimodal satırlara bakmanız gerekir.
- Toplam parametre: 295 milyar; token başına aktif: yaklaşık 21 milyar.
- Bağlam penceresi: 192K token (196.608) — duyurulan 256K değil, gerekçesi aşağıda.
- Araç çağrısı, JSON şeması ve prompt cache desteklenir.
- Düşünme varsayılan olarak kapalıdır; istek bazında açılır.
256K duyuruluyor, 192K yayınlıyoruz: aradaki fark neden önemli?
Hy3 kamuya 256K bağlam penceresiyle duyurulur. Ölçümde tek bir isteğin kabul ettiği en yüksek girdi 196.608 token, yani 192K çıkmaktadır. Bu sınırın üzerine çıktığınızda sağlayıcı bir hata döndürmez — istemin en eski kısmını sessizce düşürür ve kalanla yanıt üretir. Kaybı bildiren bir alan yoktur.
Bu davranış, uzun doküman işlerinde en tehlikeli hata sınıfıdır: sistem çalışır görünür, HTTP 200 döner, yanıt akıcıdır, ama modelin cevabı sizin gönderdiğiniz belgenin tamamına değil bir parçasına dayanır. Sözleşme analizi veya mevzuat karşılaştırması gibi işlerde bu, fark edilmesi güç bir doğruluk kaybıdır.
LLMTR bu nedenle modelin bağlam uzunluğunu katalogda 192K olarak yayınlar. Uzun dokümanları bu sınırın altında tutun ya da parçalara bölüp her parçayı ayrı istekte işleyin.
| Özellik | Değer | Not |
|---|---|---|
| Toplam parametre | 295 milyar | Mixture-of-Experts |
| Aktif parametre | Token başına yaklaşık 21 milyar | Çıkarım maliyetini belirleyen sayı |
| Bağlam penceresi | 192K token (196.608) | Duyurulan 256K; fazlası sessizce düşürülür |
| Giriş fiyatı | 1M token başına 0,14 USD | Standart girdi |
| Cache okuma | 1M token başına 0,035 USD | Tekrarlanan önek |
| Çıkış fiyatı | 1M token başına 0,58 USD | Düşünme tokenları dahil |
| Modalite | Yalnızca metin | Görsel ve ses girdisi yok |
Düşünme modları: kapalı, sığ ve derin
Hy3'te düşünme varsayılan olarak kapalıdır. Model kimliğini olduğu gibi çağırırsanız model doğrudan yanıt verir. Düşünmeyi açmak için model kimliğine sonek eklersiniz: iki nokta ve ardından low sığ, high derin düşünme demektir.
Ara seviyeler sunulmaz. Bazı modellerde bulunan minimal, medium veya xhigh kademeleri Hy3'te yoktur, çünkü ölçümde bunlar low ile high arasında ayrı bir davranış üretmiyor. Gerçek olan üç durum vardır: kapalı, sığ, derin.
Düşünme açıkken düşünce zinciri yanıtın içine karışmaz; reasoning_content alanında ayrı döner. Ancak faturalama açısından önemli olan nokta şudur: bu tokenlar completion_tokens içinde sayılır ve çıkış fiyatından faturalanır. Yani derin düşünmeyle çalıştırdığınız kısa bir soru, düşünme kapalıyken olacağından belirgin biçimde pahalı olabilir. max_tokens değerini buna göre verin.
Aynı soru üç düşünme durumunda: sonek dışında hiçbir şey değişmiyor
import os
from openai import OpenAI
client = OpenAI(
base_url="https://llmtr.com/v1",
api_key=os.environ["LLMTR_API_KEY"],
)
SORU = "Bu fonksiyonun zaman karmasikligi nedir ve neden?"
# Kapali: dogrudan yanit, dusunme tokeni harcanmaz.
# Sig: :low soneki
# Derin: :high soneki
for model_id in ["tencent/hy3", "tencent/hy3:low", "tencent/hy3:high"]:
yanit = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": SORU}],
max_tokens=2048,
)
mesaj = yanit.choices[0].message
# Dusunme zinciri yanittan ayri doner; kapali modda bu alan bos gelir.
dusunme = getattr(mesaj, "reasoning_content", None)
print(model_id, "->", yanit.usage.completion_tokens, "cikis tokeni")
if dusunme:
print(" dusunme uzunlugu:", len(dusunme))
Araç çağrısı ve JSON çıktısı: iki önemli kısıt
Hy3 araç ve fonksiyon çağrısını yerel olarak destekler, ancak iki noktada beklediğinizden farklı davranır ve ikisi de üretimde sorun çıkarabilir.
Birincisi tool_choice alanıdır. auto ve required değerleri çalışır: model sırasıyla uygun gördüğünde araç çağırır veya mutlaka bir araç çağırır. Ancak belirli bir fonksiyonu ada göre zorlamak bu sağlayıcıda güvenilir çalışmıyor — model istediğiniz aracı değil prompt'a uygun gördüğü aracı çağırabiliyor. Bu yüzden adlandırılmış seçimi bir kısıt olarak kullanmayın; akışınız yanlış aracın çağrılması ihtimalini kaldırabilmelidir.
İkincisi JSON çıktısıdır. Şema zorlamalı çıktı json_schema ile desteklenir ve çalışır. Buna karşılık json_object biçimi desteklenmez. OpenAI uyumlu istemcilerde sık kullanılan json_object kalıbını Hy3 ile kullanamazsınız; şemanızı json_schema olarak vermeniz gerekir. Bu aslında daha güçlü bir garantidir, çünkü yalnızca geçerli JSON değil, sizin tanımladığınız şemaya uyan JSON döner.
- tool_choice auto — model uygun gördüğünde araç çağırır. Çalışır.
- tool_choice required — model mutlaka bir araç çağırır. Çalışır.
- Ada göre zorlama — güvenilir değil, kısıt olarak kullanmayın.
- response_format json_schema — desteklenir, şemayı zorlar.
- response_format json_object — desteklenmez.
Fiyat ve prompt cache: maliyet nerede düşer?
Hy3'ün fiyatı 1 milyon token başına 0,14 USD giriş ve 0,58 USD çıkıştır. Tekrarlanan önekler prompt cache'ten okunduğunda giriş tarafı 0,035 USD'ye iner — yani standart girdinin dörtte birine. Bu, aynı sistem istemini veya aynı doküman başlığını defalarca gönderen akışlarda anlamlı bir fark yaratır.
Cache'in çalışması için isteklerin ortak bir öneki paylaşması gerekir. Değişken kısmı, yani kullanıcı sorusunu sona koyun; sabit kısmı, yani sistem istemini, araç tanımlarını ve referans dokümanı başa alın. Sırayı ters kurarsanız cache hiç tutmaz ve her istek tam fiyattan faturalanır.
LLMTR model fiyatlarına marj eklemez; platform marjı yalnızca kredi yüklemesinde geçerlidir. Yani yukarıdaki rakamlar sağlayıcı tarifesinin aynısıdır.
LLMTR üzerinden ilk istek
Hy3'e LLMTR üzerinden erişim, OpenAI uyumlu herhangi bir istemciyle çalışır. Taban adresi https://llmtr.com/v1 yapmanız ve model kimliği olarak tencent/hy3 vermeniz yeterlidir; istemci kodunuzun geri kalanı değişmez.
Model yurt dışındaki üçüncü taraf altyapı üzerinde çalışır. İstemler ve tamamlamalar sağlayıcı tarafından günlüğe kaydedilebilir; Türkiye'de barındırılan bir LLMTR modeli değildir. Kişisel veri içeren istemler için katalogdaki Türkiye'de barındırılan satırları değerlendirin.
curl ile tek istek: araç çağrısı ve şema zorlaması olmadan en yalın hâli
curl https://llmtr.com/v1/chat/completions \
-H "Authorization: Bearer $LLMTR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tencent/hy3",
"messages": [
{"role": "system", "content": "Kisa ve teknik yanit ver."},
{"role": "user", "content": "MoE mimarisinde aktif parametre ne demek?"}
],
"max_tokens": 512
}'
Sık sorulan sorular
Tencent Hy3'ün bağlam penceresi 256K mı 192K mı?
Model 256K ile duyurulur, ancak tek bir istek en fazla 196.608 token (192K) girdi kabul eder. Fazlasında sağlayıcı istemin en eski kısmını sessizce düşürür ve bunu bildirmez. LLMTR bu yüzden 192K yayınlar; uzun dokümanları bu sınırın altında tutun.
Hy3 görsel kabul ediyor mu?
Hayır. Hy3 yalnızca metin kabul eder ve yalnızca metin üretir. Görsel, ses veya video girdisi desteklenmez. Görsel anlama gerekiyorsa katalogdaki multimodal modellere bakın.
Hy3'te düşünme modunu nasıl açarım?
Model kimliğine sonek ekleyerek: tencent/hy3:low sığ, tencent/hy3:high derin düşünme açar. Sonek vermezseniz düşünme kapalıdır. Düşünme tokenları completion_tokens içinde sayılır ve çıkış fiyatından faturalanır.
Neden json_object biçimi çalışmıyor?
Hy3 json_object biçimini desteklemez; yalnızca json_schema desteklenir. Şemanızı json_schema olarak tanımlayın. Bu daha güçlü bir garantidir, çünkü çıktı yalnızca geçerli JSON değil tanımladığınız şemaya uygun olur.