İçeriğe geç

Agnes AI

Agnes AI'nin metin modelleri LLMTR üzerinde /v1/chat/completions ile çağrılır. İki satır sunulur ve ikisi de şu anda ücretsizdir.

ModelBağlamMaksimum çıktıGiriş / Cache okuma / Çıkış ($/1M)
agnes/agnes-2.5-flash524.28865.5360 / 0 / 0
agnes/agnes-3.0-flash524.28865.5360 / 0 / 0

Agnes 2.5 Flash, sohbet, kodlama ve ajan akışları için genel amaçlı modeldir. Varsayılan olarak düşünür ve prompt cache okuması yapar.

Agnes 3.0 Flash, ajan tabanlı kodlama ve araç kullanımı için geliştirilen yeni nesil modeldir. Varsayılan olarak düşünmez.

İkisi de metnin yanında görsel ve video girdisi kabul eder, araç çağrısı ve şema zorlamalı JSON çıktısı destekler, akış (streaming) verir.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "agnes/agnes-3.0-flash",
"messages": [
{ "role": "user", "content": "Bu fonksiyondaki hatayı bul." }
],
"max_tokens": 8192
}'

İki satırın varsayılanı farklıdır ve bu, aynı aileden olmalarına rağmen ölçülmüş bir farktır:

agnes/agnes-2.5-flash -> düşünme AÇIK (varsayılan)
agnes/agnes-3.0-flash -> düşünme KAPALI (varsayılan)

Düşünme bu iki satırda açık/kapalı bir anahtardır, seviye ölçeği değildir. Model kimliğine eklenen sonekle denetlenir:

agnes/agnes-2.5-flash:fast -> düşünme kapalı
agnes/agnes-2.5-flash:think -> düşünme açık
agnes/agnes-3.0-flash:think -> düşünme açık
agnes/agnes-3.0-flash:fast -> düşünme kapalı

Gövdede reasoning alanıyla da aynı şey yapılabilir:

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "agnes/agnes-2.5-flash",
"messages": [
{ "role": "user", "content": "2+2 kaç eder? Sadece sayı yaz." }
],
"reasoning": false,
"max_tokens": 256
}'

reasoning_effort alanı bu satırlarda desteklenmez; low, medium, high gibi seviyeler 400 ile reddedilir. Sebebi ölçümdür: sağlayıcı bu adları kabul etse de seviyeler arasında ölçülebilir bir derinlik farkı çıkmadı, ayrışan tek şey açık ile kapalı arasındaki farktı. Çalışmayan bir denetimi arayüze koymak, kullanıcıyı azalttığını sandığı düşünme token'ları için faturalandırmak olurdu.

Düşünme açıkken üretilen gizli akıl yürütme token'ları çıktı olarak sayılır.

İki satır da görsel kabul eder. Görseller base64 data URL olarak gönderilmelidir:

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "agnes/agnes-2.5-flash",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu görselde ne var?" },
{
"type": "image_url",
"image_url": { "url": "data:image/png;base64,iVBORw0KGgo..." }
}
]
}
],
"max_tokens": 1024
}'

Uzak bir adres (https://...) veren istekler kabul edilmez: bu sağlayıcının sunucusu dış adreslere erişemiyor. LLMTR bu durumu isteği göndermeden önce yakalar ve Model accepts image input only as base64 image data URLs hatası döndürür; böylece sağlayıcıdan gelen anlamsız bir sunucu hatası yerine ne yapmanız gerektiğini söyleyen bir yanıt alırsınız.

İki satır da video kabul eder. Video da base64 data URL olarak, video_url parça tipiyle gönderilir:

{
"role": "user",
"content": [
{ "type": "text", "text": "Bu videoda hangi renkler, hangi sırayla görünüyor?" },
{
"type": "video_url",
"video_url": { "url": "data:video/mp4;base64,AAAAIGZ0eXBpc29t..." }
}
]
}

Model klibi gerçekten çözümler: sıralı renk geçişleri içeren test kliplerinde renk sırasını doğru bildirdi.

tool_choice alanının auto, required ve adlandırılmış fonksiyon biçimlerinin üçü de iki satırda çalışır; akış (streaming) üzerinde de aynı şekilde çalışır.

Terminal window
curl "$LLMTR_BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer llmtr-your_key" \
-H "Content-Type: application/json" \
-d '{
"model": "agnes/agnes-3.0-flash",
"messages": [
{ "role": "user", "content": "İstanbul hava durumu nedir?" }
],
"tools": [
{
"type": "function",
"function": {
"name": "get_weather",
"description": "Bir şehrin güncel hava durumunu getirir",
"parameters": {
"type": "object",
"properties": { "city": { "type": "string" } },
"required": ["city"]
}
}
}
],
"tool_choice": "required",
"max_tokens": 4096
}'

response_format alanının json_object ve json_schema biçimleri iki satırda da desteklenir.

Yalnızca agnes/agnes-2.5-flash prompt cache okuması bildirir. Tekrarlanan istem ön eklerinde usage.prompt_tokens_details.cached_tokens alanı dolu gelir.

agnes/agnes-3.0-flash bu alanı hiç döndürmez; bu satırda cache indirimi beklemeyin. İki satır da bugün ücretsiz olduğu için bu fark faturaya yansımaz, ancak kullanım kayıtlarında görünür.

Bağlam penceresi 524.288 token, tek yanıtın çıktı tavanı 65.536 token'dır. Tavanın üzerinde bir max_tokens değeri gönderirseniz istek reddedilir.

İki satır da ücretsiz sunulduğu için bir istek kotasına ve kısa pencereli bir istek sınırına tabidir.

Kota token değil istek sayar: her başarılı çağrı bir hak tüketir, kaç token harcadığınızdan bağımsız olarak. Bu yüzden :fast soneki gizli düşünme token'larını kaldırır ama kotadan düşen hak sayısını değiştirmez.

Pencere kayandır, gece yarısı sıfırlanmaz: harcadığınız her hak, kendi isteğinin üzerinden 24 saat geçtiğinde tek tek geri gelir. Kotaya takıldığınızda yeni günü beklemeniz gerekmez; yanıttaki Retry-After başlığı ilk hakkın ne zaman açılacağını söyler.

Kısa pencere sınırı Agnes satırlarının ikisi tarafından ortak kullanılır: bir satırda sınıra takıldığınızda diğeri de aynı süre boyunca sınırlıdır. Ölçümlü modelleriniz bu kotadan etkilenmez.