İçeriğe geç

Multimodal Genel Bakış

Destekleyen modellerde messages[].content alanını string yerine OpenAI uyumlu content-part listesi olarak gönderebilirsiniz. Platform şu anda şu part türlerini kabul eder:

text  image_url  input_audio 

input_file

Tek bir modelin modalitelerini model keşif ucundan okuyabilirsiniz; bu uç kimlik doğrulaması istemez:

Terminal window
curl -s https://llmtr.com/v1/models/google/gemini-3.6-flash | jq '.architecture'

Bir operasyonu (görsel üretim, embeddings, TTS, vb.) destekleyen tüm modelleri listelemek için katalog yanıtındaki supported_operations alanını süzün:

Terminal window
# Görsel üretebilen tüm modeller
curl -s https://llmtr.com/v1/models \
| jq -r '.data[] | select(.supported_operations[] == "IMAGES_GENERATIONS").id'
# Embedding modelleri
curl -s https://llmtr.com/v1/models \
| jq -r '.data[] | select(.supported_operations[] == "EMBEDDINGS").id'
# Text-to-speech modelleri
curl -s https://llmtr.com/v1/models \
| jq -r '.data[] | select(.supported_operations[] == "AUDIO_SPEECH").id'

Bir model yanlış endpoint'e gönderildiğinde dönen 400 unsupported_operation yanıtı error.details.supported_endpoints ve error.details.suggested_endpoint alanlarıyla doğru rotayı söyler. Bkz. Hatalar.

{
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Bu görselde ne var?" },
{
"type": "image_url",
"image_url": { "url": "https://..." }
}
]
}
]
}
  • Görsel ve ses verisi JSON gövdesi üzerinden iletilir. Uzak URL kullanmak base64 inline'a göre daha güvenlidir.
  • Inline base64 ses kliplerini kısa tutun (< 1 MB önerilir).
  • Büyük dosyalar, PDF, video ve reusable medya için Files API kullanın.