Руководства
Мультимодальность
Vision — отправка изображений на вход модели через ZvenoAI API.
Эта страница — про приём изображений моделью (vision). Про генерацию изображений моделью — отдельное руководство:
Генерация изображений
modalities: ["image","text"], image_config.aspect_ratio, streaming, форматы ответа.
Генерация видео
Асинхронный API POST /v1/videos с опросом статуса, разрешениями и keyframes.
Vision (анализ изображений)
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Что на этом изображении?"},
{"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}}
]
}]
)const response = await client.chat.completions.create({
model: 'openai/gpt-4o',
messages: [{
role: 'user',
content: [
{ type: 'text', text: 'Что на этом изображении?' },
{ type: 'image_url', image_url: { url: 'https://example.com/image.jpg' } }
]
}]
})Поддерживаемые форматы: PNG, JPEG, GIF, WebP.
Модели с поддержкой vision
| Модель | Vision | Аудио |
|---|---|---|
openai/gpt-4o | Yes | Yes |
anthropic/claude-sonnet-4-20250514 | Yes | No |
google/gemini-2.5-pro | Yes | Yes |