multimodal-llm

Installation
SKILL.md

Multimodal LLM Patterns

Integrate vision, audio, and video generation capabilities from leading multimodal models. Covers image analysis, document understanding, real-time voice agents, speech-to-text, text-to-speech, and AI video generation (Kling v3, Sora 2, Veo 3.1 std/lite/fast tiers, Runway Gen-4.5 via gen4_turbo).

Canonical model IDs (Google IDs checked against ai.google.dev/gemini-api/docs/models on 2026-09-23):

Provider Model IDs
Anthropic claude-opus-5-5 (recommended, the default Opus since CC 2.1.280, same 2,576 px budget as Opus 5), claude-opus-5, claude-opus-4-8, claude-opus-4-7, claude-opus-4-6, claude-sonnet-4-6, claude-haiku-4-5-20251001. claude-fable-5 is Anthropic's frontier tier above Opus (GA 2026-07). Premium cost — never auto-pin it; the fable-spend-consent gate requires explicit user consent before any Fable spend
OpenAI gpt-5.5 (current flagship)
Google gemini-3.1-pro-preview (flagship), gemini-3.1-flash-lite (cost)
Veo veo-3.1-generate-preview / veo-3.1-lite-generate-preview / veo-3.1-fast-generate-preview
Kling kling-v3 (model_name field in Kling API)
Runway gen4_turbo (product label: Gen-4.5)

Quick Reference

Installs
234
GitHub Stars
284
First Seen
Feb 14, 2026
multimodal-llm — yonatangross/orchestkit