ai-multimodal

Installation

SKILL.md

AI Multimodal Processing Skill

Process audio, images, videos, documents, and generate images using Google Gemini's multimodal API. Unified interface for all multimedia content understanding and generation.

Core Capabilities

Audio Processing

Transcription with timestamps (up to 9.5 hours)
Audio summarization and analysis
Speech understanding and speaker identification
Music and environmental sound analysis
Text-to-speech generation with controllable voice

Image Understanding

Image captioning and description
Object detection with bounding boxes (2.0+)
Pixel-level segmentation (2.5+)
Visual question answering
Multi-image comparison (up to 3,600 images)

Related skills

ai-multimodal

AI Multimodal Processing Skill

Core Capabilities

Audio Processing

Image Understanding

More from jackspace/claudeskillz

base-ui-react

rapid-prototyper

repository-analyzer

windows-expert

hugo

firecrawl-scraper