{"model":{"id":"multimodal-omni","name":"Multimodal Omni","description":"Full multimodal model — accepts image, audio, and video input simultaneously with strong reasoning.","tasks":["vqa","caption","reasoning","multimodal"],"credits_per_call":4,"input_fields":{"image_url":"string (required)","prompt":"string (required)"},"output_fields":{"text":"string"},"api_gross_margin_percent":20,"schema_url":"/api/v1/vision?model_id=multimodal-omni","input_schema":{"$schema":"https://json-schema.org/draft/2020-12/schema","$id":"https://www.artemotion.ai/api/v1/vision?model_id=multimodal-omni","title":"Multimodal Omni request","type":"object","properties":{"model_id":{"type":"string","const":"multimodal-omni"},"webhook_url":{"type":"string","format":"uri","maxLength":2048},"webhook_secret":{"type":"string","maxLength":512},"image_url":{"type":"string","format":"uri"},"prompt":{"type":"string"},"question":{"type":"string"}},"required":["model_id","image_url"],"anyOf":[{"required":["prompt"]},{"required":["question"]}],"additionalProperties":false}},"version":"1","rate_limit":"20 req/min"}