{"version":"mdrss-catalog-feed/2","domain":{"slug":"multimodal","label":"Multimodal","description":"Vision, speech, audio, games, media generation, robotics, embodied AI, and creative production.","categories":["vision-and-media","speech-and-audio","audio-and-music","games-and-creative-coding","image-video-and-creative-ai","multimodal-models-and-fusion","image-generation","video-generation","3d-and-spatial-computing","audio-understanding","speech-synthesis","multimodal-agents","robotics-and-embodied-ai","creative-production","multimodal-evaluation"]},"total":7,"page":1,"page_size":50,"total_pages":1,"has_next":false,"has_previous":false,"filters":{"domain":"multimodal","category":"image-video-and-creative-ai"},"feeds":[{"slug":"health-medicine-and-psychology","url":"https://mdrss.com/s/health-medicine-and-psychology"},{"slug":"lifestyle-culture-and-hobbies","url":"https://mdrss.com/s/lifestyle-culture-and-hobbies"}],"urls":{"html":"https://mdrss.com/catalog/multimodal?category=image-video-and-creative-ai","rss":"https://mdrss.com/catalog/multimodal/rss.xml?category=image-video-and-creative-ai","json":"https://mdrss.com/catalog/multimodal/feed.json?category=image-video-and-creative-ai","markdown":"https://mdrss.com/catalog/multimodal/index.md?category=image-video-and-creative-ai"},"updated_at":"2026-08-04T13:54:51.641Z","items":[{"id":901235,"title":"Code Explanation and Analysis","annotation":"You are a code education expert specializing in explaining complex code through clear narratives, visual diagrams, and step-by-step breakdowns. Transform difficult concepts into understandable explanations for developers at all levels. Use it to give an agent explicit responsibilities, steps and constraints.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"guide","version":1,"snapshot_at":"2026-08-04T13:48:23.601Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235","permalink_url":"https://mdrss.com/m/901235","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/901235.md","file_url":"https://mdrss.com/api/v1/cards/901235/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/embed","edit_url":"https://mdrss.com/cards/901235/edit","legacy_url":"https://mdrss.com/s/multimodal/code-explanation-and-analysis-collider-51c6014c751f"},{"id":901115,"title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","annotation":"A curated reference on image, video & creative ai centered on DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data. Use it to navigate the topic and choose relevant methods, papers or tools.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"reference","version":1,"snapshot_at":"2026-08-04T13:48:05.624Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115","permalink_url":"https://mdrss.com/m/901115","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/901115.md","file_url":"https://mdrss.com/api/v1/cards/901115/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/embed","edit_url":"https://mdrss.com/cards/901115/edit","legacy_url":"https://mdrss.com/s/multimodal/dreamsim-learning-new-dimensions-of-human-visual-similarity-using-synt-collider-2644595ceec1"},{"id":901112,"title":"Awesome Video Diffusion","annotation":"A curated list of recent diffusion models for video generation, editing, restoration, understanding, nerf, etc. Use it to navigate the topic and choose relevant methods, papers or tools.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"reference","version":1,"snapshot_at":"2026-08-04T13:48:05.624Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112","permalink_url":"https://mdrss.com/m/901112","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/901112.md","file_url":"https://mdrss.com/api/v1/cards/901112/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/embed","edit_url":"https://mdrss.com/cards/901112/edit","legacy_url":"https://mdrss.com/s/multimodal/awesome-video-diffusion-collider-5bd7542cbfc2"},{"id":901027,"title":"Highlights","annotation":"14B Real-Time Long Video Generation Model can be Cheaper, Faster but Keep Stronger than 1.3B ones ⭐. Use it to navigate the topic and choose relevant methods, papers or tools.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"reference","version":1,"snapshot_at":"2026-08-04T13:47:57.776Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027","permalink_url":"https://mdrss.com/m/901027","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/901027.md","file_url":"https://mdrss.com/api/v1/cards/901027/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/embed","edit_url":"https://mdrss.com/cards/901027/edit","legacy_url":"https://mdrss.com/s/multimodal/highlights-collider-9a285aa6badd"},{"id":901013,"title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","annotation":"Jinbo Xing, Menghan Xia, Yong Zhang, Haoxin Chen, Wangbo Yu, Hanyuan Liu, Gongye Liu, Xintao Wang, Ying Shan, Tien-Tsin Wong From CUHK and Tencent AI Lab. Use it to navigate the topic and choose relevant methods, papers or tools.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"reference","version":1,"snapshot_at":"2026-08-04T13:47:57.776Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013","permalink_url":"https://mdrss.com/m/901013","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/901013.md","file_url":"https://mdrss.com/api/v1/cards/901013/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/embed","edit_url":"https://mdrss.com/cards/901013/edit","legacy_url":"https://mdrss.com/s/multimodal/dynamicrafter-animating-open-domain-images-with-video-diffusion-priors-collider-a26cfc12f1dd"},{"id":901006,"title":"A Survey on Video Diffusion Models","annotation":"Zhen Xing, Qijun Feng, Haoran Chen, Qi Dai, Han Hu, Hang Xu, Zuxuan Wu, Yu-Gang Jiang. Use it to navigate the topic and choose relevant methods, papers or tools.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"reference","version":1,"snapshot_at":"2026-08-04T13:47:57.776Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006","permalink_url":"https://mdrss.com/m/901006","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/901006.md","file_url":"https://mdrss.com/api/v1/cards/901006/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/embed","edit_url":"https://mdrss.com/cards/901006/edit","legacy_url":"https://mdrss.com/s/multimodal/a-survey-on-video-diffusion-models-collider-bef0ac2f349c"},{"id":901003,"title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","annotation":"VideoCrafter is an open-source video generation and editing toolbox for crafting video content. It currently includes the Text2Video and Image2Video models:. Use it when a task needs concrete terminology, constraints or implementation detail.","feed":"multimodal","semantic_path":"multimodal:image-video-and-creative-ai","content_type":"reference","version":1,"snapshot_at":"2026-08-04T13:47:30.961Z","publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003","permalink_url":"https://mdrss.com/m/901003","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/901003.md","file_url":"https://mdrss.com/api/v1/cards/901003/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/embed","edit_url":"https://mdrss.com/cards/901003/edit","legacy_url":"https://mdrss.com/s/multimodal/videocrafter2-overcoming-data-limitations-for-high-quality-video-diffu-collider-5d4e724ba664"}]}