{"version":"mdrss-catalog-feed/2","domain":{"slug":"multimodal","label":"Multimodal","description":"Vision, speech, audio, games, media generation, robotics, embodied AI, and creative production.","categories":["vision-and-media","speech-and-audio","audio-and-music","games-and-creative-coding","image-video-and-creative-ai","multimodal-models-and-fusion","image-generation","video-generation","3d-and-spatial-computing","audio-understanding","speech-synthesis","multimodal-agents","robotics-and-embodied-ai","creative-production","multimodal-evaluation"]},"total":9,"page":1,"page_size":50,"total_pages":1,"has_next":false,"has_previous":false,"filters":{"domain":"multimodal","category":"vision-and-media"},"feeds":[{"slug":"health-medicine-and-psychology","url":"https://mdrss.com/s/health-medicine-and-psychology"},{"slug":"lifestyle-culture-and-hobbies","url":"https://mdrss.com/s/lifestyle-culture-and-hobbies"}],"urls":{"html":"https://mdrss.com/catalog/multimodal?category=vision-and-media","rss":"https://mdrss.com/catalog/multimodal/rss.xml?category=vision-and-media","json":"https://mdrss.com/catalog/multimodal/feed.json?category=vision-and-media","markdown":"https://mdrss.com/catalog/multimodal/index.md?category=vision-and-media"},"updated_at":"2026-08-04T12:22:38.168Z","items":[{"id":2057,"title":"Cosmos Tokenizer: A suite of image and video neural tokenizers","annotation":"As of February 10th, 2025, this repository is read-only. Please visit github.com/NVIDIA/Cosmos for the latest updates and support on Cosmos Tokenizer.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:51.210Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/2057","permalink_url":"https://mdrss.com/m/2057","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/2057/2057.md","file_url":"https://mdrss.com/api/v1/cards/2057/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/2057/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/2057/embed","edit_url":"https://mdrss.com/cards/2057/edit","legacy_url":"https://mdrss.com/s/multimodal/nvidia-cosmos-tokenizer-nvidia-cosmos-tokenizer-readme"},{"id":1706,"title":"Model properties","annotation":"USP : Unvoice and Silence with Pitch when infer 1. Install project dependencies Note: whisper is already built-in, do not install it again otherwise it will cuase conflict and error 3.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:51.210Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1706","permalink_url":"https://mdrss.com/m/1706","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1706/1706.md","file_url":"https://mdrss.com/api/v1/cards/1706/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1706/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1706/embed","edit_url":"https://mdrss.com/cards/1706/edit","legacy_url":"https://mdrss.com/s/multimodal/playvoice-whisper-vits-svc-playvoice-whisper-vits-svc-readme"},{"id":1370,"title":"text-extract-api","annotation":"Convert any image, PDF or Office document to Markdown text or JSON structured document with super-high accuracy, including tabular data, numbers or math formulas. The API is built with FastAPI and uses Celery for asynchronous task processing.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:52.437Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1370","permalink_url":"https://mdrss.com/m/1370","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1370/1370.md","file_url":"https://mdrss.com/api/v1/cards/1370/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1370/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1370/embed","edit_url":"https://mdrss.com/cards/1370/edit","legacy_url":"https://mdrss.com/s/multimodal/catchthetornado-text-extract-api-catchthetornado-text-extract-api-readme"},{"id":1369,"title":"PICK-PyTorch","annotation":"\\\\\\\\\\ Updated on Feb 6th, 2021: Train Ticket dataset is now available for academic research. You can download from Google Drive or OneDrive.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:52.437Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1369","permalink_url":"https://mdrss.com/m/1369","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1369/1369.md","file_url":"https://mdrss.com/api/v1/cards/1369/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1369/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1369/embed","edit_url":"https://mdrss.com/cards/1369/edit","legacy_url":"https://mdrss.com/s/multimodal/wenwenyu-pick-pytorch-wenwenyu-pick-pytorch-readme"},{"id":1345,"title":"MuseV English 中文","annotation":"MuseV was a milestone achieved around July 2023. Amazed by the progress of Sora, we decided to opensource MuseV, hopefully it will benefit the community.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:51.210Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1345","permalink_url":"https://mdrss.com/m/1345","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1345/1345.md","file_url":"https://mdrss.com/api/v1/cards/1345/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1345/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1345/embed","edit_url":"https://mdrss.com/cards/1345/edit","legacy_url":"https://mdrss.com/s/multimodal/tmelyralab-musev-tmelyralab-musev-readme"},{"id":1304,"title":"EasyAnimate | An End-to-End Solution for High-Resolution and Long Video Generation","annotation":"😊 EasyAnimate is an end-to-end solution for generating high-resolution and long videos. We can train transformer based diffusion generators, train VAEs for processing long videos, and preprocess metadata.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:52.437Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1304","permalink_url":"https://mdrss.com/m/1304","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1304/1304.md","file_url":"https://mdrss.com/api/v1/cards/1304/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1304/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1304/embed","edit_url":"https://mdrss.com/cards/1304/edit","legacy_url":"https://mdrss.com/s/multimodal/aigc-apps-easyanimate-aigc-apps-easyanimate-readme"},{"id":1255,"title":"TurboDiffusion","annotation":"This repository provides the official implementation of TurboDiffusion, a video generation acceleration framework that can speed up end-to-end diffusion generation by $100 \\sim 200\\times$ on a single RTX 5090, while maintaining video quality. TurboDiffusion primarily uses SageAttention, SLA (Sparse-Linear Attention) for attention acceleration, and rCM for timestep distillation.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:51.210Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1255","permalink_url":"https://mdrss.com/m/1255","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1255/1255.md","file_url":"https://mdrss.com/api/v1/cards/1255/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1255/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1255/embed","edit_url":"https://mdrss.com/cards/1255/edit","legacy_url":"https://mdrss.com/s/multimodal/thu-ml-turbodiffusion-thu-ml-turbodiffusion-readme"},{"id":1061,"title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","annotation":"ViewCrafter can generate high-fidelity novel views from a single or sparse reference image , while also supporting highly precise pose control. Below shows some examples: Reference image Camera trajecotry Generated novel view video Reference image 1 Reference image 2 Generated novel view video |Model|Resolution|Frames|GPU Mem.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:52.437Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1061","permalink_url":"https://mdrss.com/m/1061","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1061/1061.md","file_url":"https://mdrss.com/api/v1/cards/1061/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1061/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1061/embed","edit_url":"https://mdrss.com/cards/1061/edit","legacy_url":"https://mdrss.com/s/multimodal/drexubery-viewcrafter-drexubery-viewcrafter-readme"},{"id":1039,"title":"Generating the documentation","annotation":"To generate the documentation, you first have to build it. You don't have to commit the built documentation.","feed":"multimodal","semantic_path":"multimodal:vision-and-media","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:52.437Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/multimodal/vision-and-media/1039","permalink_url":"https://mdrss.com/m/1039","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1039/1039.md","file_url":"https://mdrss.com/api/v1/cards/1039/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1039/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1039/embed","edit_url":"https://mdrss.com/cards/1039/edit","legacy_url":"https://mdrss.com/s/multimodal/huggingface-diffusers-huggingface-diffusers-docs-readme"}]}