{"version":"mdrss-hashtag-feed/1","tag":"multimodal","urls":{"html":"https://mdrss.com/feeds/multimodal","rss":"https://mdrss.com/feeds/multimodal/rss.xml","json":"https://mdrss.com/feeds/multimodal/feed.json","markdown":"https://mdrss.com/feeds/multimodal/index.md"},"updated_at":"2026-08-04T13:54:51.641Z","items":[{"schema":"mdrss.card-summary/v1","id":901314,"version":1,"title":"unity-ecs-patterns — detailed patterns and worked examples","annotation":"unity-ecs-patterns — detailed patterns and worked examples captures reusable agent playbook guidance for games & creative coding. Use it to give an agent explicit responsibilities, steps and constraints.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"games-and-creative-coding","content_type":"guide","tags":["creative-computing-media","games-creative-coding","pattern","patterns","unity-ecs-patterns","detailed","worked","games","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:41.831Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/games-and-creative-coding/901314","permalink_url":"https://mdrss.com/m/901314","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/games-and-creative-coding/901314/901314.md","file_url":"https://mdrss.com/api/v1/cards/901314/file","raw_url":"https://mdrss.com/multimodal/games-and-creative-coding/901314/raw","embed_url":"https://mdrss.com/multimodal/games-and-creative-coding/901314/embed","edit_url":"https://mdrss.com/cards/901314/edit","legacy_url":"https://mdrss.com/s/multimodal/unity-ecs-patterns-detailed-patterns-and-worked-examples-collider-5a77d3b85074"}},{"schema":"mdrss.card-summary/v1","id":901313,"version":1,"title":"godot-gdscript-patterns — detailed patterns and worked examples","annotation":"For advanced Godot patterns, performance tips, and best practices, see references/advanced-patterns.md:. Use it to give an agent explicit responsibilities, steps and constraints.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"games-and-creative-coding","content_type":"guide","tags":["creative-computing-media","games-creative-coding","pattern","patterns","godot-gdscript-patterns","detailed","worked","games","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:41.831Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/games-and-creative-coding/901313","permalink_url":"https://mdrss.com/m/901313","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/games-and-creative-coding/901313/901313.md","file_url":"https://mdrss.com/api/v1/cards/901313/file","raw_url":"https://mdrss.com/multimodal/games-and-creative-coding/901313/raw","embed_url":"https://mdrss.com/multimodal/games-and-creative-coding/901313/embed","edit_url":"https://mdrss.com/cards/901313/edit","legacy_url":"https://mdrss.com/s/multimodal/godot-gdscript-patterns-detailed-patterns-and-worked-examples-collider-362a188e59df"}},{"schema":"mdrss.card-summary/v1","id":901235,"version":1,"title":"Code Explanation and Analysis","annotation":"You are a code education expert specializing in explaining complex code through clear narratives, visual diagrams, and step-by-step breakdowns. Transform difficult concepts into understandable explanations for developers at all levels. Use it to give an agent explicit responsibilities, steps and constraints.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"guide","tags":["creative-computing-media","image-video-and-creative-ai","code","explanation","analysis","try","visual","image","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:23.601Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235","permalink_url":"https://mdrss.com/m/901235","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/901235.md","file_url":"https://mdrss.com/api/v1/cards/901235/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/embed","edit_url":"https://mdrss.com/cards/901235/edit","legacy_url":"https://mdrss.com/s/multimodal/code-explanation-and-analysis-collider-51c6014c751f"}},{"schema":"mdrss.card-summary/v1","id":901115,"version":1,"title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","annotation":"A curated reference on image, video & creative ai centered on DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","similarity","data","nights","download","dreamsim","image","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:05.624Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115","permalink_url":"https://mdrss.com/m/901115","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/901115.md","file_url":"https://mdrss.com/api/v1/cards/901115/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/embed","edit_url":"https://mdrss.com/cards/901115/edit","legacy_url":"https://mdrss.com/s/multimodal/dreamsim-learning-new-dimensions-of-human-visual-similarity-using-synt-collider-2644595ceec1"}},{"schema":"mdrss.card-summary/v1","id":901112,"version":1,"title":"Awesome Video Diffusion","annotation":"A curated list of recent diffusion models for video generation, editing, restoration, understanding, nerf, etc. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","video","generation","diffusion","awesome","models","image","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:05.624Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112","permalink_url":"https://mdrss.com/m/901112","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/901112.md","file_url":"https://mdrss.com/api/v1/cards/901112/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/embed","edit_url":"https://mdrss.com/cards/901112/edit","legacy_url":"https://mdrss.com/s/multimodal/awesome-video-diffusion-collider-5bd7542cbfc2"}},{"schema":"mdrss.card-summary/v1","id":901082,"version":1,"title":"Awesome Audio-Visual","annotation":"A curated list of papers and datsets for various audio-visual tasks, inspired by awesome-computer-vision. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","audio-visual","awesome","papers","generation","audio","music","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:04.205Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/audio-and-music/901082","permalink_url":"https://mdrss.com/m/901082","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/audio-and-music/901082/901082.md","file_url":"https://mdrss.com/api/v1/cards/901082/file","raw_url":"https://mdrss.com/multimodal/audio-and-music/901082/raw","embed_url":"https://mdrss.com/multimodal/audio-and-music/901082/embed","edit_url":"https://mdrss.com/cards/901082/edit","legacy_url":"https://mdrss.com/s/multimodal/awesome-audio-visual-collider-5368f2904684"}},{"schema":"mdrss.card-summary/v1","id":901068,"version":1,"title":"Faust - Programming Language for Audio Applications and Plugins","annotation":"Faust (Functional Audio Stream) is a functional programming language specifically designed for real-time signal processing and synthesis. A distinctive characteristic of Faust is that it is fully compiled. Use it to build a structured path from fundamentals to hands-on practice.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"guide","tags":["creative-computing-media","audio-music","faust","programming","language","audio","applications","music","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:48:02.244Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/audio-and-music/901068","permalink_url":"https://mdrss.com/m/901068","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/audio-and-music/901068/901068.md","file_url":"https://mdrss.com/api/v1/cards/901068/file","raw_url":"https://mdrss.com/multimodal/audio-and-music/901068/raw","embed_url":"https://mdrss.com/multimodal/audio-and-music/901068/embed","edit_url":"https://mdrss.com/cards/901068/edit","legacy_url":"https://mdrss.com/s/multimodal/faust-programming-language-for-audio-applications-and-plugins-collider-d2cf359f6958"}},{"schema":"mdrss.card-summary/v1","id":901034,"version":1,"title":"Tone.js","annotation":"Tone.js is a Web Audio framework for creating interactive music in the browser. The architecture of Tone.js aims to be familiar to both musicians and audio programmers creating web-based audio applications. On the high-level, Tone offers common DAW (digital audio workstation) fea. Use it to ground design choices in named patterns, trade-offs and examples.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","audio","tone.js","creating","tone","music","creative","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:59.231Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/audio-and-music/901034","permalink_url":"https://mdrss.com/m/901034","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/audio-and-music/901034/901034.md","file_url":"https://mdrss.com/api/v1/cards/901034/file","raw_url":"https://mdrss.com/multimodal/audio-and-music/901034/raw","embed_url":"https://mdrss.com/multimodal/audio-and-music/901034/embed","edit_url":"https://mdrss.com/cards/901034/edit","legacy_url":"https://mdrss.com/s/multimodal/tone-js-collider-c052c03e3e23"}},{"schema":"mdrss.card-summary/v1","id":901030,"version":1,"title":"FunDSP","annotation":"FunDSP is an audio DSP (digital signal processing) library for audio processing and synthesis. Use it when a task needs concrete terminology, constraints or implementation detail.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","audio","processing","fundsp","dsp","library","music","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:59.231Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/audio-and-music/901030","permalink_url":"https://mdrss.com/m/901030","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/audio-and-music/901030/901030.md","file_url":"https://mdrss.com/api/v1/cards/901030/file","raw_url":"https://mdrss.com/multimodal/audio-and-music/901030/raw","embed_url":"https://mdrss.com/multimodal/audio-and-music/901030/embed","edit_url":"https://mdrss.com/cards/901030/edit","legacy_url":"https://mdrss.com/s/multimodal/fundsp-collider-13583ee2dd8e"}},{"schema":"mdrss.card-summary/v1","id":901027,"version":1,"title":"Highlights","annotation":"14B Real-Time Long Video Generation Model can be Cheaper, Faster but Keep Stronger than 1.3B ones ⭐. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","model","video","pipeline","run","image","creative","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:57.776Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027","permalink_url":"https://mdrss.com/m/901027","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/901027.md","file_url":"https://mdrss.com/api/v1/cards/901027/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/embed","edit_url":"https://mdrss.com/cards/901027/edit","legacy_url":"https://mdrss.com/s/multimodal/highlights-collider-9a285aa6badd"}},{"schema":"mdrss.card-summary/v1","id":901013,"version":1,"title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","annotation":"Jinbo Xing, Menghan Xia, Yong Zhang, Haoxin Chen, Wangbo Yu, Hanyuan Liu, Gongye Liu, Xintao Wang, Ying Shan, Tien-Tsin Wong From CUHK and Tencent AI Lab. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","nbsp","video","generation","showcases","generative","image","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:57.776Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013","permalink_url":"https://mdrss.com/m/901013","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/901013.md","file_url":"https://mdrss.com/api/v1/cards/901013/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/embed","edit_url":"https://mdrss.com/cards/901013/edit","legacy_url":"https://mdrss.com/s/multimodal/dynamicrafter-animating-open-domain-images-with-video-diffusion-priors-collider-a26cfc12f1dd"}},{"schema":"mdrss.card-summary/v1","id":901006,"version":1,"title":"A Survey on Video Diffusion Models","annotation":"Zhen Xing, Qijun Feng, Haoran Chen, Qi Dai, Han Hu, Hang Xu, Zuxuan Wu, Yu-Gang Jiang. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","video","generation","models","survey","diffusion","image","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:57.776Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006","permalink_url":"https://mdrss.com/m/901006","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/901006.md","file_url":"https://mdrss.com/api/v1/cards/901006/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/embed","edit_url":"https://mdrss.com/cards/901006/edit","legacy_url":"https://mdrss.com/s/multimodal/a-survey-on-video-diffusion-models-collider-bef0ac2f349c"}},{"schema":"mdrss.card-summary/v1","id":901003,"version":1,"title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","annotation":"VideoCrafter is an open-source video generation and editing toolbox for crafting video content. It currently includes the Text2Video and Image2Video models:. Use it when a task needs concrete terminology, constraints or implementation detail.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","videocrafter2","video","models","generation","overcoming","image","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:30.961Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003","permalink_url":"https://mdrss.com/m/901003","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/901003.md","file_url":"https://mdrss.com/api/v1/cards/901003/file","raw_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/raw","embed_url":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/embed","edit_url":"https://mdrss.com/cards/901003/edit","legacy_url":"https://mdrss.com/s/multimodal/videocrafter2-overcoming-data-limitations-for-high-quality-video-diffu-collider-5d4e724ba664"}},{"schema":"mdrss.card-summary/v1","id":901002,"version":1,"title":"Music Modeling and Music Generation with Deep Learning","annotation":"A curated reference on audio & music centered on Music Modeling and Music Generation with Deep Learning. Use it to navigate the topic and choose relevant methods, papers or tools.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","music","generation","modeling","tablature","deep","audio","multimodal","collider-club"]},"publisher":"collider-club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_kind":"collider-club-curated"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"created_at":"2026-08-04T13:47:30.961Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","urls":{"card_url":"https://mdrss.com/multimodal/audio-and-music/901002","permalink_url":"https://mdrss.com/m/901002","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/audio-and-music/901002/901002.md","file_url":"https://mdrss.com/api/v1/cards/901002/file","raw_url":"https://mdrss.com/multimodal/audio-and-music/901002/raw","embed_url":"https://mdrss.com/multimodal/audio-and-music/901002/embed","edit_url":"https://mdrss.com/cards/901002/edit","legacy_url":"https://mdrss.com/s/multimodal/music-modeling-and-music-generation-with-deep-learning-collider-053f9a5bb164"}},{"schema":"mdrss.card-summary/v1","id":2474,"version":1,"title":"Whisper","annotation":"It is trained on a large dataset of diverse audio and is also a multitasking model that can perform multilingual speech recognition, speech translation, and language identification. A Transformer sequence-to-sequence model is trained on various speech processing tasks, including multilingual speech recognition, speech translation, spoken language identification, and voice activity detection.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["python","multimodal","whisper","ubuntu","debian","linux"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","urls":{"card_url":"https://mdrss.com/multimodal/speech-and-audio/2474","permalink_url":"https://mdrss.com/m/2474","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/speech-and-audio/2474/2474.md","file_url":"https://mdrss.com/api/v1/cards/2474/file","raw_url":"https://mdrss.com/multimodal/speech-and-audio/2474/raw","embed_url":"https://mdrss.com/multimodal/speech-and-audio/2474/embed","edit_url":"https://mdrss.com/cards/2474/edit","legacy_url":"https://mdrss.com/s/multimodal/openai-whisper-openai-whisper-readme"}},{"schema":"mdrss.card-summary/v1","id":2057,"version":1,"title":"Cosmos Tokenizer: A suite of image and video neural tokenizers","annotation":"As of February 10th, 2025, this repository is read-only. Please visit github.com/NVIDIA/Cosmos for the latest updates and support on Cosmos Tokenizer.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["diffusion","tokenization","transformers","multimodal","apache"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","urls":{"card_url":"https://mdrss.com/multimodal/vision-and-media/2057","permalink_url":"https://mdrss.com/m/2057","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/2057/2057.md","file_url":"https://mdrss.com/api/v1/cards/2057/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/2057/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/2057/embed","edit_url":"https://mdrss.com/cards/2057/edit","legacy_url":"https://mdrss.com/s/multimodal/nvidia-cosmos-tokenizer-nvidia-cosmos-tokenizer-readme"}},{"schema":"mdrss.card-summary/v1","id":1611,"version":1,"title":"MOVA: Towards Scalable and Synchronized Video–Audio Generation","annotation":"We introduce MOVA (MOSS Video and Audio), a foundation model designed to break the \"silent era\" of open-source video generation. Unlike cascaded pipelines that generate sound as an afterthought, MOVA synthesizes video and audio simultaneously for perfect alignment.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["diffusion-models","multimodal","sglang","video-audio-generation","python"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","urls":{"card_url":"https://mdrss.com/multimodal/speech-and-audio/1611","permalink_url":"https://mdrss.com/m/1611","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/speech-and-audio/1611/1611.md","file_url":"https://mdrss.com/api/v1/cards/1611/file","raw_url":"https://mdrss.com/multimodal/speech-and-audio/1611/raw","embed_url":"https://mdrss.com/multimodal/speech-and-audio/1611/embed","edit_url":"https://mdrss.com/cards/1611/edit","legacy_url":"https://mdrss.com/s/multimodal/openmoss-mova-openmoss-mova-readme"}},{"schema":"mdrss.card-summary/v1","id":1549,"version":1,"title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","annotation":"Towards Async, Omni-Modal RL at Scale, Just Relax. 📖 English | 📖 中文 Relax (Reinforcement Engine Leveraging Agentic X-modality) is a high-performance reinforcement learning post-training framework open-sourced by the Xiaohongshu AI Infra Team for multimodal large language models.","catalog_feed":{"slug":"ai-agents","url":"https://mdrss.com/s/ai-agents"},"classification":{"domain":"ai-agents","category":"agent-frameworks","content_type":"guide","tags":["agentic-rl","distributed-training","grpo","llm","megatron-lm","multi-agent","multimodal","post-training"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:15:38.483Z","urls":{"card_url":"https://mdrss.com/ai-agents/agent-frameworks/1549","permalink_url":"https://mdrss.com/m/1549","thread_url":"https://mdrss.com/s/ai-agents","markdown_url":"https://mdrss.com/ai-agents/agent-frameworks/1549/1549.md","file_url":"https://mdrss.com/api/v1/cards/1549/file","raw_url":"https://mdrss.com/ai-agents/agent-frameworks/1549/raw","embed_url":"https://mdrss.com/ai-agents/agent-frameworks/1549/embed","edit_url":"https://mdrss.com/cards/1549/edit","legacy_url":"https://mdrss.com/s/ai-agents/redai-infra-relax-redai-infra-relax-readme"}},{"schema":"mdrss.card-summary/v1","id":1369,"version":1,"title":"PICK-PyTorch","annotation":"\\\\\\\\\\ Updated on Feb 6th, 2021: Train Ticket dataset is now available for academic research. You can download from Google Drive or OneDrive.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["document-analysis","document-understanding","graph-learning","graph-neural-networks","key-information-extraction","python","multimodal","node"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","urls":{"card_url":"https://mdrss.com/multimodal/vision-and-media/1369","permalink_url":"https://mdrss.com/m/1369","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1369/1369.md","file_url":"https://mdrss.com/api/v1/cards/1369/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1369/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1369/embed","edit_url":"https://mdrss.com/cards/1369/edit","legacy_url":"https://mdrss.com/s/multimodal/wenwenyu-pick-pytorch-wenwenyu-pick-pytorch-readme"}},{"schema":"mdrss.card-summary/v1","id":1345,"version":1,"title":"MuseV English 中文","annotation":"MuseV was a milestone achieved around July 2023. Amazed by the progress of Sora, we decided to opensource MuseV, hopefully it will benefit the community.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["diffusion","human-video-generation","image2video","infinite-length","musev","video-generation","python","multimodal"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","urls":{"card_url":"https://mdrss.com/multimodal/vision-and-media/1345","permalink_url":"https://mdrss.com/m/1345","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1345/1345.md","file_url":"https://mdrss.com/api/v1/cards/1345/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1345/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1345/embed","edit_url":"https://mdrss.com/cards/1345/edit","legacy_url":"https://mdrss.com/s/multimodal/tmelyralab-musev-tmelyralab-musev-readme"}},{"schema":"mdrss.card-summary/v1","id":1304,"version":1,"title":"EasyAnimate | An End-to-End Solution for High-Resolution and Long Video Generation","annotation":"😊 EasyAnimate is an end-to-end solution for generating high-resolution and long videos. We can train transformer based diffusion generators, train VAEs for processing long videos, and preprocess metadata.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["python","multimodal","docker","diffusion"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","urls":{"card_url":"https://mdrss.com/multimodal/vision-and-media/1304","permalink_url":"https://mdrss.com/m/1304","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1304/1304.md","file_url":"https://mdrss.com/api/v1/cards/1304/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1304/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1304/embed","edit_url":"https://mdrss.com/cards/1304/edit","legacy_url":"https://mdrss.com/s/multimodal/aigc-apps-easyanimate-aigc-apps-easyanimate-readme"}},{"schema":"mdrss.card-summary/v1","id":1061,"version":1,"title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","annotation":"ViewCrafter can generate high-fidelity novel views from a single or sparse reference image , while also supporting highly precise pose control. Below shows some examples: Reference image Camera trajecotry Generated novel view video Reference image 1 Reference image 2 Generated novel view video |Model|Resolution|Frames|GPU Mem.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["python","multimodal","diffusion"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","urls":{"card_url":"https://mdrss.com/multimodal/vision-and-media/1061","permalink_url":"https://mdrss.com/m/1061","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/vision-and-media/1061/1061.md","file_url":"https://mdrss.com/api/v1/cards/1061/file","raw_url":"https://mdrss.com/multimodal/vision-and-media/1061/raw","embed_url":"https://mdrss.com/multimodal/vision-and-media/1061/embed","edit_url":"https://mdrss.com/cards/1061/edit","legacy_url":"https://mdrss.com/s/multimodal/drexubery-viewcrafter-drexubery-viewcrafter-readme"}},{"schema":"mdrss.card-summary/v1","id":794,"version":1,"title":"Moonshine Voice","annotation":"Voice Interfaces for Everyone Moonshine Voice is an open source AI toolkit for developers building real-time voice agents and applications. Join our community on Discord to get live support.","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["intent-recognition","stt","tts","voice","voice-recognition","c++","multimodal","python"]},"publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_kind":"mdrss-final-catalog"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","urls":{"card_url":"https://mdrss.com/multimodal/speech-and-audio/794","permalink_url":"https://mdrss.com/m/794","thread_url":"https://mdrss.com/s/multimodal","markdown_url":"https://mdrss.com/multimodal/speech-and-audio/794/794.md","file_url":"https://mdrss.com/api/v1/cards/794/file","raw_url":"https://mdrss.com/multimodal/speech-and-audio/794/raw","embed_url":"https://mdrss.com/multimodal/speech-and-audio/794/embed","edit_url":"https://mdrss.com/cards/794/edit","legacy_url":"https://mdrss.com/s/multimodal/moonshine-ai-moonshine-moonshine-ai-moonshine-readme"}}]}