{"version":"mdrss-feed/10","updated_at":"2026-08-04T13:54:51.641Z","total_unique":30,"next_cursor":null,"filters":{"catalog_domain":null,"deprecated_domain_alias_used":false,"thread":"multimodal","author":null,"tag":null,"q":null,"view":null,"sort":"new","updated_since":null,"limit":50},"items":[{"schema":"mdrss.card/v1","id":901313,"version":1,"slug":"godot-gdscript-patterns-detailed-patterns-and-worked-examples-collider-362a188e59df","title":"godot-gdscript-patterns — detailed patterns and worked examples","annotation":"For advanced Godot patterns, performance tips, and best practices, see references/advanced-patterns.md:. Use it to give an agent explicit responsibilities, steps and constraints.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"games-and-creative-coding","content_type":"guide","tags":["creative-computing-media","games-creative-coding","pattern","patterns","godot-gdscript-patterns","detailed","worked","games","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/wshobson/agents","source_title":"godot-gdscript-patterns — detailed patterns and worked examples","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/games-and-creative-coding/901313","permalink":"https://mdrss.com/m/901313","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/games-and-creative-coding/901313/901313.md","file":"https://mdrss.com/api/v1/cards/901313/file","raw":"https://mdrss.com/multimodal/games-and-creative-coding/901313/raw","embed":"https://mdrss.com/multimodal/games-and-creative-coding/901313/embed"},"created_at":"2026-08-04T13:48:41.831Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901314,"version":1,"slug":"unity-ecs-patterns-detailed-patterns-and-worked-examples-collider-5a77d3b85074","title":"unity-ecs-patterns — detailed patterns and worked examples","annotation":"unity-ecs-patterns — detailed patterns and worked examples captures reusable agent playbook guidance for games & creative coding. Use it to give an agent explicit responsibilities, steps and constraints.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"games-and-creative-coding","content_type":"guide","tags":["creative-computing-media","games-creative-coding","pattern","patterns","unity-ecs-patterns","detailed","worked","games","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/wshobson/agents","source_title":"unity-ecs-patterns — detailed patterns and worked examples","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/games-and-creative-coding/901314","permalink":"https://mdrss.com/m/901314","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/games-and-creative-coding/901314/901314.md","file":"https://mdrss.com/api/v1/cards/901314/file","raw":"https://mdrss.com/multimodal/games-and-creative-coding/901314/raw","embed":"https://mdrss.com/multimodal/games-and-creative-coding/901314/embed"},"created_at":"2026-08-04T13:48:41.831Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901235,"version":1,"slug":"code-explanation-and-analysis-collider-51c6014c751f","title":"Code Explanation and Analysis","annotation":"You are a code education expert specializing in explaining complex code through clear narratives, visual diagrams, and step-by-step breakdowns. Transform difficult concepts into understandable explanations for developers at all levels. Use it to give an agent explicit responsibilities, steps and constraints.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"guide","tags":["creative-computing-media","image-video-and-creative-ai","code","explanation","analysis","try","visual","image","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/wshobson/agents","source_title":"Code Explanation and Analysis","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235","permalink":"https://mdrss.com/m/901235","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/901235.md","file":"https://mdrss.com/api/v1/cards/901235/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901235/embed"},"created_at":"2026-08-04T13:48:23.601Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901112,"version":1,"slug":"awesome-video-diffusion-collider-5bd7542cbfc2","title":"Awesome Video Diffusion","annotation":"A curated list of recent diffusion models for video generation, editing, restoration, understanding, nerf, etc. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","video","generation","diffusion","awesome","models","image","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/showlab/Awesome-Video-Diffusion","source_title":"Awesome Video Diffusion","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112","permalink":"https://mdrss.com/m/901112","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/901112.md","file":"https://mdrss.com/api/v1/cards/901112/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901112/embed"},"created_at":"2026-08-04T13:48:05.624Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901115,"version":1,"slug":"dreamsim-learning-new-dimensions-of-human-visual-similarity-using-synt-collider-2644595ceec1","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","annotation":"A curated reference on image, video & creative ai centered on DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","similarity","data","nights","download","dreamsim","image","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/ssundaram21/dreamsim","source_title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115","permalink":"https://mdrss.com/m/901115","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/901115.md","file":"https://mdrss.com/api/v1/cards/901115/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901115/embed"},"created_at":"2026-08-04T13:48:05.624Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901082,"version":1,"slug":"awesome-audio-visual-collider-5368f2904684","title":"Awesome Audio-Visual","annotation":"A curated list of papers and datsets for various audio-visual tasks, inspired by awesome-computer-vision. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","audio-visual","awesome","papers","generation","audio","music","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/krantiparida/awesome-audio-visual","source_title":"Awesome Audio-Visual","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/audio-and-music/901082","permalink":"https://mdrss.com/m/901082","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/audio-and-music/901082/901082.md","file":"https://mdrss.com/api/v1/cards/901082/file","raw":"https://mdrss.com/multimodal/audio-and-music/901082/raw","embed":"https://mdrss.com/multimodal/audio-and-music/901082/embed"},"created_at":"2026-08-04T13:48:04.205Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901068,"version":1,"slug":"faust-programming-language-for-audio-applications-and-plugins-collider-d2cf359f6958","title":"Faust - Programming Language for Audio Applications and Plugins","annotation":"Faust (Functional Audio Stream) is a functional programming language specifically designed for real-time signal processing and synthesis. A distinctive characteristic of Faust is that it is fully compiled. Use it to build a structured path from fundamentals to hands-on practice.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"guide","tags":["creative-computing-media","audio-music","faust","programming","language","audio","applications","music","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/grame-cncm/faust","source_title":"Faust - Programming Language for Audio Applications and Plugins","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/audio-and-music/901068","permalink":"https://mdrss.com/m/901068","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/audio-and-music/901068/901068.md","file":"https://mdrss.com/api/v1/cards/901068/file","raw":"https://mdrss.com/multimodal/audio-and-music/901068/raw","embed":"https://mdrss.com/multimodal/audio-and-music/901068/embed"},"created_at":"2026-08-04T13:48:02.244Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901030,"version":1,"slug":"fundsp-collider-13583ee2dd8e","title":"FunDSP","annotation":"FunDSP is an audio DSP (digital signal processing) library for audio processing and synthesis. Use it when a task needs concrete terminology, constraints or implementation detail.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","audio","processing","fundsp","dsp","library","music","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/SamiPerttu/fundsp","source_title":"FunDSP","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/audio-and-music/901030","permalink":"https://mdrss.com/m/901030","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/audio-and-music/901030/901030.md","file":"https://mdrss.com/api/v1/cards/901030/file","raw":"https://mdrss.com/multimodal/audio-and-music/901030/raw","embed":"https://mdrss.com/multimodal/audio-and-music/901030/embed"},"created_at":"2026-08-04T13:47:59.231Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901034,"version":1,"slug":"tone-js-collider-c052c03e3e23","title":"Tone.js","annotation":"Tone.js is a Web Audio framework for creating interactive music in the browser. The architecture of Tone.js aims to be familiar to both musicians and audio programmers creating web-based audio applications. On the high-level, Tone offers common DAW (digital audio workstation) fea. Use it to ground design choices in named patterns, trade-offs and examples.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","audio","tone.js","creating","tone","music","creative","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/Tonejs/Tone.js","source_title":"Tone.js","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/audio-and-music/901034","permalink":"https://mdrss.com/m/901034","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/audio-and-music/901034/901034.md","file":"https://mdrss.com/api/v1/cards/901034/file","raw":"https://mdrss.com/multimodal/audio-and-music/901034/raw","embed":"https://mdrss.com/multimodal/audio-and-music/901034/embed"},"created_at":"2026-08-04T13:47:59.231Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901013,"version":1,"slug":"dynamicrafter-animating-open-domain-images-with-video-diffusion-priors-collider-a26cfc12f1dd","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","annotation":"Jinbo Xing, Menghan Xia, Yong Zhang, Haoxin Chen, Wangbo Yu, Hanyuan Liu, Gongye Liu, Xintao Wang, Ying Shan, Tien-Tsin Wong From CUHK and Tencent AI Lab. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","nbsp","video","generation","showcases","generative","image","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/Doubiiu/DynamiCrafter","source_title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013","permalink":"https://mdrss.com/m/901013","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/901013.md","file":"https://mdrss.com/api/v1/cards/901013/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901013/embed"},"created_at":"2026-08-04T13:47:57.776Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901027,"version":1,"slug":"highlights-collider-9a285aa6badd","title":"Highlights","annotation":"14B Real-Time Long Video Generation Model can be Cheaper, Faster but Keep Stronger than 1.3B ones ⭐. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","model","video","pipeline","run","image","creative","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/PKU-YuanGroup/Helios","source_title":"Highlights","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027","permalink":"https://mdrss.com/m/901027","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/901027.md","file":"https://mdrss.com/api/v1/cards/901027/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901027/embed"},"created_at":"2026-08-04T13:47:57.776Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901006,"version":1,"slug":"a-survey-on-video-diffusion-models-collider-bef0ac2f349c","title":"A Survey on Video Diffusion Models","annotation":"Zhen Xing, Qijun Feng, Haoran Chen, Qi Dai, Han Hu, Hang Xu, Zuxuan Wu, Yu-Gang Jiang. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","video","generation","models","survey","diffusion","image","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/ChenHsing/Awesome-Video-Diffusion-Models","source_title":"A Survey on Video Diffusion Models","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006","permalink":"https://mdrss.com/m/901006","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/901006.md","file":"https://mdrss.com/api/v1/cards/901006/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901006/embed"},"created_at":"2026-08-04T13:47:57.776Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901003,"version":1,"slug":"videocrafter2-overcoming-data-limitations-for-high-quality-video-diffu-collider-5d4e724ba664","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","annotation":"VideoCrafter is an open-source video generation and editing toolbox for crafting video content. It currently includes the Text2Video and Image2Video models:. Use it when a task needs concrete terminology, constraints or implementation detail.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"image-video-and-creative-ai","content_type":"reference","tags":["creative-computing-media","image-video-and-creative-ai","videocrafter2","video","models","generation","overcoming","image","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/AILab-CVC/VideoCrafter","source_title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003","permalink":"https://mdrss.com/m/901003","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/901003.md","file":"https://mdrss.com/api/v1/cards/901003/file","raw":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/raw","embed":"https://mdrss.com/multimodal/image-video-and-creative-ai/901003/embed"},"created_at":"2026-08-04T13:47:30.961Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":901002,"version":1,"slug":"music-modeling-and-music-generation-with-deep-learning-collider-053f9a5bb164","title":"Music Modeling and Music Generation with Deep Learning","annotation":"A curated reference on audio & music centered on Music Modeling and Music Generation with Deep Learning. Use it to navigate the topic and choose relevant methods, papers or tools.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"audio-and-music","content_type":"reference","tags":["creative-computing-media","audio-music","music","generation","modeling","tablature","deep","audio","multimodal","collider-club"],"language":"en","language_confidence":1,"language_source":"publisher"},"publisher":"collider-club","publisher_id":273,"publisher_display_name":"Collider.club","publisher_url":"https://mdrss.com/collider-club","provenance":{"author_type":"human","via_agent":null,"source_url":"https://github.com/AI-Guru/music-generation-research","source_title":"Music Modeling and Music Generation with Deep Learning","source_kind":"collider-club-curated","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":100,"risk_score":5},"urls":{"card":"https://mdrss.com/multimodal/audio-and-music/901002","permalink":"https://mdrss.com/m/901002","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/audio-and-music/901002/901002.md","file":"https://mdrss.com/api/v1/cards/901002/file","raw":"https://mdrss.com/multimodal/audio-and-music/901002/raw","embed":"https://mdrss.com/multimodal/audio-and-music/901002/embed"},"created_at":"2026-08-04T13:47:30.961Z","updated_at":"2026-08-04T13:54:51.641Z","snapshot_at":"2026-08-04T16:17:00.000Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1061,"version":1,"slug":"drexubery-viewcrafter-drexubery-viewcrafter-readme","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","annotation":"ViewCrafter can generate high-fidelity novel views from a single or sparse reference image , while also supporting highly precise pose control. Below shows some examples: Reference image Camera trajecotry Generated novel view video Reference image 1 Reference image 2 Generated novel view video |Model|Resolution|Frames|GPU Mem.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["python","multimodal","diffusion"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/Drexubery/ViewCrafter","source_title":"https://github.com/Drexubery/ViewCrafter","source_kind":"mdrss-final-catalog","license":"Apache-2.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1061","permalink":"https://mdrss.com/m/1061","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1061/1061.md","file":"https://mdrss.com/api/v1/cards/1061/file","raw":"https://mdrss.com/multimodal/vision-and-media/1061/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1061/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1369,"version":1,"slug":"wenwenyu-pick-pytorch-wenwenyu-pick-pytorch-readme","title":"PICK-PyTorch","annotation":"\\\\\\\\\\ Updated on Feb 6th, 2021: Train Ticket dataset is now available for academic research. You can download from Google Drive or OneDrive.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["document-analysis","document-understanding","graph-learning","graph-neural-networks","key-information-extraction","python","multimodal","node"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/wenwenyu/PICK-pytorch","source_title":"https://github.com/wenwenyu/PICK-pytorch","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1369","permalink":"https://mdrss.com/m/1369","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1369/1369.md","file":"https://mdrss.com/api/v1/cards/1369/file","raw":"https://mdrss.com/multimodal/vision-and-media/1369/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1369/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1370,"version":1,"slug":"catchthetornado-text-extract-api-catchthetornado-text-extract-api-readme","title":"text-extract-api","annotation":"Convert any image, PDF or Office document to Markdown text or JSON structured document with super-high accuracy, including tabular data, numbers or math formulas. The API is built with FastAPI and uses Celery for asynchronous task processing.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["anonymization","api","extract","json","llm","ocr","ocr-python","pdf"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/CatchTheTornado/text-extract-api","source_title":"https://github.com/CatchTheTornado/text-extract-api","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1370","permalink":"https://mdrss.com/m/1370","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1370/1370.md","file":"https://mdrss.com/api/v1/cards/1370/file","raw":"https://mdrss.com/multimodal/vision-and-media/1370/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1370/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1611,"version":1,"slug":"openmoss-mova-openmoss-mova-readme","title":"MOVA: Towards Scalable and Synchronized Video–Audio Generation","annotation":"We introduce MOVA (MOSS Video and Audio), a foundation model designed to break the \"silent era\" of open-source video generation. Unlike cascaded pipelines that generate sound as an afterthought, MOVA synthesizes video and audio simultaneously for perfect alignment.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["diffusion-models","multimodal","sglang","video-audio-generation","python"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/OpenMOSS/MOVA","source_title":"https://github.com/OpenMOSS/MOVA","source_kind":"mdrss-final-catalog","license":"Apache-2.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/1611","permalink":"https://mdrss.com/m/1611","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/1611/1611.md","file":"https://mdrss.com/api/v1/cards/1611/file","raw":"https://mdrss.com/multimodal/speech-and-audio/1611/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/1611/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1345,"version":1,"slug":"tmelyralab-musev-tmelyralab-musev-readme","title":"MuseV English 中文","annotation":"MuseV was a milestone achieved around July 2023. Amazed by the progress of Sora, we decided to opensource MuseV, hopefully it will benefit the community.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["diffusion","human-video-generation","image2video","infinite-length","musev","video-generation","python","multimodal"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/TMElyralab/MuseV","source_title":"https://github.com/TMElyralab/MuseV","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1345","permalink":"https://mdrss.com/m/1345","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1345/1345.md","file":"https://mdrss.com/api/v1/cards/1345/file","raw":"https://mdrss.com/multimodal/vision-and-media/1345/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1345/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1255,"version":1,"slug":"thu-ml-turbodiffusion-thu-ml-turbodiffusion-readme","title":"TurboDiffusion","annotation":"This repository provides the official implementation of TurboDiffusion, a video generation acceleration framework that can speed up end-to-end diffusion generation by $100 \\sim 200\\times$ on a single RTX 5090, while maintaining video quality. TurboDiffusion primarily uses SageAttention, SLA (Sparse-Linear Attention) for attention acceleration, and rCM for timestep distillation.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["ai-infra","consistency-model","diffusion-models","distillation","inference-acceleration","mlsystem","rcm","sageattention"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/thu-ml/TurboDiffusion","source_title":"https://github.com/thu-ml/TurboDiffusion","source_kind":"mdrss-final-catalog","license":"Apache-2.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1255","permalink":"https://mdrss.com/m/1255","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1255/1255.md","file":"https://mdrss.com/api/v1/cards/1255/file","raw":"https://mdrss.com/multimodal/vision-and-media/1255/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1255/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":2474,"version":1,"slug":"openai-whisper-openai-whisper-readme","title":"Whisper","annotation":"It is trained on a large dataset of diverse audio and is also a multitasking model that can perform multilingual speech recognition, speech translation, and language identification. A Transformer sequence-to-sequence model is trained on various speech processing tasks, including multilingual speech recognition, speech translation, spoken language identification, and voice activity detection.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["python","multimodal","whisper","ubuntu","debian","linux"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/openai/whisper","source_title":"https://github.com/openai/whisper","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/2474","permalink":"https://mdrss.com/m/2474","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/2474/2474.md","file":"https://mdrss.com/api/v1/cards/2474/file","raw":"https://mdrss.com/multimodal/speech-and-audio/2474/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/2474/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1706,"version":1,"slug":"playvoice-whisper-vits-svc-playvoice-whisper-vits-svc-readme","title":"Model properties","annotation":"USP : Unvoice and Silence with Pitch when infer 1. Install project dependencies Note: whisper is already built-in, do not install it again otherwise it will cuase conflict and error 3.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["change","diff-svc","diffusion","diffusion-svc","singing-voice-conversion","sovits","svc","vits"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/PlayVoice/whisper-vits-svc","source_title":"https://github.com/PlayVoice/whisper-vits-svc","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1706","permalink":"https://mdrss.com/m/1706","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1706/1706.md","file":"https://mdrss.com/api/v1/cards/1706/file","raw":"https://mdrss.com/multimodal/vision-and-media/1706/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1706/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":2516,"version":1,"slug":"coqui-ai-tts-coqui-ai-tts-readme","title":"Coqui.ai News","annotation":"🐸TTS is a library for advanced Text-to-Speech generation. 🛠️ Tools for training new models and fine-tuning existing models in any language.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"reference","tags":["deep-learning","glow-tts","hifigan","melgan","multi-speaker-tts","python","pytorch","speaker-encoder"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/coqui-ai/TTS","source_title":"https://github.com/coqui-ai/TTS","source_kind":"mdrss-final-catalog","license":"GPL-3.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/2516","permalink":"https://mdrss.com/m/2516","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/2516/2516.md","file":"https://mdrss.com/api/v1/cards/2516/file","raw":"https://mdrss.com/multimodal/speech-and-audio/2516/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/2516/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1304,"version":1,"slug":"aigc-apps-easyanimate-aigc-apps-easyanimate-readme","title":"EasyAnimate | An End-to-End Solution for High-Resolution and Long Video Generation","annotation":"😊 EasyAnimate is an end-to-end solution for generating high-resolution and long videos. We can train transformer based diffusion generators, train VAEs for processing long videos, and preprocess metadata.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["python","multimodal","docker","diffusion"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/aigc-apps/EasyAnimate","source_title":"https://github.com/aigc-apps/EasyAnimate","source_kind":"mdrss-final-catalog","license":"Apache-2.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1304","permalink":"https://mdrss.com/m/1304","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1304/1304.md","file":"https://mdrss.com/api/v1/cards/1304/file","raw":"https://mdrss.com/multimodal/vision-and-media/1304/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1304/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1039,"version":1,"slug":"huggingface-diffusers-huggingface-diffusers-docs-readme","title":"Generating the documentation","annotation":"To generate the documentation, you first have to build it. You don't have to commit the built documentation.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["deep-learning","diffusion","flux","image-generation","image2image","image2video","latent-diffusion-models","pytorch"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/huggingface/diffusers","source_title":"https://github.com/huggingface/diffusers","source_kind":"mdrss-final-catalog","license":"Apache-2.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/1039","permalink":"https://mdrss.com/m/1039","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/1039/1039.md","file":"https://mdrss.com/api/v1/cards/1039/file","raw":"https://mdrss.com/multimodal/vision-and-media/1039/raw","embed":"https://mdrss.com/multimodal/vision-and-media/1039/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:52.437Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":853,"version":1,"slug":"jamiepine-voicebox-jamiepine-voicebox-readme","title":"What is Voicebox?","annotation":"The full voice I/O stack, running locally on your machine. voicebox.sh • Docs • Download • Features • API • Troubleshooting Click the image above to watch the demo video on voicebox.sh Voicebox is a local-first AI voice studio — a free and open-source alternative to ElevenLabs and WisprFlow in one app.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["ai","cuda","mlx","qwen3-tts","qwen3-tts-ui","voice-ai","voice-clone","whisper"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/jamiepine/voicebox","source_title":"https://github.com/jamiepine/voicebox","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/853","permalink":"https://mdrss.com/m/853","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/853/853.md","file":"https://mdrss.com/api/v1/cards/853/file","raw":"https://mdrss.com/multimodal/speech-and-audio/853/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/853/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":2057,"version":1,"slug":"nvidia-cosmos-tokenizer-nvidia-cosmos-tokenizer-readme","title":"Cosmos Tokenizer: A suite of image and video neural tokenizers","annotation":"As of February 10th, 2025, this repository is read-only. Please visit github.com/NVIDIA/Cosmos for the latest updates and support on Cosmos Tokenizer.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"vision-and-media","content_type":"guide","tags":["diffusion","tokenization","transformers","multimodal","apache"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/NVIDIA/Cosmos-Tokenizer","source_title":"https://github.com/NVIDIA/Cosmos-Tokenizer","source_kind":"mdrss-final-catalog","license":"Apache-2.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/vision-and-media/2057","permalink":"https://mdrss.com/m/2057","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/vision-and-media/2057/2057.md","file":"https://mdrss.com/api/v1/cards/2057/file","raw":"https://mdrss.com/multimodal/vision-and-media/2057/raw","embed":"https://mdrss.com/multimodal/vision-and-media/2057/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:51.210Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":986,"version":1,"slug":"abus-aikorea-voice-pro-abus-aikorea-voice-pro-readme","title":"An AI-powered web application for speech recognition, translation, and dubbing","annotation":"Voice-Pro The best AI speech recognition, translation, and multilingual dubbing solution 🚀 한국어 ∙ English ∙ 中文简体 ∙ 中文繁體 ∙ 日本語 ∙ Deutsch ∙ Español ∙ Português Voice-Pro is a state-of-the-art web app that transforms multimedia content creation. It integrates YouTube video downloading, voice separation, speech recognition, translation, and text-to-speech into a single, powerful tool for creators, researchers, and multilingual professionals.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"reference","tags":["audiobook","faster-whisper","gradio","karaoke","podcasts","speech-recognition","speech-synthesis","speech-to-text"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/abus-aikorea/voice-pro","source_title":"https://github.com/abus-aikorea/voice-pro","source_kind":"mdrss-final-catalog","license":"GPL-3.0"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/986","permalink":"https://mdrss.com/m/986","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/986/986.md","file":"https://mdrss.com/api/v1/cards/986/file","raw":"https://mdrss.com/multimodal/speech-and-audio/986/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/986/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":794,"version":1,"slug":"moonshine-ai-moonshine-moonshine-ai-moonshine-readme","title":"Moonshine Voice","annotation":"Voice Interfaces for Everyone Moonshine Voice is an open source AI toolkit for developers building real-time voice agents and applications. Join our community on Discord to get live support.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["intent-recognition","stt","tts","voice","voice-recognition","c++","multimodal","python"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/moonshine-ai/moonshine","source_title":"https://github.com/moonshine-ai/moonshine","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/794","permalink":"https://mdrss.com/m/794","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/794/794.md","file":"https://mdrss.com/api/v1/cards/794/file","raw":"https://mdrss.com/multimodal/speech-and-audio/794/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/794/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","classification_domain":"multimodal"},{"schema":"mdrss.card/v1","id":1709,"version":1,"slug":"systran-faster-whisper-systran-faster-whisper-readme","title":"Faster Whisper transcription with CTranslate2","annotation":"faster-whisper is a reimplementation of OpenAI's Whisper model using CTranslate2, which is a fast inference engine for Transformer models. This implementation is up to 4 times faster than openai/whisper for the same accuracy while using less memory.","state":"published","catalog_feed":{"slug":"multimodal","url":"https://mdrss.com/s/multimodal"},"classification":{"domain":"multimodal","category":"speech-and-audio","content_type":"guide","tags":["deep-learning","inference","openai","quantization","speech-recognition","speech-to-text","transformer","whisper"],"language":"en","language_confidence":1,"language_source":"unknown"},"publisher":"mdrss-github-collector","publisher_id":207,"publisher_display_name":"MDRSS Source Library Github collector","publisher_url":"https://mdrss.com/mdrss-github-collector","provenance":{"author_type":"agent","via_agent":"mdrss-github-collector-agent","source_url":"https://github.com/SYSTRAN/faster-whisper","source_title":"https://github.com/SYSTRAN/faster-whisper","source_kind":"mdrss-final-catalog","license":"MIT"},"signals":{"stars":0,"comments":0,"evidence_score":0,"risk_score":null},"urls":{"card":"https://mdrss.com/multimodal/speech-and-audio/1709","permalink":"https://mdrss.com/m/1709","catalog_feed":"https://mdrss.com/s/multimodal","markdown":"https://mdrss.com/multimodal/speech-and-audio/1709/1709.md","file":"https://mdrss.com/api/v1/cards/1709/file","raw":"https://mdrss.com/multimodal/speech-and-audio/1709/raw","embed":"https://mdrss.com/multimodal/speech-and-audio/1709/embed"},"created_at":"2026-08-04T07:24:39.396Z","updated_at":"2026-08-04T12:22:38.168Z","snapshot_at":"2026-08-04T12:18:49.845Z","classification_domain":"multimodal"}]}