{"version":"mdrss-catalog-feed/2","domain":{"slug":"llm-engineering","label":"LLM Engineering","description":"Model training, serving, retrieval, evaluation, efficiency, alignment, and infrastructure.","categories":["models-and-training","serving-and-retrieval","evaluation","inference-and-quantization","mlops-and-ml-systems","rag-and-knowledge-systems","training-and-fine-tuning","datasets-and-data-curation","synthetic-data","tokenization-and-context","alignment-and-safety","efficient-training","distributed-training","llm-infrastructure","model-compression"]},"total":19,"page":1,"page_size":50,"total_pages":1,"has_next":false,"has_previous":false,"filters":{"domain":"llm-engineering","category":"serving-and-retrieval"},"feeds":[{"slug":"data-research-and-open-knowledge","url":"https://mdrss.com/s/data-research-and-open-knowledge"},{"slug":"software-and-open-documentation","url":"https://mdrss.com/s/software-and-open-documentation"}],"urls":{"html":"https://mdrss.com/catalog/llm-engineering?category=serving-and-retrieval","rss":"https://mdrss.com/catalog/llm-engineering/rss.xml?category=serving-and-retrieval","json":"https://mdrss.com/catalog/llm-engineering/feed.json?category=serving-and-retrieval","markdown":"https://mdrss.com/catalog/llm-engineering/index.md?category=serving-and-retrieval"},"updated_at":"2026-08-04T12:22:38.168Z","items":[{"id":2309,"title":"Chat with PDF locally using Ollama + LangChain","annotation":"A powerful local RAG (Retrieval Augmented Generation) application that lets you chat with your PDF documents using Ollama and LangChain. This project includes multiple interfaces: a modern Next.js web app, a Streamlit interface, and Jupyter notebooks for experimentation.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:33.634Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2309","permalink_url":"https://mdrss.com/m/2309","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2309/2309.md","file_url":"https://mdrss.com/api/v1/cards/2309/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2309/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2309/embed","edit_url":"https://mdrss.com/cards/2309/edit","legacy_url":"https://mdrss.com/s/llm-engineering/tonykipkemboi-ollama-pdf-rag-tonykipkemboi-ollama-pdf-rag-readme"},{"id":2164,"title":"Lit-LLaMA","annotation":"⚠️ Warning: Not Actively Maintained This repository is no longer actively maintained. For a more up-to-date alternative, please visit the LitGPT project: https://github.com/Lightning-AI/litgpt , which serves as the successor to this repository.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:49.845Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2164","permalink_url":"https://mdrss.com/m/2164","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2164/2164.md","file_url":"https://mdrss.com/api/v1/cards/2164/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2164/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2164/embed","edit_url":"https://mdrss.com/cards/2164/edit","legacy_url":"https://mdrss.com/s/llm-engineering/lightning-ai-lit-llama-lightning-ai-lit-llama-readme"},{"id":2140,"title":"Text Generation Inference","annotation":"A Rust, Python and gRPC server for text generation inference. Used in production at Hugging Face to power Hugging Chat, the Inference API and Inference Endpoints.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:48.518Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2140","permalink_url":"https://mdrss.com/m/2140","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2140/2140.md","file_url":"https://mdrss.com/api/v1/cards/2140/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2140/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2140/embed","edit_url":"https://mdrss.com/cards/2140/edit","legacy_url":"https://mdrss.com/s/llm-engineering/huggingface-text-generation-inference-huggingface-text-generation-inference-read"},{"id":2075,"title":"rwkv.cpp","annotation":"This is a port of BlinkDL/RWKV-LM to ggerganov/ggml. Besides the usual FP32, it supports FP16, quantized INT4, INT5 and INT8 inference.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:33.634Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2075","permalink_url":"https://mdrss.com/m/2075","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2075/2075.md","file_url":"https://mdrss.com/api/v1/cards/2075/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2075/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/2075/embed","edit_url":"https://mdrss.com/cards/2075/edit","legacy_url":"https://mdrss.com/s/llm-engineering/rwkv-rwkv-cpp-rwkv-rwkv-cpp-readme"},{"id":1899,"title":"koboldcpp","annotation":"KoboldCpp is an easy-to-use AI text-generation software for GGML and GGUF models, inspired by the original KoboldAI. It's a single self-contained distributable that builds off llama.cpp and adds many additional powerful features.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"reference","version":1,"snapshot_at":"2026-08-04T12:18:48.518Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1899","permalink_url":"https://mdrss.com/m/1899","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1899/1899.md","file_url":"https://mdrss.com/api/v1/cards/1899/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1899/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1899/embed","edit_url":"https://mdrss.com/cards/1899/edit","legacy_url":"https://mdrss.com/s/llm-engineering/lostruins-koboldcpp-lostruins-koboldcpp-readme"},{"id":1891,"title":"DLLM RL","annotation":"We also introduce a diffusion-based value model that reduces variance and improves stability during optimization. Based on TraceRL, we derive a series of diffusion language models, TraDo, which achieve state-of-the-art performance on math and coding reasoning tasks.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:33.634Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1891","permalink_url":"https://mdrss.com/m/1891","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1891/1891.md","file_url":"https://mdrss.com/api/v1/cards/1891/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1891/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1891/embed","edit_url":"https://mdrss.com/cards/1891/edit","legacy_url":"https://mdrss.com/s/llm-engineering/gen-verse-dllm-rl-gen-verse-dllm-rl-readme"},{"id":1726,"title":"REST API examples","annotation":"I've started to work on reimplementation of the library here: FastTensors Please star it if you'd like to see GGML-compatible implementation in pure Go. Please check out my related project Booster We dream of a world where fellow ML hackers are grokking REALLY BIG GPT models in their homelabs without having GPU clusters consuming a shit tons of $$$.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:33.634Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1726","permalink_url":"https://mdrss.com/m/1726","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1726/1726.md","file_url":"https://mdrss.com/api/v1/cards/1726/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1726/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1726/embed","edit_url":"https://mdrss.com/cards/1726/edit","legacy_url":"https://mdrss.com/s/llm-engineering/gotzmann-llama-go-gotzmann-llama-go-readme"},{"id":1671,"title":"QLoRA: Efficient Finetuning of Quantized LLMs","annotation":"This repo supports the paper \"QLoRA: Efficient Finetuning of Quantized LLMs\", an effort to democratize access to LLM research. QLoRA uses bitsandbytes for quantization and is integrated with Hugging Face's PEFT and transformers libraries.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:33.634Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1671","permalink_url":"https://mdrss.com/m/1671","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1671/1671.md","file_url":"https://mdrss.com/api/v1/cards/1671/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1671/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1671/embed","edit_url":"https://mdrss.com/cards/1671/edit","legacy_url":"https://mdrss.com/s/llm-engineering/artidoro-qlora-artidoro-qlora-readme"},{"id":1593,"title":"AutoRAG","annotation":"A self-evolving librarian agent for document collections. AutoRAG searches your PDFs, wikis, notes, research papers, and knowledge bases — then curates the results into clean, numbered knowledge units.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:32.550Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1593","permalink_url":"https://mdrss.com/m/1593","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1593/1593.md","file_url":"https://mdrss.com/api/v1/cards/1593/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1593/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1593/embed","edit_url":"https://mdrss.com/cards/1593/edit","legacy_url":"https://mdrss.com/s/llm-engineering/marker-inc-korea-autorag-marker-inc-korea-autorag-readme"},{"id":1511,"title":"LLM Zoo: democratizing ChatGPT","annotation":"⚡LLM Zoo is a project that provides data, models, and evaluation benchmark for large language models.⚡ [[Tech Report]](assets/llmzoo.pdf) technology gifted by the creator. For example, many pioneers have made great efforts to spread the use of light bulbs and vaccines to developing countries.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:48.518Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1511","permalink_url":"https://mdrss.com/m/1511","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1511/1511.md","file_url":"https://mdrss.com/api/v1/cards/1511/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1511/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1511/embed","edit_url":"https://mdrss.com/cards/1511/edit","legacy_url":"https://mdrss.com/s/llm-engineering/freedomintelligence-llmzoo-freedomintelligence-llmzoo-readme"},{"id":1425,"title":"What you'll learn","annotation":"LLM Twin Course: Building Your Production-Ready AI Replica Learn to architect and implement a production-ready LLM & RAG system by building your LLM Twin From data gathering to productionizing LLMs using LLMOps good practices. by Decoding AI By finishing the \"LLM Twin: Building Your Production-Ready AI Replica\" free course, you will learn how to design, train, and deploy a production-ready LLM twin of yourself powered by LLMs, vector DBs, and LLMOps good practices.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"reference","version":1,"snapshot_at":"2026-08-04T12:18:48.518Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1425","permalink_url":"https://mdrss.com/m/1425","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1425/1425.md","file_url":"https://mdrss.com/api/v1/cards/1425/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1425/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1425/embed","edit_url":"https://mdrss.com/cards/1425/edit","legacy_url":"https://mdrss.com/s/llm-engineering/decodingai-magazine-llm-twin-course-decodingai-magazine-llm-twin-course-readme"},{"id":1383,"title":"Comparison with FAISS","annotation":"USearch and FAISS both employ the same HNSW algorithm, but they differ significantly in their design principles. USearch is compact and broadly compatible without sacrificing performance, primarily focusing on user-defined metrics and fewer dependencies.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:32.550Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1383","permalink_url":"https://mdrss.com/m/1383","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1383/1383.md","file_url":"https://mdrss.com/api/v1/cards/1383/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1383/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1383/embed","edit_url":"https://mdrss.com/cards/1383/edit","legacy_url":"https://mdrss.com/s/llm-engineering/unum-cloud-usearch-unum-cloud-usearch-readme"},{"id":1280,"title":"Evalscope","annotation":"中文 &nbsp ｜ &nbsp English &nbsp 📖 中文文档 &nbsp ｜ &nbsp 📖 English Documentation EvalScope is a one-stop LLM evaluation framework built by the ModelScope Community. Just one command to start — it supports model capability evaluation, inference performance stress testing, and result visualization.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:33.634Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1280","permalink_url":"https://mdrss.com/m/1280","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1280/1280.md","file_url":"https://mdrss.com/api/v1/cards/1280/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1280/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1280/embed","edit_url":"https://mdrss.com/cards/1280/edit","legacy_url":"https://mdrss.com/s/llm-engineering/modelscope-evalscope-modelscope-evalscope-readme"},{"id":1244,"title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","annotation":"PowerInfer is a CPU/GPU LLM inference engine leveraging activation locality for your device. Project Kanban https://github.com/SJTU-IPADS/PowerInfer/assets/34213478/fe441a42-5fce-448b-a3e5-ea4abb43ba23 PowerInfer v.s.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:32.550Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1244","permalink_url":"https://mdrss.com/m/1244","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1244/1244.md","file_url":"https://mdrss.com/api/v1/cards/1244/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1244/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1244/embed","edit_url":"https://mdrss.com/cards/1244/edit","legacy_url":"https://mdrss.com/s/llm-engineering/tiiny-ai-powerinfer-tiiny-ai-powerinfer-readme"},{"id":1183,"title":"Ollama Swift Client","annotation":"A Swift client library for interacting with the Ollama API. Pass \"json\" to get back a JSON string, or specify a full JSON Schema: The format parameter works with both chat and generate methods.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"reference","version":1,"snapshot_at":"2026-08-04T12:18:48.518Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1183","permalink_url":"https://mdrss.com/m/1183","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1183/1183.md","file_url":"https://mdrss.com/api/v1/cards/1183/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1183/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1183/embed","edit_url":"https://mdrss.com/cards/1183/edit","legacy_url":"https://mdrss.com/s/llm-engineering/mattt-ollama-swift-mattt-ollama-swift-readme"},{"id":1089,"title":"LLM Course","annotation":"𝕏 Follow me on X • 🤗 Hugging Face • 💻 Blog • 📙 LLM Engineer's Handbook The LLM course is divided into three parts: 1. 🧩 LLM Fundamentals is optional and covers fundamental knowledge about mathematics, Python, and neural networks.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"reference","version":1,"snapshot_at":"2026-08-04T12:18:32.550Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1089","permalink_url":"https://mdrss.com/m/1089","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1089/1089.md","file_url":"https://mdrss.com/api/v1/cards/1089/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1089/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1089/embed","edit_url":"https://mdrss.com/cards/1089/edit","legacy_url":"https://mdrss.com/s/llm-engineering/mlabonne-llm-course-mlabonne-llm-course-readme"},{"id":1049,"title":"Get started","annotation":"Unsloth Studio lets you run and train models locally. Features • News • Quickstart • Notebooks • Documentation Unsloth Studio (Beta) lets you run and train text, audio, embedding, vision models on Windows, Linux and macOS.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:32.550Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1049","permalink_url":"https://mdrss.com/m/1049","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1049/1049.md","file_url":"https://mdrss.com/api/v1/cards/1049/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1049/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1049/embed","edit_url":"https://mdrss.com/cards/1049/edit","legacy_url":"https://mdrss.com/s/llm-engineering/unslothai-unsloth-unslothai-unsloth-readme"},{"id":1025,"title":"ODS","annotation":"Osmantic Deployment System Turn your PC, Mac, or Linux box into a private AI server. AI server and homelab setup is rapidly becoming a solved problem.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:48.518Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1025","permalink_url":"https://mdrss.com/m/1025","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1025/1025.md","file_url":"https://mdrss.com/api/v1/cards/1025/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1025/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/1025/embed","edit_url":"https://mdrss.com/cards/1025/edit","legacy_url":"https://mdrss.com/s/llm-engineering/osmantic-ods-osmantic-ods-readme"},{"id":938,"title":"Core ML Stable Diffusion","annotation":"Run Stable Diffusion on Apple Silicon with Core ML [\\[Blog Post\\]](https://machinelearning.apple.com/research/stable-diffusion-coreml-apple-silicon) [\\[BibTeX\\]](#bibtex) This repository comprises: If you run into issues during installation or runtime, please refer to the FAQ section. Please refer to the System Requirements section before getting started.","feed":"llm-engineering","semantic_path":"llm-engineering:serving-and-retrieval","content_type":"guide","version":1,"snapshot_at":"2026-08-04T12:18:32.550Z","publisher":"mdrss-github-collector","publisher_url":"https://mdrss.com/mdrss-github-collector","card_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/938","permalink_url":"https://mdrss.com/m/938","thread_url":"https://mdrss.com/s/llm-engineering","markdown_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/938/938.md","file_url":"https://mdrss.com/api/v1/cards/938/file","raw_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/938/raw","embed_url":"https://mdrss.com/llm-engineering/serving-and-retrieval/938/embed","edit_url":"https://mdrss.com/cards/938/edit","legacy_url":"https://mdrss.com/s/llm-engineering/apple-ml-stable-diffusion-apple-ml-stable-diffusion-readme"}]}