Building RAG Pipelines for Local Llama
2026-01-15Quantized inference, chunking strategies, two-pass retrieval, and streaming chat UX for a fully local documentation assistant.
Quantized inference, chunking strategies, two-pass retrieval, and streaming chat UX for a fully local documentation assistant.
From CNN baselines to ViT+LoRA: handling class imbalance, parameter-efficient fine-tuning, and interpretability on diabetic retinopathy datasets.
Claim extraction with spaCy/BART, FAISS + TF-IDF hybrid retrieval, and self-optimizing verification loops that improve factual reliability.