Can Small Language Models Rival Larger Models on Specialized Tasks?
Key idea:
Compare accuracy, latency, cost, and reliability after domain-specific fine-tuning to test when compact models are enough.
- Fine-tuning versus retrieval-augmented generation
- Performance under limited training data
- Energy use per correct answer