Benchmarking Local LLM Performance on a MacBook
Measuring how quantization, serving engine, and prefix caching affect a coding-agent workload on a 24 GB M4 Mac — TTFT, throughput, and HumanEval pass@1 across vllm-metal and Ollama.
Read More