When Code Can't Judge Quality: Model-as-Judge Evaluators in Apple's Evaluations Framework
Code-based evaluators can only measure what code can measure. This companion article goes deep on ModelJudgeEvaluator: choosing a scoring scale, writing scoring levels that actually work, and wiring a model-as-judge into the TripPlanner evaluation from part one.