Using a small real or synthetic interaction dataset (MovieLens-100k works well), build a two-stage baseline: a candidate generator (popularity or item-item co-occurrence) feeding a simple ranker, and measure recall@10 against a pure popularity baseline on a held-out time-based split.