Welk AI-platform is het beste voor inkoopwerk?
Er is geen enkele winnaar uit de PAIR-20-run van juli 2026. ChatGPT, Claude, Gemini en Copilot slaagden elk voor sommige taken en faalden voor andere; het nuttige signaal zat in waar ze van mening verschilden.
Het eerlijke antwoord is dat de PAIR-20-run van juli 2026 geen enkel beste platform voor inkoopwerk aanwijst. Het resultaat toont een meningsverschillenkaart.
De run gebruikte ChatGPT, Claude, Gemini en Copilot op zes synthetische inkooptaken: offertenormalisatie (quote normalization), contractbeoordeling, landed cost (totale inkoopkosten inclusief vracht en heffingen), leveranciersrisico, adviesoffertes en catalogusdeduplicatie. De runs waren eenmalige gedateerde runs, geen gemiddelden — het resultaat moet gelezen worden als "dit is gebeurd" in plaats van als een duurzame ranglijst.
Het verschil telt zwaarder dan de score. Gemini ving de T01-eenheidsfout op bij beide prompts, terwijl Claude deze miste zelfs toen het Structured Brief (gestructureerde taakomschrijving) de eenheid expliciet benoemde. ChatGPT was het enige platform dat de T02-prijsmelding en opzegtermijnclausules koppelde bij de generieke prompt. In T03 reconstrueerden alle vier platforms de landed-cost-opbouw, maar geen enkel platform kwam overeen met de ground truth van de casus. In T04 en T06 fabriceerde Copilot feiten in velden die onbevestigd hadden moeten blijven. In T05 hadden ChatGPT en Gemini beide presentatiefouten nadat ze belangrijke kostencomponenten correct hadden geïdentificeerd.
Kies geen platform op basis van één scorebord. Het PAIR-20-resultaat is een veldnotitie, geen software-ranglijst voor inkoop. Een model dat in deze run een fout miste, vangt die mogelijk in een andere run op — en een model dat hem nu opving, kan hem de volgende keer missen.
Gebruik meningsverschil als controle. Als twee platforms dezelfde offerte anders lezen, is dat geen ruis om weg te middelen. Het is de lijst met velden die u moet controleren: eenheid, termijn, vergoeding, scope cap (prestatieplafond), doorbelaste kosten, lege hoeveelheid of clausule-interactie.
Stem het hulpmiddel af op de controlegewoonte. Voor operationele inkoopteams is de vraag niet zozeer "welk platform is het beste?" maar eerder "welke uitvoer maakt het verificatiewerk zichtbaar?" De veiligere werkwijze is om de genormaliseerde invoergegevens én de eindaanbeveling op te vragen en vervolgens platforms of herhaalde runs te vergelijken waar de beslissing afhangt van een klein aantal kwetsbare feiten.
Where this comes from
- PAIR-20 July 2026 run of record — single dated runs, screenshots on file
- Procurement AI Reality Check, July 2026
Last checked 2026-07-12. Evidence comes from dated, single-run platform sessions with screenshots on file — read each finding as “this happened,” not “this always happens.”
Related questions
See what the platforms caught — and missed
Twenty procurement tasks, four AI platforms, real dated runs. Lesson 2 is free to read, no account needed.