Kan AI uw werk doen? We stellen agenten op de proef.

Taak 1
Onderzoek collega’s
Interactie met mensen via Slack was verrassend eenvoudig voor de AI
Taak 2
Stel personeelsbezuinigingen voor
De AI voltooide de taak, maar maakte een belangrijke fout.
Taak 3
Vul 17 formulieren in
Het raasde door het vervelende deel en worstelde met een triviale stap.
We gaven een AI-tool volledige toegang tot een laptop met vooraf geconfigureerde apps en probeerden een eenvoudige vraag te beantwoorden: kan kunstmatige intelligentie een kantoortaak uitvoeren?
Sommige bedrijfsleiders schijnen te geloven dat dit wel kan. Meer dan 200 technologiebedrijven hebben dit jaar ongeveer 120.000 banen geschrapt, volgens Layoffs.fyi, een trackingsite voor de sector; Meta, Oracle en anderen hebben onlangs allemaal substantieel bezuinigd op hun personeelsbestand, waarbij ze AI als drijvende kracht noemden; en na het ontslag van ongeveer 1.100 werknemers, werd de zei CEO van Cloudflare onlangs dat hij verwachtte dat AI werknemers in het middenmanagement, financiën en marketing zou vervangen.
In ons experiment hebben we AI-‘agenten’ ingezet om als kantoorpersoneel op te treden en ontdekten dat ze in staat waren een deel van de taken uit te voeren die we hadden toegewezen, maar niet alle taken. De agenten, die autonoom kunnen handelen en beslissingen kunnen nemen op basis van gedetailleerde instructies, blonken uit in problemen die ze konden oplossen door computerprogramma’s te schrijven. Maar ze hadden moeite met het begrijpen van de nuances van menselijke taal en met het navigeren door gebruikersinterfaces zoals de Chrome-webbrowser.
De eerste taak die we onze AI gaven, was het verzamelen van feedback van collega’s over de Slack-berichtenapp en hun antwoorden vervolgens in een spreadsheet plaatsen. We hebben Slack-bots gemaakt om als collega’s te fungeren, die de vragen van de agent zouden beantwoorden (of niet beantwoorden) met vooraf geschreven antwoorden.
Tijdens deze taak slaagde de agent erin enkele curveballs uit te voeren zonder een slag over te slaan. Toen zijn collega hem de lijst met deelnemers aan de vergadering stuurde, was een van de namen verkeerd gespeld (“Sara Johnson” in plaats van “Sarah Johnson”), maar de agent stuurde nog steeds een bericht naar de juiste persoon. Een van de aanwezigen die hij een bericht stuurde, reageerde nooit, en in plaats van te blijven wachten, voegde de agent de medewerker eenvoudigweg zonder score toe aan de spreadsheet.
Deze taak, en de andere die we aan de AI hebben toegewezen, zijn overgenomen uit artikelen en benchmarkingtools die onlangs zijn gepubliceerd door onderzoekers van Carnegie Mellon-universiteit En OpenAI. De onderzoekers ontwierpen de benchmarks om de prestaties van verschillende modellen – zoals OpenAI’s GPT, Google’s Gemini en Claude van Anthropic – in echte omgevingen te testen en ze met elkaar te vergelijken.
Beide onderzoeksprojecten omvatten volumes open source-materiaal voor het testen van agenten, waaronder verzonnen spreadsheets, memo’s, personeelslijsten en andere bedrijfsdocumenten, en zorgvuldig geschreven aanwijzingen die bedoeld waren om agenten de nodige context te bieden en precies uit te leggen wat hun rol was en welke hulpmiddelen daarvoor beschikbaar waren.
We hebben de materialen uit de benchmarks niet gebruikt om modellen met elkaar te vergelijken, maar om een algemeen beeld te krijgen van waartoe agenten in staat zijn als ze deskundige instructies en ondersteunende documentatie krijgen. We lieten de agenten draaien met de Claude Cowork-app van Anthropic, waardoor ze de controle over de computer en applicaties konden overnemen.
De volgende taak die we aan onze AI toevertrouwden, was het identificeren van personeelsinkrimpingen om aan de begrotingsvereisten van een overheidsinstantie te voldoen. De agent moest verschillende documenten bekijken, beslissen welke rollen bij het bureau konden worden geëlimineerd en een rapport van drie documenten opstellen over de conclusies ervan.
In dit geval doorliep de AI de reeks taken en besefte dat aan de budgetvereisten kon worden voldaan zonder ontslagen, aangezien verschillende werknemers van plan waren vóór het volgende fiscale jaar met pensioen te gaan of ontslag te nemen.
Maar het maakte ook een betekenisvolle fout: toen het ontdekte dat ten minste drie werknemers van plan waren met verlof te gaan, voegde het hun functies toe aan de lijst met banen die voor het volgende jaar konden worden geschrapt, zonder na te denken over wanneer die werknemers van plan waren terug te keren.
Waar een mens instinctief zou kunnen vragen hoe lang die bladeren zouden duren, leidde de AI uit dat gedeelte af dat al die werknemers op één hoop konden worden gegooid en afgeschreven.
“AI is wellicht minder goed in staat stilzwijgende kennis, de idiosyncratische tips en trucs die voortkomen uit ervaring maar die nooit worden gedigitaliseerd, te vervangen”, aldus onderzoekers van Stanford University en het National Bureau of Economic Research in een recent onderzoek.
De agent had ook problemen met het navigeren door de Google Drive-interface en een spreadsheet. En bij de stap waarin de agent een bestaand organigram in Preview of Google Slides moest wijzigen (een taak die hij waarschijnlijk had kunnen volbrengen) besloot hij vrijwel onmiddellijk dat het gebruik van een app te onpraktisch was en schreef hij code.
“Agenten werken op een zeer onmenselijke manier, ze schrijven code in plaats van de typische interfaces te gebruiken die mensen gebruiken”, zegt Graham Neubig, professor aan de Carnegie Mellon University en co-auteur van het AgentCompany-onderzoeksproject.
Onze agent liet niet alleen zien dat hij er de voorkeur aan gaf een probleem op te lossen; het negeerde ook onze instructies om te proberen apps te gebruiken voordat we overschakelden op code. Het lijkt erop dat AI begrijpt dat het heel goed is in het coderen en verwerken van gestructureerde gegevens, en minder goed in het navigeren door applicaties die zijn ontworpen voor menselijke ogen en intuïtie.
Voor de volgende taak gaf de prompt de AI opdracht om 17 I-9 arbeidsverificatieformulieren in te vullen, met behulp van werknemersgegevens uit een spreadsheet, en deze te uploaden naar een Google Drive-map.
Ondanks de instructies vermeed de agent opnieuw het gebruik van een app om het werk te doen, en begon in plaats daarvan na ongeveer 30 seconden code te schrijven. De programmatische oplossing werkte echter goed en de agent voegde zelfs een sectie aan het script toe om ervoor te zorgen dat de telefoon- en burgerservicenummers correct waren opgemaakt.
Maar nadat hij een moeizaam en tijdrovend proces voor een mens had doorlopen, stuitte de agent op een stap die voor elke kantoormedewerker triviaal zou zijn geweest: het uploaden van de PDF-documenten naar Google Drive.
De resultaten van ons experiment kwamen grofweg overeen met wat onderzoekers en bedrijven hebben ontdekt toen ze kunstmatige intelligentie-instrumenten testten en gebruikten. Scale AI, een AI-trainingsbedrijf, heeft agenten onlangs getest op echte freelanceprojecten, en het best scorende model produceerde slechts ongeveer 16 procent van de tijd klantklaar werk.
Hoewel AI regelmatig kan uitblinken in complexe taken, kan het onbetrouwbaar zijn als het de leiding krijgt over een hele klus. Het kan zeker waarde toevoegen aan bepaalde delen van de beroepsbevolking, maar voorlopig heeft AI nog steeds een menselijke baas nodig.


