Ny forskning från Decodo visar att AI-agenter fortfarande har svårt att självständigt utföra verkliga webbläsaruppgifter, bland annat fylla i formulär, genomföra transaktioner, förstå flera flikar och hantera integrationer från tredje part.
Studien analyserade 45 AI-agenter inom 10 olika förmågor. Ingen nådde maxpoängen 20. Claude for Chrome fick högst resultat med 18 poäng, medan ChatGPT Chrome Extension fick 14.
Transaktioner var den svagaste kategorin, med ett genomsnitt på 0,43 av 2 poäng. Agenterna kunde ofta nå kassan, men kunde inte slutföra ett köp åt användaren. Decodo varnade också för att agenter som kan genomföra köp kan sakna tillräckliga skydd för känslig information, exempelvis kreditkortsnummer.
Flerstegsarbetsflöden väckte liknande frågor. Mer än hälften av agenterna som klarade sådana arbetsflöden saknade dokumenterade skydd innan de utförde oåterkalleliga åtgärder.
Studien visade även att flera webbläsarinbyggda agenter fick full poäng för förståelse av flera flikar.
Kommentarer
0Inga kommentarer ännu. Skriv den första.