AI-mätning under lupp
Open AI har riktat skarp kritik mot det populära programmeringsriktmärket SWE-Bench Pro efter en granskning. Enligt företaget är omkring 30 procent av testuppgifterna trasiga eller bristfälligt utformade, vilket riskerar att ge en missvisande bild av hur bra AI-modeller faktiskt är på mjukvaruutveckling.
Granskningen identifierade problem i mellan 27 och 34 procent av de 731 offentliga testuppgifterna. Open AI väljer därför att dra tillbaka sin tidigare rekommendation att använda SWE-Bench Pro som standard för att utvärdera AI-modeller.
Vad innebär detta för svensk vård? Det är viktigt att ha tillförlitliga och robusta metoder för att utvärdera AI-modeller, särskilt inom vården där besluten kan ha stor inverkan på patienternas liv. Detta understryker behovet av noggrann granskning och validering av AI-verktyg innan de implementeras i klinisk praxis.
Denna sammanfattning är AI-genererad. Läs originalet för fullständig information.