50,6 Prozent. Das ist die Trefferquote des besten AI-Modells beim Ablesen analoger Uhren. Menschen schaffen 90,1 Prozent.
Im selben Report steht, dass Gemini Deep Think an der internationalen Mathematik-Olympiade Gold geholt hat, ohne menschliche Hilfe, in der vollen Zeit. Die Trainings-Welt der Modelle ist eben nicht die Welt der Alltagsanforderungen. Wer das nicht trennt, überschätzt eine Capability genau dort, wo es teuer wird.
Mehr Kontext im Deep-Dive Kapitel 2.
Zuerst erschienen auf LinkedIn.
Zurück: 12% Erfolg von Robotern bei Haushaltsaufgaben Alle Teile der Serie Weiter: 2,7% Vorsprung der USA vor China beim Spitzenmodell