Google präsentiert neues KI-Weltmodell Genie 3
Google hat mit Genie 3 ein neues „Weltmodell“ vorgestellt, das interaktive Umgebungen mit mehrminütigem Gedächtnis erzeugt und auch für das Training von Robotern genutzt werden kann.
Das neue KI-Tool von Google DeepMind bietet die Möglichkeit, interaktive Welten zu erstellen, die mehrere Minuten lang konsistent bleiben. In einem Demo-Video wird veranschaulicht, wie eine Spielfigur Farbe an die Wand malt, die beim Zurückblicken noch vorhanden ist.
Eines der größten Herausforderungen, denen sich KI-Modelle beim Erstellen von 3D-Welten gegenübersehen, ist die Konsistenz der Informationen. Das Vorgängermodell GameNGen hat bei der Erstellung von Videospielwelten, wie jene von „Doom“, Schwierigkeiten, sich an Positionen von Gegnern oder aktuelle Munitionsstände zu erinnern.
Genie 3 unterstützt das Roboter-Training
Google DeepMind hebt die Fortschritte von Genie 3 hervor: Im Vergleich zu früheren Modellen hat es nicht nur ein längeres Gedächtnis, sondern ist auch flexibler einsetzbar. Die generierten interaktiven Welten sind nicht nur für Videospiele geeignet, sondern können auch für das Training von Roboter-Intelligenzen verwendet werden. Zudem sollen die 3D-Welten für Übungen im Feuerwehr- oder Katastrophenschutz genutzt werden können.
Nutzer können mit den von Genie 3 generierten Welten über eine Tastatur interagieren und Figuren in Echtzeit steuern. Dabei werden neue Gebiete dynamisch erstellt. Während der Erkundung der 3D-Welt besteht die Möglichkeit, neue Elemente über Texteingaben hinzuzufügen.
Genie 3 produziert die 3D-Welten mit 24 Bildern pro Sekunde und einer maximalen Auflösung von 720p. Diese Auflösung übertrifft ältere Modelle wie GameNGen, bleibt jedoch hinter dem nicht-interaktiven Video-Tool Veo zurück, das bis zu 4K-Videos erstellen kann.
Ein Schritt in Richtung AGI
Google betrachtet Genie 3 als bedeutenden Schritt in Richtung einer Künstlichen Allgemeinen Intelligenz (AGI). Mit den generierten Welten können KI-Agenten in komplexen Simulationsumgebungen trainiert werden. Dennoch gibt es Einschränkungen: Die Interaktionsmöglichkeiten von KI-Agenten mit den simulierten Welten sind begrenzt, und die Interaktion zwischen mehreren Agenten muss weiter erforscht werden.
Ein mögliches Einsatzszenario für Genie 3 ist die Erkundung historischer Schauplätze. Google räumt jedoch ein, dass das Modell gegenwärtig nicht in der Lage ist, reale Orte präzise darzustellen. Zukünftige Versionen sollen unter anderem eine Verbesserung des Renderings von Texten bieten und die Interaktivität bei längeren Zeitintervallen ermöglichen.
Derzeit wird Genie 3 nicht allgemein veröffentlicht; stattdessen will Google DeepMind das Modell vorerst nur einer ausgewählten Gruppe von Forschern und Entwicklern zur Verfügung stellen, um deren Rückmeldungen für zukünftige Entwicklungen zu nutzen.


