量子位

Kein Gemini 4 mehr! Google veröffentlicht einen Büro-Agent, der Claude nutzen kann.

Der neue „Sewingmonster“ ist bereits aufgetaucht – wie kann er sich nicht bewegen?

Hengyu, von Ao Fei Si
Quantum Bit | Öffentlicher Account QbitAI

Gut, gut, Google hat auchan den Kampf um die Bürointelligenz teilgenommen und betont, dass es durch die Anwendung mehrerer Modelle sogar den Konkurrenten Claude in den Vordergrund bringt!

Heute früh veröffentlichte Google Cloud einen Artikel mit dem Titel „Welcome to Gemini at Work 2026: Introducing the Gemini Agent“, der von Google Clouds CEO Thomas Kurian persönlich unterschrieben wurde. Der Artikel beschreibt eine Reihe von Updates von Gemini im Bereich der Unternehmens-Agenten.

Darin ist das Beste das neu veröffentlichte Gemini Agent.

Laut Googles Vorstellung wird dies ein allgemeiner Büro-Agent sein, der alle Arten von Arbeitsaufgaben abdeckt und über längere Zeit funktioniert.

Es kann Ihnen dabei helfen, Informationen zu recherchieren, E-Mails zu schreiben, PPTs zu erstellen, Daten zu analysieren, Code zu schreiben und auszuführen. Zudem ermöglicht es die Abrufung von Werkzeugen zwischen verschiedenen Anwendungen, die Planung von Aufgaben selbstständig sowie die Zusammenarbeit mehrerer Sub-Agenten bei Bedarf.

Und es gibt noch zwei besonders bemerkenswerte Punkte.

Erstens kann es seine eigene Unternehmensidentität haben und zu einem AI-Mitarbeiter werden, der einen E-Mail-Account, einen Kalender und eine unabhängige Account hat.

Zweitens kann es das Grundmodell automatisch nach dem Aufgabenstatus auswählen und sogar Claude von Anthropic aufrufen.

Wow, muss Google sogar seinen eigenen Gemini nicht verwenden?

Interessanterweise scheinen die verschiedenen Funktionen, die diesmal veröffentlicht werden, in gewisser Weise auf den zunehmend lebhaften Markt für Büro-Agenten abzubilden.

Wahrscheinlich wird Xiao Za folgendes in seinem Kopf denken:

Lied, du rollst dein dummer Gemini-Modell nicht, und drehst dich dann zu mir um?????

Gemini-Agent

Die Arbeitsprinzipien, die Google ihr vorgegeben haben, sind die von Chaijunier:

Sie geben ihm Ziele, nicht Anweisungen.

Ihm ein Ziel geben, anstatt schrittweise Anweisungen.

Das bedeutet, dass man den Gemini-Agent helfen möchte, ohne ihm Schritt für Schritt zu sagen, was er zuerst und später tun soll.

Bitte geben Sie nur das endgültige Ergebnis an, den Rest überlassen Sie ihm selbst.

Ihre Kernfähigkeiten umfassen die Einheitliche Zugangskonsole, die dauerhafte Laufzeit im Cloud-Ökosystem, den Übertragungsverkehr zwischen Plattformen, die Kooperation mehrerer Agenten, Event-Trigger und Zeitplanaufgaben usw.

Das Beispiel in dem Text zeigt, wie es dabei hilft, einen Marktbericht zu erstellen.

Es kann selbst nach Informationen suchen und sie ordnen, relevante Daten analysieren, ein Finanzmodell in Google Sheets erstellen und anschließend mit Google Slides eine Präsentation erzeugen.

Im gesamten Prozess kann es je nach Aufgabe die richtigen Werkzeuge wählen, verschiedene Anwendungen aufrufen und anschließend das erledigte Arbeiten an Sie zurückgeben.

Du könntest voller Fragen sein – Ähnliche Operationen zwischen Anwendungen sind doch nichts Neues. Was machst du da?

Die meisten Internetnutzer sind auch nicht positiv gestimmt, und unter dem offiziellen Telegramm-Posting gibt es einfach nur ein Bild im Black-Pink-Stil:

Aber dieses Mal betont Google die Veröffentlichung von Gemini Agent,durch das Bestreben, alle verschiedenen Arbeitsfähigkeiten in einen Agenten zu konzentrieren.

Was ist anders?

Unter dem großen Rahmen des Gemini Agent hat Google auch den Coworker Agent vorgestellt, was im Original „Kollegen-Agent“ bedeutet.

Google erlaubt jetzt Unternehmen, eine langfristig bestehende Identität mit klaren Aufgaben zu erstellen, die sie wie andere Mitglieder eines Teams an der täglichen Zusammenarbeit teilnehmen lässt.

Außerdem hat der AI-Mitarbeiter eine separate Google Workspace-Konto, einen Unternehmens-E-Mail-Account, einen Kalender und Speicherplatz in Google Drive eingerichtet … und kann auch im Firmen-Adressbuch auftauchen.

Der Einstieg ist völlig unkompliziert. Nach der Erstellung kann das Teammitglied wie ein gewöhnlicher Kollege in die Google Chat-Gruppe aufgenommen werden oder es in den Dokumenten @-gestellt werden.

Die AI-Mitarbeiter verwenden ihre eigene Identität, und die ausgeführten Operationen hinterlassen ihre Aufzeichnungen, was die Unternehmensverwaltung erleichtert und es ermöglicht, zu überprüfen, was genau sie getan haben.

Bis hierhin sieht es noch ziemlich normal aus..。

Was unterschiedlich ist, ist abgesehen von der unabhängigen Identität, das Gemini AgentEs wurde ein umfassenderer Gedächtnismechanismus erlangt.

Laut der offiziellen Einstellung verfügt es insgesamt über vier Arten von Erinnerungen.

Die erste ist die Sitzungsmemoriaufbewahrung (Session Memory).

Dies dient hauptsächlich dazu, den Kontext der aktuellen Aufgabe zu speichern.

Auch wenn eine Aufgabe mehrere Tage dauert, kann das Gemini Agent die bereits ausgeführten Schritte sowie die nächsten Aufgaben merken.

Die zweite ist die semantische Erinnerung (Semantic Memory).

Der Gemini Agent sammelt Wissen aus gelesenen Dokumenten, Interaktionen mit Menschen und der Zusammenarbeit mit anderen Agenten und organisiert es in eine strukturierte Wissensdatenbank.

Zum Beispiel: Merken Sie sich, welche Produkte das Unternehmen hat, welche Aufgaben die Teammitglieder übernehmen und was ein bestimmtes Geschäftsbegriff innerhalb des Unternehmens konkret bedeutet.

Die dritte Art ist die prozedurale Erinnerung (Procedural Memory).

Dies dient hauptsächlich dazu, aufzuzeichnen, wie eine Arbeit erledigt werden sollte.

Zum Beispiel: Welche Daten benötigen eine bestimmte Art von Bericht, wie wird der Bericht nach einem bestimmten Prozess analysiert und in welcher Form wird er letztendlich übergeben?

Es gibt noch eine weitere Besonderheit: Der Gemini Agent kann sogarsich selbst Skills erstellen und die in der Arbeitsprozess erlernten Methoden speichern, um sie für folgende Aufgaben zu verwenden.

Die vierte Art ist die episodische Erinnerung (Episodic Memory).

Dies dient dazu, festzuhalten, welche Arbeiten in der Vergangenheit erledigt wurden und die damit verbundenen Ausführungserfahrungen.

Durch die Kombination von vier Arten des Lernens hat der Gemini Agent die Möglichkeit, sich allmählich an die Arbeitsgewohnheiten des Benutzers, den Unternehmensbetrieb und die Teamarbeit zu gewöhnen.

Zum Beispiel muss man beim ersten Mal, wenn es einen Projektbericht erstellt, erklären, wie die Berichtsstruktur, die Datenquellen und der Arbeitsprozess aussehen.

Wenn es die zweite und dritte Mal stattfindet, kann es die bisher angesammelten Kenntnisse und Methoden weiterhin verwenden und den Benutzer dazu vermeiden, alles noch einmal zu erklären.

Google hat außerdem eine Metapher verwendet: „Gemini wird wie ein neuer Mitarbeiter sein und sich vor dem offiziellen Arbeiten allmählich mit Ihnen, Ihren Tools und der Teamarbeit vertraut machen.“

Okay dann.

Jetzt kann man sogar die Einarbeitungsunterweisung selbst durchführen.

Die einzige Frage ist, dass dieser Mitarbeiter anscheinend nicht freiwillig gehen wird (hier wird ein Lächelnes-JPG angezeigt).

Außerdem kann man mit diesem Ding selbst eine große Modellklasse auswählen, um zu arbeiten.

Google hat diesmal klar gemacht, dass das Untermodell des Gemini Agent separat ausgewählt werden kann.

Im aktuellen Stadium kann es dynamisch zwischen den Modelle der Gemini-Serie von Google und den Claude-Modellen von Anthropic gewählt werden. In Zukunft ist auch die Unterstützung für weitere geschlossene und open-source Modelle geplant.

Welches spezifische Modell verwendet wird, entscheidet Gemini nach den Anforderungen der Aufgabe – er wird zwischen Effektivität, Geschwindigkeit und Kosten wählen.

Für einfache Aufgaben kann ein kostengünstigeres Modell verwendet werden; bei komplexen Aufgaben kann ein leistungsfähigere Modell aufgerufen werden.

In einem Projekt können auch mehrere Modelle kombiniert werden, um verschiedene Phasen zu erledigen.

Google nennt diese Fähigkeit „Multi-Modell-Orchestrierung“ und bietet dazu die automatische Routing-Funktion Smart Routing.

Es ist bemerkenswert, dass Google noch einen Punkt betont –

Das Grundmodell kann sich ändern, aber der konstante Kontext, die Fähigkeiten und die Unternehmensdaten des Agents können erhalten bleiben.

Es ist hauptsächlich so, dass man nicht jedes Mal von vorne anfangen muss, um die Arbeit zu verstehen, sondern die vorherigen Aufgaben, Kenntnisse und Arbeitsweisen fortsetzen kann.

Das bedeutet, dass Unternehmen auch dann die unterstehende Modellleistung anpassen können, wenn sich die Rangliste der zukünftigen Modelle ändert, ohne den gesamten etablierten Arbeitsprozess neu aufzubauen.

Google, Meta, OpenAI – eine „Triade der ausländischen täglichen Agenten“?

Die Einführung von Google ist dieses Mal ein ziemlich feines Timing.

Am 29. September hat OpenAI gerade Dots veröffentlicht, das 7×24 Stunden arbeiten kann.

Noch weiter voraus: Meta hat auch den personalen AI-Agent Muse eingeführt.

Heute hat Google mit dem Gemini-Agent in den Kampf eingetreten, sodass die drei Großkonzerne in Bezug auf Agenten zusammengekommen sind.

Schauen wir uns zusammen an, wie die andere zwei Unternehmen vorgehen.

Meta’s Muse zielt eher auf persönliche Lebenssituationen ab, kann Benutzer dabei helfen, Einkäufe zu tätigen, Reisen zu buchen, E-Mails zu senden und sogar Zahlungen durchzuführen.

Wenn man beispielsweise ein Produkt ins Auge führt, kann Muse dabei helfen, das Produkt zu finden, die Optionen zu vergleichen und den Website-Besuch durchzuführen, um schließlich den Kauf abzuschließen.

Im Vergleich zu den komplexen Prozessen innerhalb des Unternehmens konzentriert sich Muse auf die kleinen, zeitaufwändigen Dinge im persönlichen Alltag.

Dies hat auch mit den bestehenden sozialen Produkten von Meta und der großen Nutzergruppe zu tun.

Es ist offensichtlich auch eine Chance, die Meta nutzen möchte, indem sie den normalen Nutzern erlaubt, ihre Bedürfnisse wie Einkaufen und Reisen an die AI zu übergeben.

Die Gemeinsamkeiten zwischen Dots von OpenAI und Gemini Agent sind noch zahlreicher.

Dots verfügt über unabhängige Cloud-Computer, die 7×24 Stunden laufen, die langfristigen Ziele und Arbeitsgewohnheiten des Benutzers speichern können, sowie über die Möglichkeit, mehr als 4000 Anwendungen zu verbinden.

Zum Beispiel kann der Entwickler, wenn er neue Benutzerberichte erhält, Dots aktiv das Problem analysieren, den Code ändern und einen PR bereitstellen, um von anderen überprüft zu werden.

Für Inhaltskreative kann es auch nach dem Eintreffen neuer Interviews dazu verwendet werden, Materialien zu ordnen und Entwürfe für Inhalte zu erstellen.

Allerdings berücksichtigt Dots aktuell mehr die kontinuierliche Arbeit rund um das individuelle Benutzerprofil.

Es wird nach und nach die Präferenzen, Ziele und Bewertungskriterien des Benutzers verstehen und aktiv nach Maßnahmen suchen, die voranschreiten.

OpenAI untersucht auch professionelle Dots für Unternehmenspositionen, damit Agenten eine eigene Identität und Verantwortung haben. Allerdings befindet sich dieser Bereich derzeit hauptsächlich in einer frühen Unternehmenspilotphase.

Im Vergleich zeigt Google diesmal insbesondere, wie der Agent weiter in das bestehende Unternehmensorganisation und -system eindringen kann.

Das Gemini Agent kann den Geschäftsbetrieb in Anwendungen wie Gmail, Docs, Sheets und Calendar nutzen, um zu verstehen, was die Mitarbeiter tun.

Die Unternehmen können außerdem Coworker-Agenten mit eigenen E-Mail-Adressen, Kalendern, Accounts und Berechtigungen erstellen, damit diese in ihrer eigenen Identität an der Teamarbeit teilnehmen können.

Gleichzeitig fügt Google auch die Modellauswahl, die Verbindung zu Unternehmendaten, Sicherheitsaudits und Kostenkontrolle in dieses System ein.

Sogar der Konkurrent Claude kann zum untersten Modell werden, das von dem Gemini-Agent zur Erfüllung seiner Aufgaben verwendet wird.

So sieht es aus, dass die Schwerpunkte der drei Unternehmen deutlich erkennbar sind.

Noch eine Sache

Übrigens hat Google in seinem längeren Artikel auch weitere relevanten Inhalte veröffentlicht. Für Interessierte kann man sich die Seite selbst ansehen, chao~

Gemini tritt vollständig in Google Workspace ein und ermöglicht die Arbeit über verschiedene Anwendungen.

Offene Fähigkeiten, Tools und Unternehmensverbindungen

Einführung von Agenten für Datenanalyse, Finanzen und Recht

Stärken der Sicherheitsverwaltung und Kostenkontrolle des Agenten

【Google Originaltext】

https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026/

Originalquelle

量子位

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten