Hengyu, provenant de Aofei Si
Quantum Bit | Chaîne publique QbitAI
Bien, bien, Google aussi se joigne au combat des intelligences de travail, et en mettant l’accent sur les appels de multiples modèles, il a même inclus Claude comme concurrent !
Ce matin, à l’aube, Google Cloud a publié un article long intitulé « Welcome to Gemini at Work 2026 : Introducing the Gemini agent », signé personnellement par le PDG de Google Cloud, Thomas Kurian, dans lequel sont présentés les dernières mises à jour de Gemini dans le domaine des agents d’entreprise.
Dans ce cas, le plus important est le Gemini Agent récemment publié.
Conformément à l’idée de Google, il s’agira d’un agent de bureau général capable de couvrir toutes sortes de tâches professionnelles et de fonctionner sur le long terme.
Il peut vous aider à rechercher des informations, écrire des e-mails, créer des PPT, analyser des données, écrire et exécuter du code, ainsi que à appeler des outils entre différentes applications. Vous pouvez planifier vos tâches vous-même et, si nécessaire, rassembler plusieurs sous-Agents pour travailler ensemble.
De plus, il y a deux points particulièrement intéressants à noter.
Premièrement, elle peut avoir son propre identité d'entreprise, devenant une collègue IA dotée d’un e-mail, d’un calendrier et d’un compte indépendant.
Deuxièmement, il peut choisir automatiquement le modèle de base en fonction de la tâche, et même appeler Claude de Anthropic.
Bon sang, Google ne semble même pas obligé d’utiliser son propre Gemini ?
Plus intéressant encore, les différentes fonctionnalités publiées cette fois-ci semblent viser tout droit le marché des agents de travail qui est devenu très actif récemment.
Peut-être que Xiaoza aurait l’intérieur suivant :
Chanson, tu ne t’énerves pas sur ton modèle idiot Gemini, tu te tournes vers moi ???????
Agent Gemini
Les principes de travail que Google lui a fixés sont ceux de la vieille femme :
Vous lui donnez des objectifs, pas des instructions.
Donne-lui un objectif, plutôt que des instructions étape par étape.
C’est-à-dire vouloir faire appel à l’agent Gemini pour s’occuper du travail, sans avoir besoin de lui dire pas à pas ce qu’il doit faire en premier et en dernier.
Il suffit de communiquer le résultat final souhaité, le reste peut être géré par lui-même.
Ses compétences clés incluent une entrée unifiée, un fonctionnement persistant en nuage, des appels multiplateforme, la collaboration entre plusieurs Agents, les déclenchements d’événements et les tâches planifiées.
L’exemple donné dans le texte est pour qu’il aide à rédiger un rapport d’analyse de marché.
Il peut rechercher et organiser des données par lui-même, analyser des données correspondantes, créer un modèle financier dans Google Sheets, puis utiliser Google Slides pour générer un présentoir.
Tout au long du processus, il peut choisir les outils nécessaires en fonction des exigences du travail, appeler différentes applications, et finalement vous restituer le travail accompli.
Vous pourriez avoir une multitude de questions dans votre tête — Les opérations inter-apps similaires ne sont pas quelque chose de nouveau, alors que faites-vous ?
La plupart des utilisateurs de Internet sont également pessimistes à ce sujet, et sous le tweet officiel, une illustration au style black pink est ajoutée au hasard.
Mais, cette fois, lors de la publication de Gemini Agent par Google, l'accent est mis sur l'idée de concentrer toutes les capacités de travail sur un seul Agent.
Quel est le différend ?
Dans le grand cadre du Gemini Agent, Google a également introduit le Coworker Agent, qui signifie littéralement « agent intelligent de collègue ».
Google permet maintenant aux entreprises de créer une identité persistante et avec des responsabilités claires pour Gemini, leur permettant de participer à la collaboration quotidienne comme les autres membres de l’équipe.
De plus, le collègue IA dispose d’un compte Google Workspace indépendant, d’un e-mail professionnel, d’un calendrier et d’une place de stockage dans Google Drive… Il peut également apparaître dans l’annuaire de l’entreprise.
En premier lieu, le seuil d’initiation est à peu près nul. Ensuite, après la création, les membres du groupe peuvent l’inviter dans la conversation en ligne de Google Chat ou lui envoyer un @ dans un document, comme ils le feraient avec des collègues ordinaires.
Le collègue IA utilise sa propre identité ; les opérations effectuées sont enregistrées par lui-même, ce qui facilite la gestion de l’entreprise et permet de suivre exactement ce qu’il a fait.
À ce stade, on dirait encore que c’est normal...。
Ce qui diffère, en plus de l’identité indépendante, c’est que le Gemini Agent dispose d’un mécanisme de mémoire plus complet.
Selon la description officielle, il possède au total quatre types de mémoire.
Le premier est la mémoire de session.
Principalement utilisé pour conserver le contexte de la tâche actuelle.
Même si une tâche dure plusieurs jours, le Gemini Agent se souvient des étapes déjà réalisées et des tâches restantes.
La deuxième est la mémoire sémantique (Semantic Memory).
L’Agent Gemini accumule des connaissances à partir des documents lus, des conversations avec les personnes et de la collaboration avec d’autres Agents, et les organise dans une base de connaissances structurée.
Par exemple, mémorisez quels produits la société propose, ce que chaque membre de l’équipe est responsable de, et ce que désigne concrètement un terme commercial au sein de l’entreprise.
Le troisième type est la mémoire procédurale (Procedural Memory).
Principalement utilisé pour décrire comment une tâche doit être effectuée.
Par exemple, quels données sont nécessaires pour certains types de rapports, quel processus est suivi pour leur analyse, et en quelle format sont-ils finalement fournis.
Il y a encore un détail : l’Agent Gemini peut mêmeécrire lui-même ses Skills, en conservant les méthodes apprises au cours du travail, afin de les utiliser pour les tâches suivantes.
La quatrième est la mémoire épisodique (Episodic Memory).
Utilisé pour enregistrer les tâches accomplies dans le passé, ainsi que les expériences de mise en œuvre correspondantes.
Quatre types de mémoire combinés, le Gemini Agent aura alors la possibilité de s’habituer progressivement aux habitudes de travail des utilisateurs, aux activités de l’entreprise et aux modes de collaboration en équipe.
Par exemple, lors de la première fois que l’on lui demande de rédiger un rapport hebdomadaire, il peut être nécessaire d’expliquer la structure du rapport, les sources de données et le processus de travail.
Lors de la deuxième et troisième fois, il peut utiliser les connaissances et méthodes accumulées précédemment, réduisant ainsi le contenu à nouveau expliqué par l’utilisateur.
Google a également utilisé une métaphore : « Gemini sera comme un nouvel employé, qui s’habitue progressivement à vous, à vos outils et au équipe avant de commencer officiellement son travail ».
D’accord.
Maintenant, je peux même faire la formation d’embauche moi-même.
La seule question est que cet employé ne semble pas vouloir partir volontairement (ci-dessus un smile face.jpg).
De plus, cet outil permet de choisir soi-même les grandes modèles de travail.
Google a clairement indiqué cette fois que le modèle de base du Gemini Agent peut être choisi séparément.
À l’heure actuelle, il peut choisir dynamiquement entre les modèles de la série Gemini d’Google et les modèles de la série Claude d’Anthropic. À l’avenir, il est prévu de soutenir davantage de modèles closed-source et open-source.
Quant à la méthode exacte à utiliser, Gemini fera une sélection entre l’efficacité, la vitesse et le coût, en fonction des exigences du projet.
Pour des tâches relativement simples, on peut utiliser un modèle moins coûteux ; face à des tâches complexes, on peut appeler un modèle plus performant.
Un projet peut également combiner plusieurs modèles pour réaliser différentes étapes.
Google appelle cette capacité « orchestration de multiples modèles », et propose en complément la capacité de routage automatique Smart Routing.
Il est intéressant de noter que Google souligne également un point –
Le modèle de base peut changer, mais le contexte, les compétences et les données de l'entreprise accumulées par l’Agent peuvent être conservées.
C’est principalement afin qu’il n’ait pas besoin de commencer tout à nouveau à chaque fois, et puisse continuer les tâches, les connaissances et les méthodes de travail existantes.
Cela signifie que, même si la hiérarchie des capacités des modèles futurs change, les entreprises peuvent ajuster le modèle de base sans avoir à reprendre tout le processus de travail déjà établi.
Google, Meta, OpenAI, une sorte de "Sangoku" quotidien à l’étranger ?
La présence de Google cette fois-ci, le moment est plutôt subtil.
Le 29 septembre, OpenAI vient de publier Dots capable de fonctionner 7×24 heures.
En avant, Meta a également lancé l’agent AI personnel Muse.
Aujourd'hui, Google s'engage dans la bataille avec le Gemini agent, et les trois géants se retrouvent donc à se rencontrer en matière d'agents.
Voici un résumé des approches des deux autres entreprises.
Muse de Meta est plus axé sur les scénarios de vie personnelles, et peut aider les utilisateurs à faire des achats, réserver des voyages, envoyer des e-mails, et même effectuer des paiements.
Par exemple, si vous avez un produit en tête, Muse peut vous aider à trouver la marchandise, comparer les options et utiliser le site web, pour finalement effectuer l’achat.
Par rapport aux processus complexes internes de l'entreprise, Muse se concentre davantage sur les tâches insignifiantes et chronophages de la vie quotidienne personnelle.
Celaest également lié aux produits sociaux existants de Meta et à son vaste groupe d’utilisateurs.
Permettre aux utilisateurs ordinaires d’accepter que les besoins liés aux achats ou aux déplacements soient gérés par l’IA est également une opportunité que Meta souhaite saisir.
Les points communs entre Dots d’OpenAI et Gemini Agent sont encore plus nombreux.
Dots dispose d’un ordinateur en nuage indépendant, fonctionnant 7×24 heures, capable de mémoriser les objectifs à long terme et les habitudes de travail de l’utilisateur, et il peut se connecter à plus de 4000 applications.
Par exemple, lorsque le développeur reçoit de nouvelles réactions des utilisateurs, Dots peut analyser l’problème de manière proactive, modifier le code et préparer un PR pour être examiné par les autres.
Pour les créateurs de contenu, cela permet également de organiser les matériaux et de préparer un projet de contenu après l’arrivée de nouvelles entretiens.
Cependant, Dots met actuellement davantage l’accent sur le travail continu autour de la personne utilisateur.
Il comprend progressivement les préférences, les objectifs et les critères de jugement de l’utilisateur, et cherche activement les actions qui peuvent le faire progresser.
OpenAI explore également des Dots professionnels adaptés aux postes d’entreprise, permettant aux Agents d’avoir une identité et des responsabilités indépendantes. Cependant, cette partie se trouve actuellement principalement dans une phase précoce de pilote pour les entreprises.
En comparaison, ce que Google met en avant cette fois, c’est le fait de permettre à l’Agent d’entrer davantage dans les structures organisationnelles et les systèmes de travail existants de l’entreprise.
Le Gemini Agent peut utiliser le contexte professionnel présent dans des applications telles que Gmail, Docs, Sheets et Calendar pour comprendre ce que fait l’employé.
L’entreprise peut également créer un agent Coworker doté d’un email indépendant, d’un calendrier, d’un compte et de droits, afin qu’il participe à la collaboration d’équipe en tant que sa propre identité.
En même temps, Google intègre également la sélection des modèles, le connecteur de données d'entreprise, l’audit de sécurité et la gestion des coûts.
Même le concurrent Claude peut devenir le modèle de base appelé par l’agent Gemini lorsqu’il accomplit sa tâche.
De cette manière, les points clés de chaque entreprise sont assez clairs.
Une chose de plus
BTW, dans le long article de Google, d’autres contenus pertinents ont également été publiés. Ceux qui sont intéressés peuvent se rendre sur les pages pour les consulter eux-mêmes, chut !
Gemini entre pleinement dans Google Workspace, permettant de travailler entre différentes applications.
Ouvrir des compétences, des outils et des connecteurs entre entreprises
Lancement de l’agent pour les domaines de l’analyse de données, la finance et le droit
Renforcer la gouvernance de sécurité et le contrôle des coûts pour l’Agent
【Texte original de Google】
https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026/