量子位

No espero Gemini 4. Google lanza un agente de oficina que soporta la llamada a Claude.

Un nuevo “monstruo de sutura” ya ha aparecido, ¿cómo podría quedarse atascado?

Hengyu, enviado desde Aofei Si
QuantumBit | Account público QbitAI

Muy bien, ¡Google también se ha unido a la batalla de los agentes inteligentes de oficina, y además destaca por el uso de múltiples modelos, incluso ha incluido a su competidor Claude en esa competencia!

Hoy en la madrugada, Google Cloud publicó un artículo largo titulado “Bienvenido a Gemini en el trabajo 2026: Presentación del agente Gemini”, firmado personalmente por Thomas Kurian, CEO de Google Cloud, que trata sobre una serie de actualizaciones de Gemini en el campo de los agentes empresariales.

Entre ellos, el más importante es el Gemini Agent recién lanzado.

De acuerdo con la idea de Google, se tratará de un agente de oficina universal que cubra todo tipo de tareas laborales y pueda operar a largo plazo.

Puede ayudarte a buscar información, escribir correos, crear PPTs, analizar datos, escribir y ejecutar código, además de llamar a herramientas entre aplicaciones, planificar tareas por tu cuenta y, si es necesario, reunir varios sub-Agentes para trabajar juntos.

Además, hay dos aspectos especialmente dignos de atención.

En primer lugar, puede tener su propia identidad empresarial, convirtiéndose en un colega de IA con correo electrónico, calendario y cuenta independiente.

En segundo lugar, puede seleccionar automáticamente el modelo subyacente según la tarea, e incluso llamar a Claude de Anthropic.

Vaya, ¿Google ni siquiera necesita usar su propio Gemini?

Lo más interesante es que todas las funciones lanzadas esta vez parecen estar orientadas hacia el mercado de agentes de oficina, que ha ganado popularidad recientemente.

Seguramente, el pequeño Zha tendría algo así en su mente:

Canción, ¿no te envolves con ese modelo tonto de Gemini, sino que te vuelves hacia mí?????

Agente Gemini

Los principios de trabajo que Google le ha establecido son los de la tía Jang:

Le das objetivos, no instrucciones.

Dale un objetivo, en lugar de instrucciones paso a paso.

Es decir, quiero que el agente Gemini ayude en el trabajo, sin necesidad de indicarle paso a paso qué hacer primero y qué hacer después.

Solo necesita informar el resultado final que desea, y el resto debe dejarse organizar por sí mismo.

Sus capacidades clave incluyen una entrada unificada, funcionamiento persistente en la nube, llamadas multiplataforma, colaboración entre múltiples Agentes, desencadenamiento de eventos y tareas programadas.

El ejemplo que se muestra en el texto es para que ayude a completar un informe de análisis de mercado.

Puede buscar y organizar información por sí misma, analizar datos relacionados, crear modelos financieros en Google Sheets, y luego llamar a Google Slides para generar un presentación.

Durante todo el proceso, puede elegir las herramientas necesarias según las tareas, llamar a diferentes aplicaciones y, finalmente, devolverte el trabajo completado.

Podrías tener un montón de preguntas en la cabeza—Las operaciones entre aplicaciones similares no son nada nuevo, ¿qué estás haciendo?

La mayoría de los usuarios en internet tampoco tienen buenas expectativas al respecto, y debajo del tweet oficial de promoción hay un dibujo con estilo black pink:

Pero, esta vez, cuando Google lanza Gemini Agent, se enfoca en intentar concentrar todas las capacidades de trabajo en un único Agent.

¿Qué diferencia hay?

En el gran marco del Gemini Agent, Google también ha presentado al Coworker Agent, que en español se traduce como “intérprete inteligente de colega”.

Google ahora permite que las empresas creen una identidad de existencia a largo plazo y con tareas claras para Gemini, permitiéndole participar en la colaboración diaria como los demás miembros del equipo.

Además, el colega de IA tiene una cuenta independiente de Google Workspace, un correo electrónico empresarial, un calendario y almacenamiento en Google Drive… Y también puede aparecer en la lista de contactos de la empresa.

En primer lugar, el umbral de inicio es aproximadamente nulo; en segundo lugar, después de la creación, los miembros del equipo pueden invitarlo a unirse al grupo de chat de Google Chat o @arlo en el documento, tal como lo harían con colegas comunes.

Los colegas de IA utilizan su propia identidad; las operaciones que realizan dejan registros propios, lo que facilita la gestión empresarial y el seguimiento de lo que realmente hacen.

Hasta este punto, parece todavía muy normal..

Lo que es diferente es que, además de la identidad independiente, el Gemini Agentdispone de un mecanismo de memoria más completo.

Según la introducción oficial, tiene un total de cuatro tipos de memoria.

El primero es la memoria de sesión.

Se utiliza principalmente para guardar el contexto de la tarea actual.

Incluso si una tarea dura varios días, Gemini Agent puede recordar qué pasos se han completado y qué trabajo queda por hacer.

La segunda es la memoria semántica (Semantic Memory).

El Agente Gemini acumula conocimiento a partir de los documentos leídos, las conversaciones con personas y la colaboración con otros Agentes, y lo organiza en una base de conocimientos estructurada.

Por ejemplo, recuerde qué productos tiene la empresa, qué se encarga de cada miembro del equipo y qué significa un término comercial específico dentro de la empresa.

El tercer tipo es la memoria procedural (Procedural Memory).

Se utiliza principalmente para registrar cómo debe realizarse una tarea.

Por ejemplo, qué datos necesita un tipo de informe, qué proceso se utiliza para su análisis y en qué formato se entrega finalmente.

También hay un detalle: el Gemini Agent puede inclusoescribir sus propias habilidades, guardar los métodos aprendidos durante el trabajo y utilizarlos en tareas futuras.

La cuarta es la memoria episódica.

Se utiliza para registrar qué trabajos se completaron en el pasado, así como las experiencias de ejecución correspondientes.

Cuando las cuatro formas de memoria se combinan, Gemini Agent tendrá la oportunidad de familiarizarse gradualmente con los hábitos de trabajo del usuario, los negocios de la empresa y el modo de colaboración en equipo.

Por ejemplo, la primera vez que se le pide que haga el informe semanal del proyecto, puede ser necesario explicar la estructura del informe, las fuentes de datos y el proceso de trabajo.

Cuando llegue la segunda y tercera vez, podrá utilizar los conocimientos y métodos acumulados anteriormente, reduciendo así el contenido que los usuarios deben repetir.

Google también utilizó una metáfora específica, diciendo que “Gemini será como un nuevo empleado: antes de comenzar a trabajar oficialmente, se familiarizará gradualmente contigo, con tus herramientas y con el equipo”.

Bueno.

Ahora incluso puedo hacer yo mismo el entrenamiento de incorporación.

El único problema es que parece que este empleado no se irá voluntariamente (aquí se envía un .jpg con un rostro sonriente).

Además, este dispositivo permite elegir por sí mismo los modelos grandes de inteligencia artificial para trabajar.

Google ha dejado claro esta vez que el modelo subyacente del Gemini Agent puede seleccionarse por separado.

En esta etapa, puede elegir dinámicamente entre las series de modelos Gemini propiedad de Google y las series de modelos Claude de Anthropic. En el futuro, se planea soportar más modelos con código cerrado y con código abierto.

En cuanto al uso específico, Gemini, según las necesidades de la tarea, elige entre el efecto, la velocidad y el costo.

Para trabajos más sencillos, se puede utilizar un modelo de menor costo; frente a tareas complejas, se puede llamar a un modelo con mayor capacidad.

En un proyecto también se pueden combinar varios modelos para completar diferentes etapas.

Google denomina esta capacidad como programación de múltiples modelos, y ofrece además la capacidad de enrutamiento automático Smart Routing.

Cabe destacar que Google también enfatizó algo.

El modelo subyacente puede cambiar, pero el contexto, las habilidades y los datos empresariales acumulados por el Agente pueden permanecer.

Se trata de permitir que no sea necesario comenzar todo desde cero cada vez para entender el trabajo, sino que se pueda continuar con las tareas, conocimientos y métodos de trabajo anteriores.

Esto significa que, incluso si cambian las posiciones en el ranking de capacidades de los modelos futuros, las empresas pueden ajustar el modelo subyacente, sin tener que deshacer todo el proceso de trabajo ya establecido.

Google, Meta, OpenAI, ¿la triple batalla diaria en el extranjero?

La entrada de Google esta vez tiene un momento bastante delicado.

El 29 de septiembre, OpenAI acaba de lanzar Dots que puede funcionar las 24 horas del día, los 7 días de la semana.

Más adelante, Meta también lanzó el agente AI personal Muse.

Hoy, Google se une a la batalla con el agente Gemini, y los tres gigantes se encuentran en lo que respecta a los agentes.

Revisemos juntos cómo son las otras dos empresas.

La Muse de Meta se enfoca más en escenarios de vida personal, y puede ayudar a los usuarios a comprar, reservar viajes, enviar correos electrónicos e incluso realizar pagos.

Por ejemplo, si te gusta un artículo, Muse puede ayudarte a buscar productos, comparar opciones y operar en la página web, hasta que finalmente completes la compra.

En comparación con los complejos procesos de trabajo dentro de la empresa, Muse se enfoca más en las cosas triviales y que consumen tiempo en la vida diaria de las personas.

Esto también tiene relación con los productos sociales existentes de Meta y su gran grupo de usuarios.

Hacer que los usuarios comunes se acostumbren a dejar que la IA se encargue de necesidades como comprar y viajar, obviamente también es una oportunidad que Meta espera aprovechar.

Hay muchas similitudes entre Dots de OpenAI y Gemini Agent.

Dots tiene una computadora en la nube independiente que funciona 7×24 horas, puede recordar los objetivos a largo plazo y las costumbres de trabajo del usuario, e también puede conectarse a más de 4000 aplicaciones.

Por ejemplo, cuando el desarrollador recibe nuevas observaciones de los usuarios, Dots puede analizar activamente el problema, modificar el código y preparar un PR para que sea revisado por otros.

Para los creadores de contenido, también puede organizar los materiales y elaborar esquemas de contenido después de que lleguen las nuevas grabaciones de entrevistas.

Sin embargo, Dots actualmente enfatiza más el trabajo continuo en torno a la persona del usuario.

Entenderá gradualmente las preferencias, objetivos y criterios de juicio del usuario, y buscará activamente las acciones que puedan avanzar.

OpenAI también está explorando Dots especializados para puestos empresariales, lo que permitiría a los Agentes tener una identidad y responsabilidades independientes. Sin embargo, esta parte se encuentra actualmente en una fase temprana de piloto empresarial.

En comparación, lo que Google destaca en esta ocasión es cómo permite al Agent entrar aún más en los sistemas organizativos y de trabajo existentes de las empresas.

El Gemini Agent puede aprovechar el contexto de negocio en aplicaciones como Gmail, Docs, Sheets y Calendar para entender lo que hace los empleados.

La empresa también puede crear un agente Coworker con correo electrónico independiente, calendario, cuenta y permisos, para que participe en el trabajo en equipo bajo su propia identidad.

Al mismo tiempo, Google también incluye la selección de modelos, la conexión de datos empresariales, la auditoría de seguridad y el control de costos en este sistema.

Incluso el competidor Claude puede convertirse en el modelo subyacente llamado por el agente Gemini para completar las tareas.

De esta manera, los puntos focales de las tres empresas son bastante claros.

Otra cosa más

Por cierto, en el artículo largo de Google también se publican otros contenidos relacionados. Aquellos que estén interesados pueden visitarlos por sí mismos. ¡Chao!

Gemini entra completamente en Google Workspace, y permite realizar trabajo entre aplicaciones.

Abre habilidades, herramientas y conectores empresariales

Lanzar agentes especializados en análisis de datos, finanzas y derecho

Mejorar la gobernanza de seguridad y el control de costos del agente

【Texto original de Google】

https://cloud.google.com/blog/products/ai-machine-learning/welcome-to-gemini-at-work-2026/

Fuente original

量子位

Notas sobre el contenido

La publicación original y los derechos pertenecen a la fuente.

Traducción automática · Consulte el original