Durante años utilizamos ChatGPT de una forma muy concreta:

pregunta
  ↓
modelo
  ↓
respuesta
  ↓
humano copia la respuesta
  ↓
humano abre otra aplicación
  ↓
humano ejecuta el trabajo

El modelo ayudaba a pensar.

Pero la última milla seguía siendo humana.

Había que copiar el correo a Gmail.

Crear manualmente el evento en Calendar.

Abrir Excel o Sheets.

Buscar archivos.

Mover información entre aplicaciones.

Un video reciente de Gustavo Entrala, “El nuevo ChatGPT tiene SUPERPODERES y no los estás usando”, resulta interesante precisamente porque enseña cómo empieza a romperse esa arquitectura.

Entrala prueba tareas bastante ordinarias:

  • preparar un correo;
  • investigar noticias diariamente;
  • convertir un video en una presentación;
  • reorganizar su calendario;
  • buscar facturas en el correo y construir una hoja de cálculo;
  • recuperar información dispersa entre aplicaciones.

Las demos llaman la atención.

Pero el punto importante no es que ChatGPT pueda hacer una presentación bonita.

La transformación real es ésta:

ANTES

Humano
  ↓
ChatGPT
  ↓
respuesta
  ↓
Humano
  ↓
aplicación

AHORA

Humano
  ↓
ChatGPT
  ↓
tools / apps / browser / archivos
  ↓
aplicación
  ↓
resultado

El modelo deja de ser únicamente una fuente de respuestas.

Empieza a convertirse en una capa operativa sobre el software que ya usamos.

Y eso puede ser bastante más importante que una mejora incremental del modelo.

La demo del correo: el humano deja de transportar contexto

Una de las primeras pruebas del video es muy simple.

Entrala tiene abierto un borrador de correo destinado a Ethan Mollick, profesor de Wharton y una de las voces más conocidas alrededor de la adopción práctica de IA.

En vez de copiar el texto del borrador a ChatGPT, pedir sugerencias, copiar la respuesta y volver al correo, hace algo conceptualmente distinto:

"lee el borrador que tengo abierto,
investiga información reciente
y déjame una versión preparada en Gmail"

La diferencia parece pequeña.

Pero elimina al usuario como bus de integración humano.

Antes:

Safari
  ↓ copiar
ChatGPT
  ↓ copiar
Gmail

Ahora:

ChatGPT
  ├── observa contexto
  ├── investiga
  ├── redacta
  └── actúa en Gmail

Ese patrón se repite en prácticamente todas las demás demos.

Lo importante ya no es únicamente generar el texto correcto.

Es llevar el resultado hasta el lugar donde debe vivir.

De “respuesta” a “resultado terminado”

OpenAI describe actualmente ChatGPT Work como un agente para tareas más largas y complejas que puede investigar, analizar información, trabajar entre apps y archivos y producir documentos, hojas de cálculo, presentaciones, reportes y otros entregables terminados.

No es simplemente una nueva pestaña visual.

Representa otra expectativa sobre lo que debería hacer el sistema.

Un chat tradicional optimiza para:

prompt → respuesta

Work optimiza para algo más parecido a:

objetivo
  ↓
recopilar contexto
  ↓
planificar
  ↓
usar herramientas
  ↓
crear artefactos
  ↓
verificar
  ↓
entregar resultado

OpenAI lo resume como una experiencia para convertir metas en trabajo terminado y mantener proyectos avanzando mientras el usuario conserva control sobre las acciones importantes.

Eso mueve la unidad de valor.

La unidad deja de ser solamente un mensaje.

Empieza a ser una tarea completada.

Las apps son el sistema nervioso del agente

En el video aparece repetidamente la palabra plugins.

La terminología de ChatGPT ha cambiado varias veces entre conectores, apps y plugins, pero la idea arquitectónica es estable: ChatGPT necesita interfaces estructuradas para acceder a los sistemas donde viven nuestros datos y donde ocurren nuestras acciones.

OpenAI documenta actualmente las apps conectadas como una forma de permitir que ChatGPT busque información, incorpore contexto y, cuando la aplicación lo soporta y el usuario tiene los permisos adecuados, ejecute acciones.

Podemos verlo así:

                    ┌── Gmail
                    ├── Google Calendar
                    ├── Google Drive
Usuario → ChatGPT ──┼── Slack
                    ├── GitHub
                    └── otras apps

La conversación se convierte en un punto de entrada común.

El usuario ya no necesita pensar primero:

“¿En qué aplicación tengo que entrar?”

Puede pensar:

“¿Qué quiero conseguir?”

Y el agente decide qué herramienta necesita.

Este cambio encaja con una tesis que hemos analizado anteriormente en Capital de Tokens: las aplicaciones pueden empezar a convertirse en backends para agentes.

Gmail sigue siendo Gmail.

Calendar sigue siendo Calendar.

GitHub sigue siendo GitHub.

Pero cada vez más trabajo puede llegar a esos productos a través de una interfaz superior: el agente.

Scheduled Tasks: el salto más subestimado

En el video, Entrala pide un informe diario sobre el impacto de la inteligencia artificial en el trabajo.

No quiere simplemente una búsqueda.

Quiere que el sistema vuelva mañana.

Y pasado mañana.

Y el día siguiente.

Eso cambia radicalmente la relación con el modelo.

Un chatbot tradicional existe cuando el usuario escribe.

Una tarea programada introduce persistencia temporal:

Usuario define objetivo
       ↓
ChatGPT guarda tarea
       ↓
reloj / condición
       ↓
ChatGPT vuelve a ejecutar
       ↓
resultado + notificación

OpenAI documenta actualmente Scheduled Tasks para trabajos de una sola vez, recurrencias, monitoreo de cambios y, en determinados planes y superficies, tareas disparadas por eventos.

Por ejemplo:

"Todos los días a las 10 AM,
busca novedades fiables sobre IA y empleo,
contrasta las fuentes y dime qué cambió."

El detalle clave es que el usuario no necesita iniciar manualmente cada corrida.

Ahí aparece una de las propiedades fundamentales de un agente persistente:

capacidad de volver a trabajar sin que el humano tenga que recordar empezar de nuevo.

Del cron a un agente con contexto

Los ingenieros llevan décadas automatizando trabajo con cron.

0 10 * * * script.sh

Entonces, ¿qué tiene de especial una Scheduled Task?

La diferencia es la capa de razonamiento.

Un cron tradicional ejecuta una instrucción rígida:

cada día
  ↓
ejecutar script

Una tarea agéntica puede ejecutar una intención:

cada día
  ↓
revisar información nueva
  ↓
comparar con lo anterior
  ↓
decidir qué es relevante
  ↓
resumir
  ↓
notificar sólo si importa

La automatización deja de estar limitada a una función determinista.

Puede contener evaluación semántica.

Eso abre posibilidades como:

si aparece una noticia importante → avísame
si no cambió nada significativo → no me molestes

O:

cada mañana
  ↓
revisar correo
  ↓
identificar mensajes importantes
  ↓
cruzar con calendario
  ↓
preparar briefing

No es magia.

Sigue siendo software ejecutando instrucciones y herramientas.

Pero el lenguaje natural empieza a convertirse en una forma de programar automatizaciones de mayor nivel.

El calendario muestra algo más importante que crear eventos

Otra demo del video consiste en organizar lo que queda del mes de agosto.

Entrala dicta varias reglas:

  • reservar mañanas para escribir un libro;
  • dedicar tardes a videos;
  • separar tiempo específico para desarrollar el canal;
  • mantener fines de semana libres.

La parte interesante ocurre cuando el sistema detecta un conflicto con un evento que ya existía.

Ahí el agente no está ejecutando ciegamente una lista.

Está haciendo algo parecido a:

leer estado actual
  ↓
interpretar restricciones nuevas
  ↓
detectar conflicto
  ↓
pedir decisión
  ↓
escribir cambios

Esto ilustra una diferencia crítica entre una macro y un agente.

Una macro ejecuta pasos.

Un agente intenta resolver un objetivo bajo restricciones cambiantes.

La arquitectura conceptual se parece más a:

Goal
  ↓
Observe
  ↓
Plan
  ↓
Act
  ↓
Observe again
  ↓
Replan if needed

Ese loop —observar, actuar, volver a observar— es una de las piezas centrales de los sistemas agénticos.

Facturas → hoja de cálculo: el valor está en atravesar aplicaciones

La demo que probablemente tiene más valor práctico para muchos autónomos y pequeñas empresas es la de las facturas.

Entrala pide algo parecido a:

busca todas las facturas recientes en mi correo
       ↓
abre o examina los documentos
       ↓
extrae importes
       ↓
separa monedas
       ↓
crea una hoja de cálculo
       ↓
añade enlaces a las facturas originales

Ninguno de esos pasos es revolucionario individualmente.

La novedad está en que el agente puede atravesar varias capas:

correo
  ↓
clasificación
  ↓
adjuntos / documentos
  ↓
extracción estructurada
  ↓
hoja de cálculo
  ↓
links de trazabilidad

Eso se parece mucho más a una automatización empresarial que a un chatbot.

En la demo, el sistema encuentra 19 documentos y deja algunas facturas sin importe cuando no puede validarlo correctamente.

Entrala hace una observación muy importante: hay que revisar el resultado.

Ese comentario debería acompañar prácticamente todas las demos de agentes que operan sobre sistemas reales.

El principio que importa: separar lectura, propuesta y acción

Cuanto más poder recibe un agente, más importante se vuelve controlar la autoridad.

Podemos dividir las acciones en tres niveles:

1. READ
   buscar
   leer
   resumir
   analizar

2. PREPARE
   redactar correo
   proponer eventos
   preparar compra
   construir documento

3. MUTATE
   enviar
   borrar
   publicar
   mover dinero
   cancelar
   modificar datos

No todas deberían tener el mismo nivel de autonomía.

Una arquitectura prudente podría permitir:

leer automáticamente
      ↓
preparar automáticamente
      ↓
confirmar antes de acciones sensibles

Por ejemplo:

ChatGPT redacta correo
        ↓
lo deja como draft
        ↓
humano revisa
        ↓
enviar

O:

ChatGPT reorganiza agenda
        ↓
detecta conflicto
        ↓
pide decisión
        ↓
aplica cambios

A medida que los agentes se convierten en capas operativas, permission design deja de ser un detalle de producto.

Se convierte en parte de la ingeniería principal.

Cloud Browser: cuando no existe una API perfecta

Las apps estructuradas son el camino ideal.

Pero gran parte de internet sigue sin ofrecer una integración específica para agentes.

Ahí entra otra pieza de ChatGPT Work: Cloud Browser.

OpenAI lo describe como un navegador remoto que puede leer páginas, pulsar botones, completar formularios y ejecutar pasos en sitios compatibles, incluyendo determinados flujos con sesión iniciada.

Conceptualmente:

ChatGPT Work
    ↓
Cloud Browser
    ↓
website
    ↓
DOM / interfaz
    ↓
click / type / navigate

Esto es importante porque proporciona un fallback universal.

La jerarquía ideal podría ser:

¿Existe app/tool estructurada?
   ├── sí → usarla
   │
   └── no
        ↓
   usar navegador

La misma idea aparece en WebMCP: cuanto más estructurada sea la interfaz para agentes, menos tiene que depender el modelo de interpretar pixels, botones y navegación pensada para humanos.

Pero mientras esa web agent-native no exista de forma universal, el navegador sigue siendo una herramienta esencial.

Las presentaciones son interesantes por otra razón

En el video, Entrala pide convertir uno de sus videos anteriores en una presentación.

El proceso incluye:

localizar video
  ↓
entender contenido
  ↓
extraer estructura
  ↓
crear slides
  ↓
guardar archivo
  ↓
recibir feedback
  ↓
rehacer diseño

La portada inicial le parece demasiado sosa.

Le pide una versión más cinematográfica.

El sistema modifica el entregable.

Esto muestra otra diferencia entre respuesta y trabajo.

Una respuesta tradicional es efímera.

Un artefacto tiene estado.

Puede abrirse, editarse, revisarse y evolucionar.

OpenAI documenta que ChatGPT Work puede crear y editar documentos, hojas de cálculo y presentaciones, trabajando a partir de instrucciones, fuentes o plantillas existentes.

Ese cambio hace que el modelo participe directamente en el lifecycle de un deliverable:

idea
  ↓
primer borrador
  ↓
archivo
  ↓
review
  ↓
iteración
  ↓
versión final

El verdadero “superpoder” es la composición

Cada capacidad por separado ya existía de alguna forma.

Buscar en internet.

Generar texto.

Crear documentos.

Automatizar un navegador.

Leer correo mediante APIs.

Crear eventos.

Ejecutar tareas programadas.

Lo nuevo aparece cuando todas esas piezas pueden componerse bajo el mismo agente.

                 ┌── razonamiento
                 ├── voz
                 ├── web search
                 ├── apps/plugins
Usuario → ChatGPT├── archivos
                 ├── browser
                 ├── artifacts
                 └── scheduled tasks

En esa arquitectura, el modelo se parece menos a una aplicación aislada y más a un orquestador.

No necesita reemplazar Gmail, Calendar, Drive, Slack o GitHub.

Puede sentarse encima de ellos.

La interfaz del ordenador empieza a cambiar

Durante décadas aprendimos una gramática muy específica para operar computadoras:

abrir aplicación
  ↓
buscar menú
  ↓
seleccionar comando
  ↓
rellenar formulario
  ↓
confirmar

El lenguaje natural introduce otra capa:

"Organiza mi agenda de la semana,
pero no toques las mañanas del miércoles
y avísame si existe algún conflicto."

La interfaz deja de ser una secuencia de comandos explícitos.

Se convierte en una especificación de intención.

Eso no elimina las interfaces gráficas.

Las hace complementarias.

El agente puede encargarse del trabajo mecánico.

La UI sigue siendo excelente para:

  • revisar;
  • comparar;
  • visualizar;
  • corregir;
  • confirmar;
  • entender el estado.

Podemos terminar con un patrón híbrido:

lenguaje natural → delegar
UI              → supervisar

Esto se parece más a un sistema operativo que a un chatbot

No en el sentido literal de reemplazar Windows o macOS.

Sino en el sentido de convertirse en una capa que coordina recursos y aplicaciones.

Un sistema operativo clásico abstrae hardware:

aplicación
   ↓
OS
   ↓
filesystem / red / procesos / dispositivos

Un agente personal puede empezar a abstraer software:

usuario
   ↓
agente
   ↓
correo / calendario / navegador / archivos / SaaS

La persona especifica el resultado.

El agente administra qué recursos necesita.

Esta analogía explica por qué las apps, permisos, automatizaciones y browser use son tan importantes como el propio modelo.

Un modelo excelente sin herramientas sigue siendo principalmente un consejero.

Un modelo suficientemente bueno con herramientas confiables puede convertirse en operador.

El cuello de botella se desplaza al harness

Esta evolución conecta con otro patrón que estamos viendo en ingeniería de agentes.

El valor deja de vivir exclusivamente en el modelo.

Empieza a desplazarse hacia el harness que lo rodea.

Podemos resumir ChatGPT Work así:

modelo
+
contexto
+
apps
+
permisos
+
browser
+
artifacts
+
scheduling
+
monitoring
+
UI de revisión

Eso recuerda a lo que hemos analizado en DeepSeek Harness y en Codex como plataforma.

El modelo decide.

Pero el harness determina:

  • qué puede observar;
  • qué puede modificar;
  • qué herramientas existen;
  • cómo se guarda estado;
  • cuándo vuelve a ejecutarse;
  • qué requiere aprobación;
  • qué artefactos produce;
  • cómo se recupera de errores.

La inteligencia útil emerge de la combinación.

El riesgo: confundir fluidez con fiabilidad

Las demos agénticas tienen una cualidad peligrosa.

Parecen humanas.

El sistema responde con naturalidad.

Navega.

Crea archivos.

Detecta información.

Eso puede generar una falsa sensación de certeza.

Pero un agente sigue pudiendo:

  • interpretar mal una instrucción;
  • seleccionar el correo incorrecto;
  • confundir una factura con otro documento;
  • omitir un evento;
  • completar mal un formulario;
  • malinterpretar una página;
  • generar un dato plausible pero incorrecto.

Por eso los workflows de alto impacto deberían diseñarse alrededor de evidencia y reversibilidad.

Un patrón razonable es:

observe
  ↓
reason
  ↓
propose
  ↓
verify
  ↓
approve if needed
  ↓
act
  ↓
log

No:

LLM dijo que sí
  ↓
ejecutar inmediatamente

La autonomía útil no es autonomía absoluta

Existe una narrativa simplista donde el objetivo final es quitar completamente al humano.

En muchos workflows eso no será óptimo.

La mejor división puede ser:

máquina
  → búsqueda
  → clasificación
  → preparación
  → repetición
  → monitoreo

humano
  → prioridades
  → criterio
  → excepciones
  → decisiones sensibles
  → responsabilidad

En el ejemplo de las facturas, el agente puede reducir horas de trabajo mecánico.

El humano sigue siendo quien valida el resultado antes de utilizarlo contablemente.

En el correo, el agente puede preparar el draft.

El humano puede decidir si se envía.

En Calendar, el agente puede detectar un conflicto.

El humano decide qué compromiso pesa más.

Esto no hace al agente menos poderoso.

Lo hace más útil.

Qué deberíamos aprender a hacer con esta nueva capa

Si ChatGPT empieza a operar software por nosotros, saber “promptear” deja de ser suficiente.

Necesitamos aprender a especificar trabajo.

Un buen encargo debería incluir:

objetivo
+
fuentes permitidas
+
restricciones
+
criterios de calidad
+
acciones prohibidas
+
condiciones de parada
+
qué necesita aprobación
+
formato de salida

Por ejemplo, en vez de:

"mira mis facturas"

podríamos pedir:

"Busca facturas recibidas durante los últimos 60 días.
Incluye proveedor, fecha, moneda e importe.
No conviertas divisas.
Si un importe no puede verificarse, déjalo vacío.
Incluye un enlace al correo original.
No borres ni archives mensajes.
Genera una hoja de cálculo y dame un resumen de anomalías."

Eso se parece mucho más a escribir una especificación que a mantener una conversación casual.

Y ésa puede ser una de las habilidades centrales de la próxima etapa de productividad con agentes.

De chatbot a delegado digital

La evolución puede resumirse en cuatro etapas.

Etapa 1 — chatbot

pregunta → respuesta

Etapa 2 — copiloto

usuario trabaja
      +
IA sugiere

Etapa 3 — agente

objetivo
  ↓
IA usa tools
  ↓
completa tarea

Etapa 4 — agente persistente

objetivo
  ↓
agente
  ↓
trabaja ahora
  ↓
vuelve luego
  ↓
monitorea cambios
  ↓
notifica / actúa

Scheduled Tasks, apps y Work empujan ChatGPT claramente hacia esas últimas etapas.

La pregunta importante deja de ser:

“¿Qué tan buena fue la respuesta?”

Y empieza a ser:

“¿Qué trabajo terminó realmente?”

Conclusión

El título del video de Gustavo Entrala habla de “superpoderes”.

La palabra funciona para YouTube, pero técnicamente el fenómeno es más interesante.

No estamos viendo un único superpoder.

Estamos viendo la composición de varias capas:

modelo capaz
+
contexto
+
apps
+
browser
+
voz
+
archivos
+
artefactos
+
automatizaciones

Cada una reduce una parte del trabajo de coordinación que antes hacía la persona.

Y cuando se combinan, ChatGPT deja de ser solamente un lugar donde preguntar cosas.

Empieza a convertirse en un lugar desde el cual operar el resto del entorno digital.

Ese cambio puede ser mucho más importante que cualquier benchmark aislado del próximo modelo.

Porque la productividad no depende únicamente de cuánto sabe una IA.

Depende de si puede convertir ese conocimiento en acciones fiables dentro de nuestros sistemas.

La transición que estamos viendo podría resumirse así:

IA que responde
      ↓
IA que ayuda
      ↓
IA que actúa
      ↓
IA que vuelve a actuar cuando hace falta

Y en ese último paso es donde un chatbot empieza realmente a parecerse a un agente personal.


Fuentes