La historia es la brecha
A dos años de la fiebre de la IA generativa, el número empresarial más importante no es un benchmark ni el precio de un modelo. Es la brecha entre lo que los boards han autorizado y lo que los procesos de primera línea realmente han absorbido.
La encuesta State of AI 2024 de McKinsey encontró que la supervisión del CEO es el elemento de liderazgo más asociado con impacto en EBIT. Y aún así, solo el 21% de las organizaciones había rediseñado al menos un proceso. Menos de uno de cada cinco medía KPIs de gen AI. Más del 80% no reportaba impacto tangible en EBIT a nivel empresa. El IBM CEO Study 2026, mirando el mismo universo un ciclo después, encontró que el 76% había nombrado un Chief AI Officer y el 64% se sentía cómodo tomando decisiones estratégicas con input de IA. En la misma encuesta, solo el 25% de la plantilla usaba IA con regularidad, y el 83% de los CEOs decía que el éxito ahora depende más de la adopción de las personas que de la tecnología.
Esa es la historia. La IA es real. Y está absorbida de forma desigual. Las firmas que componen valor no son las del relato más ruidoso. Son las que convierten capacidad del modelo en cambio medido de proceso, controlan coste con arquitectura, y gobiernan la IA como sistema de producción, no como demo.
Mi lectura operativa: cuando un programa de IA no puede nombrar al dueño del workflow, la línea base, el modo de fallo y la guardrail de coste, sigue siendo una demo aunque la interfaz ya esté en producción. Las organizaciones que capturan valor vuelven explícitos esos cuatro nombres antes de pedir otro piloto.
Esta es mi síntesis de la evidencia disponible hasta mayo de 2026: páginas de precios, filings públicos, casos oficiales, encuestas cross-industria y guía de estándares. La escribo como leo el mercado: primero los números, después la historia, al final la opinión.
Qué están construyendo realmente las empresas
El mix de despliegue es mucho más estrecho de lo que sugiere la retórica de "transformación con IA". Los patrones dominantes son copilots de productividad, búsqueda empresarial sobre contenido interno, asistentes de servicio al cliente, asistentes de código, resumen de documentos y reuniones, y agentes acotados que solo actúan dentro de un workflow contenido. La generación de texto sigue siendo la modalidad dominante. Código e imágenes están materialmente por detrás.
Una taxonomía práctica:
| Tipo de proyecto | Arquitectura típica | Por qué gana pronto | Centro principal de coste o riesgo |
|---|---|---|---|
| Copilot de productividad SaaS | Modelo gestionado + grounding sobre datos del tenant + licencia por asiento | Ruta más rápida de procurement y cambio | Coste por asiento, identidad, fronteras de datos |
| Búsqueda interna / chat de conocimiento | RAG sobre documentos internos, búsqueda vectorial o híbrida, citas, RBAC | Alto valor, bajo riesgo de acción | Calidad de retrieval, permisos, evaluación |
| Bot de servicio al cliente | Orquestador de conversación + base de conocimiento + acciones CRM/workflow + escalado | ROI claro y alto volumen | Alucinaciones, calidad de deflection, confianza del cliente |
| Asistente de código | Extensión de IDE o asistente con grounding en repo | Adopción inmediata y telemetría medible | Seguridad, calidad del código, IP, compliance |
| Workflow agéntico de back-office | LLM planner/router + uso de herramientas + aprobaciones + ejecución de APIs | Mayor potencial de automatización | Fiabilidad, manejo de excepciones, gobernanza |
El patrón de arquitectura que hoy domina los "copilots" en producción no es "un modelo grande". Es un stack: identidad y control de acceso, orquestación, RAG, llamadas a herramientas o APIs, observabilidad, evaluación y escalado humano. Microsoft, AWS, Google Cloud y OpenAI publican arquitecturas de referencia casi idénticas. La guía de OpenAI recomienda explícitamente empezar con un único agente y añadir herramientas de forma incremental, no saltar a sistemas multiagente.
Dónde aplicar esto en tu propio portfolio
Si quieres pasar una iniciativa concreta por las seis capas que uso al escribir sobre esto (Baseline, Architecture, Surface, Intelligence, Containment, Scale), el diagnóstico es la versión interactiva del marco al que vuelvo en este texto.
La economía de tokens, APIs y nube
El mercado de precios maduró en varios modelos: token directo, licencias por asiento, throughput prioritario o reservado, y cargos de plataforma por ruteo, búsqueda, herramientas o gobernanza. El precio del modelo rara vez es el precio entregado.
Comparativa de precios
| Proveedor | Modelo de precio | Precio público ilustrativo | Caveats clave |
|---|---|---|---|
| OpenAI | Token API directo; Batch -50%; residencia de datos +10% | GPT-5.5 $5 input / $30 output por MTok; GPT-5.4 $2,50 / $15; GPT-5.4 mini $0,75 / $4,50 | El input cacheado es mucho más barato que el base. |
| Anthropic | Token API directo; prompt caching; Batch -50%; tiers prioritarios y premiums regionales en plataformas | Claude Opus 4.7 $5 / $25; Sonnet 4.6 $3 / $15; Haiku 4.5 $1 / $5 | Cache hits cuestan 10% del input base; Opus 4.7 puede consumir hasta 35% más tokens por el mismo texto; el tool use añade tokens. |
| Google Cloud | Vertex/Agent Platform con Priority vs Flex/Batch y throughput provisionado (GSUs) | Gemini 3.1 Pro Preview Flex/Batch: $1 / $6 hasta 200k input, luego $2 / $9; Priority: $3,6 / $21,6 hasta 200k, luego $7,2 / $32,4 | Tier por tamaño de contexto y servicio; el throughput se compra en GSUs. |
| Microsoft | Azure OpenAI por token + PTUs; productos Copilot por asiento aparte | Azure GPT-4.1 Global Standard $2 / $8; Priority $3,50 / $14; Batch $1 / $4. Microsoft 365 Copilot Business $18 user/mes anual o $25,20 mensual hasta 300 usuarios | Mezcla dos economías: APIs por token y licencias por asiento. |
| AWS | Bedrock con tiers Standard/Flex/Priority/Reserved; precios por modelo; descuentos batch | Claude 3.5 Sonnet en Bedrock acceso extendido $6 / $30; batch $3 / $15; Intelligent Prompt Routing $1 por 1.000 requests | Bedrock es plataforma, no familia única. |
Dos observaciones estratégicas. Los precios convergen a la baja en texto, pero siguen estructuralmente asimétricos en output. Y las palancas de coste más importantes hoy son arquitectónicas: caching, batching, ruteo de prompts simples a modelos pequeños, y limitar la verbosidad innecesaria.
Tres formas de carga, valoradas a lista
| Escenario | Volumen mensual | OpenAI GPT-5.4 mini | Anthropic Sonnet 4.6 | Google Gemini 3.1 Pro Flex/Batch | Azure GPT-4.1 Global | AWS Bedrock Claude 3.5 Sonnet |
|---|---|---|---|---|---|---|
| Asistente interno de conocimiento | 55.000 turnos; 110M input + 33M output | $231 | $825 | $308 | $484 | $1.650 |
| Copilot de resúmenes de reunión | 20.000 reuniones; 160M input + 20M output | $210 | $780 | $280 | $480 | $1.560 |
| Bot de servicio al cliente a escala | 10M chats; 10.000M input + 2.500M output | $18.750 | $67.500 | $25.000 | $40.000 | $135.000 |
Para muchas cargas internas de texto, el meter del modelo no es la línea de coste dominante. Un despliegue de 300 asientos de Microsoft 365 Copilot Business al precio anual cuesta ~$5.400/mes antes de implementación, ya por encima del meter de muchos casos internos modestos.
Resultados de negocio y ROI
La mejor evidencia no muestra un dividendo uniforme de productividad. Muestra ganancias acotadas en contextos acotados.
| Organización | Caso de uso | Resultado | Lo que prueba y lo que no |
|---|---|---|---|
| Morgan Stanley con OpenAI | Asistente de conocimiento del asesor | 98% uso diario; acceso a documentos de 20% a 80%; menos tiempo de búsqueda | Fuerte señal de adopción y productividad; sin ROI firmado de la firma |
| GitHub con Accenture | Asistente de código empresarial | 8,69% más PRs, 15% más merge rate, 84% más builds exitosos; 90% más realizado, 95% disfruta más | Telemetría + diseño controlado, alta calidad |
| Klarna | Asistente de servicio al cliente | 2,3M conversaciones en mes uno; trabajo de 700 FTE; tiempo medio de 11 min a <2 min; CSAT "a la par" | Fuerte eficiencia; comentarios posteriores indican que la calidad exigió rebalancear con humanos |
| Klarna | Operaciones de marketing | IA responsable del 37% de los ahorros, ~$10M anualizados | Caso raro con porcentaje explícito atribuido a IA |
| Duolingo | Premium habilitado por IA | Margen bruto Q1 2026 +190 pb YoY, principalmente por menor coste unitario de IA | El ROI mejora cuando los costes unitarios bajan |
A nivel mercado, los números más optimistas siguen siendo de encuesta o patrocinados. El estudio IDC patrocinado por Microsoft reporta ROI medio de 3,7x y de 10,3x para líderes. Trátalos como dirección, no como retornos auditados.
La regla sobria de ROI: la IA crea valor cuando el tiempo ahorrado se redespliega en throughput, ventas, servicio o exactitud, no cuando la organización solo observa que la gente acabó la tarea más rápido.
Modos de fallo y costes ocultos
Los errores empresariales más caros casi nunca son del modelo. Son de diseño de sistema y de modelo operativo.
Costes técnicos ocultos
Inflación de tokens fuera del prompt base: schemas de herramientas, system prompts, chunks recuperados, historia de conversación y tokenizadores específicos cambian el coste real. Anthropic señala que Opus 4.7 puede usar hasta 35% más tokens por el mismo texto; el tool use añade ~313-346 tokens por llamada.
Latencia como función de la verbosidad: Google Cloud lo dice explícito y recomienda limitar max_output_tokens. Outputs largos suben coste, cola, espera del usuario y carga del revisor.
Deuda de retrieval y data engineering: RAG en producción significa ingestión, chunking, indexación, replicación de permisos, tuning de retrieval híbrido, validación de citas y mantenimiento de conectores.
Calidad, seguridad y riesgo legal
El riesgo de calidad sigue centrado en inexactitud y alucinación, seguido de privacidad, ciberseguridad e IP. McKinsey reporta que el 47% experimentó al menos una consecuencia negativa de gen AI. NIST AI RMF Generative AI Profile y SP 800-218A son las plantillas públicas de referencia.
Efectos organizacionales
IBM reporta crecimiento rápido de Chief AI Officer y mayor influencia del CHRO. McKinsey encontró que solo el 13% había contratado especialistas de compliance en IA y el 6% de ética. Es una brecha de capacidad relevante.
El lock-in del proveedor es más profundo de lo que muchos compradores asumieron. La portabilidad del prompt es fácil. La portabilidad operativa no: PTUs, GSUs, cache de Anthropic, tiers de Bedrock, grounding propietario. El coste de cambio se mueve de texto a economía de runtime, observabilidad, lógica de aprobación y gobernanza.
Gobernanza y el playbook de AI FinOps
Cinco prácticas que la evidencia apoya con claridad:
- Construye un control plane central para gobernanza de datos, acceso a modelos, observabilidad y política. Deja la experimentación parcialmente descentralizada.
- Trata la selección de casos como un portfolio. Empieza por tareas de alta frecuencia con superficie de error contenida.
- AI FinOps desde el día uno: caps de output, prompt caching, batch para asíncrono, ruteo a modelos pequeños, presupuestos separados, chargeback por workspace.
- Exige evidencia de valor, no solo adopción. Mide procesos: tiempo de resolución, merge rate, lead time, conversión, margen, exactitud.
- Estratifica la supervisión humana por riesgo. NIST AI RMF GenAI Profile y SP 800-218A son las mejores plantillas.
Preguntas abiertas
Tres preguntas siguen siendo difíciles de cerrar con datos públicos: el gasto exacto en tokens por cliente, el ROI all-in real, y la durabilidad del uplift en el medio plazo. Klarna y Duolingo muestran que la economía puede moverse rápido en ambas direcciones según mejora la calidad del despliegue y caen los costes unitarios.
La conclusión de mayor confianza ya está clara. El impacto empresarial de la fiebre de la IA ha sido real pero desigual. Las firmas más exitosas no son las del relato más alto. Son las que convierten capacidad del modelo en cambio medido de proceso, usan arquitectura para controlar coste, y gobiernan la IA como sistema de producción, no como demo.
Referencias
- McKinsey & Company. State of AI surveys 2024-2025.
- Gartner. Forecast y predicciones de generative AI, julio 2024.
- IBM Institute for Business Value. CEO Study 2026.
- OpenAI, Anthropic, Google Cloud, Microsoft Azure, AWS Bedrock. Páginas oficiales de pricing y documentación.
- Morgan Stanley con OpenAI; GitHub con Accenture; Klarna; Duolingo; Snowflake. Casos y filings públicos 2024-2026.
- NIST. AI RMF Generative AI Profile y SP 800-218A.
- IDC sponsored by Microsoft. Estudio de ROI empresarial de gen AI, 2024.