La historia es la brecha

A dos años de la fiebre de la IA generativa, el número empresarial más importante no es un benchmark ni el precio de un modelo. Es la brecha entre lo que los boards han autorizado y lo que los procesos de primera línea realmente han absorbido.

La encuesta State of AI 2024 de McKinsey encontró que la supervisión del CEO es el elemento de liderazgo más asociado con impacto en EBIT. Y aún así, solo el 21% de las organizaciones había rediseñado al menos un proceso. Menos de uno de cada cinco medía KPIs de gen AI. Más del 80% no reportaba impacto tangible en EBIT a nivel empresa. El IBM CEO Study 2026, mirando el mismo universo un ciclo después, encontró que el 76% había nombrado un Chief AI Officer y el 64% se sentía cómodo tomando decisiones estratégicas con input de IA. En la misma encuesta, solo el 25% de la plantilla usaba IA con regularidad, y el 83% de los CEOs decía que el éxito ahora depende más de la adopción de las personas que de la tecnología.

Esa es la historia. La IA es real. Y está absorbida de forma desigual. Las firmas que componen valor no son las del relato más ruidoso. Son las que convierten capacidad del modelo en cambio medido de proceso, controlan coste con arquitectura, y gobiernan la IA como sistema de producción, no como demo.

Mi lectura operativa: cuando un programa de IA no puede nombrar al dueño del workflow, la línea base, el modo de fallo y la guardrail de coste, sigue siendo una demo aunque la interfaz ya esté en producción. Las organizaciones que capturan valor vuelven explícitos esos cuatro nombres antes de pedir otro piloto.

Esta es mi síntesis de la evidencia disponible hasta mayo de 2026: páginas de precios, filings públicos, casos oficiales, encuestas cross-industria y guía de estándares. La escribo como leo el mercado: primero los números, después la historia, al final la opinión.

Qué están construyendo realmente las empresas

El mix de despliegue es mucho más estrecho de lo que sugiere la retórica de "transformación con IA". Los patrones dominantes son copilots de productividad, búsqueda empresarial sobre contenido interno, asistentes de servicio al cliente, asistentes de código, resumen de documentos y reuniones, y agentes acotados que solo actúan dentro de un workflow contenido. La generación de texto sigue siendo la modalidad dominante. Código e imágenes están materialmente por detrás.

Una taxonomía práctica:

Tipo de proyectoArquitectura típicaPor qué gana prontoCentro principal de coste o riesgo
Copilot de productividad SaaSModelo gestionado + grounding sobre datos del tenant + licencia por asientoRuta más rápida de procurement y cambioCoste por asiento, identidad, fronteras de datos
Búsqueda interna / chat de conocimientoRAG sobre documentos internos, búsqueda vectorial o híbrida, citas, RBACAlto valor, bajo riesgo de acciónCalidad de retrieval, permisos, evaluación
Bot de servicio al clienteOrquestador de conversación + base de conocimiento + acciones CRM/workflow + escaladoROI claro y alto volumenAlucinaciones, calidad de deflection, confianza del cliente
Asistente de códigoExtensión de IDE o asistente con grounding en repoAdopción inmediata y telemetría medibleSeguridad, calidad del código, IP, compliance
Workflow agéntico de back-officeLLM planner/router + uso de herramientas + aprobaciones + ejecución de APIsMayor potencial de automatizaciónFiabilidad, manejo de excepciones, gobernanza

El patrón de arquitectura que hoy domina los "copilots" en producción no es "un modelo grande". Es un stack: identidad y control de acceso, orquestación, RAG, llamadas a herramientas o APIs, observabilidad, evaluación y escalado humano. Microsoft, AWS, Google Cloud y OpenAI publican arquitecturas de referencia casi idénticas. La guía de OpenAI recomienda explícitamente empezar con un único agente y añadir herramientas de forma incremental, no saltar a sistemas multiagente.

Dónde aplicar esto en tu propio portfolio

Si quieres pasar una iniciativa concreta por las seis capas que uso al escribir sobre esto (Baseline, Architecture, Surface, Intelligence, Containment, Scale), el diagnóstico es la versión interactiva del marco al que vuelvo en este texto.

La economía de tokens, APIs y nube

El mercado de precios maduró en varios modelos: token directo, licencias por asiento, throughput prioritario o reservado, y cargos de plataforma por ruteo, búsqueda, herramientas o gobernanza. El precio del modelo rara vez es el precio entregado.

Comparativa de precios

ProveedorModelo de precioPrecio público ilustrativoCaveats clave
OpenAIToken API directo; Batch -50%; residencia de datos +10%GPT-5.5 $5 input / $30 output por MTok; GPT-5.4 $2,50 / $15; GPT-5.4 mini $0,75 / $4,50El input cacheado es mucho más barato que el base.
AnthropicToken API directo; prompt caching; Batch -50%; tiers prioritarios y premiums regionales en plataformasClaude Opus 4.7 $5 / $25; Sonnet 4.6 $3 / $15; Haiku 4.5 $1 / $5Cache hits cuestan 10% del input base; Opus 4.7 puede consumir hasta 35% más tokens por el mismo texto; el tool use añade tokens.
Google CloudVertex/Agent Platform con Priority vs Flex/Batch y throughput provisionado (GSUs)Gemini 3.1 Pro Preview Flex/Batch: $1 / $6 hasta 200k input, luego $2 / $9; Priority: $3,6 / $21,6 hasta 200k, luego $7,2 / $32,4Tier por tamaño de contexto y servicio; el throughput se compra en GSUs.
MicrosoftAzure OpenAI por token + PTUs; productos Copilot por asiento aparteAzure GPT-4.1 Global Standard $2 / $8; Priority $3,50 / $14; Batch $1 / $4. Microsoft 365 Copilot Business $18 user/mes anual o $25,20 mensual hasta 300 usuariosMezcla dos economías: APIs por token y licencias por asiento.
AWSBedrock con tiers Standard/Flex/Priority/Reserved; precios por modelo; descuentos batchClaude 3.5 Sonnet en Bedrock acceso extendido $6 / $30; batch $3 / $15; Intelligent Prompt Routing $1 por 1.000 requestsBedrock es plataforma, no familia única.

Dos observaciones estratégicas. Los precios convergen a la baja en texto, pero siguen estructuralmente asimétricos en output. Y las palancas de coste más importantes hoy son arquitectónicas: caching, batching, ruteo de prompts simples a modelos pequeños, y limitar la verbosidad innecesaria.

Tres formas de carga, valoradas a lista

EscenarioVolumen mensualOpenAI GPT-5.4 miniAnthropic Sonnet 4.6Google Gemini 3.1 Pro Flex/BatchAzure GPT-4.1 GlobalAWS Bedrock Claude 3.5 Sonnet
Asistente interno de conocimiento55.000 turnos; 110M input + 33M output$231$825$308$484$1.650
Copilot de resúmenes de reunión20.000 reuniones; 160M input + 20M output$210$780$280$480$1.560
Bot de servicio al cliente a escala10M chats; 10.000M input + 2.500M output$18.750$67.500$25.000$40.000$135.000

Para muchas cargas internas de texto, el meter del modelo no es la línea de coste dominante. Un despliegue de 300 asientos de Microsoft 365 Copilot Business al precio anual cuesta ~$5.400/mes antes de implementación, ya por encima del meter de muchos casos internos modestos.

Resultados de negocio y ROI

La mejor evidencia no muestra un dividendo uniforme de productividad. Muestra ganancias acotadas en contextos acotados.

OrganizaciónCaso de usoResultadoLo que prueba y lo que no
Morgan Stanley con OpenAIAsistente de conocimiento del asesor98% uso diario; acceso a documentos de 20% a 80%; menos tiempo de búsquedaFuerte señal de adopción y productividad; sin ROI firmado de la firma
GitHub con AccentureAsistente de código empresarial8,69% más PRs, 15% más merge rate, 84% más builds exitosos; 90% más realizado, 95% disfruta másTelemetría + diseño controlado, alta calidad
KlarnaAsistente de servicio al cliente2,3M conversaciones en mes uno; trabajo de 700 FTE; tiempo medio de 11 min a <2 min; CSAT "a la par"Fuerte eficiencia; comentarios posteriores indican que la calidad exigió rebalancear con humanos
KlarnaOperaciones de marketingIA responsable del 37% de los ahorros, ~$10M anualizadosCaso raro con porcentaje explícito atribuido a IA
DuolingoPremium habilitado por IAMargen bruto Q1 2026 +190 pb YoY, principalmente por menor coste unitario de IAEl ROI mejora cuando los costes unitarios bajan

A nivel mercado, los números más optimistas siguen siendo de encuesta o patrocinados. El estudio IDC patrocinado por Microsoft reporta ROI medio de 3,7x y de 10,3x para líderes. Trátalos como dirección, no como retornos auditados.

La regla sobria de ROI: la IA crea valor cuando el tiempo ahorrado se redespliega en throughput, ventas, servicio o exactitud, no cuando la organización solo observa que la gente acabó la tarea más rápido.

Modos de fallo y costes ocultos

Los errores empresariales más caros casi nunca son del modelo. Son de diseño de sistema y de modelo operativo.

Costes técnicos ocultos

Inflación de tokens fuera del prompt base: schemas de herramientas, system prompts, chunks recuperados, historia de conversación y tokenizadores específicos cambian el coste real. Anthropic señala que Opus 4.7 puede usar hasta 35% más tokens por el mismo texto; el tool use añade ~313-346 tokens por llamada.

Latencia como función de la verbosidad: Google Cloud lo dice explícito y recomienda limitar max_output_tokens. Outputs largos suben coste, cola, espera del usuario y carga del revisor.

Deuda de retrieval y data engineering: RAG en producción significa ingestión, chunking, indexación, replicación de permisos, tuning de retrieval híbrido, validación de citas y mantenimiento de conectores.

Calidad, seguridad y riesgo legal

El riesgo de calidad sigue centrado en inexactitud y alucinación, seguido de privacidad, ciberseguridad e IP. McKinsey reporta que el 47% experimentó al menos una consecuencia negativa de gen AI. NIST AI RMF Generative AI Profile y SP 800-218A son las plantillas públicas de referencia.

Efectos organizacionales

IBM reporta crecimiento rápido de Chief AI Officer y mayor influencia del CHRO. McKinsey encontró que solo el 13% había contratado especialistas de compliance en IA y el 6% de ética. Es una brecha de capacidad relevante.

El lock-in del proveedor es más profundo de lo que muchos compradores asumieron. La portabilidad del prompt es fácil. La portabilidad operativa no: PTUs, GSUs, cache de Anthropic, tiers de Bedrock, grounding propietario. El coste de cambio se mueve de texto a economía de runtime, observabilidad, lógica de aprobación y gobernanza.

Gobernanza y el playbook de AI FinOps

Cinco prácticas que la evidencia apoya con claridad:

  • Construye un control plane central para gobernanza de datos, acceso a modelos, observabilidad y política. Deja la experimentación parcialmente descentralizada.
  • Trata la selección de casos como un portfolio. Empieza por tareas de alta frecuencia con superficie de error contenida.
  • AI FinOps desde el día uno: caps de output, prompt caching, batch para asíncrono, ruteo a modelos pequeños, presupuestos separados, chargeback por workspace.
  • Exige evidencia de valor, no solo adopción. Mide procesos: tiempo de resolución, merge rate, lead time, conversión, margen, exactitud.
  • Estratifica la supervisión humana por riesgo. NIST AI RMF GenAI Profile y SP 800-218A son las mejores plantillas.

Preguntas abiertas

Tres preguntas siguen siendo difíciles de cerrar con datos públicos: el gasto exacto en tokens por cliente, el ROI all-in real, y la durabilidad del uplift en el medio plazo. Klarna y Duolingo muestran que la economía puede moverse rápido en ambas direcciones según mejora la calidad del despliegue y caen los costes unitarios.

La conclusión de mayor confianza ya está clara. El impacto empresarial de la fiebre de la IA ha sido real pero desigual. Las firmas más exitosas no son las del relato más alto. Son las que convierten capacidad del modelo en cambio medido de proceso, usan arquitectura para controlar coste, y gobiernan la IA como sistema de producción, no como demo.

Referencias

  • McKinsey & Company. State of AI surveys 2024-2025.
  • Gartner. Forecast y predicciones de generative AI, julio 2024.
  • IBM Institute for Business Value. CEO Study 2026.
  • OpenAI, Anthropic, Google Cloud, Microsoft Azure, AWS Bedrock. Páginas oficiales de pricing y documentación.
  • Morgan Stanley con OpenAI; GitHub con Accenture; Klarna; Duolingo; Snowflake. Casos y filings públicos 2024-2026.
  • NIST. AI RMF Generative AI Profile y SP 800-218A.
  • IDC sponsored by Microsoft. Estudio de ROI empresarial de gen AI, 2024.