Salta al contenuto principale
Lympha technologies

Casos de éxito

Cómo lo hicimos: 600+ aplicaciones, una Administración Regional y la continuidad que se paga sola

Primer capítulo de una serie de casos contados desde el terreno: la gestión plurianual, la evolución y la continuidad operativa de las infraestructuras de una gran Administración Regional — tres equipos, un cuadro de mando único open source y un centro de

Con este artículo abrimos «Cómo lo hicimos»: una serie en la que tomamos un proyecto real y lo contamos tal como fue — sin nombres, por confidencialidad, pero con los números y las decisiones verdaderas. Empezamos por uno de los más exigentes: la gestión plurianual, la evolución y la continuidad operativa de las infraestructuras tecnológicas de una gran Administración Regional italiana.

Participamos activamente en el diseño, la implementación y la gestión de un modelo completo de IT Service Management para un sistema de información en rápida evolución, con un centro de datos multisede de elevada complejidad tecnológica. El suministro abarcó la gestión y el desarrollo de las infraestructuras que soportan más de 650 aplicaciones distribuidas en tres cadenas tecnológicas, al servicio de miles de usuarios internos y externos, con un equipo dedicado de profesionales especializados.

El proyecto introdujo elementos de fuerte innovación: un Sistema de Gobernanza Operativa integrado, una solución de Business Continuity y Disaster Recovery basada en un modelo both-active y un enfoque metodológico construido sobre las buenas prácticas ITIL, garantizando la plena conformidad con el Decreto Legislativo italiano 235/2010 (art. 50-bis del Código de la Administración Digital) y con las directivas de la Agenda Digital.

600+

aplicaciones gestionadas en tres cadenas tecnológicas

+15%

de crecimiento de las aplicaciones en un bienio

−50%

de riesgo de pérdida de los servicios críticos

4 h

de RTO en los servicios críticos, con RPO de 1 hora

El contexto y los retos

La Administración afrontaba una transformación profunda de su sistema de información. De una infraestructura IT de tipo mid-range, diseñada para las necesidades internas de la Administración, se había pasado progresivamente a un centro de datos dotado de una infraestructura tecnológica particularmente compleja en materia de red, almacenamiento y servidores, al servicio no solo de la propia Administración, sino también de numerosos entes locales, asociaciones sectoriales, empresas privadas y ciudadanos del territorio.

El proceso de federalismo regional había modificado sustancialmente, tanto en términos cualitativos como cuantitativos, el perímetro del sistema de información, provocando un crecimiento significativo de los volúmenes, los sistemas y las aplicaciones a gestionar: el número de aplicaciones publicadas había crecido un 15% en un solo bienio, en las tres cadenas tecnológicas.

Los puntos críticos identificados

El análisis de la situación de partida había puesto de relieve problemas que cualquiera que trabaje en la Administración Pública reconocerá al vuelo:

  • fragmentación de las herramientas de monitorización: múltiples herramientas distintas (ticketing, monitorización, CMDB, gestión de proyectos) con datos descorrelacionados y sin una visión integrada de los servicios IT;
  • desconexión entre desarrollo y operación: la falta de «soldadura» entre el ciclo de vida del proyecto software y el ciclo de vida del servicio era el eslabón débil de la cadena de control;
  • ausencia de un plan estructurado de Business Continuity y Disaster Recovery, en contra de las obligaciones normativas introducidas por el Decreto Legislativo 235/2010;
  • almacenamiento sin clasificar según lógicas de tier (rendimiento, capacidad, fiabilidad), con las consiguientes ineficiencias operativas;
  • puntos únicos de fallo en la conectividad a internet y en la protección perimetral;
  • backup en cinta con ventanas temporales insuficientes para los servicios críticos;
  • ausencia de un cuadro de mando integrado para la gobernanza operativa y la rendición de cuentas de los servicios.

Los objetivos estratégicos

La Administración había definido objetivos claros — y ninguno de ellos era «comprar tecnología»:

  1. adoptar una metodología de gestión de los servicios IT orientada a procesos, con el nivel de calidad percibido por los usuarios como eje de la acción;
  2. dotarse de un plan de Business Continuity y Disaster Recovery conforme a la normativa vigente;
  3. implantar una plataforma integrada de gobernanza para el control de extremo a extremo de los servicios IT;
  4. garantizar la continuidad operativa sin interrupciones durante la transición;
  5. asegurar la plena medibilidad y transparencia de los servicios prestados mediante SLA y KPI objetivos.

Modelo organizativo y gobernanza

Diseñamos por tanto un modelo organizativo ágil y flexible, con roles decisorios claros, estructurado en tres niveles de gobernanza:

  • Nivel estratégico — IT Steering Group: comité ejecutivo compuesto por representantes de la Administración, encargado de asegurar la alineación de los objetivos estratégicos y de evaluar las inversiones necesarias y la senda de evolución de la infraestructura IT;
  • Nivel táctico — Comité de Control de los Servicios IT: órgano operativo para la planificación y la coordinación de las acciones de ejecución, con la figura del Technical Manager como interfaz principal para las actividades diarias de control, gestión y diseño;
  • Nivel operativo — tres equipos integrados, descritos en la tabla siguiente.
Equipo Ámbito Actividades principales
Equipo de Gestión Operativa (TGO)Service Operation, Service Transition Monitorización de extremo a extremo, operation control, backup/scheduling, help desk de nivel II, deploy & configuration, facility management
Equipo de Soporte de Sistemas Centralizado (TSSC)Service Operation, Transition, Design Gestión de infraestructura especializada en 6 áreas verticales (Infraestructura, Middleware, Bases de datos, Cartografía, Open Source, SAP), integración de sistemas, help desk de nivel III
Equipo de Desarrollo de Proyectos (TSP)Service Design, Service Strategy Diseño e implementación de nuevas arquitecturas, help desk de nivel III para casos críticos, arranque de la toma a cargo

El Área Change: integrar el ciclo de vida del software y el del servicio

Uno de los elementos más innovadores de la solución fue la creación del Área Change, una unidad organizativa transversal a los tres equipos, dedicada a la fase de «toma a cargo» del software producido y a su posterior «transformación» en servicio al usuario — el mismo principio que hoy aplicamos a lo largo de todo el ciclo de vida del servicio. El Área Change garantizó:

  • la integración entre la fase de diseño y desarrollo de la aplicación (Service Design) y la fase de prestación del servicio (Service Operation);
  • una fuerte atención a las fases de prueba y validación del servicio (Service Transition);
  • la planificación de las actividades de puesta en producción de cada nuevo servicio/producto;
  • la identificación y la propuesta de estrategias y caminos de innovación en el ciclo de vida de los servicios;
  • la coordinación de las intervenciones de los recursos dedicados a la definición y el control de los estándares y las directrices.

El Área de Auditoría y Mejora

Para garantizar una evaluación constante y objetiva de la calidad de los servicios, instituimos el Área de Auditoría y Mejora, con las siguientes responsabilidades:

  • monitorización continua de los parámetros de calidad predefinidos (KPI y SLA);
  • planificación de acciones de mejora incluso en presencia de niveles satisfactorios;
  • apoyo a la redacción de una Carta de Servicios TIC para formalizar el «pacto de servicio» entre el departamento de informática y las direcciones generales usuarias;
  • gestión del proceso de satisfacción del cliente;
  • recogida de los indicadores estadísticos para la rendición de cuentas periódica.

El Sistema de Gobernanza Operativa: un solo cuadro de mando, casi todo open source

A la fragmentación de las herramientas respondimos participando en la implementación de una plataforma completa e integrada al servicio de las funciones y los procesos IT — el corazón de lo que llamamos gobernanza IT — estructurada en tres grandes áreas y construida en gran parte sobre componentes open source.

Gobernanza de los servicios

  • gestión integrada de incidentes, problemas, cambios y configuración mediante CMDBuild;
  • herramienta de ticketing ( RT) para el seguimiento de las peticiones de servicio y los incidentes;
  • interacción con los sistemas de balanceo ( LBL LoadBalancer) para el Capacity Management;
  • base de conocimiento construida sobre Alfresco para la gestión documental centralizada.

Gobernanza de la infraestructura

  • Storage Management: gestión de los datos, backup y restauración;
  • System Fault & Performance Management: monitorización en tiempo real mediante Zabbix con consola centralizada, filtrado y correlación de eventos;
  • Application Performance Management: control de los servicios desde el punto de vista del usuario con transacciones de muestra;
  • historización de los datos en un data warehouse open source, SpagoBI, para análisis y reporting.

Gestión del conocimiento

  • repositorio documental centralizado construido sobre Alfresco;
  • organización, persistencia y aprovechamiento del conocimiento producido en el marco de la prestación de los servicios;
  • apoyo a las actividades de formación y adiestramiento.

El cuadro de mando Monitor de gobernanza

Por encima de todo, el cuadro de mando Monitor realizado sobre tecnología SpagoBI. Para una administración pública no es un detalle estético: es la diferencia entre declarar la calidad del servicio y poder demostrarla, número a número. El cuadro de mando ofrecía:

  • una vista de conjunto «de semáforo» sobre el estado global de los servicios;
  • la navegación por los KPI asociados a cada servicio prestado;
  • profundizaciones por dimensiones y periodos temporales distintos (tiempo real, día, semana, mes);
  • informes, OLAP, minería de datos y QBE;
  • un cuaderno de bitácora: visión de conjunto de todos los eventos que caracterizan la prestación de los servicios, filtrable por momento temporal, servicio, sistema, evento desencadenante y tipología;
  • un módulo de rendición de cuentas con imputación de los costes a las direcciones usuarias;
  • la gestión de las presencias y los turnos del personal técnico;
  • Site Activity para trazar «quién hace qué»;
  • la activación de proyectos con visión del estado de avance mediante Redmine.

Los procesos fundamentales ITIL

Se implantó a continuación un conjunto completo de Procesos Fundamentales (PF) basados en ITIL v3, contextualizados sobre las necesidades específicas de la Administración:

Proceso Ámbito
PF01 — Incident ManagementRestablecer la operatividad en el menor tiempo posible
PF02 — Problem ManagementIdentificación de las causas raíz
PF03 — Gestión del Servicio AplicativoToma a cargo, evolución y terminación de los servicios (proceso creado ad hoc)
PF04 — Change ManagementGestión controlada de los cambios
PF05 — Service Asset & Configuration ManagementGestión de la CMDB
PF06 — Release & Deploy ManagementGestión de las puestas en producción
PF07 — Service Level ManagementMonitorización y reporting de los SLA
PF08 — Capacity ManagementPlanificación y asignación de los recursos
PF09 — Knowledge ManagementGestión del conocimiento

Change Management e IMaaS

Para la gestión de los cambios de infraestructura introdujimos el concepto de «Infrastructure Model as a Service» (IMaaS): el Equipo de Desarrollo de Proyectos entrega modelos de infraestructura que, una vez aprobados, se transforman en arquitecturas IT operativas. El proceso de cambio se articula en:

  1. Request For Change y análisis de viabilidad;
  2. Service Design según las 4 P de ITIL (People, Products, Processes, Partners);
  3. entrega del Service Design Package (SDP) con requisitos, especificaciones técnicas, planes de prueba, plan de transición y plan de operación;
  4. aprobación por parte de la Administración;
  5. Transition: desarrollo de los entornos de prueba y aceptación;
  6. puesta en producción con el apoyo del Equipo de Gestión Operativa;
  7. CSI (Continual Service Improvement) transversal a todas las fases.

Se propuso además un laboratorio virtual (IaaS) para la simulación de las fases de transición, con el objetivo de simplificar la adopción y la gestión del cambio, estandarizar las actividades de transición, garantizar la integridad de las configuraciones de la infraestructura de producción y reducir problemas e incidentes en producción.

Business Continuity y Disaster Recovery: la continuidad que se paga sola

El capítulo más innovador es la continuidad de negocio. La solución se diseñó en plena conformidad con:

  • el Decreto Legislativo italiano n.º 235 de 30 de diciembre de 2010, art. 50-bis (continuidad operativa);
  • las directivas de DigitPA (hoy AgID) para los estudios de viabilidad técnica;
  • las normas ISO 22301 / BS 25999 para el Business Continuity Management;
  • el marco ITIL — proceso de IT Service Continuity Management (ITSCM);
  • la metodología M_o_R (Management of Risk) para el análisis y la gestión de riesgos.

Arquitectura multisede

El enfoque clásico prevé un centro secundario que cuesta, consume y permanece apagado esperando la emergencia. Aquí hicimos lo contrario, articulando la arquitectura en varios niveles.

Business Continuity Site (BCS) — dentro del campus de la Administración:

  • modelo both-active: el BCS no es un coste pasivo, sino que participa activamente en la prestación de los servicios en tiempo real;
  • réplica asíncrona a nivel de almacenamiento (Tier 4) para los servicios críticos, mediante virtualizadores IBM SVC y sistemas Global Mirror/FlashCopy;
  • réplica mediante agentes/snapshots (Tier 3) para los servicios de menor criticidad, mediante VMware Site Recovery Manager y vSphere Replication;
  • troncal ethernet a 10 Gbit y Storage Area Network extendida con doble fabric de fibra óptica;
  • conectividad a internet autónoma y sistemas de protección perimetral dedicados.

Disaster Recovery Site (DRS) — en un proveedor externo a más de 80 km:

  • predisposición arquitectónica nativa para la activación en emergencia;
  • interconexión mediante tecnologías DWDM (Dense Wavelength Division Multiplexing) para distancias superiores a los 100 km;
  • infraestructura mayoritariamente virtualizada con posibilidad de bare metal restore.

Un centro de continuidad que permanece apagado es un coste a la espera de un desastre. Uno que trabaja cada día es capacidad productiva — y se paga solo.

LBL Surface Cluster: orquestación y prevención del split brain

El riesgo técnico más insidioso de una arquitectura con dos centros activos es el split brain: ambos centros convencidos de ser el «verdadero», con la consiguiente corrupción lógica de los datos. Para gestionar los procedimientos de failover/failback y prevenir este escenario, gracias a la colaboración con nuestro partner Oplon introdujimos la suite LBL Surface Cluster (Decision Engine y WorkFlow), con las siguientes funcionalidades:

  • el algoritmo «Split Brain Assassin»: prevención de la corrupción lógica de los datos en caso de alimentación paralela de las bases de datos;
  • Decision Engine: 3 instancias en clúster por centro, para la verificación constante del funcionamiento de los servicios críticos y la toma de decisiones;
  • WorkFlow: ejecución coordinada de las secuencias de actividades (scripts, reinicios, apagados) mediante comandos remotos RWC (Remote Workflow Command);
  • autodocumentación de los procedimientos de failover y failback;
  • una consola web intuitiva para la reactivación de los servicios incluso por parte de personal no especializado — porque en las emergencias reales el especialista puede no estar.

Niveles de protección (Tiers)

No todos los servicios valen lo mismo, y la Business Impact Analysis lo tradujo en niveles de protección diferenciados — el mismo principio que contamos en «El backup no basta»: RTO y RPO se definen por servicio, no para la organización entera.

Tier RPO RTO Tecnología Servicios
Tier 41 hora 4 horas Réplica asíncrona del almacenamiento (Global Mirror) Servicios críticos de extremo a extremo
Tier 34 horas 4 horas Agentes software, snapshots, Site Recovery Manager Servicios de criticidad media
Tier 2Vaulting con TSM, snapshots, VTL con deduplicación Backups consolidados
Tier 1TSM, snapshots Servicios no críticos

Los planes: BCP, DRP, BIA y análisis de riesgos

Se redactó a continuación un cuerpo documental completo, mantenido en el tiempo:

  • el Business Continuity Plan (BCP): identificación de la exposición a peligros internos y externos, de los activos hardware/software y de los procesos destinados a prevenir interrupciones y restablecer los servicios;
  • el Disaster Recovery Plan (DRP): procedimientos operativos paso a paso, listas de verificación y esquemas técnicos para las fases reactivas de Response y Recovery;
  • la Business Impact Analysis (BIA): cuantificación del impacto de la interrupción de los servicios IT en el negocio;
  • el Risk Analysis y el Risk Management: identificación de las amenazas, evaluación de su probabilidad y definición de las contramedidas.

La gestión del servicio aplicativo

El proceso — creado ad hoc — que gobierna toda la vida de una aplicación en operación, del nacimiento a la retirada.

Toma a cargo y arranque

El proceso de toma a cargo de un nuevo servicio aplicativo preveía:

  1. la verificación de la completitud y adecuación de la documentación;
  2. el análisis de impacto y la gestión del cambio (CAB);
  3. la preparación del entorno de producción (software de base, aplicación, base de datos);
  4. la preparación del entorno de monitorización (sondas y reglas específicas);
  5. la preparación del entorno de gestión (parametrización y traspaso de responsabilidades);
  6. el registro de los Configuration Items en la CMDB;
  7. la aceptación de toda la infraestructura;
  8. la formación del Equipo de Gestión Operativa.

Evolución del servicio

Para las evoluciones (nuevas funcionalidades, cambios de configuración), el proceso preveía la identificación de las modificaciones y el análisis de impacto, la ejecución del test de regresión antes de la puesta en producción, y la actualización de la CMDB y de la documentación operativa.

Terminación del servicio

Para la retirada de un servicio: verificación del impacto sobre los demás servicios, salvaguarda de los archivos, desinstalación del componente aplicativo, actualización de la CMDB y reasignación de los recursos mediante el Capacity Management.

Formación, knowledge management y transferencia del know-how

Un suministro plurianual se juzga también por cómo termina: el conocimiento, al final, debe quedar en manos de quien tiene que ejercerlo.

Adiestramiento del personal

Se implantó un proceso de knowledge sharing continuo con:

  • un número adecuado de jornadas de formación anuales para cada recurso;
  • itinerarios de certificación ITIL (Foundation, Service Strategy, Service Design, Service Operation, CSI) para los responsables de unidad;
  • cursos en la Escuela interna de Alta Formación TIC;
  • formación a distancia y seminarios presenciales;
  • autoformación sobre manuales de producto y recursos documentales.

Knowledge management

El proceso de knowledge management se articuló en dos fases recursivas: la organización del conocimiento (identificación de las necesidades, búsqueda, catalogación en un repositorio clasificado por procesos de servicio) y la valorización del conocimiento (distribución, uso y actualización continua del know-how recogido).

Transferencia del know-how al final del suministro

El plan de exit management preveía:

  • Paso 1 — Programación: preparación de la documentación, reuniones preparatorias, organización de seminarios, verificación del estado de los sistemas mediante listas de verificación;
  • Paso 2 — Acompañamiento: sesiones de aprendizaje presencial, ejecución autónoma de tareas específicas, evaluación y autoevaluación, formación sobre el terreno;
  • dos meses de asistencia bajo demanda tras el final del suministro (correo electrónico, teléfono, comunicación en línea).

Recursos y competencias

El Equipo de Soporte de Sistemas Centralizado operó con cobertura 24/7 en seis áreas verticales:

  1. Infraestructura (servidores blade IBM/HP, redes, virtualización VMware/Citrix);
  2. Middleware (WebSphere, JBoss, IIS, Apache, Tomcat);
  3. Bases de datos (Oracle, SQL Server, PostgreSQL, MySQL, DB2);
  4. Cartografía (sistemas GIS y territoriales);
  5. Open Source (Linux, Red Hat, soluciones FOSS);
  6. SAP (entornos ERP, BW, CRM).

Todo ello sostenido por un sistema de certificaciones y alianzas:

ISO 9001ISO 14001ISO/IEC 27001CMMI Nivel 3ITIL v3PMPPRINCE2

Resultados y beneficios

Indicador Resultado
Disponibilidad del servicio SLA cumplidos y mejorados respecto a los requisitos contractuales
Cobertura operativa Cobertura garantizada 24/7 en 6 áreas tecnológicas críticas
Activación del soporte especializado (bloqueante) Dentro del siguiente día laborable
Activación del soporte especializado (no bloqueante) Dentro de 5 días laborables
Riesgo de pérdida de los servicios críticos Reducido un 50% gracias al modelo BCS activo
ROI de la Business Continuity Retorno de la inversión casi inmediato
Aplicaciones gestionadas +15% en un bienio
Transparencia y control Cuadro de mando único con KPI en tiempo real y rendición de cuentas por dirección
Conformidad normativa Plena adhesión al Decreto Legislativo 235/2010 y a las directrices de la AgID

Beneficios de infraestructura

  • fiabilidad: solución certificada por los proveedores y validada mediante implementaciones análogas;
  • elasticidad: componentes hardware y software elegidos para responder con mínimo impacto a los cambios de infraestructura;
  • estandarización: contraste constante con las normas ISO, el marco ITIL y las normativas sectoriales;
  • resiliencia: dimensionamiento correcto de las infraestructuras y elección ponderada de las tecnologías;
  • control: gestión global de todos los centros mediante herramientas centralizadas.

Beneficios económicos

  • economía de escala: el BCS activo incrementó globalmente los servicios prestados;
  • virtualización: reducción del coste total de propiedad (TCO) de la infraestructura;
  • optimización del almacenamiento: racionalización mediante tecnología multi-tier (EasyTier), con discos SSD para los datos críticos y discos de capacidad para el resto;
  • reutilización de los activos existentes: limitación de la compra de nuevo hardware gracias a la redistribución de recursos ya en poder de la Administración.

Beneficios organizativos

  • superación del conflicto desarrollo/operación gracias al Área Change;
  • mejora continua institucionalizada mediante el Área de Auditoría y el proceso CSI;
  • transparencia en la cooperación entre la Administración y el proveedor;
  • la Carta de Servicios TIC como formalización del pacto de servicio;
  • rendición de cuentas e imputación de los costes a las direcciones usuarias.

Los elementos de innovación

El modelo «both-active»

El Business Continuity Site no es un coste pasivo: participa activamente en la prestación de los servicios, generando un ROI inmediato.

Un Área Change integrada

Superación del conflicto estructural entre equipos de desarrollo y de operación, con una toma a cargo controlada y documentada de cada nuevo servicio.

Una plataforma de gobernanza unificada

La fragmentación de herramientas superada en un único ecosistema integrado: CMDBuild, RT, Zabbix, Alfresco, Redmine, SpagoBI, LBL.

LBL Surface Cluster como orquestador de DR

Automatización y autodocumentación de los procedimientos de failover/failback, con gestión del riesgo de split brain a escala de todo el centro de datos.

El enfoque IMaaS

Infrastructure Model as a Service: industrialización del proceso de diseño de infraestructura, con reutilización de modelos y componentes en lógica «industrial».

Un laboratorio virtual para la transición

Simulación de las fases de aceptación en un entorno virtual (IaaS) para reducir riesgos e incidentes en producción.

Un cuadro de mando Monitor con vista de semáforo

Navegación intuitiva por los KPI con profundizaciones multidimensionales y reporting automatizado (OLAP, minería de datos, RSS).

Conclusiones

El proyecto realizado representa un caso de excelencia en la gestión integrada de las infraestructuras tecnológicas para la Administración Pública. La combinación de competencias especializadas, metodología ITIL, herramientas de gobernanza open source y soluciones innovadoras de Business Continuity permitió a la Administración:

  • garantizar la continuidad operativa de sus servicios IT en conformidad con la normativa vigente;
  • obtener una visión integrada y transparente de toda la infraestructura tecnológica;
  • reducir los riesgos operativos y de desastre en un 50%;
  • optimizar los costes mediante la virtualización, la reutilización de los activos y el modelo BCS activo;
  • mejorar continuamente la calidad de los servicios prestados mediante procesos estructurados de auditoría y CSI;
  • preservar el patrimonio de conocimientos mediante un plan estructurado de knowledge management y transferencia del know-how.

La solución se demostró escalable, sostenible y plenamente integrada con el contexto organizativo y tecnológico de la Administración: un modelo replicable para otras administraciones públicas de dimensiones y complejidad análogas — hablamos de ello en la página dedicada a la administración local, mientras que nuestro enfoque de medición, análisis y mejora continua está contado en nuestro método. Si tu organización está afrontando una transición parecida — una gobernanza por construir, una continuidad que poner a norma, servicios que crecen más deprisa que la capacidad de gestionarlos — hablemos.

Por confidencialidad no citamos a la Administración; los datos y los indicadores se refieren al periodo de prestación del servicio.

Redacción Lympha

Los artículos de este blog nacen de la experiencia de campo de nuestras Business Units y Centros de competencia: quien escribe es quien diseña, gestiona y da soporte cada día a los sistemas de los que hablamos. Los contenidos tienen carácter informativo y reflejan el estado del arte en la fecha de publicación.

Comparte este artículo

LinkedIn X Email

También te puede interesar