Fallos en la refrigeración líquida en centros de datos de IA: causas, riesgos y prevención.

Fallos en la refrigeración líquida en centros de datos de IA: causas, riesgos y prevención.

Fernanda Palma

16 July 2026

Autor:  David McGlocklin , Gerente de Desarrollo de Refrigeración/Ingeniería de Mantenimiento, Schneider Electric

 

El despliegue de centros de datos de IA es costoso, con racks individuales que cuestan 3 millones de dólares o más . A medida que los centros de datos de IA alcancen una capacidad de 1 gigavatio en un futuro próximo, se estima que las instalaciones costarán 38 mil millones de dólares . Proteger este tipo de inversión es fundamental, por lo que los operadores de centros de datos de IA invierten en infraestructura de refrigeración líquida para disipar el intenso calor generado por las GPU.

Lo último que desea un operador es una falla en el sistema de refrigeración líquida de los centros de datos de IA, que suele deberse a fallos en las bombas, degradación del refrigerante, fugas y problemas con los sensores. Esto puede provocar sobrecalentamiento, reducción del rendimiento por limitación térmica, tiempo de inactividad, costosos daños a la infraestructura y penalizaciones por incumplimiento del acuerdo de nivel de servicio (SLA). La rescisión de contratos también es una posibilidad. Las fugas del sistema pueden dañar el hardware e incluso requerir una limpieza ambiental si se derrama una cantidad considerable de refrigerante.

Cuando la infraestructura de refrigeración soporta cargas de trabajo de IA de alta densidad, lo que está en juego financieramente es aún mayor, lo que convierte la fiabilidad de la refrigeración líquida en una consideración de diseño esencial.

Refrigeración líquida en el concepto de centro de datos de IA

¿Cuáles son las fallas más comunes en la refrigeración líquida?

Pueden producirse fallos comunes en cualquier punto de la infraestructura, tanto en el sistema de agua de la instalación (FWS) como en el sistema de refrigeración de la tecnología (TCS). Las causas pueden variar, desde caídas de tensión hasta corrosión de componentes o un refrigerante con un mantenimiento deficiente, que puede degradarse con el tiempo.

Explore soluciones de refrigeración líquida para centros de datos de IA.

Cuando se produce una fuga, los sistemas de refrigeración pueden activarse para proteger los equipos, dependiendo de la ubicación y la gravedad de la misma. En la mayoría de los demás casos de fallo, bombas, sensores o unidades completas redundantes se activan para asumir la carga y continuar con las operaciones normales. De lo contrario, las temperaturas aumentarán rápidamente en caso de emergencia, como por ejemplo, una bomba averiada, filtros obstruidos, variadores de frecuencia defectuosos , fallos en el controlador o problemas con otros componentes mecánicos o eléctricos del sistema. En entornos de IA de alta densidad, los sistemas alcanzan umbrales de temperatura críticos en segundos, lo que deja poco margen para la intervención del operador.

Causas comunes de fallos en la refrigeración líquida

Fallos de hardware : Estos se deben a problemas como fallos en la bomba, intercambiadores de calor sucios, aire en el sistema, filtros obstruidos, corrosión, fallos en los sensores, mala calidad de la energía y mal uso del sistema, como utilizar la unidad de tratamiento de aguas residuales (CDU) para la limpieza inicial del sistema.

Fugas en el sistema : Los defectos mecánicos en la fabricación de mangueras y conexiones, los problemas de diseño del sistema y la corrosión pueden provocar fugas. Dependiendo de la ubicación de la fuga, el refrigerante puede dañar los equipos informáticos y las propias instalaciones.

Degradación del refrigerante : un lavado inicial deficiente del sistema, la falta de un plan de mantenimiento del refrigerante o una gestión inadecuada del mismo, la presencia de aire en el sistema, la degradación del refrigerante y del rendimiento térmico del sistema, pueden provocar daños en el silicio.

Cómo prevenir fallos en la refrigeración líquida en centros de datos de IA

La prevención de fallos en la refrigeración líquida comienza mucho antes de que surja un problema. A medida que las cargas de trabajo de IA aumentan la densidad de los racks y los sistemas de refrigeración se vuelven cada vez más críticos para la disponibilidad, los operadores deben adoptar un enfoque proactivo basado en tres pilares fundamentales: planificación, monitorización y mantenimiento.

Planificación : Aquí es donde comienza todo. Una buena planificación que incluya redundancia ayuda a prevenir problemas costosos. Al diseñar el sistema de refrigeración líquida, planifique diversas contingencias, un lavado inicial adecuado del sistema, el llenado y la puesta en marcha. Esto puede incluir unidades de distribución de refrigerante (CDU) con sensores integrados y redundancia de bombas, o un sistema de redundancia distribuida, un plan de mantenimiento de fluidos adecuado y tanques de almacenamiento térmico tanto en el sistema de refrigeración del tanque (TCS) como en el sistema de almacenamiento de fluidos (FWS) para ayudar a mantener los niveles de temperatura adecuados y soportar transitorios.

Supervisión : La visibilidad continua de los entornos de los centros de datos, incluida la infraestructura de refrigeración líquida, es fundamental. Las alarmas en las unidades y las vistas generales de DCIM y los gemelos digitales alertan a los equipos del centro de datos sobre la necesidad de mantenimiento preventivo antes de que surja algún problema.

Mantenimiento proactivo : Los sistemas mecánicos y las redes de fluidos críticos requieren un mantenimiento adecuado según un cronograma establecido. Esto implica revisar periódicamente el refrigerante en sistemas de circuito cerrado e inspeccionar los diversos componentes del sistema. Es fundamental mantener la mezcla de refrigerante adecuada, el mismo fabricante de PG25 y la cantidad correcta de aditivos, así como realizar el mantenimiento o la sustitución de bombas, filtros y otros componentes según sea necesario. Obtenga más información sobre la gestión de fluidos de refrigeración líquida en esta publicación del blog .

Cómo mejorar la fiabilidad de la refrigeración en centros de datos de IA

A medida que la densidad de racks para IA y las inversiones en infraestructura siguen aumentando, la fiabilidad de la refrigeración líquida se vuelve esencial para proteger el tiempo de actividad, el rendimiento y la rentabilidad. Si bien las fallas de refrigeración pueden ser costosas, la mayoría se pueden prevenir mediante un diseño cuidadoso, redundancia integrada, monitoreo continuo y mantenimiento proactivo. Al adoptar un enfoque proactivo para la fiabilidad de la refrigeración, los operadores pueden reducir el riesgo y proteger los activos informáticos críticos. Para obtener más información sobre cómo optimizar el rendimiento y la fiabilidad de la refrigeración líquida, consulte este documento sobre los desafíos comunes de la refrigeración líquida .

Publicación anterior

Siguiente publicación

Regresar al blog