Desde sus humildes inicios hace más de una década, cuando la Inteligencia Artificial (IA) aún no era la fuerza dominante que es hoy, Kubernetes ha evolucionado de un simple orquestador de contenedores a una plataforma robusta y adaptable. Con cada iteración, Kubernetes refina su capacidad para abordar los desafíos tecnológicos más apremiantes del momento. La versión 1.37, bajo el nombre clave Garhwal, es un testimonio de esta evolución, marcando un giro decisivo hacia la optimización para cargas de trabajo de IA y Machine Learning, una modernización radical en la gestión de redes y un robustecimiento intrínseco de la seguridad.
La Era de la Computación Consciente de Cargas de Trabajo AI
La adaptación de Kubernetes a las demandas de la IA y el Machine Learning (ML) es uno de los pilares de la versión 1.37. Tradicionalmente, Kubernetes gestionaba los pods de forma individual, con una conciencia limitada de sus interdependencias. Este enfoque, aunque eficaz para servicios sin estado, presenta desafíos para las cargas de trabajo de IA que a menudo requieren que múltiples pods se inicien simultáneamente, compartan acceso a aceleradores y escalen como un grupo. La versión 1.37 aborda esto con un enfoque de planificación consciente de la carga de trabajo, introduciendo varias características clave:
- HPA Scale to Zero (KEP-2021): Esta funcionalidad, que se gradúa a Beta y se habilita por defecto, permite al Horizontal Pod Autoscaler reducir las réplicas de una carga de trabajo a cero cuando la demanda desaparece, restaurándolas cuando regresa. Utiliza métricas externas u de objeto en lugar de CPU o memoria, lo cual es vital para cargas de trabajo de alto procesamiento con GPUs costosas, permitiendo un ahorro significativo de costos al no mantener recursos inactivos.
- Gang Scheduling (KEP-4671): Introduce la colocación de pods «todo o nada» para trabajos de entrenamiento distribuido. Esto asegura que un grupo completo de pods se programe solo si todos pueden ser aprovisionados, previniendo estados de bloqueo o subutilización de recursos que son comunes en entornos de ML.
- Workload-aware Preemption (KEP-5710): También en Beta, permite al planificador considerar un
PodGroupcompleto, en lugar de pods individuales, al preempcionar cargas de trabajo de menor prioridad. Esto es crucial para mantener la coherencia y eficiencia de las tareas de IA que operan en conjunto. - DRA Device Taints and Tolerations (KEP-5055): La asignación dinámica de recursos (DRA) es fundamental para gestionar hardware especializado como GPUs. Esta característica, que alcanza el estado Estable, permite a Kubernetes marcar dispositivos rotos o degradados para que no se asignen a nuevas cargas de trabajo, similar a cómo se marcan los nodos. Los administradores pueden así drenar hardware degradado utilizando el modelo familiar de taints de nodo.
Modernización de la Red: El Adiós a IPVS y la Bienvenida a nftables
Kubernetes 1.37 continúa la transición estratégica en la gestión de la red del clúster, moviéndose de IPVS e iptables hacia nftables. Kube-proxy, el componente que enruta el tráfico a los servicios de Kubernetes, ha soportado IPVS como alternativa a iptables desde la versión 1.8. Sin embargo, IPVS dependía subyacentemente de iptables, lo que limitaba sus beneficios. La versión 1.37 formaliza la depreciación del modo IPVS (KEP-5495), con un plan para deshabilitarlo en 1.40 y eliminarlo en 1.43.
La adopción de nftables es un paso adelante significativo. Ofrece un rendimiento superior gracias a las actualizaciones incrementales de reglas y se alinea mejor con la dirección de la pila de red del kernel de Linux. Los clústeres que no configuran explícitamente un modo kube-proxy ahora recibirán una advertencia de depreciación (KEP-5343). Además, la característica DRA Resource Claim Status con datos estandarizados de interfaz de red (KEP-4817) proporciona a los controladores de DRA una forma consistente de describir las interfaces de red adjuntas, algo cada vez más relevante para cargas de trabajo de GPU y RDMA.
Reforzando la Seguridad con PKI Nativo
La seguridad es un pilar innegociable en cualquier infraestructura moderna, y Kubernetes 1.37 introduce mejoras significativas en este ámbito. Las características de Pod Certificates (KEP-4317) y ClusterTrustBundles (KEP-3257), ambas alcanzando el estado Estable, representan un avance fundamental. Estas innovaciones proporcionan por primera vez a Kubernetes una historia completa de PKI (Infraestructura de Clave Pública) nativa para las cargas de trabajo.
Los pods pueden ahora solicitar certificados X.509 de corta duración y recibir anclajes de confianza con alcance de clúster a través de volúmenes proyectados. Esto hace posible la implementación de mTLS (mutual TLS) directamente en el clúster sin la necesidad de herramientas externas como Cert-Manager o SPIFFE/SPIRE. Este enfoque simplifica drásticamente la gestión de identidades y la comunicación segura entre servicios, fortaleciendo la postura de seguridad global del clúster.
Conclusión y Recomendaciones de Mitigación
Kubernetes 1.37 no es solo una actualización incremental; es una reafirmación del compromiso del proyecto con la evolución y la adaptación a las necesidades de la computación cloud nativa. Desde la optimización de cargas de trabajo de IA hasta la modernización de la red y el refuerzo de la seguridad, cada mejora está diseñada para hacer de Kubernetes una plataforma más potente, eficiente y segura.
Para administradores de sistemas, desarrolladores y profesionales de IT, estas son las principales recomendaciones:
- Adopción de PKI Nativo: Priorice la implementación de Pod Certificates y ClusterTrustBundles para establecer mTLS robusto y simplificar la gestión de la identidad y la confianza entre sus servicios. Esto mitiga riesgos de comunicación no autorizada y facilita la auditoría.
- Planificación de la Transición de Red: Monitoree de cerca la depreciación de IPVS y planifique la transición a nftables. Asegúrese de que sus configuraciones de red sean compatibles y aproveche las mejoras de rendimiento y alineación con el kernel de Linux.
- Optimización de Recursos para IA/ML: Utilice características como HPA Scale to Zero y Gang Scheduling para optimizar costos y asegurar la ejecución eficiente de cargas de trabajo de IA y ML, especialmente aquellas que utilizan hardware especializado como GPUs. Configure DRA Device Taints para una gestión proactiva del hardware.
- Mantenimiento y Actualización Continua: Como siempre, manténgase al día con las últimas versiones y KEPs de Kubernetes. La comunidad sigue evolucionando rápidamente, y la adopción temprana de estas innovaciones puede proporcionar una ventaja competitiva y una mayor resiliencia operativa.
La evolución de Kubernetes continúa, y con la versión 1.37, se sienta una base aún más sólida para el futuro de las aplicaciones cloud nativas y la inteligencia artificial.






