Kubernetes 1.34 新特性解析:DRA GA、KMS v2 与安全增强

Kubernetes 1.34(O' WaW)将 DRA 与 KMS v2 带到 GA,同时带来卷扩容失败恢复、AdminNetworkPolicy 与审计注解等值得运维关注的特性。

文章目录 · 6 节

Kubernetes 1.34(代号 “O’ WaW”)于 2025 年 8 月发布。这个版本的主线是「硬件资源管理与安全加固」:Dynamic Resource Allocation 与 KMS v2 双双 GA,GPU 等异构资源的调度方式进入新阶段。

Dynamic Resource Allocation(DRA)GA

DRA 是下一代硬件资源管理框架,1.34 中结构化参数模型正式 GA,成为官方推荐的 GPU、网卡、FPGA 等设备分配方式:

apiVersion: resource.k8s.io/v1beta1
kind: ResourceClaim
metadata:
  name: gpu-claim
spec:
  devices:
    requests:
      - deviceClassName: gpu.nvidia.com
        count: 2

对运维的影响:

  • Device Plugin 框架进入冻结维护,只修 bug 不再加新特性,但现有 nvidia.com/gpu 工作负载仍可继续使用
  • 新 GPU 工作负载建议评估 DRA:支持按属性精确选择设备、处理设备间的亲和与约束,调度语义更清晰
  • 需要部署对应的 DRA 驱动(如 NVIDIA 的 DRA 实现),并在节点上注册设备类

KMS v2 GA 与 KMSv1 禁用

KMS v2 在 1.34 中 GA,静态加密(Secrets 落盘加密)的推荐实现从 v1 切换到 v2:

# kube-apiserver 的 EncryptionConfiguration
apiVersion: apiserver.config.k8s.io/v1
kind: EncryptionConfiguration
resources:
  - resources: [secrets]
    providers:
      - kms:
          apiVersion: kmsv2
          name: myKMS
          endpoint: unix:///var/run/kms.sock

KMSv1 在 1.34 中默认禁用,并将在后续版本移除。使用 v1 的集群需要尽快迁移:先确认 KMS 插件支持 v2 协议,再分步切换 EncryptionConfiguration 并观察 API Server 日志。

卷扩容失败恢复 GA

以前 PVC 扩容失败后往往卡在 FileSystemResizePending,只能删除重建。1.34 中该特性 GA,扩容失败可以恢复并重试,无需重建 PVC:

kubectl patch pvc data-0 -p '{"spec":{"resources":{"requests":{"storage":"200Gi"}}}}'

配合 CSI 驱动的失败报告,存储团队可以建立自动重试流程,减少人工介入。

AdminNetworkPolicy 进入 Beta

AdminNetworkPolicyBaselineAdminNetworkPolicy 是集群级网络策略,由集群管理员统一定义,优先级高于命名空间内的 NetworkPolicy,适合多团队集群的统一安全基线。Beta 版本 API 已可用:

apiVersion: policy.networking.k8s.io/v1beta1
kind: AdminNetworkPolicy
metadata:
  name: block-cross-ns-db
spec:
  priority: 10
  subject:
    namespaces:
      matchLabels:
        tier: app
  ingress:
    - action: Deny
      from:
        - namespaces:
            matchLabels:
              tier: db

审计注解(Audit Annotations)Beta

审计日志现在可以携带对象上的注解信息,便于追溯变更来源与请求意图。需要审计合规的集群可以在 audit policy 中开启对应规则,把注解纳入审计事件。

升级与落地建议

  • 升级前先处理 KMSv1:确认加密配置、插件版本与回滚方案,避免升级后 Secret 无法解密
  • GPU 工作负载分两步走:保持 device plugin 稳定运行,同时在小范围集群验证 DRA
  • 查看官方 1.34 发布说明与 CHANGELOG,核对 API 变更与废弃项,再按常规节奏升级控制平面

版本升级不是终点:DRA 与 KMS v2 都改变了资源管理的默认路径,先在小集群跑通,再推广到生产。