HCI 扩容会同时改变计算和存储。只看“节点加入成功”很容易忽略后续的数据移动。扩容前应记录容量与性能基线,扩容后持续观察到重平衡完成、告警收敛、业务指标回到基线。

READING NOTES

本文要点

  • 先说清扩容解决容量、性能还是计算资源问题
  • 加入节点前检查硬件、固件、AOS/AHV 与网络基线
  • 把后台重平衡对业务的影响纳入变更观察

01|先确认为什么要扩

容量高不一定只需要增加容量盘,性能高也不一定只需要增加节点。应检查近 30 天容量增长、热点虚拟机、读写时延、CPU/内存余量和单节点故障后的可用空间。目标不清楚,扩容后可能仍然解决不了热点。

02|扩容前检查单

扩容前应导出 Prism 健康检查和未完成任务,确认集群当前没有数据保护、硬件或 CVM 异常。新节点则需要核对型号、磁盘介质、网卡、固件和软件兼容组合。

  • 集群健康、数据副本与容错状态正常。
  • 容量留有扩容期间节点或磁盘故障的处理余量。
  • 新节点管理、CVM、存储网络的 VLAN 与 MTU 一致。
  • DNS、NTP、带外管理和上联冗余已验证。
  • 扩容前容量、IOPS、时延和热点分布已截图留档。

03|节点加入后的观察重点

新节点加入后,平台会逐步重新分布数据。后台任务会占用磁盘和网络资源,因此需要将重平衡进度、业务时延、CVM 资源和上联流量放在一起观察。业务高峰前不应追求尽快跑满后台任务。

扩容前基线
  ↓
节点发现与加入
  ↓
集群服务稳定
  ↓
数据重平衡 ↔ 业务延迟 / CVM / 上联流量
  ↓
容量分布均衡
  ↓
HA、告警、备份、监控复核

04|什么时候才算完成

应等待容量分布趋于稳定、数据保护正常、严重告警清零,再复核主机调度、备份任务和监控,最后更新资产表、机柜图、IP 表、序列号和维保信息。

如果扩容同时包含版本升级,建议拆成两个变更窗口。一次只引入一种主要变化,后续出现异常时更容易定位。

FIELD NOTE扩容交付的结果不是“多了几 TB”,而是容量、性能和单点故障余量回到可预测范围。

SOURCES / 资料核对

相关官方资料

产品功能会随版本和授权变化。下面列出撰写时核对的资料, 实际交付仍以项目版本的兼容矩阵和正式文档为准。