I. Tổng quan:
Trong môi trường VMware vSphere, Network Redundancy là cơ chế đảm bảo kết nối mạng của máy ảo và các dịch vụ trên ESXi vẫn hoạt động khi một thành phần mạng gặp sự cố. Các thành phần có thể xảy ra lỗi bao gồm cáp mạng, card mạng vật lý (pNIC), cổng trên Physical Switch hoặc đường uplink.
Cơ chế dự phòng được xây dựng bằng cách sử dụng nhiều Physical NIC, cấu hình NIC Teaming trên Port Group, nhiều đường uplink và trong một số trường hợp sử dụng LACP trên vSphere Distributed Switch. Khi đường mạng chính bị mất kết nối, VMware sẽ phát hiện trạng thái lỗi và chuyển lưu lượng sang đường dự phòng theo chính sách Failover đã cấu hình.
II. Cơ chế dự phòng của Port Group:
1. Khái niệm:
Trong VMware vSphere, Port Group là thành phần kết nối giữa máy ảo (Virtual Machine) và Virtual Switch (vSwitch hoặc Distributed Switch). Ngoài chức năng cấu hình VLAN, chính sách bảo mật và quản lý lưu lượng mạng, Port Group còn hỗ trợ cơ chế dự phòng thông qua tính năng NIC Teaming and Failover.
Cơ chế này cho phép nhiều card mạng vật lý (Physical NIC hay vmnic) được liên kết với cùng một Port Group nhằm đảm bảo tính sẵn sàng của hệ thống mạng. Khi một đường truyền hoặc thiết bị mạng gặp sự cố, lưu lượng mạng sẽ được chuyển sang đường dự phòng, giúp máy ảo tiếp tục hoạt động mà không bị gián đoạn hoặc chỉ gián đoạn trong thời gian rất ngắn.
2. Failover Detection:
Failover Detection là cơ chế giúp ESXi phát hiện sự cố của đường kết nối mạng để xác định khi nào cần chuyển lưu lượng sang uplink dự phòng. VMware cung cấp hai phương thức chính:
2.1. Link Status:
Link Status là cơ chế phát hiện lỗi mặc định trong VMware vSphere được sử dụng trong chính sách NIC Teaming and Failover. Cơ chế này dựa trên trạng thái liên kết vật lý (Physical Link State) của card mạng để xác định tình trạng hoạt động của các uplink kết nối giữa ESXi Host và hệ thống mạng bên ngoài.
Khi một card mạng vật lý (vmnic) đang hoạt động bị mất tín hiệu liên kết do đứt cáp mạng, hỏng card mạng hoặc cổng kết nối trên switch bị tắt, ESXi sẽ ngay lập tức nhận biết sự cố thông qua trạng thái Link Down. Sau khi phát hiện lỗi, VMware tự động loại bỏ uplink bị lỗi khỏi nhóm NIC Teaming và chuyển toàn bộ lưu lượng mạng sang uplink dự phòng còn hoạt động.
Trong mô hình NIC Teaming, Port Group thường được cấu hình theo cơ chế Active/Standby hoặc Active/Active.
Trong điều kiện bình thường, toàn bộ lưu lượng của máy ảo được truyền qua vmnic0.
VM > Port Group > vmnic0 (Active) > Switch A
Khi xảy ra sự cố như đứt cáp hoặc hỏng cổng kết nối: vmnic0 → Link Down
ESXi Host thực hiện các bước sau:
2.2. Beacon Probing:
Beacon Probing là cơ chế phát hiện lỗi mạng nâng cao được VMware tích hợp trong chính sách NIC Teaming and Failover. Cơ chế này sử dụng các gói tin Beacon (Beacon Probe Packets) được gửi và nhận giữa các card mạng vật lý (Physical NIC) trong cùng nhóm teaming nhằm kiểm tra tính khả dụng của các đường kết nối mạng. Theo tài liệu của Broadcom Knowledge Base, Beacon Probing là cơ chế gửi và lắng nghe các Beacon Probe Packet trên tất cả các NIC trong nhóm teaming để phát hiện các sự cố mạng như đứt cáp hoặc lỗi thiết bị chuyển mạch.
Khác với cơ chế Link Status chỉ kiểm tra trạng thái kết nối vật lý của card mạng, Beacon Probing có khả năng phát hiện các lỗi xảy ra phía sau switch, chẳng hạn như lỗi uplink, lỗi đường truyền đến Core Switch hoặc sự cố trên các thiết bị mạng trung gian. Điều này giúp nâng cao khả năng dự phòng và đảm bảo tính liên tục của hệ thống mạng trong môi trường VMware vSphere.
vSwitch được cấu hình sử dụng ba card mạng vật lý kết nối đến ba switch độc lập (A, B và C). Các card mạng liên tục trao đổi các gói Beacon thông qua hạ tầng mạng vật lý.
Quá trình hoạt động diễn ra như sau:
3. NIC Teaming & Failover Order
NIC Teaming là cơ chế cho phép kết hợp nhiều card mạng vật lý (Physical NIC) thành một nhóm nhằm tăng băng thông mạng và nâng cao khả năng dự phòng cho hệ thống. Khi một card mạng hoặc đường truyền gặp sự cố, VMware có thể tự động chuyển lưu lượng sang card mạng khác trong nhóm, giúp duy trì kết nối mạng cho các máy ảo. Đồng thời, cơ chế cân bằng tải (Load Balancing Policy) cho phép phân phối lưu lượng giữa các card mạng vật lý nhằm tối ưu hiệu suất sử dụng tài nguyên mạng. Theo thiết kế của VMware, việc cân bằng tải chỉ áp dụng đối với lưu lượng ra (outbound traffic), trong khi lưu lượng vào (inbound traffic) được quyết định bởi chính sách cân bằng tải trên thiết bị chuyển mạch vật lý.
Để xác định card mạng nào được sử dụng trong điều kiện hoạt động bình thường và card mạng nào sẽ được kích hoạt khi xảy ra sự cố, VMware sử dụng cơ chế Failover Order. Cơ chế này cho phép sắp xếp các card mạng vào ba nhóm chính gồm Active, Standby và Unused.
Active: Là nhóm card mạng đang hoạt động và được sử dụng để truyền nhận dữ liệu trong điều kiện bình thường. Tất cả lưu lượng mạng sẽ được xử lý thông qua các adapter thuộc nhóm Active. Nếu cấu hình nhiều Active Adapter, VMware có thể phân phối lưu lượng giữa các uplink theo chính sách cân bằng tải được thiết lập.
Standby: Là nhóm card mạng dự phòng. Các adapter này không tham gia xử lý lưu lượng khi hệ thống hoạt động bình thường mà chỉ được kích hoạt khi một adapter trong nhóm Active gặp sự cố. Khi đó VMware sẽ tự động chuyển lưu lượng sang adapter Standby để duy trì kết nối mạng.
Unused: Là nhóm card mạng không được sử dụng trong cấu hình hiện tại. Các adapter này được giữ ở trạng thái dự phòng và không tham gia truyền dữ liệu. Khi cần thiết, quản trị viên có thể chuyển chúng sang nhóm Active hoặc Standby.
4. Failback Mechanism (quay lại đường chính sau khi phục hồi):
Failback là cơ chế xác định cách VMware đưa một card mạng vật lý (Physical NIC) trở lại trạng thái hoạt động sau khi đã phục hồi từ sự cố. Cơ chế này hoạt động cùng với NIC Teaming và Failover Order nhằm đảm bảo hệ thống sử dụng đúng uplink ưu tiên đã được cấu hình.
Khi một uplink Active gặp sự cố, VMkernel sẽ tự động chuyển lưu lượng sang uplink dự phòng thuộc nhóm Standby. Sau khi uplink gặp sự cố được khôi phục, hành vi của hệ thống phụ thuộc vào thiết lập Failback.
III. Dự phòng Physical Network
1. Multiple Physical NIC (pNIC)
Physical NIC (pNIC), hay còn gọi là vmnic trong VMware ESXi, là card mạng vật lý dùng để kết nối ESXi Host với hệ thống mạng bên ngoài. Một ESXi Host có thể được trang bị nhiều pNIC nhằm tăng khả năng dự phòng, khả năng mở rộng và hiệu suất truyền tải dữ liệu.
Trong môi trường VMware vSphere, nhiều pNIC có thể được liên kết với cùng một vSwitch hoặc Port Group thông qua cơ chế NIC Teaming. Việc sử dụng nhiều pNIC giúp hệ thống duy trì kết nối mạng khi một card mạng hoặc một đường truyền vật lý gặp sự cố. Đồng thời, nhiều pNIC còn cho phép phân phối lưu lượng mạng giữa các đường truyền nhằm tối ưu băng thông sử dụng.
Nhờ sử dụng nhiều pNIC, hệ thống VMware có thể giảm thiểu nguy cơ mất kết nối do lỗi phần cứng hoặc đường truyền, đồng thời nâng cao tính sẵn sàng của hạ tầng ảo hóa.
2. Multiple Uplinks
Trong VMware vSphere, Uplink là kết nối giữa Virtual Switch (vSwitch hoặc vSphere Distributed Switch) và card mạng vật lý (Physical NIC - pNIC) của máy chủ ESXi. Một vSwitch có thể được cấu hình với nhiều uplink nhằm tăng tính sẵn sàng và nâng cao hiệu năng mạng.
Việc sử dụng nhiều uplink (Multiple Uplinks) cho phép VMware triển khai các cơ chế dự phòng và cân bằng tải thông qua NIC Teaming. Khi một uplink gặp sự cố, lưu lượng mạng có thể được tự động chuyển sang uplink khác còn hoạt động, giúp giảm thiểu gián đoạn dịch vụ. Đồng thời, nhiều uplink cũng cho phép phân phối lưu lượng giữa các đường kết nối vật lý để tận dụng tối đa băng thông mạng.
Các uplink được liên kết với nhiều card mạng vật lý khác nhau. VMware có thể sử dụng các uplink này theo cơ chế Active/Standby hoặc Active/Active tùy thuộc vào chính sách Teaming and Failover được cấu hình.
3. Dự phòng Physical Switch
Bên cạnh cơ chế dự phòng ở cấp độ Port Group và NIC Teaming, việc triển khai dự phòng cho Physical Switch cũng đóng vai trò quan trọng nhằm loại bỏ điểm lỗi đơn (Single Point of Failure) trong hạ tầng mạng. Nếu tất cả các card mạng vật lý của ESXi Host đều kết nối đến cùng một switch, toàn bộ hệ thống có thể mất kết nối khi switch đó gặp sự cố.
Trong điều kiện bình thường, lưu lượng mạng có thể đi qua một hoặc nhiều uplink tùy thuộc vào chính sách Teaming and Failover được cấu hình.
Khi xảy ra sự cố trên Switch A hoặc đường kết nối giữa ESXi và Switch A. VMkernel phát hiện uplink vmnic0 không còn khả dụng thông qua cơ chế Link Status hoặc Beacon Probing. Hệ thống sẽ tự động loại bỏ vmnic0 khỏi nhóm Active và chuyển lưu lượng sang vmnic1 đang kết nối với Switch B. Nhờ đó các máy ảo vẫn duy trì được kết nối mạng dù một thiết bị chuyển mạch vật lý gặp sự cố.
IV. LACP trong VMware
1, Khái niệm LACP
LACP (Link Aggregation Control Protocol) là giao thức chuẩn IEEE 802.1AX (trước đây là IEEE 802.3ad), cho phép gộp nhiều đường kết nối vật lý giữa máy chủ và thiết bị chuyển mạch thành một liên kết logic duy nhất. Trong môi trường VMware vSphere, LACP được sử dụng nhằm tăng băng thông, nâng cao khả năng dự phòng và đơn giản hóa việc quản lý nhiều kết nối mạng. LACP chỉ được hỗ trợ trên vSphere Distributed Switch (vDS) và yêu cầu cấu hình tương ứng trên Physical Switch.
Khi triển khai LACP, các card mạng vật lý (vmnic) của ESXi Host sẽ được nhóm lại thành một Link Aggregation Group (LAG). Các thành viên trong nhóm sẽ trao đổi các gói tin LACP để kiểm tra trạng thái hoạt động và duy trì tính nhất quán của liên kết.
2. Link Aggregation
Link Aggregation là kỹ thuật kết hợp nhiều liên kết mạng vật lý thành một liên kết logic duy nhất. Đây là nền tảng hoạt động của LACP.
Các card mạng vật lý được gộp thành một nhóm LAG. Đối với hệ điều hành và VMware, nhóm liên kết này được nhìn nhận như một kết nối logic duy nhất.
Khi lưu lượng mạng phát sinh, VMware và Physical Switch sẽ sử dụng thuật toán phân phối tải (Load Balancing) để quyết định đường truyền nào sẽ được sử dụng. Nhờ đó, lưu lượng được phân bố trên nhiều liên kết vật lý thay vì chỉ sử dụng một đường duy nhất.
Bên cạnh việc tăng băng thông, Link Aggregation còn cung cấp khả năng dự phòng. Nếu một thành viên trong nhóm LAG gặp sự cố, các liên kết còn lại vẫn tiếp tục hoạt động và đảm bảo lưu lượng mạng không bị gián đoạn.
3. LACP trên vSphere Distributed Switch
LACP (Link Aggregation Control Protocol) chỉ được hỗ trợ trên vSphere Distributed Switch (vDS) và không được hỗ trợ trên Standard Switch. LACP cho phép nhiều uplink vật lý (vmnic) của ESXi Host được nhóm lại thành một Link Aggregation Group (LAG) để tăng băng thông và cung cấp khả năng dự phòng cho kết nối mạng.
Khi cấu hình LACP trên vDS, VMware Distributed Switch và Physical Switch sẽ trao đổi các gói tin LACP nhằm xác định các liên kết hợp lệ và duy trì trạng thái hoạt động của nhóm LAG. Tất cả các uplink thành viên sẽ hoạt động như một liên kết logic duy nhất
Lợi ích của LACP trên vSphere Distributed Switch:
4. Cơ chế xử lý khi một Link bị lỗi
Một trong những ưu điểm quan trọng của LACP là khả năng duy trì kết nối mạng khi một liên kết vật lý trong nhóm Link Aggregation Group (LAG) gặp sự cố. Trong quá trình hoạt động, các thành viên trong nhóm LAG liên tục trao đổi các gói tin LACP để giám sát trạng thái kết nối. Khi phát hiện một liên kết bị lỗi, LACP sẽ tự động loại bỏ liên kết đó khỏi nhóm mà không ảnh hưởng đến các liên kết còn lại.
Khi xảy ra sự cố: vmnic2 → Link Down
LACP sẽ thực hiện các bước sau:
Mặc dù tổng băng thông khả dụng của nhóm LAG giảm xuống do mất một đường truyền, hệ thống vẫn duy trì được kết nối mạng và các máy ảo tiếp tục hoạt động bình thường. Đây là điểm khác biệt quan trọng giữa LACP và việc sử dụng một liên kết đơn lẻ, trong đó lỗi trên đường truyền sẽ làm gián đoạn hoàn toàn kết nối mạng.
Khi liên kết bị lỗi được khôi phục, LACP sẽ tự động phát hiện trạng thái hoạt động trở lại và thêm liên kết đó vào nhóm LAG. Sau khi đồng bộ thành công, liên kết được sử dụng trở lại để tham gia truyền tải lưu lượng cùng với các thành viên khác trong nhóm.
Nhờ cơ chế tự động phát hiện, loại bỏ và đưa liên kết trở lại hoạt động, LACP giúp tăng tính sẵn sàng của hệ thống mạng, giảm thiểu thời gian gián đoạn dịch vụ và đảm bảo các ứng dụng trên môi trường VMware vSphere luôn duy trì kết nối ổn định.
V. vSphere HA
1. Heartbeat Network
Trong VMware vSphere HA, các ESXi Host trong cùng một Cluster liên tục trao đổi tín hiệu heartbeat thông qua mạng quản trị (Management Network). Heartbeat là cơ chế giúp các Host xác nhận trạng thái hoạt động của nhau và phát hiện nhanh các sự cố xảy ra trong Cluster.
Mỗi Host sẽ định kỳ gửi các gói heartbeat đến các Host còn lại. Nếu một Host không nhận được heartbeat từ Host khác trong một khoảng thời gian nhất định, vSphere HA sẽ xem đây là dấu hiệu của sự cố và bắt đầu quá trình kiểm tra bổ sung trước khi đưa ra quyết định xử lý.
2. Heartbeat Network Redundancy bằng NIC Teaming
Để tránh việc mất heartbeat do lỗi card mạng hoặc đường truyền vật lý, VMware khuyến nghị triển khai NIC Teaming cho mạng Management hoặc VMkernel Adapter được sử dụng bởi HA.
Heartbeat vẫn tiếp tục được truyền qua vmnic1 và HA không bị ảnh hưởng. Việc kết hợp NIC Teaming với Management Network giúp loại bỏ điểm lỗi đơn tại tầng kết nối vật lý, đồng thời tăng độ tin cậy của cơ chế giám sát Host trong Cluster.
3. Redundancy bằng Additional Heartbeat Networks
Ngoài NIC Teaming, VMware còn hỗ trợ cấu hình nhiều mạng Heartbeat dự phòng thông qua các VMkernel Adapter khác nhau.
Trong trường hợp mạng Heartbeat chính gặp sự cố, vSphere HA có thể sử dụng mạng Heartbeat dự phòng để tiếp tục trao đổi trạng thái giữa các Host.
Việc triển khai nhiều mạng Heartbeat giúp tăng khả năng chịu lỗi và giảm nguy cơ xảy ra hiện tượng mất liên lạc giữa các Host do lỗi mạng đơn lẻ.
4. Xử lý khi Host mất kết nối mạng
Khi một Host không còn gửi heartbeat đến các Host khác trong Cluster, vSphere HA sẽ tiến hành xác minh tình trạng của Host đó.
Quá trình xử lý diễn ra theo các bước:
Dự phòng Network trong VMware được xây dựng dựa trên nhiều lớp như Port Group, NIC Teaming, Physical NIC, Uplink, Physical Switch và LACP. Khi một đường mạng bị lỗi, VMware có thể phát hiện sự cố và chuyển traffic sang đường dự phòng mà không cần thay đổi cấu hình mạng của máy ảo.
Trong đó, Port Group và NIC Teaming chịu trách nhiệm chính cho cơ chế Failover ở tầng mạng của ESXi, LACP hỗ trợ kết hợp và quản lý nhiều đường link trên Distributed Switch, còn Multiple Uplinks và nhiều Physical Switch giúp loại bỏ các điểm lỗi đơn trong hạ tầng vật lý. Ở cấp độ Host, vSphere HA cung cấp một lớp bảo vệ khác bằng cách phát hiện Host failure và khởi động lại VM trên ESXi Host khác. Vì vậy, một hệ thống VMware có khả năng dự phòng tốt cần thiết kế nhiều lớp thay vì chỉ dựa vào một cơ chế duy nhất.
Trong môi trường VMware vSphere, Network Redundancy là cơ chế đảm bảo kết nối mạng của máy ảo và các dịch vụ trên ESXi vẫn hoạt động khi một thành phần mạng gặp sự cố. Các thành phần có thể xảy ra lỗi bao gồm cáp mạng, card mạng vật lý (pNIC), cổng trên Physical Switch hoặc đường uplink.
Cơ chế dự phòng được xây dựng bằng cách sử dụng nhiều Physical NIC, cấu hình NIC Teaming trên Port Group, nhiều đường uplink và trong một số trường hợp sử dụng LACP trên vSphere Distributed Switch. Khi đường mạng chính bị mất kết nối, VMware sẽ phát hiện trạng thái lỗi và chuyển lưu lượng sang đường dự phòng theo chính sách Failover đã cấu hình.
II. Cơ chế dự phòng của Port Group:
1. Khái niệm:
Trong VMware vSphere, Port Group là thành phần kết nối giữa máy ảo (Virtual Machine) và Virtual Switch (vSwitch hoặc Distributed Switch). Ngoài chức năng cấu hình VLAN, chính sách bảo mật và quản lý lưu lượng mạng, Port Group còn hỗ trợ cơ chế dự phòng thông qua tính năng NIC Teaming and Failover.
Cơ chế này cho phép nhiều card mạng vật lý (Physical NIC hay vmnic) được liên kết với cùng một Port Group nhằm đảm bảo tính sẵn sàng của hệ thống mạng. Khi một đường truyền hoặc thiết bị mạng gặp sự cố, lưu lượng mạng sẽ được chuyển sang đường dự phòng, giúp máy ảo tiếp tục hoạt động mà không bị gián đoạn hoặc chỉ gián đoạn trong thời gian rất ngắn.
2. Failover Detection:
Failover Detection là cơ chế giúp ESXi phát hiện sự cố của đường kết nối mạng để xác định khi nào cần chuyển lưu lượng sang uplink dự phòng. VMware cung cấp hai phương thức chính:
2.1. Link Status:
Link Status là cơ chế phát hiện lỗi mặc định trong VMware vSphere được sử dụng trong chính sách NIC Teaming and Failover. Cơ chế này dựa trên trạng thái liên kết vật lý (Physical Link State) của card mạng để xác định tình trạng hoạt động của các uplink kết nối giữa ESXi Host và hệ thống mạng bên ngoài.
Khi một card mạng vật lý (vmnic) đang hoạt động bị mất tín hiệu liên kết do đứt cáp mạng, hỏng card mạng hoặc cổng kết nối trên switch bị tắt, ESXi sẽ ngay lập tức nhận biết sự cố thông qua trạng thái Link Down. Sau khi phát hiện lỗi, VMware tự động loại bỏ uplink bị lỗi khỏi nhóm NIC Teaming và chuyển toàn bộ lưu lượng mạng sang uplink dự phòng còn hoạt động.
Trong mô hình NIC Teaming, Port Group thường được cấu hình theo cơ chế Active/Standby hoặc Active/Active.
Trong điều kiện bình thường, toàn bộ lưu lượng của máy ảo được truyền qua vmnic0.
VM > Port Group > vmnic0 (Active) > Switch A
Khi xảy ra sự cố như đứt cáp hoặc hỏng cổng kết nối: vmnic0 → Link Down
ESXi Host thực hiện các bước sau:
- Phát hiện trạng thái mất liên kết trên vmnic0.
- Đánh dấu uplink là không khả dụng.
- Kích hoạt vmnic1 từ trạng thái Standby sang Active.
- Chuyển toàn bộ lưu lượng mạng sang vmnic1.
2.2. Beacon Probing:
Beacon Probing là cơ chế phát hiện lỗi mạng nâng cao được VMware tích hợp trong chính sách NIC Teaming and Failover. Cơ chế này sử dụng các gói tin Beacon (Beacon Probe Packets) được gửi và nhận giữa các card mạng vật lý (Physical NIC) trong cùng nhóm teaming nhằm kiểm tra tính khả dụng của các đường kết nối mạng. Theo tài liệu của Broadcom Knowledge Base, Beacon Probing là cơ chế gửi và lắng nghe các Beacon Probe Packet trên tất cả các NIC trong nhóm teaming để phát hiện các sự cố mạng như đứt cáp hoặc lỗi thiết bị chuyển mạch.
Khác với cơ chế Link Status chỉ kiểm tra trạng thái kết nối vật lý của card mạng, Beacon Probing có khả năng phát hiện các lỗi xảy ra phía sau switch, chẳng hạn như lỗi uplink, lỗi đường truyền đến Core Switch hoặc sự cố trên các thiết bị mạng trung gian. Điều này giúp nâng cao khả năng dự phòng và đảm bảo tính liên tục của hệ thống mạng trong môi trường VMware vSphere.
Quá trình hoạt động diễn ra như sau:
- Card mạng thứ nhất gửi gói Beacon Broadcast vào hệ thống mạng.
- Beacon được các switch trung gian chuyển tiếp đến Core Switch.
- Các card mạng còn lại nhận được gói Beacon và xác nhận đường truyền đang hoạt động bình thường.
- Nếu một đường kết nối gặp sự cố, Beacon sẽ không thể được chuyển tiếp đến card mạng tương ứng.
3. NIC Teaming & Failover Order
NIC Teaming là cơ chế cho phép kết hợp nhiều card mạng vật lý (Physical NIC) thành một nhóm nhằm tăng băng thông mạng và nâng cao khả năng dự phòng cho hệ thống. Khi một card mạng hoặc đường truyền gặp sự cố, VMware có thể tự động chuyển lưu lượng sang card mạng khác trong nhóm, giúp duy trì kết nối mạng cho các máy ảo. Đồng thời, cơ chế cân bằng tải (Load Balancing Policy) cho phép phân phối lưu lượng giữa các card mạng vật lý nhằm tối ưu hiệu suất sử dụng tài nguyên mạng. Theo thiết kế của VMware, việc cân bằng tải chỉ áp dụng đối với lưu lượng ra (outbound traffic), trong khi lưu lượng vào (inbound traffic) được quyết định bởi chính sách cân bằng tải trên thiết bị chuyển mạch vật lý.
Để xác định card mạng nào được sử dụng trong điều kiện hoạt động bình thường và card mạng nào sẽ được kích hoạt khi xảy ra sự cố, VMware sử dụng cơ chế Failover Order. Cơ chế này cho phép sắp xếp các card mạng vào ba nhóm chính gồm Active, Standby và Unused.
Active: Là nhóm card mạng đang hoạt động và được sử dụng để truyền nhận dữ liệu trong điều kiện bình thường. Tất cả lưu lượng mạng sẽ được xử lý thông qua các adapter thuộc nhóm Active. Nếu cấu hình nhiều Active Adapter, VMware có thể phân phối lưu lượng giữa các uplink theo chính sách cân bằng tải được thiết lập.
Standby: Là nhóm card mạng dự phòng. Các adapter này không tham gia xử lý lưu lượng khi hệ thống hoạt động bình thường mà chỉ được kích hoạt khi một adapter trong nhóm Active gặp sự cố. Khi đó VMware sẽ tự động chuyển lưu lượng sang adapter Standby để duy trì kết nối mạng.
Unused: Là nhóm card mạng không được sử dụng trong cấu hình hiện tại. Các adapter này được giữ ở trạng thái dự phòng và không tham gia truyền dữ liệu. Khi cần thiết, quản trị viên có thể chuyển chúng sang nhóm Active hoặc Standby.
4. Failback Mechanism (quay lại đường chính sau khi phục hồi):
Failback là cơ chế xác định cách VMware đưa một card mạng vật lý (Physical NIC) trở lại trạng thái hoạt động sau khi đã phục hồi từ sự cố. Cơ chế này hoạt động cùng với NIC Teaming và Failover Order nhằm đảm bảo hệ thống sử dụng đúng uplink ưu tiên đã được cấu hình.
Khi một uplink Active gặp sự cố, VMkernel sẽ tự động chuyển lưu lượng sang uplink dự phòng thuộc nhóm Standby. Sau khi uplink gặp sự cố được khôi phục, hành vi của hệ thống phụ thuộc vào thiết lập Failback.
Failback = Yes
Khi tùy chọn Failback được bật, uplink bị lỗi trước đó sẽ tự động quay trở lại trạng thái Active ngay sau khi phục hồi. Uplink Standby đang thay thế sẽ được chuyển về trạng thái dự phòng.Failback = No
Khi tùy chọn Failback bị tắt, uplink đã phục hồi sẽ không tự động trở lại trạng thái Active. Uplink đang hoạt động tiếp tục xử lý lưu lượng cho đến khi xảy ra một sự cố mới hoặc được quản trị viên chuyển đổi thủ công.III. Dự phòng Physical Network
1. Multiple Physical NIC (pNIC)
Physical NIC (pNIC), hay còn gọi là vmnic trong VMware ESXi, là card mạng vật lý dùng để kết nối ESXi Host với hệ thống mạng bên ngoài. Một ESXi Host có thể được trang bị nhiều pNIC nhằm tăng khả năng dự phòng, khả năng mở rộng và hiệu suất truyền tải dữ liệu.
Trong môi trường VMware vSphere, nhiều pNIC có thể được liên kết với cùng một vSwitch hoặc Port Group thông qua cơ chế NIC Teaming. Việc sử dụng nhiều pNIC giúp hệ thống duy trì kết nối mạng khi một card mạng hoặc một đường truyền vật lý gặp sự cố. Đồng thời, nhiều pNIC còn cho phép phân phối lưu lượng mạng giữa các đường truyền nhằm tối ưu băng thông sử dụng.
Nhờ sử dụng nhiều pNIC, hệ thống VMware có thể giảm thiểu nguy cơ mất kết nối do lỗi phần cứng hoặc đường truyền, đồng thời nâng cao tính sẵn sàng của hạ tầng ảo hóa.
2. Multiple Uplinks
Trong VMware vSphere, Uplink là kết nối giữa Virtual Switch (vSwitch hoặc vSphere Distributed Switch) và card mạng vật lý (Physical NIC - pNIC) của máy chủ ESXi. Một vSwitch có thể được cấu hình với nhiều uplink nhằm tăng tính sẵn sàng và nâng cao hiệu năng mạng.
Việc sử dụng nhiều uplink (Multiple Uplinks) cho phép VMware triển khai các cơ chế dự phòng và cân bằng tải thông qua NIC Teaming. Khi một uplink gặp sự cố, lưu lượng mạng có thể được tự động chuyển sang uplink khác còn hoạt động, giúp giảm thiểu gián đoạn dịch vụ. Đồng thời, nhiều uplink cũng cho phép phân phối lưu lượng giữa các đường kết nối vật lý để tận dụng tối đa băng thông mạng.
Các uplink được liên kết với nhiều card mạng vật lý khác nhau. VMware có thể sử dụng các uplink này theo cơ chế Active/Standby hoặc Active/Active tùy thuộc vào chính sách Teaming and Failover được cấu hình.
3. Dự phòng Physical Switch
Bên cạnh cơ chế dự phòng ở cấp độ Port Group và NIC Teaming, việc triển khai dự phòng cho Physical Switch cũng đóng vai trò quan trọng nhằm loại bỏ điểm lỗi đơn (Single Point of Failure) trong hạ tầng mạng. Nếu tất cả các card mạng vật lý của ESXi Host đều kết nối đến cùng một switch, toàn bộ hệ thống có thể mất kết nối khi switch đó gặp sự cố.
Trong điều kiện bình thường, lưu lượng mạng có thể đi qua một hoặc nhiều uplink tùy thuộc vào chính sách Teaming and Failover được cấu hình.
Khi xảy ra sự cố trên Switch A hoặc đường kết nối giữa ESXi và Switch A. VMkernel phát hiện uplink vmnic0 không còn khả dụng thông qua cơ chế Link Status hoặc Beacon Probing. Hệ thống sẽ tự động loại bỏ vmnic0 khỏi nhóm Active và chuyển lưu lượng sang vmnic1 đang kết nối với Switch B. Nhờ đó các máy ảo vẫn duy trì được kết nối mạng dù một thiết bị chuyển mạch vật lý gặp sự cố.
IV. LACP trong VMware
1, Khái niệm LACP
LACP (Link Aggregation Control Protocol) là giao thức chuẩn IEEE 802.1AX (trước đây là IEEE 802.3ad), cho phép gộp nhiều đường kết nối vật lý giữa máy chủ và thiết bị chuyển mạch thành một liên kết logic duy nhất. Trong môi trường VMware vSphere, LACP được sử dụng nhằm tăng băng thông, nâng cao khả năng dự phòng và đơn giản hóa việc quản lý nhiều kết nối mạng. LACP chỉ được hỗ trợ trên vSphere Distributed Switch (vDS) và yêu cầu cấu hình tương ứng trên Physical Switch.
Khi triển khai LACP, các card mạng vật lý (vmnic) của ESXi Host sẽ được nhóm lại thành một Link Aggregation Group (LAG). Các thành viên trong nhóm sẽ trao đổi các gói tin LACP để kiểm tra trạng thái hoạt động và duy trì tính nhất quán của liên kết.
2. Link Aggregation
Link Aggregation là kỹ thuật kết hợp nhiều liên kết mạng vật lý thành một liên kết logic duy nhất. Đây là nền tảng hoạt động của LACP.
Các card mạng vật lý được gộp thành một nhóm LAG. Đối với hệ điều hành và VMware, nhóm liên kết này được nhìn nhận như một kết nối logic duy nhất.
Khi lưu lượng mạng phát sinh, VMware và Physical Switch sẽ sử dụng thuật toán phân phối tải (Load Balancing) để quyết định đường truyền nào sẽ được sử dụng. Nhờ đó, lưu lượng được phân bố trên nhiều liên kết vật lý thay vì chỉ sử dụng một đường duy nhất.
Bên cạnh việc tăng băng thông, Link Aggregation còn cung cấp khả năng dự phòng. Nếu một thành viên trong nhóm LAG gặp sự cố, các liên kết còn lại vẫn tiếp tục hoạt động và đảm bảo lưu lượng mạng không bị gián đoạn.
3. LACP trên vSphere Distributed Switch
LACP (Link Aggregation Control Protocol) chỉ được hỗ trợ trên vSphere Distributed Switch (vDS) và không được hỗ trợ trên Standard Switch. LACP cho phép nhiều uplink vật lý (vmnic) của ESXi Host được nhóm lại thành một Link Aggregation Group (LAG) để tăng băng thông và cung cấp khả năng dự phòng cho kết nối mạng.
Khi cấu hình LACP trên vDS, VMware Distributed Switch và Physical Switch sẽ trao đổi các gói tin LACP nhằm xác định các liên kết hợp lệ và duy trì trạng thái hoạt động của nhóm LAG. Tất cả các uplink thành viên sẽ hoạt động như một liên kết logic duy nhất
Lợi ích của LACP trên vSphere Distributed Switch:
- Tăng băng thông bằng cách sử dụng đồng thời nhiều uplink vật lý.
- Cung cấp khả năng dự phòng khi một liên kết gặp sự cố.
- Tự động phát hiện và loại bỏ các liên kết lỗi khỏi nhóm LAG.
- Giảm nguy cơ mất kết nối do hỏng card mạng hoặc hỏng cổng switch.
- Đơn giản hóa việc quản lý nhiều kết nối mạng thông qua một liên kết logic duy nhất.
4. Cơ chế xử lý khi một Link bị lỗi
Một trong những ưu điểm quan trọng của LACP là khả năng duy trì kết nối mạng khi một liên kết vật lý trong nhóm Link Aggregation Group (LAG) gặp sự cố. Trong quá trình hoạt động, các thành viên trong nhóm LAG liên tục trao đổi các gói tin LACP để giám sát trạng thái kết nối. Khi phát hiện một liên kết bị lỗi, LACP sẽ tự động loại bỏ liên kết đó khỏi nhóm mà không ảnh hưởng đến các liên kết còn lại.
Khi xảy ra sự cố: vmnic2 → Link Down
LACP sẽ thực hiện các bước sau:
- Phát hiện vmnic2 không còn hoạt động thông qua các bản tin LACP.
- Loại bỏ vmnic2 khỏi nhóm LAG.
- Phân phối lại lưu lượng qua các uplink còn lại.
- Duy trì kết nối mạng mà không cần can thiệp thủ công.
Mặc dù tổng băng thông khả dụng của nhóm LAG giảm xuống do mất một đường truyền, hệ thống vẫn duy trì được kết nối mạng và các máy ảo tiếp tục hoạt động bình thường. Đây là điểm khác biệt quan trọng giữa LACP và việc sử dụng một liên kết đơn lẻ, trong đó lỗi trên đường truyền sẽ làm gián đoạn hoàn toàn kết nối mạng.
Khi liên kết bị lỗi được khôi phục, LACP sẽ tự động phát hiện trạng thái hoạt động trở lại và thêm liên kết đó vào nhóm LAG. Sau khi đồng bộ thành công, liên kết được sử dụng trở lại để tham gia truyền tải lưu lượng cùng với các thành viên khác trong nhóm.
Nhờ cơ chế tự động phát hiện, loại bỏ và đưa liên kết trở lại hoạt động, LACP giúp tăng tính sẵn sàng của hệ thống mạng, giảm thiểu thời gian gián đoạn dịch vụ và đảm bảo các ứng dụng trên môi trường VMware vSphere luôn duy trì kết nối ổn định.
V. vSphere HA
1. Heartbeat Network
Trong VMware vSphere HA, các ESXi Host trong cùng một Cluster liên tục trao đổi tín hiệu heartbeat thông qua mạng quản trị (Management Network). Heartbeat là cơ chế giúp các Host xác nhận trạng thái hoạt động của nhau và phát hiện nhanh các sự cố xảy ra trong Cluster.
Mỗi Host sẽ định kỳ gửi các gói heartbeat đến các Host còn lại. Nếu một Host không nhận được heartbeat từ Host khác trong một khoảng thời gian nhất định, vSphere HA sẽ xem đây là dấu hiệu của sự cố và bắt đầu quá trình kiểm tra bổ sung trước khi đưa ra quyết định xử lý.
2. Heartbeat Network Redundancy bằng NIC Teaming
Để tránh việc mất heartbeat do lỗi card mạng hoặc đường truyền vật lý, VMware khuyến nghị triển khai NIC Teaming cho mạng Management hoặc VMkernel Adapter được sử dụng bởi HA.
Heartbeat vẫn tiếp tục được truyền qua vmnic1 và HA không bị ảnh hưởng. Việc kết hợp NIC Teaming với Management Network giúp loại bỏ điểm lỗi đơn tại tầng kết nối vật lý, đồng thời tăng độ tin cậy của cơ chế giám sát Host trong Cluster.
3. Redundancy bằng Additional Heartbeat Networks
Ngoài NIC Teaming, VMware còn hỗ trợ cấu hình nhiều mạng Heartbeat dự phòng thông qua các VMkernel Adapter khác nhau.
Trong trường hợp mạng Heartbeat chính gặp sự cố, vSphere HA có thể sử dụng mạng Heartbeat dự phòng để tiếp tục trao đổi trạng thái giữa các Host.
Việc triển khai nhiều mạng Heartbeat giúp tăng khả năng chịu lỗi và giảm nguy cơ xảy ra hiện tượng mất liên lạc giữa các Host do lỗi mạng đơn lẻ.
4. Xử lý khi Host mất kết nối mạng
Khi một Host không còn gửi heartbeat đến các Host khác trong Cluster, vSphere HA sẽ tiến hành xác minh tình trạng của Host đó.
Quá trình xử lý diễn ra theo các bước:
- Host ngừng gửi heartbeat.
- Các Host còn lại phát hiện mất kết nối.
- HA kiểm tra các cơ chế heartbeat dự phòng.
- Xác định Host bị cô lập (Isolation) hoặc Host gặp lỗi hoàn toàn (Host Failure).
- Nếu Host thực sự bị lỗi, HA khởi động lại các máy ảo trên một ESXi Host khác trong Cluster.
Dự phòng Network trong VMware được xây dựng dựa trên nhiều lớp như Port Group, NIC Teaming, Physical NIC, Uplink, Physical Switch và LACP. Khi một đường mạng bị lỗi, VMware có thể phát hiện sự cố và chuyển traffic sang đường dự phòng mà không cần thay đổi cấu hình mạng của máy ảo.
Trong đó, Port Group và NIC Teaming chịu trách nhiệm chính cho cơ chế Failover ở tầng mạng của ESXi, LACP hỗ trợ kết hợp và quản lý nhiều đường link trên Distributed Switch, còn Multiple Uplinks và nhiều Physical Switch giúp loại bỏ các điểm lỗi đơn trong hạ tầng vật lý. Ở cấp độ Host, vSphere HA cung cấp một lớp bảo vệ khác bằng cách phát hiện Host failure và khởi động lại VM trên ESXi Host khác. Vì vậy, một hệ thống VMware có khả năng dự phòng tốt cần thiết kế nhiều lớp thay vì chỉ dựa vào một cơ chế duy nhất.
Sửa lần cuối:
Bài viết liên quan
Được quan tâm
Bài viết mới