NVIDIA PAIR merutekan independent requests ke beberapa node Request Aindependent job Request Bindependent job Request Cindependent job NVIDIA PAIR local inference router Node 1eligible Node 2eligible Node 3eligible

NVIDIA Personal AI Router (PAIR) adalah local inference router yang membantu beberapa komputer dalam satu jaringan lokal berbagi pekerjaan AI. Aplikasi mengirim request melalui satu endpoint PAIR, lalu PAIR memilih satu komputer yang mampu menjalankan model tersebut untuk mengerjakannya. PAIR membagi request yang berbeda ke komputer yang berbeda; teknologi ini tidak menggabungkan GPU atau VRAM beberapa komputer menjadi satu resource untuk satu request berat.

Transparansi AI. Artikel ini disusun dengan bantuan AI untuk riset dan drafting, kemudian ditinjau dan disunting oleh tim Sequel Cloud untuk memastikan akurasi teknis dan relevansi isi.

Intisari Artikel

  • PAIR paling berguna ketika beberapa pekerjaan AI yang independen datang hampir bersamaan.
  • Setiap request tetap dikerjakan oleh satu node; PAIR bukan GPU pooling atau VRAM pooling.
  • Komputer tambahan dapat membantu mengurangi antrean, tetapi tidak otomatis membuat satu request menjadi lebih cepat.
  • Jika satu pekerjaan sendiri terlalu berat untuk node yang tersedia, hardware yang lebih kuat tetap dibutuhkan.

Antrean AI Tidak Selalu Berarti GPU Kurang Kuat

Sebuah komputer sedang menjalankan local AI. Task A sedang diproses, lalu Task B dan Task C datang dan mulai menunggu. Di jaringan yang sama sebenarnya ada komputer lain yang masih tersedia.

Melihat kondisi seperti ini, kesimpulan yang mudah muncul adalah: “Berarti GPU-nya kurang kuat.”

Belum tentu. Ada dua masalah yang perlu dibedakan.

Satu pekerjaan memang terlalu berat

Jika satu model atau satu inference job membutuhkan resource lebih besar daripada yang dimiliki komputer tersebut, masalahnya memang berada pada kemampuan satu node.

PAIR tidak membuat GPU 8 GB di satu komputer dan GPU 12 GB di komputer lain berubah menjadi GPU 20 GB. Teknologi ini juga tidak membagi satu inference request agar sebagian dikerjakan komputer A dan sisanya komputer B.

Banyak pekerjaan datang bersamaan

Kondisi kedua berbeda. Task A, B, dan C sebenarnya masing-masing mampu dijalankan oleh komputer yang tersedia. Masalahnya, seluruh pekerjaan masuk ke komputer yang sama pada waktu yang berdekatan.

Dua bottleneck AI: single heavy task dan concurrency 1. Satu task terlalu berat Masalah: kapasitas satu node Heavy Task butuh resource lebih Node tidak cukup Tambah node tidak membuat satu node menjadi lebih besar 2. Banyak task datang bersamaan Masalah: antrean / concurrency Task ATask BTask C PAIR Node 1Node 2Node 3
Dua gejala bisa sama-sama terasa lambat, tetapi cara scaling-nya berbeda: kapasitas satu node vs banyak independent requests yang datang bersamaan.

Kalau satu pekerjaan terlalu berat, dibutuhkan komputer yang lebih kuat. Kalau banyak pekerjaan datang bersamaan, yang dibutuhkan bisa jadi pembagian pekerjaan yang lebih baik.

Apa Itu NVIDIA PAIR?

PAIR bekerja sebagai perantara antara aplikasi AI dan beberapa komputer yang tersedia di local network. Komputer yang ingin digunakan bersama menjalankan PAIR dan dipasangkan sebagai node.

Aplikasi tidak perlu menentukan secara manual request harus dikirim ke komputer mana. Request cukup dikirim melalui endpoint PAIR, lalu sistem memilih node yang dapat mengerjakannya.

PAIR tidak asal memilih komputer yang sedang kosong. Node perlu dapat dijangkau, menjalankan inference engine yang sesuai, dan memiliki model yang diminta. Setelah itu, workload menjadi bagian dari pertimbangan routing.

Catatan: berada di cluster belum otomatis berarti sebuah node dapat menerima semua request. Model dan inference engine yang dibutuhkan tetap harus tersedia pada node tersebut.

Dokumentasi NVIDIA saat ini mendukung Ollama dan LM Studio sebagai local inference backends. Satu request tetap diselesaikan oleh satu node.

Cara Mudah Membayangkannya: Beberapa Loket

Bayangkan sebuah kantor memiliki tiga loket. Semua pelanggan mengantre di loket pertama, padahal loket kedua dan ketiga sedang kosong.

PAIR kurang lebih berfungsi seperti petugas yang membagi antrean: pelanggan berikutnya dapat diarahkan ke loket lain yang mampu melayani.

AnalogiNVIDIA PAIR
PelangganInference request
LoketKomputer / node
Petugas pembagi antreanPAIR
Tiga loket tidak berubah menjadi satu loket super. Satu pelanggan tetap dilayani satu loket. Begitu juga dengan PAIR: beberapa komputer membantu menangani lebih banyak pekerjaan, bukan melebur menjadi satu komputer besar.

Kenapa PAIR Menjadi Menarik untuk AI Agent?

Satu perintah kepada AI sekarang tidak selalu berarti hanya satu pekerjaan. Dalam workflow AI agent, sebuah agent dapat membagi pekerjaan menjadi beberapa bagian yang relatif independen.

Misalnya, satu task mencari informasi, task lain membandingkan data, sementara task berikutnya menyiapkan rangkuman. Bagi pengguna semuanya terlihat seperti satu pekerjaan, tetapi di belakang layar beberapa inference request dapat muncul hampir bersamaan.

Kalau seluruh request masuk ke satu inference engine, antrean mulai terbentuk. Kalau beberapa task memang tidak perlu menunggu satu sama lain, PAIR dapat mengarahkan pekerjaan tersebut ke node berbeda yang eligible.

Apakah Itu Berarti PAIR Membuat AI Lebih Cepat?

Jawabannya bergantung pada apa yang diukur.

PAIR tidak otomatis membuat satu inference request menjadi lebih cepat. Yang dapat berkurang adalah waktu tunggu ketika ada banyak pekerjaan independen.

NVIDIA menunjukkan demo multi-agent di mana keseluruhan workload pada beberapa perangkat menggunakan PAIR selesai lebih cepat dibanding workload yang sama pada satu mesin. Demonstrasi tersebut menunjukkan manfaat concurrency pada workload tertentu, bukan klaim bahwa PAIR mempercepat setiap inference request secara universal.

Kecepatan masing-masing worker tidak berubah. Yang berubah adalah antreannya.

Kapan PAIR Membantu, dan Kapan Tidak?

Cara termudah menentukannya adalah melihat jenis bottleneck.

KondisiYang lebih relevan
Banyak independent requests datang bersamaanMenambah eligible node dapat membantu
Ada komputer capable yang masih tersediaPAIR dapat membantu membagi workload
Model tersedia pada beberapa nodePAIR memiliki lebih banyak kandidat node
Satu request terlalu berat untuk satu komputerDibutuhkan node dengan resource lebih besar
Model tidak dapat dijalankan pada node yang tersediaRouting tidak menyelesaikan masalah

Bagian ini juga menjelaskan kenapa menyebut PAIR sebagai GPU pooling akan menyesatkan.

PAIR bukan GPU pooling SALAH: GPU pooling GPU AGPU B “Giant GPU”bukan cara kerja PAIR BENAR: request routing Request ARequest BRequest C PAIR Node 1Node 2Node 3
PAIR membagi independent requests ke node berbeda. Kapasitas GPU dari beberapa komputer tidak dilebur menjadi satu resource.

PAIR tidak menjumlahkan VRAM, tidak membuat beberapa GPU menjadi satu virtual GPU, tidak melakukan model sharding, dan tidak membagi satu in-flight inference request ke beberapa komputer.

Mau Mencoba NVIDIA PAIR?

NVIDIA menyediakan PAIR untuk compatible Windows, Linux, dan macOS systems. Untuk mencoba routing antarkomputer, dua atau lebih mesin pada local network yang sama dapat dipasangkan sebagai cluster.

  1. Install PAIR pada setiap komputer yang akan berpartisipasi.
  2. Pair perangkat pada local network yang dipercaya.
  3. Siapkan inference engine dan model pada node yang ingin digunakan. PAIR saat ini mendukung Ollama dan LM Studio.
  4. Arahkan aplikasi atau AI agent ke local endpoint PAIR.
  5. Kirim beberapa independent requests dan periksa node mana yang menjalankan masing-masing job.

PAIR juga menyediakan fungsi Test di Settings → Service untuk menghasilkan burst inference dan melihat routing antar-node tanpa harus menyiapkan aplikasi kompleks terlebih dahulu.

Download resmi

Gunakan halaman resmi NVIDIA untuk paket dan system requirements terbaru.

Download NVIDIA PAIR →

Panduan resmi

Ikuti langkah setup terbaru dari dokumentasi NVIDIA.

Getting Started NVIDIA PAIR →

Karena PAIR masih aktif dikembangkan, requirement, kompatibilitas perangkat, dan langkah instalasi sebaiknya selalu dicek kembali pada dokumentasi NVIDIA sebelum setup.

Glosarium Singkat

Gunakan tabel ini sebagai referensi cepat tanpa perlu mencari kembali istilah di paragraf sebelumnya.

IstilahArti sederhana
InferenceProses ketika model AI menerima input dan menghasilkan output.
Inference requestSatu pekerjaan yang dikirim ke model AI.
NodeSatu komputer yang dapat menerima dan menjalankan pekerjaan.
ConcurrencyBeberapa pekerjaan datang atau berjalan pada waktu yang berdekatan.
Eligible nodeKomputer yang memang mampu menerima request tertentu.
Inference engineSoftware yang menjalankan model AI, misalnya Ollama atau LM Studio.
RoutingProses memilih request harus dikirim ke komputer mana.
GPU poolingMenggabungkan beberapa GPU menjadi satu resource logis; bukan cara kerja PAIR.
Scale-upMembuat satu komputer atau node lebih kuat.
Scale-outMenambah node agar lebih banyak pekerjaan dapat ditangani.

FAQ NVIDIA PAIR

Apakah NVIDIA PAIR menggabungkan GPU atau VRAM beberapa komputer?

Tidak. PAIR tidak melakukan GPU pooling atau VRAM pooling. Setiap inference request tetap dijalankan oleh satu node yang mampu melayani request tersebut.

Apakah NVIDIA PAIR membuat satu inference request menjadi lebih cepat?

Tidak otomatis. Manfaat PAIR paling terasa ketika beberapa independent requests datang bersamaan dan dapat diarahkan ke node berbeda, sehingga waktu antre dapat berkurang.

Apakah model yang sama harus tersedia di setiap komputer?

Tidak harus di semua node. Namun sebuah node hanya dapat menerima request jika inference engine yang sesuai berjalan dan model yang diminta memang tersedia di node tersebut. Menyiapkan model yang sama pada lebih banyak node memberi PAIR lebih banyak pilihan untuk routing.

Inference engine apa yang saat ini didukung NVIDIA PAIR?

Dokumentasi resmi NVIDIA saat ini menyebut Ollama dan LM Studio. Karena PAIR masih aktif dikembangkan, cek dokumentasi resmi sebelum setup untuk melihat dukungan terbaru.

Jadi, GPU Lebih Besar atau Lebih Banyak Node?

Tidak ada satu jawaban untuk semua workload. Pertanyaan yang lebih berguna adalah: apakah satu pekerjaan terlalu berat, atau terlalu banyak pekerjaan datang bersamaan?

Kalau satu task sendiri membutuhkan resource lebih besar, dibutuhkan node yang lebih kuat. Kalau setiap task sebenarnya mampu dijalankan tetapi banyak task datang bersamaan, PAIR menawarkan pendekatan lain: gunakan beberapa komputer yang tersedia dan bagi antrean pekerjaannya.

Hal penting dari NVIDIA PAIR bukan karena beberapa komputer berubah menjadi satu komputer super, tetapi karena teknologi ini membantu membedakan kapasitas satu pekerjaan dengan kapasitas menangani banyak pekerjaan sekaligus.

Daftar Pustaka