tn.Thien Nguyen
EN/VI
Thien Nguyen

InferCap

Toolkit kiểm tra khả năng chạy LLM trên phần cứng hiện có, tạo cấu hình vLLM và đo capacity của hệ thống inference.

Bài toán

Triển khai LLM thường bắt đầu bằng nhiều câu hỏi: model có vừa GPU không, cấu hình serving nào hợp lý và GPU đạt giới hạn ở đâu?

Cách tiếp cận

InferCap kết hợp kiểm tra môi trường và GPU, tìm model theo family, ước lượng memory, xác minh endpoint, benchmark và telemetry trong một quy trình CLI.

Tài liệu có sẵn

Repository công khai gồm Python CLI, tests, tài liệu, output benchmark JSON / PNG và giao diện web để khám phá công cụ.

Đóng góp & Bối cảnh

Tự thiết kế và xây dựng dự án như một toolkit mã nguồn mở.

Phạm vi bản giới thiệu dự án

Phiên bản hiện tại tập trung vào NVIDIA GPU và vLLM. Ước lượng memory chỉ dùng để kiểm tra tính khả thi, không bảo đảm runtime ổn định.