Đo AI trên
nghiệp vụ thật.
Bảng xếp hạng công khai cho mô hình ngôn ngữ, AI xử lý tài liệu, bộ nhớ dài hạn và voicebot, đo bằng dữ liệu tiếng Việt, tiêu chí nghiệp vụ và chi phí sử dụng nêu rõ cách tính.
- Bảng xếp hạng công khaiMỗi điểm số kèm khoảng tin cậy 95%.
- Bộ đề kínĐề và đáp án không công bố, để không ai học thuộc.
- Phương pháp minh bạchCấu hình, số lần chạy và giới hạn đều công bố.
-
MINH HOẠ · AB-VOICE V1Voice agent tổng đài: bản xem trướcTám voice agent qua kịch bản ngân hàng và viễn thông, giọng ba miền. Số liệu minh hoạ.
-
MINH HOẠ · THÁNG 10·2026AB-VietLLM: bảng xếp hạng tháng mớiPhần đề xoay vòng được thay mới; lõi cố định giữ để so với các tháng trước.
-
MINH HOẠ · AB-MEMORY V1Bộ nhớ dài hạn tiếng ViệtNhớ qua nhiều phiên, ngữ cảnh dài và giữ đúng xưng hô. Số liệu minh hoạ.
Các mảng đánh giá
Mỗi mảng trả lời một câu hỏi riêng, có bộ chỉ số và bảng xếp hạng riêng. Chúng tôi không quy đổi các mảng thành một điểm chung.
- AB-VietLLMMô hình ngôn ngữ
Model nào phù hợp với tác vụ tiếng Việt cụ thể?
Số liệu minh hoạ - AB-DocXử lý tài liệu
Giải pháp có xử lý đúng tài liệu và giảm công thao tác không?
Số liệu minh hoạ - AB-VoiceVoicebot
Voicebot có hoàn thành cuộc gọi thực tế và xử lý tình huống đúng không?
Số liệu minh hoạ - AB-MemoryBộ nhớ dài hạn
Hệ thống có nhớ đúng và dùng đúng thông tin qua nhiều phiên không? Có thêm phần ngữ cảnh dài của model nền.
Số liệu minh hoạ
Các bộ đề khác nằm trong lộ trình, chưa có số đo. Xem tất cả bộ đề →
Bảng xếp hạng
Số liệu minh hoạ — chưa phải kết quả đo thực tếBảng xếp hạng công khai của từng bộ đề, trình bày dạng bảng điểm (scorecard): mỗi điểm số kèm khoảng tin cậy 95%. Hạng chung nghĩa là chưa đủ bằng chứng để tách hai bên khi so theo cặp, không có nghĩa là ngang nhau.
Một chuẩn chung cho nhiều hệ thống
Đo nhiều giải pháp theo cùng một chuẩn để xếp hạng công khai. Đề và đáp án được giữ kín; phương pháp và kết quả tổng hợp được công bố.
- Quyết định bảng xếp hạng công khai
- Không dùng dữ liệu của khách hàng
Dựng từ dữ liệu và tiêu chí của một tổ chức
Quyền dùng dữ liệu, quyền sở hữu bộ đề và phạm vi công bố kết quả được ghi trong hợp đồng.
- Mặc định không vào bảng xếp hạng công khai
- Không chuyển thành dữ liệu huấn luyện
So sánh
minh hoạChọn bộ đề và 2–4 giải pháp. Câu trả lời đứng trước, số đo đứng sau.
Kết luận
Cách đọc nhãn. Mỗi nhãn so một bên với bên điểm cao nhất, theo cặp trên cùng bộ câu hỏi, với ngưỡng chênh lệch có ý nghĩa đặt trước () và đã hiệu chỉnh cho nhiều phép so sánh. Kém hơn: khoảng chênh lệch nằm hẳn một phía. Tương đương: cả khoảng nằm trong ngưỡng. Chưa đủ bằng chứng: chưa kết luận được, không có nghĩa là ngang nhau. Giữ lại ở vòng sau cũng chưa có nghĩa là đủ tốt. Vì dữ liệu mới là minh hoạ, khoảng chênh lệch được dựng từ giả định tương quan giữa hai hệ thống; kết quả thật sẽ dùng paired bootstrap.
So từng chỉ số
Mọi bên nằm trên cùng một trục. Dải xanh nhạt chỉ là khoảng tin cậy riêng của bên điểm cao nhất, để tham chiếu; nhãn bên phải dựa trên so sánh theo cặp, không dựa vào việc hai khoảng có chạm nhau.Xem phân tích đầy đủChất lượng × chi phí, chi phí nghiệm thu (ước tính), theo nhóm tác vụ, bảng cho phòng mua sắm
Cho phòng mua sắm
✓ có · ◐ tuỳ hợp đồng hoặc tuỳ nơi bạn host · ✗ không.Số liệu minh hoạ — chưa phải kết quả đo thực tế. Khoảng của chi phí nghiệm thu ghép từ khoảng của giá máy và tỷ lệ làm xong; lương giờ và số phút xử lý lỗi là giả định bạn chỉnh được, không phải số đo. Khi công bố thật, mỗi ô sẽ kèm số mục đã chạy, số lần chạy và ngày đo.
Bộ đề
Tác vụ mà benchmark quốc tế chưa chạm tới. Mọi kết quả đều kèm khoảng tin cậy 95%. Các bộ ở nhóm đầu hiện chỉ có số liệu minh hoạ; các bộ trong lộ trình chưa có số đo.
Phương pháp
Uy tín là thứ duy nhất chúng tôi bán, nên luật chơi được công khai từ ngày đầu. Quy trình lấy ISO/IEC 17025 làm tham chiếu; AsiaBench chưa được công nhận theo tiêu chuẩn đó.
“Không có điểm số nào đứng một mình.”
Mỗi bộ đề có một thẻ mô tả: mục tiêu, đối tượng đo, phạm vi tác vụ, cách lấy mẫu, cỡ mẫu, nguồn và quyền dùng dữ liệu, rubric, cách tổng hợp điểm và giới hạn áp dụng. Điểm tổng chỉ để đọc nhanh; báo cáo luôn truy xuống được theo nhóm tác vụ, loại lỗi và mức nghiêm trọng.
- R1Không bán thứ hạngPhí dịch vụ không phụ thuộc điểm số hay thứ hạng. Không ai trả tiền để vào, lên hạng hay rút khỏi bảng; các quy tắc chọn hệ thống, tài trợ, cập nhật, khiếu nại và rút kết quả sẽ được công bố trong bộ nguyên tắc v0.1.
- R2Chỉ xếp hạng bản thương mạiPhiên bản khách hàng thực sự mua được. Model, agent và giải pháp trọn gói được đo riêng, không đọc lẫn với nhau.
- R3Đề kín: lõi cố định, phần xoay vòngPhần cố định để so với các tháng trước, phần xoay vòng để chống học thuộc. Mỗi đợt đo có quy trình và số lần chạy định trước.
- R4So theo cặp, luôn kèm khoảng tin cậyHạng chung là chưa đủ bằng chứng để tách, không phải ngang nhau. Ngưỡng chênh lệch có ý nghĩa nghiệp vụ được đặt trước; so nhiều cặp thì hiệu chỉnh.
- R5Mỗi lần đo ghi đủ điều kiệnPhiên bản, cấu hình, ngân sách tài nguyên, số lần chạy và ngày đo. Phần do nhà cung cấp quản lý mà ta không quan sát được thì nêu rõ là giới hạn.
- R6Có người kiểm đáp ánĐáp án chuẩn và rubric do chuyên gia duyệt. Nếu dùng LLM làm giám khảo, công bố mức đồng thuận với người chấm và cách xử lý bất đồng.
- R7Dữ liệu khách hàng tách riêngKhông đưa vào bảng xếp hạng công khai và không chuyển thành dữ liệu huấn luyện, trừ khi hợp đồng ghi khác.
Dịch vụ
Chọn AI bằng số đo trên dữ liệu của chính bạn, từ một bên không bán AI. Bảng xếp hạng công khai luôn miễn phí, và phí dịch vụ không phụ thuộc vào điểm số hay thứ hạng.
AsiaBench Verified
Một lần chạy độc lập cho một phiên bản và cấu hình cụ thể, trên phạm vi tác vụ ghi trong báo cáo, có thời hạn hiệu lực. Không phải bảo đảm cho mọi trường hợp sử dụng, cũng không phải chứng nhận hay công nhận. Không làm đổi thứ hạng công khai.
Báo cáo ghi phiên bản, cấu hình, phạm vi, ngày đo và thời hạn. Có thể làm tư liệu khi chuẩn bị hồ sơ theo Luật AI; AsiaBench chưa phải tổ chức đánh giá sự phù hợp.
Đánh giá trước ra mắt
Đánh giá mù trước ngày ra mắt và đo lại định kỳ trên bộ đề kín, người bản ngữ chấm. Báo cáo theo nhóm tác vụ và loại lỗi, không trả lại đề hay đáp án. Kết quả riêng được bảo mật theo hợp đồng; việc đưa lên bảng xếp hạng theo chính sách chung.
Tư vấn lựa chọn
Từ xác định bài toán đến nghiệm thu bằng điểm đo ghi vào hợp đồng. Không hoa hồng, không làm triển khai.
Bộ đề theo dữ liệu của bạn
Dựng từ dữ liệu thật và tiêu chí nghiệp vụ của doanh nghiệp, rồi dùng lại cho mời thầu, nghiệm thu và giám sát. Quyền dùng dữ liệu và quyền sở hữu bộ đề ghi trong hợp đồng; kết quả không vào bảng xếp hạng công khai.
Báo giá theo phạm vi sau buổi trao đổi đầu.
Vì sao cần bộ đề theo dữ liệu của bạn
- 01Lấy mẫu dữ liệu thậtChứng từ, cuộc gọi, câu hỏi của khách; ẩn danh trước khi dùng.
- 02Viết tiêu chí chấm theo nghiệp vụSai số tiền nặng hơn sai chính tả; người bản ngữ chấm.
- 03Chạy 3–5 giải pháp cùng điều kiệnCùng bộ đề, cùng cấu hình, kèm khoảng tin cậy.
- 04Dùng lại cho nghiệm thu và giám sátNgưỡng điểm ghi vào hợp đồng; đo lại mỗi khi nhà cung cấp cập nhật.
- 01Xác định bài toánTác vụ, dữ liệu, chỉ số thành công
- 02Bộ đề theo khách hàngTừ dữ liệu và tiêu chí của bạn
- 03Đánh giá rút gọnSo 3–5 giải pháp trên dữ liệu thật
- 04Kiến trúc và chi phíXây hay mua, API hay tự host
- 05Nghiệm thu bằng điểm đoNgưỡng điểm ghi vào hợp đồng
- 06Giám sátĐo định kỳ sau triển khai
Chứng nhận
Luật Trí tuệ nhân tạo yêu cầu AI rủi ro cao qua đánh giá sự phù hợp. Chúng tôi lấy chuẩn phòng thử nghiệm làm tham chiếu từ ngày đầu.
Benchmark và đánh giá riêng
Bộ đề đầu tiên, pilot có trả phí.
Phòng thử ISO/IEC 17025
Thử nghiệm kỹ thuật được công nhận.
Đánh giá sự phù hợp
Theo Luật AI, mở rộng khu vực.
Đưa giải pháp của bạn vào phòng thử.
Doanh nghiệp, nhà cung cấp hay lab mô hình: để lại email, chúng tôi liên hệ trong vài ngày làm việc.