Một buổi chiều, bạn dựng thử tính năng có AI. Chạy mười lần đúng chín. Demo xong, câu trả lời cho "bao giờ xong?" là "một tháng, còn vài ca lẻ".

Ba tháng sau vẫn "còn vài ca lẻ". Sáu tháng sau vẫn thế — nhưng là ca khác. Sang năm thứ hai, vẫn "gần xong".

Chuyện này có quy luật. Bài viết nói về quy luật đó, cách đo cho đúng, và cuối bài: model 2026 mạnh hơn hẳn thì quy luật còn đúng không.


1. Đơn vị đo: "số 9"

Phần mềm thường chạy chắc chắn — cùng đầu vào luôn ra cùng kết quả. Hệ thống AI thì chỉ có tỷ lệ. Nên câu hỏi đúng là "đúng bao nhiêu phần trăm số lần", và thêm một số 9 = chia lỗi cho 10.

Hệ thống 1 triệu lượt/ngày:

90%     ████████████████████████████████████████  100.000 lỗi/ngày
99%     ████                                       10.000
99,9%   ▌                                            1.000
99,99%  ▏                                              100

Người dùng thử vài chục lần thấy 99% và 99,9% giống hệt nhau. Với vận hành, đó là 9.000 sự cố mỗi ngày. Nên báo cáo bằng số lỗi tuyệt đối, đừng báo cáo bằng phần trăm.


2. Quy luật

Andrej Karpathy, 5 năm phụ trách mảng tự lái của Tesla: "Every single nine is a constant amount of work."

Từ khoá là march — hành quân, chặng nào cũng dài như chặng nào. Hình dung phổ biến thì ngược lại: về đích, được 90% rồi thì phần còn lại phải ngắn.

Đội Autopilot của Tesla, 2017–2022, đi được 2–3 số 9 trong 5 năm.

Đây là quan sát từ thực tế vận hành, không phải định lý.


3. Vì sao lúc nào cũng thấy "gần xong"

#Lý doCụ thể
1Thước đo tự nén90→99 nhích 9 điểm, 99→99,9 chỉ 0,9 điểm. Công bằng nhau, số nhích ít dần
2Chỉ gặp phần đã đúngThử tay 20 lần thì 20 lần đúng, ca hỏng ở tần suất 1/100 hoặc 1/1.000
3"Còn vài ca lẻ" luôn đúngĐúng ở mọi thời điểm, nên không nói được còn bao lâu
4Lấy chặng đầu làm mẫu0→90% mất một buổi chiều nên suy ra phần còn lại cũng vậy
5Cách đo cho ra số đẹpChạy mỗi ca một lần thì khoảng cách thật bị che (mục 5)

4. Agent nhiều bước: lỗi nhân lên

Mọi bước phải đúng thì cả việc mới xong, nên xác suất nhân với nhau.

Mỗi bước đúng5 bước10 bước20 bước50 bước
90%59,0%34,9%12,2%0,5%
95%77,4%59,9%35,8%7,7%
99%95,1%90,4%81,8%60,5%
99,9%99,5%99,0%98,0%95,1%

Mỗi bước 99% nghe giỏi, nhưng việc 20 bước chỉ xong 81,8% — cứ 5 lần chạy hỏng 1. Tính ngược: muốn việc 20 bước đạt 99% thì mỗi bước phải đạt 99,95%.

Cắt bớt một bước thường rẻ hơn làm từng bước giỏi thêm một số 9.

Điều kiện: phép nhân chỉ đúng khi các bước không ảnh hưởng nhau. Thực tế bước 2 sai thì bước 3, 4, 5 sai theo — nên đây là mốc hình dung, không phải dự báo.


5. Đo: pass@k và pass^k

  • pass@k — đúng ít nhất một lần trong k lần. Che lỗi.
  • pass^k — đúng cả k lần. Đo độ ổn định.
Đúng mỗi lầnĐúng liền 3 lầnĐúng liền 8 lần
70%~34%~6%
90%~73%~43%
99%~97%~92%

Số thật từ τ-bench: agent dùng GPT-4o ở mảng bán lẻ, đòi đúng cả 8 lần thì còn ~25% — giảm khoảng 60% so với chính nó khi đo một lần. Cùng agent, cùng bộ việc, chỉ đổi cách đo.

Chạy mỗi trường hợp 8 lần trong một cấu hình cố định, ghi 1/0, rồi phân loại:

Dãy 1 0 1 1 1 0 1 1 = 75% khi đo một lần, 0% khi đòi đúng cả 8.


6. Việc nào code làm được thì đừng giao cho AI

Với AI, "sửa" thường chỉ là dịch chỗ lỗi sang chỗ khác: sửa prompt cho đúng ca A thì ca B đang đúng có thể bắt đầu sai. Đổi model là dịch chỗ lỗi trên toàn hệ thống.

Nên: việc nào máy làm chắc chắn được thì để máy làm, đừng giao cho AI đoán.

  • Sai: nhờ model tính tổng tiền rồi ghi thẳng vào cơ sở dữ liệu.
  • Đúng: model trích mã sản phẩm và số lượng; code tra giá, tính tiền, kiểm hợp lệ rồi mới ghi.
  • Rẻ nhất: nhờ AI viết ra quy tắc (ví dụ ORD-\d{5}\b) rồi để máy chạy quy tắc — chạy triệu lần vẫn một kết quả.

Cảnh báo kèm theo: chạy chắc chắn không có nghĩa là chạy đúng. Quy tắc sai sẽ lặp lại cái sai rất ổn định — nhưng nó lộ ra ngay trên bộ trường hợp đã chuẩn bị.

Mỗi việc chuyển từ AI sang code là bỏ hẳn một mặt trận số 9.


7. Chọn mức, rồi chọn điểm dừng

Loại việcVí dụCần đúng cỡ nàoSai một lần mất gì
AI gợi ý, người duyệtGợi ý nhãn ticket, viết nháp trả lời9/10 lầnSửa tay, mất vài giây
Máy tự làm, việc nhẹPhân loại ticket, tóm tắt99/100 lầnTicket vào nhầm hàng đợi
Động tới tiền, dữ liệu kháchCộng trừ điểm, hoàn tiền, ghi DB999/1.000 trở lên, code chặn trước khi ghiMất tiền thật, phải đối soát và đền
An toàn con ngườiĐiều khiển thiết bị, cảnh báo y tếNhiều số 9, AI không ra quyết định cuốiKhông mức nào chấp nhận được

Đọc ngược từ cột cuối: chịu được hậu quả nào thì chọn mức thấp nhất tương ứng.

                số 9 thứ 2   thứ 3    thứ 4    thứ 5
công phải bỏ    ████████   ████████ ████████ ████████
giá trị thu về  ████████   █████    ██       ▌
                                      ↑ điểm dừng

Và khoản hay bị quên — chi phí chứng minh: để tin 95% rằng mình đạt mục tiêu, cần ~299 lần chạy không lỗi cho 99%, ~2.995 cho 99,9%, ~29.956 cho 99,99%. Mỗi số 9, chi phí chứng minh nhân mười.


8. Model 2026 thì quy luật còn đúng không?

Đã đổi thậtKhông đổi
Số 9 đầu tiên đến nhanh hơn nhiều0,99 qua 20 bước vẫn là 81,8% — số học, không phụ thuộc model
Ở việc dễ kiểm đúng/sai, số 9 lên nhanh: agent viết code có bước nhảy từ khoảng 12/2025Ca hiếm không biến mất, chỉ đổi chỗ sang đầu vào lạ hơn
METR: độ dài việc model làm trọn được gấp đôi mỗi ~89 ngàyChi phí chứng minh vẫn gấp mười mỗi số 9

Chi tiết hay bị bỏ qua: METR đo ở mức đúng 50% số lần — làm đúng một nửa số lần còn chưa tới số 9 đầu tiên. Khoảng từ đó tới 99% chính là march of nines.

Model mạnh lên dịch điểm xuất phát, không đổi độ dốc.

Nâng model có làm tụt độ tin cậy không? Có, ở ba chỗ:

  1. Lỗi đổi chỗ — trung bình cao hơn không bảo đảm cao hơn ở mọi nhóm ca của bạn.
  2. Việc được giao dài hơn — nhiều bước hơn thì nhân lỗi nhiều hơn.
  3. Ít chốt chặn của người hơn — lỗi đi xa hơn trước khi bị bắt.

Nên coi mỗi lần nâng model là một lần phát hành: chạy lại bộ trường hợp cố định, so pass^k trước/sau theo từng nhóm, đừng nhìn điểm trung bình.


9. Đúc kết

Bốn sai lầm: hứa ngày dựa trên demo 90% · cố đạt 99,99% cho việc chỉ cần 99% · dùng AI cho phần code làm chắc chắn được · đo một lần rồi gọi đó là độ tin cậy.

Ba điều mang đi:

  1. Demo 90% chỉ là số 9 đầu tiên.
  2. Agent nhiều bước nhân lỗi — đo bằng pass^k, chọn sẵn điểm dừng.
  3. Số 9 rẻ nhất ở nơi kiểm được.

Một câu nếu chỉ nhớ một câu: hãy làm cho công việc của bạn dễ kiểm hơn.


Tham khảo