March of nines: vì sao sản phẩm AI cứ "gần xong" mà mãi không xong
Một buổi chiều, bạn dựng thử tính năng có AI. Chạy mười lần đúng chín. Demo xong, câu trả lời cho "bao giờ xong?" là "một tháng, còn vài ca lẻ".
Ba tháng sau vẫn "còn vài ca lẻ". Sáu tháng sau vẫn thế — nhưng là ca khác. Sang năm thứ hai, vẫn "gần xong".
Chuyện này có quy luật. Bài viết nói về quy luật đó, cách đo cho đúng, và cuối bài: model 2026 mạnh hơn hẳn thì quy luật còn đúng không.
1. Đơn vị đo: "số 9"
Phần mềm thường chạy chắc chắn — cùng đầu vào luôn ra cùng kết quả. Hệ thống AI thì chỉ có tỷ lệ. Nên câu hỏi đúng là "đúng bao nhiêu phần trăm số lần", và thêm một số 9 = chia lỗi cho 10.
Hệ thống 1 triệu lượt/ngày:
90% ████████████████████████████████████████ 100.000 lỗi/ngày
99% ████ 10.000
99,9% ▌ 1.000
99,99% ▏ 100
Người dùng thử vài chục lần thấy 99% và 99,9% giống hệt nhau. Với vận hành, đó là 9.000 sự cố mỗi ngày. Nên báo cáo bằng số lỗi tuyệt đối, đừng báo cáo bằng phần trăm.
2. Quy luật
Andrej Karpathy, 5 năm phụ trách mảng tự lái của Tesla: "Every single nine is a constant amount of work."
Từ khoá là march — hành quân, chặng nào cũng dài như chặng nào. Hình dung phổ biến thì ngược lại: về đích, được 90% rồi thì phần còn lại phải ngắn.
Đội Autopilot của Tesla, 2017–2022, đi được 2–3 số 9 trong 5 năm.
Đây là quan sát từ thực tế vận hành, không phải định lý.
3. Vì sao lúc nào cũng thấy "gần xong"
| # | Lý do | Cụ thể |
|---|---|---|
| 1 | Thước đo tự nén | 90→99 nhích 9 điểm, 99→99,9 chỉ 0,9 điểm. Công bằng nhau, số nhích ít dần |
| 2 | Chỉ gặp phần đã đúng | Thử tay 20 lần thì 20 lần đúng, ca hỏng ở tần suất 1/100 hoặc 1/1.000 |
| 3 | "Còn vài ca lẻ" luôn đúng | Đúng ở mọi thời điểm, nên không nói được còn bao lâu |
| 4 | Lấy chặng đầu làm mẫu | 0→90% mất một buổi chiều nên suy ra phần còn lại cũng vậy |
| 5 | Cách đo cho ra số đẹp | Chạy mỗi ca một lần thì khoảng cách thật bị che (mục 5) |
4. Agent nhiều bước: lỗi nhân lên
Mọi bước phải đúng thì cả việc mới xong, nên xác suất nhân với nhau.
| Mỗi bước đúng | 5 bước | 10 bước | 20 bước | 50 bước |
|---|---|---|---|---|
| 90% | 59,0% | 34,9% | 12,2% | 0,5% |
| 95% | 77,4% | 59,9% | 35,8% | 7,7% |
| 99% | 95,1% | 90,4% | 81,8% | 60,5% |
| 99,9% | 99,5% | 99,0% | 98,0% | 95,1% |
Mỗi bước 99% nghe giỏi, nhưng việc 20 bước chỉ xong 81,8% — cứ 5 lần chạy hỏng 1. Tính ngược: muốn việc 20 bước đạt 99% thì mỗi bước phải đạt 99,95%.
Cắt bớt một bước thường rẻ hơn làm từng bước giỏi thêm một số 9.
Điều kiện: phép nhân chỉ đúng khi các bước không ảnh hưởng nhau. Thực tế bước 2 sai thì bước 3, 4, 5 sai theo — nên đây là mốc hình dung, không phải dự báo.
5. Đo: pass@k và pass^k
- pass@k — đúng ít nhất một lần trong k lần. Che lỗi.
- pass^k — đúng cả k lần. Đo độ ổn định.
| Đúng mỗi lần | Đúng liền 3 lần | Đúng liền 8 lần |
|---|---|---|
| 70% | ~34% | ~6% |
| 90% | ~73% | ~43% |
| 99% | ~97% | ~92% |
Số thật từ τ-bench: agent dùng GPT-4o ở mảng bán lẻ, đòi đúng cả 8 lần thì còn ~25% — giảm khoảng 60% so với chính nó khi đo một lần. Cùng agent, cùng bộ việc, chỉ đổi cách đo.
Chạy mỗi trường hợp 8 lần trong một cấu hình cố định, ghi 1/0, rồi phân loại:
Dãy 1 0 1 1 1 0 1 1 = 75% khi đo một lần, 0% khi đòi đúng cả 8.
6. Việc nào code làm được thì đừng giao cho AI
Với AI, "sửa" thường chỉ là dịch chỗ lỗi sang chỗ khác: sửa prompt cho đúng ca A thì ca B đang đúng có thể bắt đầu sai. Đổi model là dịch chỗ lỗi trên toàn hệ thống.
Nên: việc nào máy làm chắc chắn được thì để máy làm, đừng giao cho AI đoán.
- Sai: nhờ model tính tổng tiền rồi ghi thẳng vào cơ sở dữ liệu.
- Đúng: model trích mã sản phẩm và số lượng; code tra giá, tính tiền, kiểm hợp lệ rồi mới ghi.
- Rẻ nhất: nhờ AI viết ra quy tắc (ví dụ
ORD-\d{5}\b) rồi để máy chạy quy tắc — chạy triệu lần vẫn một kết quả.
Cảnh báo kèm theo: chạy chắc chắn không có nghĩa là chạy đúng. Quy tắc sai sẽ lặp lại cái sai rất ổn định — nhưng nó lộ ra ngay trên bộ trường hợp đã chuẩn bị.
Mỗi việc chuyển từ AI sang code là bỏ hẳn một mặt trận số 9.
7. Chọn mức, rồi chọn điểm dừng
| Loại việc | Ví dụ | Cần đúng cỡ nào | Sai một lần mất gì |
|---|---|---|---|
| AI gợi ý, người duyệt | Gợi ý nhãn ticket, viết nháp trả lời | 9/10 lần | Sửa tay, mất vài giây |
| Máy tự làm, việc nhẹ | Phân loại ticket, tóm tắt | 99/100 lần | Ticket vào nhầm hàng đợi |
| Động tới tiền, dữ liệu khách | Cộng trừ điểm, hoàn tiền, ghi DB | 999/1.000 trở lên, code chặn trước khi ghi | Mất tiền thật, phải đối soát và đền |
| An toàn con người | Điều khiển thiết bị, cảnh báo y tế | Nhiều số 9, AI không ra quyết định cuối | Không mức nào chấp nhận được |
Đọc ngược từ cột cuối: chịu được hậu quả nào thì chọn mức thấp nhất tương ứng.
số 9 thứ 2 thứ 3 thứ 4 thứ 5
công phải bỏ ████████ ████████ ████████ ████████
giá trị thu về ████████ █████ ██ ▌
↑ điểm dừng
Và khoản hay bị quên — chi phí chứng minh: để tin 95% rằng mình đạt mục tiêu, cần ~299 lần chạy không lỗi cho 99%, ~2.995 cho 99,9%, ~29.956 cho 99,99%. Mỗi số 9, chi phí chứng minh nhân mười.
8. Model 2026 thì quy luật còn đúng không?
| Đã đổi thật | Không đổi |
|---|---|
| Số 9 đầu tiên đến nhanh hơn nhiều | 0,99 qua 20 bước vẫn là 81,8% — số học, không phụ thuộc model |
| Ở việc dễ kiểm đúng/sai, số 9 lên nhanh: agent viết code có bước nhảy từ khoảng 12/2025 | Ca hiếm không biến mất, chỉ đổi chỗ sang đầu vào lạ hơn |
| METR: độ dài việc model làm trọn được gấp đôi mỗi ~89 ngày | Chi phí chứng minh vẫn gấp mười mỗi số 9 |
Chi tiết hay bị bỏ qua: METR đo ở mức đúng 50% số lần — làm đúng một nửa số lần còn chưa tới số 9 đầu tiên. Khoảng từ đó tới 99% chính là march of nines.
Model mạnh lên dịch điểm xuất phát, không đổi độ dốc.
Nâng model có làm tụt độ tin cậy không? Có, ở ba chỗ:
- Lỗi đổi chỗ — trung bình cao hơn không bảo đảm cao hơn ở mọi nhóm ca của bạn.
- Việc được giao dài hơn — nhiều bước hơn thì nhân lỗi nhiều hơn.
- Ít chốt chặn của người hơn — lỗi đi xa hơn trước khi bị bắt.
Nên coi mỗi lần nâng model là một lần phát hành: chạy lại bộ trường hợp cố định, so pass^k trước/sau theo từng nhóm, đừng nhìn điểm trung bình.
9. Đúc kết
Bốn sai lầm: hứa ngày dựa trên demo 90% · cố đạt 99,99% cho việc chỉ cần 99% · dùng AI cho phần code làm chắc chắn được · đo một lần rồi gọi đó là độ tin cậy.
Ba điều mang đi:
- Demo 90% chỉ là số 9 đầu tiên.
- Agent nhiều bước nhân lỗi — đo bằng pass^k, chọn sẵn điểm dừng.
- Số 9 rẻ nhất ở nơi kiểm được.
Một câu nếu chỉ nhớ một câu: hãy làm cho công việc của bạn dễ kiểm hơn.
Tham khảo
- Karpathy — Dwarkesh Podcast (10/2025): https://www.dwarkesh.com/p/andrej-karpathy
- Karpathy — Sequoia Ascent 2026: https://karpathy.bearblog.dev/sequoia-ascent-2026/
- Yao et al. — τ-bench (arXiv 2406.12045): https://arxiv.org/abs/2406.12045
- Sierra — Benchmarking AI agents: https://sierra.ai/blog/benchmarking-ai-agents
- METR — Time horizons: https://metr.org/time-horizons/
- Google SRE — Embracing Risk: https://sre.google/sre-book/embracing-risk/