Học máy (machine learning) là cách để phần mềm tự rút ra quy luật từ dữ liệu quá khứ rồi áp dụng cho dữ liệu mới, thay vì được lập trình từng quy tắc. Lãnh đạo doanh nghiệp không cần hiểu thuật toán, nhưng cần nắm 7 khái niệm để đánh giá đúng một đề xuất AI: dữ liệu huấn luyện, mô hình, dự đoán kèm xác suất, độ chính xác và cách đo, quá khớp, trôi dữ liệu, và mô hình ngôn ngữ lớn. Hiểu 7 điều này, anh chị sẽ biết dự án nào khả thi, tốn bao nhiêu để duy trì, và câu hỏi nào khiến người bán phải trả lời thật.
Vì sao lãnh đạo cần biết, dù đã có người kỹ thuật
Quyết định đầu tư AI thường được đưa ra bởi người không làm kỹ thuật, dựa trên bài trình bày của người bán. Không có khái niệm nền, anh chị chỉ có thể đánh giá bằng cảm giác, và cảm giác thường bị dẫn dắt bởi bản demo đẹp.
Bảy khái niệm dưới đây không phải để lập trình. Chúng là ngôn ngữ để đặt câu hỏi đúng và đọc báo cáo sau khi triển khai.
1. Dữ liệu huấn luyện: mô hình chỉ biết những gì nó đã thấy
Học máy học từ ví dụ. Muốn mô hình phân loại yêu cầu bảo hành, phải cho nó xem hàng nghìn yêu cầu cũ đã được nhân viên phân loại đúng. Ba hệ quả trực tiếp:
- Không có dữ liệu thì không có mô hình. Doanh nghiệp mới, chưa ghi lại lịch sử, chưa thể "dùng AI dự báo" được gì.
- Dữ liệu sai thì mô hình sai. Nếu nhân viên từng phân loại tuỳ tiện, mô hình học đúng sự tuỳ tiện đó.
- Dữ liệu cũ thì mô hình lạc hậu. Mô hình học từ hành vi khách năm ngoái sẽ ngạc nhiên với hành vi năm nay.
Vì thế câu hỏi đầu tiên cho mọi đề xuất AI là: "Dữ liệu để học lấy từ đâu, bao nhiêu, ai đã kiểm tra?" Bài từ bảng tính đến hệ thống thông minh là bước chuẩn hoá dữ liệu nên làm trước bất kỳ dự án AI nào.
2. Mô hình: một công thức được điều chỉnh, không phải trí tuệ
Mô hình là kết quả sau khi học: một hàm toán học nhận đầu vào (thông tin khách hàng) và cho đầu ra (khả năng khách sẽ mua). Nó không "hiểu" khách hàng. Nó tìm được mối tương quan trong dữ liệu quá khứ.
Điều này quan trọng vì mô hình có thể đúng vì lý do sai. Ví dụ có thật: mô hình dự đoán đơn hàng lớn học được rằng "đơn đặt lúc 9 giờ sáng thứ Hai thường lớn", chỉ vì bộ phận mua hàng của một khách lớn duy nhất hay đặt vào giờ đó. Khách đó rời đi, mô hình sai hoàn toàn.
3. Dự đoán luôn kèm xác suất
Mô hình không nói "khách này sẽ mua". Nó nói "xác suất mua là 72%". Doanh nghiệp quyết định ngưỡng hành động: gọi cho khách từ 60% trở lên, hay chỉ từ 80%?
Ngưỡng thấp: gọi nhiều, tốn công, bắt được nhiều khách. Ngưỡng cao: gọi ít, bỏ lỡ một số. Không có ngưỡng "đúng"; có ngưỡng phù hợp với chi phí và lợi ích của doanh nghiệp. Đây là quyết định kinh doanh, không phải kỹ thuật, và là thứ lãnh đạo nên tự chọn.
4. Độ chính xác và cách đo: con số 95% có thể vô nghĩa
"Mô hình chính xác 95%" là câu người bán hay nói và là câu lãnh đạo nên nghi ngờ nhất. Ví dụ: 5% giao dịch là gian lận. Một mô hình luôn nói "không gian lận" có độ chính xác 95% mà không bắt được gì.
Cần hai con số thay vì một:
- Bắt được bao nhiêu trong số thật (mô hình tìm được bao nhiêu phần trăm gian lận thật).
- Bao nhiêu cảnh báo là đúng (trong số mô hình báo gian lận, bao nhiêu phần trăm thật sự gian lận).
Hai con số này thường kéo nhau: tăng cái này giảm cái kia. Hỏi cả hai, và hỏi được đo trên dữ liệu chưa dùng để học, vì đo trên dữ liệu đã học thì mô hình nào cũng "giỏi".
5. Quá khớp: học thuộc lòng thay vì học quy luật
Mô hình phức tạp có thể nhớ từng ví dụ trong dữ liệu huấn luyện thay vì rút ra quy luật, giống học sinh học thuộc đáp án mà không hiểu bài. Kết quả: điểm rất cao khi thi lại đề cũ, rất thấp khi gặp đề mới.
Dấu hiệu: kết quả khi thử nghiệm đẹp hơn nhiều so với khi chạy thật. Cách phòng: luôn giữ một phần dữ liệu riêng để kiểm tra, và chạy thử với dữ liệu mới vài tuần trước khi tin.
6. Trôi dữ liệu: mô hình đúng hôm nay, sai sau sáu tháng
Thế giới thay đổi, mô hình thì không, trừ khi được huấn luyện lại. Giá cả đổi, hành vi khách đổi, sản phẩm mới ra, mùa vụ khác. Mô hình dự báo tồn kho học từ năm không có khuyến mãi sẽ dự báo sai ngay tháng khuyến mãi đầu tiên.
Hệ quả cho ngân sách: một dự án AI không kết thúc khi bàn giao. Nó cần được theo dõi độ chính xác liên tục và huấn luyện lại định kỳ. Khoản này phải nằm trong chi phí năm, không phải chi phí một lần. Siri9 gói phần này trong dịch vụ quản lý hệ thống AI: đo độ chính xác hằng tuần, cảnh báo khi trôi, cập nhật theo tháng.
7. Mô hình ngôn ngữ lớn: khác gì với học máy "truyền thống"
Mọi thứ ở trên là học máy truyền thống: mô hình riêng cho từng bài toán, huấn luyện trên dữ liệu của doanh nghiệp. Mô hình ngôn ngữ lớn (LLM, như các mô hình đứng sau ChatGPT, Claude, Gemini) khác ở chỗ:
- Đã được huấn luyện sẵn trên lượng chữ khổng lồ; doanh nghiệp không tự huấn luyện mà dùng qua API, trả tiền theo lượng chữ xử lý.
- Làm được nhiều việc bằng chỉ dẫn thay vì huấn luyện: đọc, tóm tắt, phân loại, viết, trích thông tin.
- Có thể bịa một cách trôi chảy khi không biết. Cách khắc phục phổ biến là cho mô hình đọc tài liệu của doanh nghiệp trước khi trả lời, gọi là RAG, giải thích ở bài fine-tuning hay RAG.
Với doanh nghiệp nhỏ, đa số việc đáng làm hiện nay dùng LLM qua API, không phải huấn luyện mô hình riêng. Rẻ hơn, nhanh hơn, và không cần dữ liệu huấn luyện lớn. Nhưng khái niệm 3, 4, 6 vẫn áp dụng nguyên: đầu ra có xác suất, phải đo đúng, và trôi theo thời gian (kể cả khi nhà cung cấp đổi phiên bản mô hình).
6 câu hỏi nên hỏi trước khi ký
- Dữ liệu để học hoặc để tra cứu lấy từ đâu, bao nhiêu, ai kiểm tra?
- Độ chính xác đo bằng chỉ số nào, trên dữ liệu nào, và hai con số ở mục 4 là bao nhiêu?
- Ngưỡng hành động ai quyết, đổi được không?
- Mô hình sai thì chuyện gì xảy ra, ai duyệt trước khi tác động ra khách hàng?
- Chi phí mỗi tháng để theo dõi và huấn luyện lại là bao nhiêu, ai làm?
- Dữ liệu doanh nghiệp có được dùng để huấn luyện mô hình của bên khác không?
Người bán trả lời rành mạch cả sáu là người đã từng vận hành mô hình thật. Người trả lời "AI của chúng tôi rất thông minh" thì chưa.
Nên bắt đầu từ đâu
Không phải từ mô hình, mà từ một việc lặp lại có dữ liệu sẵn, làm nhỏ, đo được, có người vận hành. Bài AI cho doanh nghiệp nhỏ, 4 việc nên tự động hoá trước liệt kê các việc đó và tiêu chí chọn.
Câu hỏi thường gặp
Doanh nghiệp nhỏ có cần tự huấn luyện mô hình không?
Hầu hết không. Dùng LLM qua API kèm tài liệu của doanh nghiệp giải quyết phần lớn việc với chi phí thấp. Tự huấn luyện chỉ đáng khi có dữ liệu riêng rất lớn và bài toán rất đặc thù.
"Độ chính xác 95%" có tin được không?
Chỉ khi biết đo bằng chỉ số nào, trên dữ liệu nào. Hỏi hai con số ở mục 4 và yêu cầu đo trên dữ liệu chưa dùng để học.
AI có thay được quyết định của lãnh đạo không?
Không. Mô hình đưa xác suất; con người đặt ngưỡng và chịu trách nhiệm. Vai trò của lãnh đạo là chọn việc đáng làm, đặt ngưỡng, và đòi báo cáo đo lường đều đặn.
Siri9 giúp gì ở bước này?
Đánh giá miễn phí một ý tưởng AI theo 6 câu hỏi trên, xây phần tích hợp ở dịch vụ tích hợp AI, và vận hành sau bàn giao. Gửi mô tả việc đang cân nhắc, chúng tôi trả lời trong 24 giờ.
