Dữ liệu định tính là chữ viết tự do: phản hồi khảo sát, ticket hỗ trợ, đánh giá trên sàn, tin nhắn khách. Mô hình ngôn ngữ lớn (LLM) có thể đọc hàng nghìn đoạn như vậy mỗi tháng, gắn chủ đề, chấm cảm xúc, trích yêu cầu cụ thể và tổng hợp thành báo cáo mà trước đây cần vài nhân viên đọc tay trong nhiều ngày. Điều kiện để kết quả tin được: bộ chủ đề do người định nghĩa, một mẫu kiểm tra được người gắn nhãn để đo độ chính xác, và quy trình chạy lặp lại hằng tháng thay vì một lần rồi bỏ.

Vì sao phản hồi khách hàng thường không được đọc

Một doanh nghiệp bán lẻ 30 người nhận mỗi tháng khoảng 400 ticket hỗ trợ, 200 đánh giá trên sàn và 150 phản hồi khảo sát sau mua. Tổng 750 đoạn chữ. Đọc và phân loại tay mất khoảng 25 giờ người, và kết quả phụ thuộc người đọc hôm đó mệt hay tỉnh.

Kết cục quen thuộc: phản hồi được đọc lướt khi có khủng hoảng, bỏ qua khi bình thường. Doanh nghiệp biết "khách hay than phiền giao hàng" nhưng không biết là 12% hay 40%, tăng hay giảm so với tháng trước, do đơn vị vận chuyển nào.

LLM làm được gì với dữ liệu định tính

Bốn việc, xếp theo mức tin cậy giảm dần:

  1. Phân loại theo bộ chủ đề cho sẵn: mỗi phản hồi gắn vào một hay vài chủ đề (giao hàng, chất lượng sản phẩm, thái độ nhân viên, giá, đổi trả). Độ chính xác cao khi bộ chủ đề rõ và có ví dụ.
  2. Chấm cảm xúc: tích cực, trung tính, tiêu cực, kèm mức độ. Đủ tốt cho theo dõi xu hướng, không nên dùng để xử lý từng ca.
  3. Trích thông tin cụ thể: tên sản phẩm bị lỗi, mã đơn, yêu cầu tính năng, đối thủ được nhắc tên. Tốt khi phản hồi có cấu trúc, kém hơn với chữ viết tắt và tiếng lóng.
  4. Tổng hợp và phát hiện chủ đề mới: "tháng này có gì khách nói mà bộ chủ đề chưa có". Hữu ích nhưng cần người đọc lại, vì mô hình có thể gộp sai hoặc tô đậm thứ xuất hiện ít.

Khái niệm nền về xác suất, độ chính xác và trôi dữ liệu áp dụng nguyên cho việc này, xem kiến thức học máy cơ bản cho lãnh đạo.

Quy trình 5 bước

Bước 1: gom dữ liệu về một chỗ

Ticket từ phần mềm hỗ trợ, đánh giá từ sàn, khảo sát từ form, tin nhắn từ kênh chat. Mỗi dòng cần ít nhất: nội dung, ngày, nguồn, và mã khách hoặc mã đơn nếu có. Đây thường là bước tốn thời gian nhất ở lần đầu và là lý do bài từ bảng tính đến hệ thống thông minh khuyên chuẩn hoá dữ liệu trước.

Bước 2: định nghĩa bộ chủ đề bằng tay

Người hiểu nghiệp vụ liệt kê 8 đến 15 chủ đề, mỗi chủ đề có định nghĩa một câu và 3 ví dụ thật. Đừng để mô hình tự đề xuất bộ chủ đề ở bước này; bộ chủ đề là ngôn ngữ chung để so sánh theo tháng, đổi liên tục thì mất khả năng so.

Bước 3: gắn nhãn tay một mẫu kiểm tra

Chọn ngẫu nhiên 150 đến 200 phản hồi, hai người gắn nhãn độc lập, thống nhất chỗ lệch. Mẫu này là thước đo: mọi thay đổi chỉ dẫn hay đổi mô hình đều chạy lại trên mẫu để biết độ chính xác tăng hay giảm. Bỏ bước này là lý do phổ biến nhất khiến dự án phân tích phản hồi bị mất niềm tin sau ba tháng.

Bước 4: viết chỉ dẫn, chạy, đo, sửa

Chỉ dẫn cho mô hình gồm bộ chủ đề với định nghĩa và ví dụ, định dạng đầu ra cố định, quy tắc cho trường hợp không rõ (gắn "khác" thay vì đoán). Chạy trên mẫu kiểm tra, so với nhãn người, đọc các ca sai để sửa định nghĩa hoặc thêm ví dụ. Với bộ chủ đề rõ, độ khớp với người thường đạt 85 đến 92% sau hai ba vòng sửa; cao hơn mức hai người gắn nhãn khớp nhau trong nhiều trường hợp.

Bước 5: chạy định kỳ, xuất báo cáo, giữ người đọc mẫu

Mỗi tháng hệ thống gắn nhãn toàn bộ phản hồi mới, xuất bảng: số lượng và tỷ lệ theo chủ đề, biến động so với tháng trước, cảm xúc theo chủ đề, danh sách phản hồi tiêu cực nhất để người đọc trực tiếp. Người phụ trách đọc lại 30 phản hồi ngẫu nhiên đã gắn nhãn để phát hiện lệch sớm.

Chi phí thực tế

Với 750 phản hồi mỗi tháng, mỗi phản hồi trung bình 80 từ:

  • Phí mô hình: dưới 100 nghìn đồng mỗi tháng với mô hình thương mại tầm trung. Chi phí mô hình không phải vấn đề ở quy mô này.
  • Xây lần đầu: gom dữ liệu, bộ chủ đề, mẫu kiểm tra, chỉ dẫn, báo cáo: 2 đến 4 tuần, vài chục triệu đồng tuỳ số nguồn dữ liệu cần nối.
  • Vận hành: 2 đến 4 giờ người mỗi tháng đọc mẫu và đọc báo cáo, cộng phí quản lý hệ thống AI nếu thuê ngoài.

So với 25 giờ đọc tay mỗi tháng, hoàn vốn thường trong quý đầu, chưa kể giá trị của việc thật sự biết khách đang nói gì.

5 lỗi hay gặp

  1. Bộ chủ đề quá nhiều hoặc chồng lấn. 30 chủ đề với ranh giới mờ làm cả người và mô hình gắn nhãn không nhất quán. Bắt đầu với 10, gộp mạnh tay.
  2. Không có mẫu kiểm tra. Không đo được thì không biết khi nào hệ thống sai, và nó sẽ sai lúc nhà cung cấp đổi phiên bản mô hình.
  3. Tin điểm cảm xúc cho từng ca. Cảm xúc dùng để xem xu hướng nhóm lớn; xử lý từng khách vẫn cần người đọc.
  4. Gửi thông tin định danh không cần thiết cho mô hình. Tên, số điện thoại, địa chỉ nên được che trước khi gửi; mô hình không cần chúng để phân loại.
  5. Làm một lần rồi thôi. Giá trị nằm ở so sánh theo tháng. Báo cáo tháng đầu chỉ là điểm mốc.

Từ phân tích sang hành động

Báo cáo phản hồi chỉ có giá trị khi có người chịu trách nhiệm cho mỗi chủ đề: chủ đề giao hàng thuộc vận hành, chủ đề sản phẩm thuộc mua hàng, chủ đề thái độ thuộc trưởng ca. Mỗi tháng, mỗi người nhận đúng phần của mình kèm 10 phản hồi nguyên văn tiêu cực nhất. Đây là chỗ hệ thống phân tích nối vào quy trình vận hành, và là lúc nên nghĩ tới việc để AI agent tự chuyển phản hồi khẩn thành ticket cho đúng người trong ngày thay vì chờ báo cáo tháng.

Siri9 xây phần này trong dịch vụ tích hợp AI và duy trì độ chính xác qua quản lý hệ thống AI.

Câu hỏi thường gặp

Cần bao nhiêu phản hồi mỗi tháng thì đáng làm?

Từ khoảng 200 trở lên. Dưới mức đó, một người đọc tay trong vài giờ vẫn hiệu quả hơn và hiểu sâu hơn.

Mô hình có hiểu tiếng Việt viết tắt, không dấu, lẫn tiếng Anh không?

Các mô hình thương mại hiện tại xử lý khá tốt tiếng Việt không dấu và lẫn tiếng Anh; viết tắt nội bộ ngành cần được giải nghĩa trong chỉ dẫn. Mẫu kiểm tra sẽ cho biết mức chính xác thật trên dữ liệu của bạn.

Có cần huấn luyện mô hình riêng không?

Không, với đa số doanh nghiệp nhỏ và vừa. Chỉ dẫn tốt kèm ví dụ đủ đạt 85 đến 92%. Huấn luyện riêng chỉ đáng cân nhắc khi khối lượng rất lớn, xem fine-tuning hay RAG.

Bắt đầu thế nào?

Gửi Siri9 một file xuất 100 phản hồi gần nhất (đã che thông tin định danh) và danh sách nguồn dữ liệu; chúng tôi chạy thử phân loại và gửi lại kết quả kèm ước tính phạm vi trong 3 ngày làm việc.