LLM Zoomcamp: khoá RAG miễn phí dạy cả đánh giá và giám sát
Khoá học của DataTalks.Club không dừng lại khi chatbot trả lời được câu đầu tiên. Hai module của khoá dành riêng cho việc đo và theo dõi hệ thống sau đó.
Phải biết lỗi nằm ở tầng nào thì mới biết cần đo gì và sửa ở đâu.
Đồ hoạ: FDE Times
Tóm tắt nhanh
- LLM Zoomcamp của DataTalks.Club miễn phí toàn bộ video, tài liệu và bài tập. Bạn chỉ cần viết Python vững và một chiếc laptop bất kỳ, không cần GPU.
- Phần đáng học nhất là Module 4 (Evaluation) và Module 5 (Monitoring). Đó cũng là phần việc FDE phải lo sau buổi demo.
- Muốn có chứng chỉ thì phải học theo cohort hằng năm, thường bắt đầu vào tháng 6. Tự học thì không có chứng chỉ nhưng vẫn làm được dự án portfolio.
Dựng được một chatbot RAG trả lời vài câu hỏi mới là nửa đầu công việc. Nửa sau là câu khách hàng có thể hỏi ở tuần thứ ba: “Nó có đang trả lời đúng không, và làm sao anh biết?”. LLM Zoomcamp, khoá học miễn phí của DataTalks.Club, đáng chú ý chính vì nó đi thẳng vào câu hỏi đó.
Ngoài phần nền tảng LLM và RAG, khoá học có riêng một module về đánh giá và một module về giám sát. Với người muốn làm FDE, đây là phần đáng học nhất. Lý do là việc của FDE bắt đầu đúng ở chỗ buổi demo kết thúc.
Ai làm khoá học, và phải trả gì?
DataTalks.Club là cộng đồng đứng sau loạt khoá Zoomcamp. Alexey Grigorev, người sáng lập cộng đồng, là một trong các giảng viên. Video, tài liệu và bài tập đều miễn phí; khoản bạn có thể phải trả là 1-5 USD credit OpenAI nếu tự chạy code.
Yêu cầu đầu vào thấp: viết Python tự tin và có một chiếc laptop bất kỳ, không cần GPU. Với developer Việt Nam đã có vài năm làm backend, rào cản kỹ thuật gần như không có. Cái khó nằm ở thói quen đo lường mà hai module phía sau đòi hỏi.
Hai module dành cho tuần thứ ba
Module 4 (Evaluation) dạy cách đo chất lượng retrieval và chất lượng câu trả lời, cả offline lẫn online, cho search, RAG và agent. Module 5 (Monitoring) chuyển sang hệ thống đã deploy. Phần này gồm phản hồi người dùng, tình trạng hệ thống, dashboard thời gian thực, metric cho từng lời gọi LLM, độ trễ và chi phí.
Đọc danh sách như vậy thì thấy khô. Nó chỉ có nghĩa khi bạn đặt vào một sự cố cụ thể.
Thử hình dung bạn deploy một trợ lý tra cứu quy trình nội bộ cho một ngân hàng. Tuần đầu ai cũng khen. Sang tuần thứ ba, một trưởng phòng phàn nàn rằng câu trả lời “nghe hợp lý nhưng sai”.
Phản xạ thường gặp là sửa prompt. Nhưng “sai” có ít nhất hai nguồn: retriever lấy nhầm tài liệu, hoặc retriever lấy đúng mà model diễn giải sai. Sửa prompt chỉ chạm tới nguồn thứ hai.
Hai mươi câu hỏi để tách hai loại lỗi
Đây là kỹ năng Module 4 hướng tới, và bạn có thể làm ngay. Hãy soạn 20 câu hỏi giống kiểu trưởng phòng hay hỏi, mỗi câu đánh dấu đoạn quy trình chứa câu trả lời đúng. Đó là bộ đánh giá offline đầu tiên của bạn.
Bước một chỉ chạy retriever, chưa gọi model. Với mỗi câu, kiểm tra xem đoạn đúng có nằm trong các kết quả trả về không. Giả sử 14 câu trúng và 6 câu trượt: 6 câu đó là lỗi retrieval, và không prompt nào cứu được vì model chưa từng thấy tài liệu đúng.
Bước hai chỉ xét 14 câu mà retriever đã trúng. Đưa đúng ngữ cảnh ấy cho model rồi chấm câu trả lời. Câu nào vẫn sai mới là lỗi diễn giải, và lúc này việc sửa prompt, đổi cách trình bày ngữ cảnh hay đổi model mới có ý nghĩa.
Sau hai bước, lời phàn nàn “nghe hợp lý nhưng sai” đã thành hai con số tách bạch, mỗi con số chỉ ra một tầng cần sửa. Bạn quay lại gặp trưởng phòng với một chẩn đoán, không phải một lời hứa.
Bộ test tự soạn sẽ cũ đi
Hai mươi câu hỏi tự viết không bao giờ giống hệt câu người dùng thật gõ vào. Vì thế Module 4 nói đến cả đánh giá online, còn Module 5 đưa phản hồi của người dùng vào dashboard. Câu hỏi bị chấm thấp hôm nay nên được thêm vào bộ test tuần sau.
Giám sát còn trả lời được những câu mà bộ test bỏ ngỏ: lỗi xảy ra thường đến mức nào, và mỗi câu trả lời tốn bao nhiêu. Với khách hàng doanh nghiệp, một trợ lý trả lời đúng nhưng bắt người dùng chờ lâu hoặc tốn quá nhiều tiền API vẫn là trợ lý có vấn đề.
Hãy coi độ trễ và chi phí là một phần của chất lượng, ngang với độ chính xác.
Học theo cohort hay tự học?
Khoá học chạy mỗi năm một lần, thường bắt đầu vào tháng 6. “Live cohort” không có nghĩa là lớp học trực tiếp: mọi bài giảng đều quay sẵn, cohort chỉ thêm deadline và chấm điểm. Người tự học không được cấp chứng chỉ nhưng vẫn thoải mái làm dự án portfolio.
Nếu bạn cần deadline để ép mình học, hãy chờ cohort tiếp theo. Nếu đã tự giác, cứ bắt đầu ngay từ repo trên GitHub. Dù chọn cách nào, đừng nhảy cóc vào Module 4: đi nhanh qua phần nền tảng, dựng pipeline trên một bộ dữ liệu bạn hiểu rõ, rồi dồn thời gian cho đánh giá và giám sát.
Biến khoá học thành bằng chứng trong CV
Trong phỏng vấn FDE, thứ thuyết phục hơn tên một khoá học là bằng chứng bạn từng đo một hệ thống thật. Khi đọc JD, hãy để ý các cụm như “evaluation”, “production monitoring” hay “observability cho LLM”. Đó chính là nội dung của Module 4 và Module 5.
Trên CV, đừng chỉ viết “hoàn thành LLM Zoomcamp”. Hãy mô tả hệ thống RAG bạn dựng, bộ đánh giá tách retrieval khỏi câu trả lời và dashboard theo dõi độ trễ, chi phí, phản hồi người dùng, kèm link repo. Vào phỏng vấn, hãy kể một lần bộ test giúp bạn chỉ ra lỗi nằm ở tầng nào.
Khoá học này không biến bạn thành FDE. Nhưng nó dạy bạn trả lời câu “làm sao anh biết?” bằng con số, và với một FDE, đó là phần lớn công việc.