Ollama và LM Studio: demo model open-weight trên laptop khi khách cấm gửi dữ liệu ra ngoài
Khi phòng pháp chế của khách cấm mọi API cloud, buổi demo chỉ còn trông vào chiếc laptop, và kết quả phụ thuộc vào việc bạn chuẩn bị nó trước khi bước vào văn phòng khách.
- 1Tải model trướcTải ở nơi có mạng; tab Discover của LM Studio có gọi ra huggingface.co
- 2Đặt model lên ổ đã duyệtDùng OLLAMA_MODELS trỏ sang thư mục trên ổ mã hoá
- 3Tắt cloud featuresLàm theo FAQ của Ollama; chấp nhận mất cloud model và web search
- 4Giữ server ở localhostOllama mặc định loopback cổng 11434; server LM Studio cũng nên để localhost
- 5Chạy thử offlineNgắt mạng chạy hết kịch bản; dùng lsof xác nhận 11434 chỉ nghe 127.0.0.1
Mọi bước cần mạng phải xong trước khi bước vào văn phòng khách.
Đồ hoạ: FDE Times
Tóm tắt nhanh
- Ollama nói hãng không thấy prompt hay dữ liệu khi bạn chạy cục bộ; LM Studio nói nội dung chat và tài liệu tải lên không rời máy.
- Ollama mặc định chỉ bind vào loopback, cổng 11434; muốn mở ra mạng thì phải chủ động đổi OLLAMA_HOST.
- LM Studio vẫn gọi mạng khi tìm model trong tab Discover và khi cập nhật, nên mọi thứ phải tải xong trước khi tới chỗ khách.
Câu “dữ liệu không được ra khỏi tòa nhà” thường kết thúc buổi demo trước khi bạn kịp mở slide. Với ngân hàng, bệnh viện hay nhà máy, đó là điều kiện bắt buộc, không còn chỗ để thương lượng. Lúc ấy, thứ FDE mang theo được chỉ là một chiếc laptop có model open-weight chạy ngay trên máy.
Ollama và LM Studio là hai cách phổ biến để làm việc đó. Chúng không cạnh tranh nhau về độ thông minh của model, vì model là của bên thứ ba. Khác biệt nằm ở cách mỗi công cụ cư xử khi máy bị cắt mạng, và chính chi tiết đó quyết định bạn có vượt qua được buổi họp với đội an ninh của khách hay không.
Ollama hợp với người quen làm việc trên terminal
Ollama là dự án mã nguồn mở theo giấy phép MIT, chạy trên backend llama.cpp. Repo chính thức liệt kê nhiều họ model như Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma. Câu bạn nên trích cho khách nằm trong FAQ: khi chạy cục bộ, Ollama không nhìn thấy prompt hay dữ liệu của người dùng.
Điều FDE đánh giá cao nhất ở Ollama là cấu hình mặc định đã khá an toàn. Server chỉ bind vào loopback trên cổng 11434. Muốn máy khác trong mạng gọi được thì bạn phải tự đổi biến môi trường OLLAMA_HOST, nên việc mở ra ngoài luôn là một quyết định có chủ ý. Ứng dụng demo chạy trên cùng laptop chỉ cần gọi REST API cục bộ:
curl http://localhost:11434/api/chat -d '{
"model": "<tên-model-đã-tải>",
"messages": [{"role": "user", "content": "Tóm tắt điều khoản bảo mật này"}]
}'
Thử hình dung bạn demo cho một ngân hàng muốn tóm tắt hợp đồng. Trước buổi gặp, bạn tải model ở nhà. Sau đó bạn đặt OLLAMA_MODELS trỏ sang thư mục trên ổ mã hoá đã được bộ phận IT của khách duyệt, vì FAQ cho phép đổi nơi lưu model bằng biến này.
Bạn cũng tắt cloud features của Ollama theo hướng dẫn trong FAQ, chấp nhận mất cloud model và web search. Trong một engagement cấm egress, đánh đổi đó là đúng.
LM Studio hợp với buổi demo cho người không viết code
LM Studio có giao diện đồ hoạ, dễ đưa cho chuyên viên nghiệp vụ tự gõ thử. Tài liệu chính thức nói những gì bạn nhập khi chat với model cục bộ không rời thiết bị. Tài liệu người dùng tải lên để hỏi đáp cũng được xử lý hoàn toàn trên máy.
Chính sách quyền riêng tư có hiệu lực từ tháng 6/2026 xác nhận thêm: khi dùng cục bộ, tin nhắn, lịch sử chat và tài liệu không bao giờ được truyền ra khỏi hệ thống, chỉ Cloud Services của hãng mới xử lý nội dung.
Runtime của LM Studio dựa trên MLX và llama.cpp, nên trên MacBook dùng Apple Silicon nó có thể chạy qua MLX. Khi cần nối ứng dụng, bạn bật server cục bộ tương thích OpenAI từ tab Developer hoặc bằng lệnh lms server start. Server này chạy được trên localhost hoặc mở ra mạng. Trong môi trường khắt khe, hãy giữ ở localhost.
Hai công cụ vẫn có những chỗ cần mạng
Đây là phần nhiều người bỏ qua. LM Studio vẫn gửi request ra ngoài, chẳng hạn tới huggingface.co, khi bạn tìm model trong tab Discover. Không có internet thì updater trong app cũng không chạy.
Model vì thế phải tải sẵn hoặc sideload, còn việc cập nhật phải làm qua kênh riêng, không làm trên chiếc laptop đã bị khoá. Danh sách model cần dùng phải được chốt và tải xong từ hôm trước, đừng mở Discover ngay tại chỗ khách chỉ để tìm thêm một model “cho chắc”.
Ollama có cloud model và web search, và cả hai đều tắt được. Hãy ghi bước tắt vào script dựng máy để lần sau không phải nhớ. Nếu đội an ninh của khách soi lưu lượng mạng, một request lạ xuất hiện giữa buổi demo sẽ làm mất niềm tin nhanh hơn bất kỳ câu trả lời sai nào của model.
Ollama
- MIT, chạy trên llama.cpp
- REST API tại localhost:11434
- Mặc định chỉ bind loopback, đổi bằng OLLAMA_HOST
- Đổi nơi lưu model bằng OLLAMA_MODELS
- Có cloud features cần tắt
LM Studio
- Giao diện đồ hoạ, chat với tài liệu ngay trên máy
- API tương thích OpenAI, bật từ tab Developer hoặc lms server start
- Runtime dùng MLX và llama.cpp
- Tab Discover gọi ra huggingface.co
- Updater cần internet
Một buổi chạy thử bắt lỗi trước khi khách bắt
Lỗi dễ mắc nhất là để server mở ra mạng. LM Studio có sẵn tùy chọn này, và một lần bật để thử ở văn phòng rất dễ bị quên khi mang máy sang chỗ khách. Với Ollama, rủi ro tương tự đến từ việc đổi OLLAMA_HOST rồi không đổi lại.
Bước đầu của buổi chạy thử: ngắt Wi-Fi, chạy lại toàn bộ kịch bản demo từ đầu đến cuối, kể cả phần chat với tài liệu. Bước nào hỏng là bước bạn vẫn đang ngầm dựa vào mạng.
Tiếp theo, kiểm tra server đang nghe ở đâu. Trên Mac, lệnh dưới đây phải trả về địa chỉ loopback như 127.0.0.1:11434. Nếu thấy *:11434 hoặc IP của card mạng, server đang mở ra ngoài; làm tương tự với cổng server LM Studio đang dùng.
lsof -nP -iTCP:11434 -sTCP:LISTEN
Cuối cùng, bật mạng, chạy lại kịch bản và liệt kê các kết nối đang mở bằng lsof -nP -iTCP -sTCP:ESTABLISHED. Mọi kết nối không trỏ về 127.0.0.1 là câu hỏi bạn phải trả lời được trước khi đội an ninh của khách hỏi.
Nên học gì trước, và ghi gì vào CV
Học Ollama trước. API của nó đơn giản, cấu hình bằng biến môi trường nên dễ ghi thành script dựng máy, và mặc định loopback giúp bạn giải thích với đội an ninh một cách rõ ràng. LM Studio nên có sẵn khi người dùng thử là người làm nghiệp vụ, hoặc khi bạn muốn tận dụng MLX trên Mac.
Khi đọc JD FDE, hãy để ý các cụm như “on-prem”, “air-gapped” hay “regulated industries”. Đó là dấu hiệu bạn sẽ cần kỹ năng này. Trong CV, đừng chỉ ghi “đã dùng Ollama”. Hãy mô tả việc bạn dựng một môi trường demo không egress: model tải trước, lưu trên ổ mã hoá, server chỉ nghe localhost, cloud features đã tắt, có chạy thử offline.
Đội an ninh của khách thường không hỏi model của bạn thông minh tới đâu. Họ hỏi laptop của bạn sẽ gửi gì ra ngoài, và bạn nên trả lời được câu đó ngay trên terminal.