1. Khởi đầu & Nghịch lý Con ngựa - Dây cương
Dạo này, chúng ta thường nghe từ harness, ví dụ Garry Tan (president và CEO của Y Combinator) có bài nổi tiếng nói về “Thin Harness, Fat Skills”.
Harness, trước hết, không phải là một từ công nghệ. Nó là bộ dây cương. Thứ giữ một con ngựa khỏe không biến sức mạnh của mình thành tai nạn.
Một con ngựa tốt có thể chạy rất nhanh. Nhưng nhanh thôi thì chưa đủ. Nó cần dây cương, yên ngựa, bàn đạp, người cưỡi, con đường, và cả một cảm giác rất khó gọi tên: biết lúc nào nên ghìm lại. AI hôm nay cũng vậy.
Năm 2025, người ta nói nhiều về AI agent. Nghe hấp dẫn hơn chatbot, vì agent không chỉ trả lời. Nó có thể gọi công cụ, đọc file, lập kế hoạch, viết mã, bấm nút, đi vài bước thay con người. Nhưng dùng agent đủ lâu, nhất là trong công việc thật của doanh nghiệp, ta sẽ thấy một nghịch lý hơi khó chịu: điều quyết định không chỉ là con “ngựa AI” mạnh đến đâu, mà là bộ dây cương quanh nó được thiết kế thế nào.
2. Giải phẫu Harness - “Thân thể” của AI
Chúng ta tạm gọi đó là harness, hay nói bình dân hơn, bộ khung điều phối. Model giống một bộ não rất giỏi nghĩ bằng ngôn ngữ. Nhưng một bộ não nằm trơ trên bàn thì không làm được gì nhiều. Nó không tự biết nên đọc file nào, gọi công cụ nào, dừng ở đâu, hỏi lại lúc nào, nhớ chuyện cũ ra sao, và quan trọng hơn cả, lúc nào không được làm bậy.
Harness là phần thân thể quanh bộ não ấy. Là hệ thần kinh. Là luật giao thông. Là dây an toàn. Là cái phanh. Là khoảng cách nhỏ giữa “AI có thể làm” và “AI được phép làm”. Nói ngắn gọn: model tạo ra suy nghĩ. Harness biến suy nghĩ thành hành động có kiểm soát.
‘Anatomy of a Harness’ minh họa cấu trúc gen của hệ thống điều phối AI, nơi các thành phần như Chính sách (Policy), Bộ nhớ (Memory) và Công cụ (Tools) đan xen để tạo nên hành vi an toàn.
3. Bài học từ thực tế - Case study Claude Code
Đợt source map của Claude Code bị lộ cách đây không lâu làm nhiều người trong giới kỹ thuật phải nhìn lại. Cái làm người ta chú ý không chỉ là vài chi tiết lạ bên trong sản phẩm, mà là toàn bộ cách Anthropic bao quanh model: quyền hạn, công cụ, bộ nhớ, sandbox, policy, prompt, telemetry, cách tự sửa lỗi, cách chia nhỏ công việc, cách một agent được phép đi tiếp hay buộc phải dừng. Nói hơi thô một chút, người ta không chỉ nhìn thấy con ngựa. Người ta nhìn thấy dây cương.
Và từ đó mới lộ ra một điều thú vị. Đó là sức mạnh của Anthropic không hẳn chỉ nằm ở chuyện Opus 4.7 hay Mythos hơn kém GPT-5.5, Gemini Pro 3.1 bao nhiêu điểm. Những cuộc so model vẫn cần, nhưng chúng dễ làm ta quên rằng trong công việc thật, model chỉ trở nên hữu dụng khi có một hệ thống đủ tốt bao quanh nó. Không có harness, một model rất mạnh vẫn có thể vụng về, nguy hiểm, hoặc chỉ thông minh theo kiểu trình diễn.
‘Thought-to-Action Filter’ cho thấy mô hình lọc đa lớp, nơi ‘Trí tuệ thô’ (Raw Intelligence) được bao bọc bởi các lớp Harness để tạo ra ‘Hành động an toàn’.
Vì thế, cùng một mô hình nền, nhưng khi nằm trong Claude Code, Cursor, Codex, Kimi Code hay OpenCode, ta có cảm giác “thông minh” rất khác nhau. Không chỉ vì model khác nhau. Mà vì phần bao quanh model khác nhau: công cụ khác, bộ nhớ khác, quyền hạn khác, cách kiểm tra lỗi khác, cách hỏi lại khác, và cả triết lý thiết kế khác.
4. Triết lý “Cái Không” & Công dụng thực tế
Đây là chỗ nhiều doanh nghiệp dễ nhầm. Họ hỏi “model nào mạnh nhất?” Câu hỏi đó không sai. Nhưng nó mới chỉ là câu hỏi về con ngựa. Câu hỏi khó hơn phải là: “ai đang cầm cương, đường nào được đi, việc nào phải xin phép, dữ liệu nào không được chạm vào, lỗi nào phải dừng ngay, và nếu con ngựa phi sai hướng thì ai chịu trách nhiệm?”
Lão Tử, trong chương 11 của Đạo Đức Kinh, có một câu rất hay: “Thiện chấp dĩ vi khí, đương kỳ vô, hữu khí chi dụng.” Nặn đất sét để làm chiếc bình. Nhưng chính khoảng trống bên trong mới làm nên công dụng của chiếc bình. Rồi ông kết lại: “Hữu chi dĩ vi lợi, vô chi dĩ vi dụng.” Cái có tạo ra lợi ích. Cái không mới tạo ra công dụng.
Tôi nghĩ AI cũng nên được nhìn như vậy. Model là phần “có”. Ta nhìn thấy nó, đo điểm nó, so benchmark nó, đem nó ra tranh luận trên mạng. Nhưng harness, bối cảnh, quy trình, ký ức tổ chức, đạo đức nghề nghiệp, quyền hạn, điểm dừng, và trách nhiệm con người lại là phần “không”. Nó ít được khoe hơn. Không dễ demo trong ba phút. Không gây ồn ào như một bảng xếp hạng model mới. Nhưng chính nó mới tạo ra cái dụng.
‘The Invisible Utility’ sử dụng ẩn dụ chiếc bình của Lão Tử: phần vật chất (Model) tạo ra lợi ích, nhưng chính ‘khoảng trống’ (Harness) bên trong mới tạo ra công dụng thật sự.
5. Tương lai AI trong Doanh nghiệp - từ hào nhoáng đến dùng được
Có lẽ cuộc chơi AI sắp tới ở doanh nghiệp sẽ không chỉ là cuộc đua model. Nó sẽ là cuộc đua thiết kế những hệ thống biết ghìm, biết mở, biết nhớ, biết quên, biết hỏi lại, và biết dừng đúng lúc. Một AI mạnh mà không có harness tốt, nhiều khi chỉ là một con ngựa hay đang chạy trong sương mù. Còn một AI vừa đủ mạnh, nhưng được đặt trong một bộ dây cương tử tế, có thể trở thành năng lực thật của doanh nghiệp.
Không hào nhoáng lắm. Nhưng dùng được. Và trong kinh doanh, sau cùng, “dùng được” thường quan trọng hơn “trông rất thông minh”.
Bạn nghĩ doanh nghiệp của mình đang đầu tư nhiều hơn vào con ngựa, hay vào bộ dây cương?
PS. Tôi có cảm giác nhiều dự án AI thất bại không phải vì thiếu model mạnh. Mà vì người ta để một con ngựa rất khỏe chạy trong một tổ chức chưa kịp học cách cầm cương.





Chút cảm khái cuối ngày, mong thầy đừng cười ạ.
LLM không phát triển theo một kế hoạch hoàn hảo ngay từ đầu, mà theo kiểu gặp vấn đề đến đâu thì giải quyết đến đó. Mỗi nút thắt được tháo gỡ lại làm lộ ra một nút thắt mới ở tầng cao hơn, tạo thành một vòng xoáy trôn ốc của tiến bộ kỹ thuật.
Ban đầu là prompt engineering để cải thiện chất lượng đầu vào. Khi LLM biết dùng tool và phải ghi nhớ kết quả qua nhiều bước, xuất hiện context engineering để quản lý ngữ cảnh. Khi hệ thống phải phối hợp nhiều lời gọi LLM và nhiều thành phần khác nhau, cần harness engineering để điều phối toàn bộ luồng xử lý. Đến khi hệ thống hoạt động theo nhiều vòng lặp tự sửa và tối ưu, sinh ra loop engineering. Cuối cùng, khi lỗi tích lũy qua nhiều bước khiến con người không còn đánh giá thủ công được, evals ra đời để đo lường và so sánh chất lượng một cách có hệ thống.
Năm tầng này không thay thế nhau mà chồng lên nhau; tầng sau xuất hiện để giải quyết những giới hạn của tầng trước. Đặc biệt, evals không phải một ý tưởng hoàn toàn mới, mà chỉ là sự hình thức hóa việc so sánh và đánh giá vốn đã tồn tại từ khi người ta thử nghiệm các prompt đầu tiên.
Toàn bộ quá trình phản ánh đúng quy luật lượng đổi dẫn đến chất đổi của triêt học: nhu cầu tích lũy dần đến một ngưỡng thì bùng phát thành một kỹ thuật độc lập. Nếu nhìn theo lăng kính này, có thể thấy lịch sử phát triển của LLM thật ra không có gì thần bí, mà là chuỗi cải tiến liên tục trước những vấn đề thực tế, tương tự cách toàn ngành phần mềm đã phát triển suốt nhiều thập kỷ, nhưng kết quả mà nó mang lại thực sự đã thay đổi vĩnh viễn cuộc sống con người, ở 1 quy mô và tốc độ chưa từng có.
Nghe chú Thành nói về AI mà đầu cứ nghĩ tới mình... cách mình đầu tư vào phần "con ngựa" và "dây cương"... Cảm ơn chú đã chia sẻ ❤️