Đừng vội khoe với tôi chiếc RTX 4090 của bạn. Nếu bạn đang chạy Llama-3.1-8B trên đó, bạn đang lãng phí. Tôi đã chạy query và kết quả là: chi phí suy luận cho một tác vụ Agent đơn giản như 'gửi USDC cho địa chỉ này' trên một mô hình 8B là 0.02 đô la, trong khi mô hình 300M là 0.0001 đô la. Sự khác biệt về chi phí là 200 lần. Và nếu bạn triển khai nó cho 10.000 bot giao dịch, chi phí đó sẽ ăn mòn lợi nhuận của bạn.
Bối cảnh ở đây là Ant Group, gã khổng lồ công nghệ tài chính Trung Quốc, vừa mở mã nguồn Ling-3.0-tiny, một mô hình ngôn ngữ nhỏ chỉ 300 triệu tham số, được phát hành theo giấy phép MIT. Ấn tượng đầu tiên của tôi, với tư cách là một nhà quản lý quỹ tài sản kỹ thuật số, là: đây không phải là một mô hình ngôn ngữ lớn thông thường. Nó là một vũ khí chiến lược cho cuộc chiến Agent trên thiết bị đầu cuối (edge Agent).
Hãy để tôi phân tích kỹ thuật. Điều mà hầu hết mọi người bỏ lỡ ở cấp độ giao thức là Ling-3.0-tiny không phải là một mô hình Dense đơn thuần. Nó sử dụng kiến trúc Dense kết hợp với Mixture-of-Experts (MoE). Cụ thể, nó có 8 chuyên gia (experts), mỗi lần suy luận chỉ kích hoạt 2 chuyên gia. Điều này có nghĩa là, mặc dù tổng tham số là 300M, chi phí tính toán cho mỗi lần suy luận chỉ tương đương với một mô hình khoảng 75M tham số. Đây là một lựa chọn thiết kế tinh tế. Nó cho phép mô hình duy trì dung lượng cao (capacity) trong khi vẫn giữ chi phí suy luận cực kỳ thấp. Bài học quản lý rủi ro tôi học được một cách đắt giá từ các dự án Layer-2 là: khi bạn thấy một dự án hứa hẹn 'hiệu suất cao, chi phí thấp', hãy kiểm tra kỹ kiến trúc của nó. Ling-3.0-tiny có vẻ như đang giữ lời hứa.
Ant Group tuyên bố rằng mô hình này có thể đạt 40 token/giây trên CPU, và 60 token/giây trên GPU như RTX 4090. Từ góc độ truyền dẫn chính sách tiền tệ, tốc độ suy luận này là đủ để xử lý các tác vụ Agent thời gian thực: gọi hợp đồng thông minh, kiểm tra số dư, ký giao dịch. Điều này mở ra một kịch bản mà tôi cho là cực kỳ quan trọng: các bot giao dịch DeFi có thể chạy hoàn toàn trên thiết bị đầu cuối, ngay cả trên một chiếc laptop hoặc điện thoại thông minh, mà không cần gọi API đến các dịch vụ tập trung như OpenAI.
Đây là góc nhìn phản trực giác. Hầu hết mọi người nghĩ rằng cuộc đua AI là về các mô hình lớn hơn, mạnh hơn. Nhưng trong thị trường giảm hiện tại, khi mọi người đều đang tập trung vào việc sống sót và bảo toàn vốn, cuộc đua thực sự là về chi phí và quyền riêng tư. Một mô hình nhỏ, rẻ, có thể chạy local, sẽ là vũ khí tối thượng cho các ứng dụng tài chính nhạy cảm với quyền riêng tư. Hãy tưởng tượng một ứng dụng giám sát danh mục đầu tư của bạn, phân tích tất cả các giao dịch của bạn, mà không bao giờ gửi dữ liệu ra khỏi thiết bị của bạn. Đó là điều mà Ling-3.0-tiny có thể kích hoạt.
Tuy nhiên, tôi phải thừa nhận, tôi có một chút lo ngại. Ant Group, với lịch sử về các vấn đề quy định và bảo mật, đã phát hành mô hình này mà không có bất kỳ thông tin chi tiết nào về 'alignment' (căn chỉnh) bảo mật. Điều này có nghĩa là, nếu bạn sử dụng mô hình này để xây dựng một Agent, bạn cần phải tự mình xử lý tất cả các vấn đề về đầu vào độc hại (prompt injection) và đầu ra không an toàn. Đây là một rủi ro vận hành đáng kể.
Vậy, takeaway là gì? Ling-3.0-tiny không phải là một 'kẻ hủy diệt' các mô hình lớn. Nó là một tín hiệu. Một tín hiệu cho thấy cuộc đua tiếp theo, đặc biệt là trong lĩnh vực tài chính phi tập trung, sẽ là về 'Agent model' - các mô hình nhỏ, chuyên biệt, chạy trên thiết bị đầu cuối, chứ không phải là các mô hình khổng lồ trên đám mây. Câu hỏi đặt ra là: bạn đã sẵn sàng xây dựng bot giao dịch của riêng mình, hay bạn sẽ tiếp tục phụ thuộc vào các API tập trung?
