Chắc hẳn bạn đã thấy bảng xếp hạng rồi. Qwen 3.5–27B đạt 49,2% trên SWE-bench. DeepSeek V3.2 rất giỏi trong việc giải quyết các tác vụ thuật toán. Llama 3.3 8B đạt 73,0 điểm trên MMLU. Những con số này trông thật ấn tượng, và bạn bắt đầu nghĩ, mình nên chạy một trong những công cụ này trên máy tính cục bộ để tạo câu lệnh SQL, gỡ lỗi mã và lập tài liệu lược đồ.
Sau đó, bạn khởi chạy mô hình, xem RAM hoạt động hết công suất trong bốn phút và chỉ nhận được 2,3 token mỗi giây, chậm hơn cả tốc độ đọc của bạn.
Bảng xếp hạng không hề nói dối bạn. Nó chỉ trả lời một câu hỏi khác với câu hỏi bạn đang đặt ra.
Đối với bất kỳ nhà phát triển hoặc chuyên gia dữ liệu và trí tuệ nhân tạo nào, câu hỏi đúng không bao giờ là“mô hình nào tốt nhất?”Mà là “mô hình nào tốt nhất mà phần cứng của tôi có thể cung cấp đủ nhanh để hữu ích trong quá trình gỡ lỗi?”Đó là hai câu hỏi hoàn toàn khác nhau, và trả lời sai câu hỏi này sẽ khiến bạn mất từ cả buổi chiều bực bội đến cả ngàn đô la tiền phần cứng không cần thiết.
Dưới đây là cách để suy nghĩ thấu đáo quá trình lựa chọn theo hướng ưu tiên phần cứng: đâu là hạn chế thực sự, các cấp độ được thể hiện như thế nào bằng các con số cụ thể, và mô hình nào phù hợp với quy trình làm việc nào khi bạn đã xác định được giới hạn của máy.
Trước khi đi sâu hơn, có một khái niệm quan trọng cần nắm rõ:suy luậnvàlượng tử hóa.
Suy luận đơn giản là quá trình một mô hình tạo ra các token để đáp ứng yêu cầu của bạn. Mỗi khi một mô hình LLM cục bộ trả lời một câu hỏi, viết câu lệnh SQL, giải thích lỗi của DAG hoặc tạo mã, phần cứng của bạn sẽ liên tục tải trọng số của mô hình từ bộ nhớ và tính toán token tiếp theo.
Các trọng số mô hình đó thường được lưu trữ với độ chính xác số học cao, điều này làm cho mô hình trở nên lớn và tốn nhiều bộ nhớ. Lượng tử hóa làm giảm độ chính xác đó để thu nhỏ kích thước mô hình và giúp suy luận nhanh hơn.
Bạn thường sẽ thấy những thuật ngữ như:
- Q8→ Lượng tử hóa 8 bit, lớn hơn nhưng gần với chất lượng độ chính xác đầy đủ hơn.
- Q4→ Lượng tử hóa 4 bit, kích thước chỉ bằng khoảng một nửa và dễ dàng chạy cục bộ hơn nhiều.
Ví dụ, một mô hình 7B cần khoảng 9 GB trong quý 8 có thể giảm xuống còn khoảng 4,5 GB trong quý 4 mà chất lượng chỉ giảm nhẹ đối với hầu hết các tác vụ dữ liệu thực tế.
Sự đánh đổi đó là lý do tại sao các biến thể Q4 trở thành mặc định cho các quy trình làm việc LLM cục bộ: ít áp lực bộ nhớ hơn, tạo mã thông báo nhanh hơn và yêu cầu phần cứng thấp hơn đáng kể.
Token là “lượng chữ” mà AI phải đọc và viết. Token là đơn vị đếm số chữ/chữ cái mà AI phải bỏ công sức ra để đọc và hiểu.Câu hỏi càng dài, câu trả lời càng dài => Số Token càng nhiều.
Bạn trả tiền vì AI phải dùng điện, chip và sức mạnh siêu máy tính để xử lý đống chữ đó.Các nhà cung cấp AI (như OpenAI, Google) tính phí theo kiểu“mua bán buôn”:
Họ đặt giá cho1 triệu Token(VD: vài chục nghìn đồng).
Họ tínhcả 2 chiều: Token bạngửi vào(câu hỏi dài lê thê) + Token họtrả ra(câu trả lời dài ngoằng).
Vì vậy, nếu bạn hỏi một câu ngắn gọn:*“1+1=?”*(khoảng 5 Token) và AI đáp*“=2”*(khoảng 2 Token) => giá rẻ như không.
- Cửa sổ ngữ cảnh là “bộ nhớ tạm thời” của AI. Nó là giới hạn số Token mà AI có thể “nhìn” được trong một lần xử lý.
Thứ duy nhất chi phối mọi thứ
Trước khi đưa ra các đề xuất về mẫu mã, có một thực tế về mặt kỹ thuật mà bạn cần hiểu, bởi vì nó sẽ thay đổi cách bạn đọc mọi bảng thông số kỹ thuật.
Việc tạo mã thông báo LLM bị giới hạn bởi băng thông bộ nhớ , chứ không phải bởi khả năng tính toán.
Điều này khiến nhiều người ngạc nhiên. Theo trực giác, việc tạo văn bản đòi hỏi rất nhiều phép toán dấu phẩy động, vì vậy càng nhiều lõi GPU thì tốc độ xử lý càng nhanh. Điều đó đúng trong quá trình huấn luyện, khi bạn thực hiện các phép nhân ma trận lớn trên các lô dữ liệu lớn. Nhưng trong quá trình suy luận, cụ thể là bước giải mã tự hồi quy, nơi mô hình tạo ra từng token một, điểm nghẽn chính là tốc độ phần cứng đọc trọng số của mô hình từ bộ nhớ trong mỗi lần truyền tiến.
Mỗi token bạn tạo ra đều yêu cầu đọc toàn bộ tập hợp trọng số mô hình từ bộ nhớ một lần. Một mô hình 7 tỷ tham số ở mức lượng tử hóa Q4 có dung lượng khoảng 4,5 GB. Việc tạo ra phản hồi 500 token có nghĩa là phải truyền tải 4,5 GB dữ liệu đó qua bộ nhớ 500 lần. Phần cứng thực hiện việc này nhanh nhất không phải là phần cứng có nhiều lõi nhất, mà là phần cứng có băng thông bộ nhớ cao nhất.

Thực tế này giải thích hầu hết sự nhầm lẫn trong cộng đồng phần cứng LLM địa phương. Đó là lý do tại sao một chiếc MacBook Pro M4 Max, với băng thông bộ nhớ hợp nhất 546 GB/s, lại có cảm giác nhanh hơn đối với một máy có GPU mạnh hơn nhưng bộ nhớ chậm hơn (mặc dù đây là model 14B) . Đó là lý do tại sao hai máy có dung lượng RAM giống hệt nhau lại có tốc độ suy luận khác nhau rất nhiều. Và đó là lý do tại sao câu hỏi “Tôi có bao nhiêu VRAM?” chỉ là một nửa câu hỏi, nửa còn lại là “VRAM đó có thể được đọc nhanh đến mức nào?”
Dung lượng bộ nhớ quyết định bạn có thể chạy những mô hình nào . Băng thông quyết định tốc độ hoạt động của chúng . Cả hai thông số đều quan trọng và chúng ưu tiên những lựa chọn khác nhau.

Các cấp độ phần cứng, với số liệu cụ thể.
Tôi sẽ cung cấp cho bạn hình ảnh cụ thể về phần cứng mà hầu hết các kỹ sư dữ liệu thực sự đang sử dụng.
Cấp độ 1: Giới hạn 8–16 GB (hầu hết các máy tính xách tay của mọi người)
Nếu bạn đang sử dụng máy tính Windows hoặc Linux với 8 GB VRAM GPU chuyên dụng, ví dụ như RTX 3060 hoặc RTX 4060, bạn có thể chạycác mô hình tham số 7B và 8Bmột cách thoải mái ở mức lượng tử hóa Q4. Mộtmô hình Qwen 3 7Bở mức Q4_K_M sẽ chiếm khoảng 4,5 GB VRAM. Một mô hình Llama 3.3 8B ở cùng mức lượng tử hóa sẽ chiếm khoảng 5,5–6 GB.
Tốc độ ở mức này:dự kiến 30–50 token mỗi giây trên RTX 4060. Tốc độ này đủ nhanh cho việc sử dụng tương tác, khoảng năm đến tám giây cho phản hồi truy vấn SQL 200 token. Không phải là siêu nhanh, nhưng thực sự hữu dụng cho các công việc kiểu“viết cho tôi một truy vấn dàn dựng cho lược đồ này”hoặc“có vấn đề gì với ngữ cảnh tác vụ Airflow này”.
Mức giới hạn 8 GB cũng là nơi bạn gặp phải sự sụt giảm chất lượng mô hình đáng kể nhất. Một mô hình 7 tỷ GB là tốt. Nó không giống như một mô hình 30 tỷ GB trong một tác vụ suy luận khó hơn, và nếu bạn đang cố gắng tạo ra logic đường ống nhiều bước phức tạp hoặc gỡ lỗi chuyển đổi kiểu dữ liệu tinh vi trong một tác vụPySpark, bạn sẽ nhận thấy sự khác biệt. Quan điểm thẳng thắn: mức 8 GB là mức“hoàn thành công việc”, chứ không phải mức“hoàn thành công việc một cách hoàn hảo”.

Các máy tính xách tay Apple Silicon ở cấu hình M4 cơ bản (bộ nhớ hợp nhất 16 GB) nằm ở phân khúc cao cấp hơn một chút. Băng thông bộ nhớ của chip M4 thấp hơn so với GPU rời nhưng điều quan trọng là, vùng bộ nhớ hợp nhất cho phép GPU thực sự sử dụng toàn bộ 16 GB thay vì phải cạnh tranh với hệ điều hành để giành lấy dung lượng. Trên thực tế, một chiếc MacBook Air M4 với 16 GB chạyLlama 3.3 8Bở tốc độ khoảng 25-30 token mỗi giây thông qua Ollama với khả năng tăng tốc Metal. Tốc độ này không nhanh hơn đáng kể so với RTX 4060,nhưng cấu hình nhiệt hoàn toàn khác biệt, Air không bị giảm hiệu năng khi hoạt động liên tục như các máy tính xách tay Windows mỏng nhẹ.
Cấp độ 2: Phạm vi 24–48 GB (phần thú vị hơn)
Đây là nơi tập trung hầu hết các sự đánh đổi thú vị giữa phần cứng và kiểu dáng.
Về phía NVIDIA, RTX 4090 với 24 GB VRAM và băng thông 1.008 GB/giây hiện là lựa chọn tối ưu cho suy luận đơn GPU ở mức giá này. Bạn sẽ đạt được 90-120 token mỗi giây trên môhình 7Bở quý 4. Vớimô hình 13B, khoảng 60-80 token mỗi giây. Đối vớimô hình 30B,vẫn đáp ứng được và chạy ở tốc độ khoảng 25-35 token mỗi giây. Có thể mua hàng đã qua sử dụng với giá khoảng 1.000-1.200 đô la. Tốc độ này đủ nhanh để phản hồi của mô hình gần như tức thì đối với các truy vấn kỹ thuật dữ liệu và trí tuệ nhân tạo thông thường.
Giới hạn 24 GB VRAM là rào cản cứng. MộtLlama 3.3 70Bở Q4_K_M yêu cầu khoảng 40–43 GB chỉ riêng cho các trọng số. Nó đơn giản là không thể chứa vừa trên một card RTX 4090. Bạn có thể chuyển các lớp xử lý sang RAM hệ thống, nhưng tốc độ truyền tải sẽ giảm xuống còn khoảng 4–8 token mỗi giây, về mặt kỹ thuật thì vẫn hoạt động nhưng trải nghiệm sẽ giống như đang nói chuyện với một người rất chu đáo nhưng bị chấn thương đầu.

Macmini M4 Provới bộ nhớ hợp nhất 48 GB nằm ở một vị trí hoàn toàn khác. Băng thông bộ nhớ của nó là 273 GB/s, thấp hơn so với 1.008 GB/s của RTX 4090. Vì vậy, đối với bất kỳ mô hình nào phù hợp với cả hai máy, RTX 4090 nhanh hơn khoảng 3-4 lần về số token mỗi giây. Mac mini với 48 GB cho phép bạn xử lý khoảng 12-15 token mỗi giây trênmô hình 7B.Trênmô hình 13B,con số này chỉ khoảng 10-12 token mỗi giây. Như vậy là chậm hơn.
Nhưng.Mac minicó thể tải và chạymô hình 70Bở Q4 mà RTX 4090 đơn giản là không thể đáp ứng được. Đối với công việc kỹ thuật dữ liệu liên quan đến cửa sổ ngữ cảnh lớn, việc dán toàn bộ dự án dbt và yêu cầu phân tích, hoặc gỡ lỗi một dấu vết ngăn xếp PySpark dài, giới hạn 48 GB đó quan trọng hơn lợi thế về băng thông. Ở chếđộ 70B, Mac mini chạy khoảng 5-8 token mỗi giây. Nó không nhanh. Nhưng 8 token mỗi giây trênmô hình 70Bthường là câu trả lời tốt hơn so với 80 token mỗi giây trênmô hình 8Bkhông thể lưu trữ đủ ngữ cảnh để hiểu những gì bạn thực sự đang yêu cầu.
Thực ra, hãy để tôi nói rõ hơn một chút. Trên thực tế, việc xử lý ở cấp độ 70B trên Mac mini thông qua CPU offloading chậm hơn so với những con số được đưa ra, bởi vì chi phí xử lý ngữ cảnh tỷ lệ thuận với độ dài của dữ liệu đầu vào. Với một lời nhắc dài, bạn sẽ phải chờ. Câu hỏi đặt ra là liệu bạn có cần cấp độ70Bcho công việc xử lý dữ liệu hay không, và câu trả lời thẳng thắn là: thường thì không. Nhưng đôi khi thì có, và ở mức giá này, Mac mini là lựa chọn duy nhất trên một thiết bị duy nhất cho phép bạn truy cập vào cấp độ xử lý đó.

M4Max, có sẵn trong cấu hìnhMacBook ProvàMac Studio,đạt tốc độ 546 GB/giây và bộ nhớ hợp nhất lên đến 128 GB. Đây là một cỗ máy khác biệt đáng kể. Một chiếcQwen 3 14Bở Q4 chạy ở tốc độ 35-50 token mỗi giây. Mộtmẫu 30Bchạy ở tốc độ khoảng 25-30 token.Llama 3.3 70Bở Q4 vẫn còn dư khả năng và chạy ở tốc độ khoảng 20-25 token mỗi giây, thực sự đủ nhanh cho việc sử dụng tương tác nếu bạn kiên nhẫn với các thế hệ máy dài hơn.
Cấp độ 3: Card đồ họa đơn cao cấp (RTX 5090)
RTX5090với 32 GB GDDR7 ở tốc độ 1.792 GB/giây hiện là giới hạn hiệu năng cho suy luận dựa trên GPU đơn dành cho người tiêu dùng. Khoảng 200 token mỗi giây trên môhình 8B.Mô hình 30Bmật độ cao hơn có thể chứa và chạy ở tốc độ 60-90 token mỗi giây. Giới hạn 32 GB VRAM có nghĩa là bạn vẫn không thể đạt được cấp độ 70B nếu không sử dụng kỹ thuật offloading, nhưng mọi thứ ở dưới mức đó đều chạy với tốc độ thực sự tức thì.
Vấn đề nằm ở giá cả. Card đồ họaRTX 5090có giá từ 1.800 đô la trở lên chỉ riêng GPU, chưa kể đến hệ thống máy tính bạn xây dựng xung quanh nó. Đối với một kỹ sư dữ liệu sử dụng suy luận LLM cục bộ như một quy trình phát triển chứ không phải là một sản phẩm, tỷ lệ chi phí/lợi ích trở nên đáng ngờ. Một chiếcMacBook Pro M4 Maxvới bộ nhớ hợp nhất 36 GB hoặc 48 GB có giá tương đương, mang lại tính di động, chạy đượccác model 70Bvà không cần quản lý trình điều khiển.RTX 5090nhanh hơn cho mọi thứ phù hợp. Nhưng điều đó không thay đổi việc bạn có thể truy cập vào dòng máy nào so với cấu hình Mac 32 GB.
Các kỹ sư dữ liệu thực sự cần gì từ một trung tâm đào tạo luật địa phương (LLM)?
Trước khi chọn phần cứng, hãy thành thật về quy trình làm việc của bạn. Không phải tất cả các tác vụ kỹ thuật dữ liệu đều cần cùng một loại phần cứng, và khả năng chịu đựng độ trễ cũng khác nhau đáng kể.
- Tạo và lặp lại câu lệnh SQL.
Đây là điểm tối ưu cho các mô hình cục bộ nhỏ. MộtQwen 3 7BhoặcLlama 3.3 8Bcó thể tạo ra các câu lệnh SQL tốt dựa trên mô tả lược đồ và lặp lại trên đó. Cửa sổ ngữ cảnh phù hợp. Độ trễ ở mức 30-50 token mỗi giây là chấp nhận được. Bạn không thực hiện bất kỳ thao tác nào ở đây yêu cầu mô hình 70B, và tốc độ của một mô hình nhỏ có nghĩa là bạn nhận được phản hồi, chỉnh sửa lời nhắc và lặp lại nhanh hơn so với khi sử dụng một mô hình chậm hơn nhưng thông minh hơn.
- Gỡ lỗi đường dẫn xử lý dữ liệu.
Đây là lúc mà giới hạn bộ nhớ trở nên quan trọng hơn. Việc dán toàn bộ dấu vết ngăn xếp, định nghĩa DAG và ba nhật ký tác vụ sẽ tạo ra rất nhiều token. Về mặt kỹ thuật,mô hình 7Bvới ngữ cảnh 4K có thể xử lý được, nhưng bạn sẽ thấy nó bị mất mạch xử lý khi ngữ cảnh đầy. Đối với các phiêngỡ lỗi nghiêm túc, mô hình trongkhoảng 13B–27Bsẽ giữ ngữ cảnh tốt hơn, và sự khác biệt về chất lượng mô hình trong các tác vụ suy luận đa bước là có thật.Qwen 3.5–27Bở Q4 phù hợp với 18 GB VRAM và đạt 49,2% trên SWE-bench, mặc dù không phải là benchmark SQL, nhưng nó cho thấy mô hình có thể giữ được một chuỗi suy luận đa bước mạch lạc.
- Tạo tài liệu lược đồ và từ điển dữ liệu.
Các mô hình nhỏ hoạt động tốt ở đây. Đây chủ yếu là nhiệm vụ định dạng và diễn đạt lại. Ngay cả mộtmô hình 3Bvới lời nhắc được cấu trúc tốt cũng tạo ra kết quả hợp lý. Lý do duy nhất để sử dụng mô hình lớn hơn là nếu lược đồ của bạn cực kỳ phức tạp hoặc có các mối quan hệ ngữ nghĩa tinh tế mà bạn muốn mô hình hiểu được.
- Viết DAG và mã mẫu Airflow.
Nhiệm vụ ở mức độ trung bình.Mô hình 7B tạo ra mãAirflowđúng cú pháp với độ đều đặn hợp lý, nhưng đôi khi nó sẽ tạo ra các toán tử không tồn tại hoặc sai đường dẫn nhập khẩu.Mô hình 14B hoặc 27Bmắc ít lỗi hơn. Tỷ lệ lỗi của mô hình nhỏ hơn có thể chấp nhận được hay không phụ thuộc vào mức độ bạn sẵn sàng xem xét và sửa chữa.
- Suy luận về sự đánh đổi trong kiến trúc dữ liệu.
Đây là điểm mà các mô hình cục bộ nhỏ thực sự gặp khó khăn. Câu hỏi“Tôi nên sử dụngSCD loại 2hay phương pháp chụp nhanh với tần suất cập nhật và mô hình truy vấn tiếp theo này?”là loại câu hỏi đòi hỏi suy luận nhiều bước liên tục. Mộtmô hình 7Bsẽ đưa ra câu trả lời nghe có vẻ tự tin nhưng thường hời hợt. Mộtmô hình 70Bhoạt động tốt hơn đáng kể ở đây. Nếu đây là một phần quan trọng trong quy trình làm việc của bạn, thì việc truy cập 70B cục bộ hay chỉ sử dụng API đám mây đáng để xem xét lại.

Lưới lựa chọn mô hình
Với tất cả những điều đó, đây là bản đồ cụ thể:
▣Bộ nhớ VRAM 8 GB / Bộ nhớ hợp nhất 16 GB
Qwen 3 7Btại Q4_K_M hiện làmô hình mạnh nhất trong số các mô hình dưới 8B , đạt điểm HumanEval 76.0, cao hơn 3.4 điểm so vớiLlama 3.3 8B (72.6). Đối với công việc SQL và quản trị lược đồ, đây là lựa chọn hàng đầu.Llama 3.3 8Blà lựa chọn đa năng hơn nếu công việc của bạn đa dạng và bạn muốn có nhiều tùy chỉnh từ cộng đồng hơn.
▣16–24 GB VRAM
Qwen 3.5–27BhoặcDeepSeek-Coder V3Distilled ở mức Q4 là phạm vi cần xem xét. DeepSeek-Coder V3 Distilled đạt hiệu suất 40,5% trên SWE-bench Verified khi chạy trên 12 GB VRAM, một con số ấn tượng so với kích thước của nó. Đối với các tác vụ tính toán phức tạp, logic đường ống phức tạp, chuyển đổi dữ liệu thuật toán,DeepSeek V3.2vẫn dẫn đầu ở cấp độ trọng số mở.Qwen 3.5–27Blà điểm tối ưu cho GPU đơn cho các công việc dữ liệu nói chung.
▣Bộ nhớ hợp nhất 24–48 GB (Mac M4 Max / Mac Studio)
Qwen 3 14Bở mức Q4_K_M hoạt động với tốc độ 35–50 token mỗi giây và mang lại chất lượng gần bằng mức 27B đối với hầu hết các tác vụ kỹ thuật dữ liệu. Đối với hầu hết người dùng trong phạm vi phần cứng này, đây là lựa chọn hàng ngày. Hãy nâng cấp lên 30B nếu các tác vụ của bạn chủ yếu liên quan đến kiến trúc và nhiều bước.
▣48 GB trở lên / cấu hình cao cấp (M4 Max 128 GB, Mac Studio M4 Ultra, RTX 5090)
Llama 3.3 70Bở quý 4 trở nên khả thi. Đây thực sự là một cấp độ chất lượng khác biệt cho các tác vụ tính toán nặng. M4 Ultra có bộ nhớ hợp nhất 256 GB với tốc độ 819 GB/s,Llama 3.1 405Bhoạt động tốt ở quý 4 trên máy đó, đây thực sự là một cấu hình cục bộ có khả năng xử lý các tác vụ tiên tiến.
Một điều đáng lưu ý về các mô hình suy luận cụ thể: chế độ tư duy Qwen 3, phương pháp chưng cất DeepSeek R1 và các mô hình chuỗi suy nghĩ khác phát ra hơn 2000 token suy luận nội bộ trước khi bạn thấy từ đầu tiên của câu trả lời. Trên M5 Max với tốc độ 35 token mỗi giây, một mô hình suy luận 32B phát ra 2000 token suy nghĩ sẽ mất khoảng 63 giây trước khi kết quả hiển thị bắt đầu. Đó không phải là lỗi, mà là sự đánh đổi. Nếu bạn đang sử dụng các mô hình suy luận cục bộ cho các tác vụ phức tạp, hãy tính đến thời gian thực tế, chứ không chỉ thông số token mỗi giây.

Tính toán chi phí thực tế
Việc chạy các hệ thống LLM cục bộ không phải là miễn phí khi bạn tính đến chi phí phần cứng.
Nếu bạn đang sử dụng cấu hình 7B (RTX 4060 với giá khoảng 300 đô la hoặc MacBook M3/M4 hiện có ), chi phí phần cứng đã được khấu hao. Chi phí biên cho việc suy luận là bằng không. Với 50 truy vấn mỗi ngày, một con số hợp lý đối với một kỹ sư dữ liệu sử dụng hỗ trợ LLM cho SQL, đánh giá mã và tài liệu, bạn sẽ chi khoảng 15-25 đô la/tháng theo giá API của GPT-40 mini hoặc Claude Sonnet , hoặc có thể 3-8 đô la/tháng theo giá DeepSeek V3.2 (0,28 đô la đầu vào / 0,42 đô la đầu ra trên mỗi triệu token). Việc mua phần cứng chỉ để thay thế chi phí API đó không tự cân bằng về mặt kinh tế.
Lý do chính để sử dụng API cục bộ không chỉ nằm ở chi phí ở quy mô nhỏ. Đó còn là vấn đề bảo mật, độ trễ và khả năng truy cập ngoại tuyến. Các định nghĩa lược đồ của công ty bạn, cấu trúc bảng sản xuất, cấu hình đường dẫn xử lý dữ liệu — việc gửi chúng đến API của bên thứ ba sẽ tạo ra một bề mặt tuân thủ khác nhau tùy thuộc vào từng tổ chức. Suy luận cục bộ loại bỏ hoàn toàn bề mặt đó.
Cách tính chi phí sẽ thay đổi nếu bạn xử lý các lô dữ liệu lớn hơn. Nếu nhóm của bạn đang thực hiện kiểm tra chất lượng dữ liệu tự động dựa trên mô tả ngôn ngữ tự nhiên, hoặc chạy quá trình tạo tài liệu dựa trên LLM trên hàng trăm bảng, thì chi phí API trên mỗi token sẽ tăng tuyến tính và chi phí phần cứng cố định bắt đầu được bù đắp. Với 10 triệu token mỗi tháng, ngay cả DeepSeek V3.2 với mức giá điện toán đám mây cũng có giá từ 2.800 đến 4.200 đô la/tháng. Một card đồ họa RTX 4090 với giá 1.200 đô la sẽ được hoàn vốn trong vài tuần với khối lượng xử lý như vậy.
Đối với các kỹ sư dữ liệu cá nhân thực hiện công việc khám phá: việc tính toán phần cứng hiếm khi chỉ dựa trên chi phí API. Những lý do thực sự để chạy cục bộ là quyền riêng tư, tốc độ lặp lại và khả năng thử nghiệm mà không cần theo dõi mức sử dụng.

Tôi chưa tự mình kiểm tra hiệu năng của tất cả các cấu hình này. Tốc độ mã thông báo được trích dẫn ở đây dựa trên các kết quả kiểm tra hiệu năng đã được công bố từ tháng 4 đến tháng 5 năm 2026, được thử nghiệm trên phần cứng và lượng tử hóa cụ thể. Kết quả thực tế có thể khác nhau tùy thuộc vào độ dài ngữ cảnh(ngữ cảnh dài hơn = giải mã chậm hơn do chi phí bộ nhớ cache KV), biến thể mô hình (lệnh so với cơ sở), phiên bản Ollama, hệ điều hành và tải hệ thống.
Theo một nguồn, tốc độ xử lý tối đa của M4 Max cho thấyQwen 3 14Bđạt 35-50 token mỗi giây; một nguồn khác lại cho rằngcác mẫu 70Bđạt khoảng 70 token mỗi giây với chip đó. Phạm vi này khá rộng và phụ thuộc vào khối lượng công việc. Trước khi đưa ra bất kỳ quyết định mua phần cứng nào dựa trên tốc độ xử lý token mỗi giây mục tiêu, hãy chạy thửollama run llama3.2:3btrên máy tính thực tế của bạn và xem kết quả đạt được làm cơ sở. Sau đó, hãy ước tính sơ bộ: mộtmẫu 7Bchạy với tốc độ bằng khoảng một nửa so với mẫu 3B trên cùng phần cứng, và mộtmẫu 14Bchạy với tốc độ bằng khoảng một nửa so với mẫu 7B.
Card đồ họa AMD RX 7900 XTX với 24 GB VRAM là một lựa chọn hợp lý với mức giá thấp hơn so với RTX 4090, nhưng khả năng hỗ trợ phần mềm ROCm vẫn còn kém hơn so với CUDA đối với các công cụ mà các kỹ sư dữ liệu thường sử dụng. Tôi chưa thử nghiệm và không khuyến nghị nó là lựa chọn đầu tiên trừ khi bạn sử dụng hệ điều hành Linux và cảm thấy thoải mái với việc thiết lập phức tạp.
Quyết định thực tế
Nếu bạn đang lựa chọn phần cứng hiện nay dành riêng cho công việc xử lý dữ liệu LLM cục bộ, câu hỏi đặt ra là cấu hình nào trong ba cấu hình sau đây phù hợp với bạn:
⇨Bạn muốn tốc độ cao trên các mô hình phù hợp với 24 GB và bạn đã có PC: một cardRTX 4090với tốc độ 1.008 GB/s cung cấp 90–120 token mỗi giây trêncác mô hình 7B–14Bvà xử lý mượt mà cấp độ 27B. Không có sản phẩm nào trong tầm giá này sánh được với nó về hiệu năng đối với các mô hình phù hợp.
⇨Bạn muốn một hệ thống hoàn chỉnh với khả năng truy cập 70B và độ trễ thấp:Mac mini M4 Pro48 GB hoặcMac Studio M4 Maxcung cấp cho bạn khả năng truy cập 70B, không cần quản lý trình điều khiển và công suất tiêu thụ ở chế độ chờ chỉ 30W. Chậm hơn so với 4090 đối với tất cả các tác vụ tương thích với cả hai card. Mạnh mẽ hơn đối với các mẫu máy không tương thích.
⇨Bạn muốn thiết lập một thiết bị duy nhất tốt nhất hiện có: một chiếcMacBook Pro M4 Maxvới bộ nhớ hợp nhất 48 GB hoặc 64 GB, hoặc một chiếcMac Studio M4 Maxvới cấu hình tương tự, tốc độ 546 GB/s. Có tính di động, chạy hệ điều hành70B,và với tốc độ 35-50 token mỗi giây trênphiên bản 14B,nó thực sự đủ nhanh để độ trễ không còn là nút thắt cổ chai nữa mà chất lượng lời nhắc của bạn mới trở thành nút thắt cổ chai.
Sự chuyển đổi cuối cùng từ“Tôi đang chờ mô hình”sang“Tôi cần viết một câu hỏi gợi ý tốt hơn”có lẽ là bước đi đúng đắn cho công việc kỹ thuật dữ liệu hàng ngày.


Bài viết liên quan: