ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển

TPU (Bộ xử lý Tensor)

TPU là một con chip tùy chỉnh được Google phát triển dành riêng cho AI và học máy. Nó tăng tốc các hoạt động ma trận và đạt được thông lượng gấp vài đến hàng chục lần so với GPU.

TPU (Bộ xử lý Tensor) là ASIC (Mạch tích hợp dành riêng cho ứng dụng) được Google phát hành lần đầu tiên vào năm 2016 và được đặc trưng bởi một thiết kế được thiết kế đặc biệt cho việc suy luận và học tập mạng thần kinh. Không giống như các GPU đa năng, các hoạt động nhân ma trận được tối ưu hóa ở cấp độ mạch, khiến nó cực kỳ tiết kiệm chi phí cho việc đào tạo các mô hình tạo hình ảnh và LLM.

Trong hoạt động thực tế kể từ năm 2026, Google Cloud TPU v5p sẽ là sản phẩm chủ lực. Theo các điều kiện thị trường mà ban biên tập hiểu được từ hiện trường, TPU v5p (chip đơn) có giá khoảng 3 đến 5 USD mỗi giờ và có những trường hợp nó có thể cung cấp thông lượng gấp 2 đến 3 lần với chi phí gấp khoảng 0,6 đến 0,8 lần chi phí của GPU H100 cùng thế hệ. Tuy nhiên, điều đáng tiếc là khả năng hỗ trợ cho các khung không phải TensorFlow/JAX bị hạn chế và người dùng PyTorch sẽ phải chịu phí chuyển.

Có ba điểm cần cân nhắc khi lựa chọn. ① Nếu cơ sở mã hiện tại của bạn là JAX/TensorFlow, TPU là lựa chọn duy nhất của bạn. ②Nếu bạn chỉ sử dụng PyTorch, hãy sử dụng H100 mà không cần chuyển đổi. ③Hiệu suất chi phí của TPU trở nên nổi bật hơn đối với các ứng dụng suy luận hàng loạt (không theo thời gian thực). Các trường hợp sử dụng gián tiếp phần phụ trợ TPU thông qua Google Vertex AI và các dịch vụ được quản lý của Amazon Bedrock cũng sẽ tăng nhanh vào năm 2026.

Thuật ngữ liên quan