ReviewAI
Xếp hạngDanh mụcKhám pháTạp chíSo sánhMiễn phíTừ điển
📘Hướng dẫn03/04/2026· 29 phút đọc

Giá thì thầm của OpenAI | Phiên bản API 0,006 USD/phút, miễn phí cục bộ, mức giá thấp nhất Groq 0,04 USD/giờ so sánh đầy đủ [2026]

Whisper có ba tùy chọn: phiên bản API 0,006 USD/phút (0,36 USD mỗi giờ), chỉ thực thi cục bộ đối với điện và lưu trữ Groq 0,04 USD/giờ. big-v3-turbo có thể chạy miễn phí với 6GB VRAM. Bạn có thể đánh giá mọi thứ từ độ chính xác của tiếng Nhật, sự khác biệt về tốc độ giữa lời thì thầm nhanh hơn và lời thì thầm mlx cũng như lựa chọn kiểu máy bằng một công cụ này.

Các điểm chính (câu trả lời sẽ đọc sau 30 giây): Whisper có hai lựa chọn về giá. Nếu bạn sử dụng nó với API OpenAI, nó sẽ có giá khoảng 0,006 USD/phút mỗi phút (khoảng 0,36 USD mỗi giờ) và nếu bạn chạy phiên bản mã nguồn mở cục bộ trên PC của chính mình, nó sẽ miễn phí (chỉ tính tiền điện). Local là lựa chọn phù hợp nếu bạn muốn chạy nó với số lượng lớn và API là lựa chọn phù hợp nếu bạn muốn dùng thử trong một vài dòng.

Hộp thông tin Ban biên tập

lớn-v3, lớn-v3-turbo

Xác nhận lần cuối: Ngày 4 tháng 7 năm 2026 bởi ban biên tập

"Không phải Whisper miễn phí sao?" Chắc hẳn nhiều người sẽ bối rối khi nhìn vào bảng giá. Câu trả lời rất đơn giản. Nếu bạn sử dụng API, chi phí là 0,9 yên Nhật mỗi phút và nếu bạn sử dụng địa phương, chi phí là 0 yên Nhật.

Whisper là một mô hình nhận dạng giọng nói (phiên âm) nguồn mở do OpenAI xuất bản, hỗ trợ hơn 99 ngôn ngữ. Nó được phân phối theo giấy phép MIT, vì vậy bạn có thể sử dụng miễn phí nếu cài đặt nó trên PC. Mặt khác, API trả tiền khi bạn sử dụng cũng có sẵn cho những ai muốn dễ dàng vận hành nó mà không cần viết bất kỳ mã nào. Cấu trúc kép này là nguyên nhân khiến giá cả trở nên khó hiểu.

Biên bản cuộc họp, phụ đề video YouTube và bản ghi cuộc phỏng vấn. Phiên âm là một công việc mà ai cũng ít nhất một lần cảm thấy tẻ nhạt. OpenAI Whisper tiếp tục được sử dụng vào năm 2026 như một công cụ tiêu chuẩn giúp tự động hóa hầu hết những rắc rối này.

Tôi sẽ tổ chức nó từ góc độ giá cả. Tập trung vào Whisper (phiên bản mã nguồn mở/phiên bản API thì thầm-1), chúng tôi đã liệt kê phí API, điều kiện miễn phí tại địa phương, Groq và giá lưu trữ khác, lựa chọn mô hình, độ chính xác của Nhật Bản và so sánh với các đối thủ cạnh tranh (xác nhận lần cuối vào ngày 28-06-2026, xem tài liệu chính thức của OpenAI để biết thông số kỹ thuật mới nhất). OpenAI cũng đã phát hành mô hình STT phiên âm gpt-4o như một mô hình kế thừa cho thì thầm-1 và giá cả cũng đang được tích hợp vào mô hình đó. Con số cụ thể sẽ đưa ra sau.

Các điểm chính của bài viết này So sánh giá của Whisper trên ba trục: trả tiền theo mức sử dụng cho phiên bản API, miễn phí cục bộ cho phiên bản mã nguồn mở và dịch vụ lưu trữ như Groq. Chúng tôi sẽ tóm tắt mọi thứ từ góc độ định giá, bao gồm lựa chọn mô hình, sự khác biệt giữa thì thầm nhanh hơn và thì thầm.cpp cũng như xác minh độ chính xác của tiếng Nhật.

Những điểm chính của bài viết này

  • Whisper là gì và tại sao nó là AI phiên mã tiêu chuẩn?
  • Giá và mức sử dụng phiên bản API (có mã Python)
  • Điều kiện để thực thi cục bộ là “miễn phí” và yêu cầu về GPU
  • So sánh giá của các công ty lưu trữ như Groq và Azure
  • Cách chọn model từ nhỏ đến lớn-v3-turbo
  • So sánh tốc độ với Whisper nhanh hơn, thì thầm.cpp, mlx-thì thầm
  • Độ chính xác của phiên âm tiếng Nhật và những điểm cần lưu ý

Kết luận sau 30 giây

Nếu bạn lựa chọn dựa trên giá cả, quyết định của bạn chủ yếu sẽ phụ thuộc vào mục đích sử dụng.

  • Những người muốn sử dụng nó một cách dễ dàng → API OpenAI (thì thầm-1, 0,006 USD/phút) thật dễ dàng. Bạn có thể kiểm tra hoạt động bằng một mã Python ngắn
  • Những người muốn giảm chi phí → Chạy cục bộ turbo lớn v3 (miễn phí). Thoải mái với GPU 6GB trở lên
  • Người dùng Mac → mlx-whisper là nhanh nhất. Tối ưu hóa cho Apple Silicon, siêu nhanh và miễn phí
  • Yêu cầu độ chính xác cao nhất → Chạy cục bộ big-v3 (yêu cầu 10GB VRAM)

Nếu bạn muốn chạy một lượng lớn dữ liệu với mức giá thấp, Groq hosting là lựa chọn tốt nhất. 0,04 USD/giờ đối với turbo-v3 lớn (kể từ ngày 28 tháng 06 năm 2026 groq.com). Tuy nhiên, tình hình lại khác với phiên âm thời gian thực. Phiên bản Whisper mã nguồn mở/API thì thầm-1 phù hợp để xử lý hàng loạt, vì vậy hệ thống phiên âm gpt-4o, API thời gian thực, Deepgram và Google STT của OpenAI là những ứng cử viên.

Vậy sự chênh lệch giá này đến từ đâu? Chúng ta hãy nhìn vào chúng theo thứ tự.

Tôi cũng muốn đọc nó

TypingMind là gì? Giá và các tùy chọn lựa chọn bắt đầu từ $39 (phiên bản 2026)

TypingMind là màn hình trò chuyện một lần, nơi bạn có thể sử dụng nhiều AI bằng khóa API của riêng mình. Chúng tôi đã sắp xếp các nội dung của Tiêu chuẩn $39, Mở rộng $79 và Cao cấp $99, phiên bản Nhóm bắt đầu từ $83 mỗi tháng, nơi lưu dữ liệu và mức độ bạn có thể sử dụng miễn phí bằng cách sử dụng thông tin chính thức kể từ tháng 8 năm 2026.

Ngày 7 tháng 8 năm 2026

14 bài toán và giải pháp triển khai AI trong các công ty xây dựng và ngành xây dựng

Phải mất nửa ngày để tạo ước tính và bạn có thể thu thập 20 báo cáo hàng ngày. Chúng tôi đã sắp xếp 14 vấn đề gặp phải khi giới thiệu AI trong ngành xây dựng dưới dạng Hỏi đáp. Hầu hết các nguyên nhân không nằm ở hiệu suất của AI mà nằm ở cách nó được phân phối. Nó bao gồm bản tóm tắt chi tiết về báo cáo hàng ngày, cách bắt đầu sau một tuần, chi phí khoảng 3.000 yên Nhật mỗi tháng và những điểm cần lưu ý về trợ cấp.

Ngày 7 tháng 8 năm 2026

Lời thì thầm là gì? Tại sao nó miễn phí?

OpenAI Whisper là một mô hình nhận dạng giọng nói đa năng được OpenAI phát hành dưới dạng nguồn mở vào tháng 9 năm 2022. Được đào tạo với hơn 680.000 giờ dữ liệu âm thanh trên web. Các đặc điểm có thể được tóm tắt thành ba điều sau đây.

  • Hỗ trợ hơn 99 ngôn ngữ (bao gồm cả tiếng Nhật)
  • Hỗ trợ hai tác vụ: phiên âm và dịch sang tiếng Anh
  • Được phát hành theo giấy phép MIT, chạy miễn phí cục bộ và có sẵn cho mục đích thương mại

Lý do nó miễn phí sử dụng rất đơn giản. OpenAI cung cấp công khai toàn bộ trọng lượng mô hình (dữ liệu đã đào tạo) theo giấy phép MIT, vì vậy bất kỳ ai cũng có thể tải xuống và chạy trên máy của riêng họ. Vì vậy, không có phí cho việc thực hiện tại địa phương. Chi phí duy nhất là tiền điện và khoản đầu tư ban đầu cho GPU.

Mặt khác, API OpenAI cũng có thể được sử dụng làm mô hình thì thầm-1 và bạn sẽ chỉ bị tính phí cho những gì bạn sử dụng (các khoản phí sẽ được mô tả sau, việc sử dụng API tuân theo Điều khoản sử dụng và Chính sách dữ liệu của OpenAI, kể từ ngày 28 tháng 6 năm 2026).

Tính đến năm 2026, các mẫu mới nhất là big-v3 (phát hành vào tháng 11 năm 2023) và phiên bản nhanh hơn big-v3-turbo (phát hành vào tháng 10 năm 2024).

Kiến trúc thì thầm

Whisper là một mô hình Transformer loại mã hóa-giải mã. Âm thanh được chuyển đổi thành biểu đồ phổ mel (biểu diễn tần số âm thanh giống như hình ảnh), bộ mã hóa trích xuất các đặc điểm và bộ giải mã tạo ra văn bản.

Quy trình xử lý như sau.

Tệp âm thanh → Biểu đồ phổ Mel (128bin) → Bộ mã hóa máy biến áp → Bộ giải mã máy biến áp → Xuất văn bản

Thiết kế này cho phép độ chính xác tương đối cao ngay cả trong môi trường ồn ào.

Các loại mô hình và cách chọn

Whisper có nhiều kích cỡ model tùy thuộc vào ứng dụng. Kích thước lớn hơn sẽ tăng độ chính xác nhưng cũng đòi hỏi nhiều bộ nhớ và thời gian xử lý hơn. Đây là lựa chọn liên quan trực tiếp đến giá cả (hóa đơn tiền điện nếu là địa phương, hóa đơn nếu là API).

Danh sách mẫu xe (tính đến tháng 4 năm 2026)

Bảng dưới đây liệt kê kích thước và thông số kỹ thuật yêu cầu của từng model.

người mẫuSố lượng tham sốVRAM bắt buộctốc độ tương đốiTIẾNG ANH WERKhuyến nghị sử dụng
nhỏ xíu39M~1GB32xCaonguyên mẫu thử nghiệm
căn cứ74M~1GB16xvừa phảiphiên âm nhẹ
bé nhỏ244M~2GB6xvừa phảiLoại cân bằng
trung bình769 triệu~5GB2xThấpNhững cảnh yêu cầu độ chính xác cao
lớn-v21,55B~10GB1x7,6%Độ chính xác cao (phiên bản cũ)
lớn-v31,55B~10GB1x7,4%độ chính xác cao nhất
lớn-v3-turbo809M~6GB6x7,75%Sự cân bằng tốt nhất giữa tốc độ và độ chính xác

Nói cách khác, big-v3-turbo là giải pháp tốt nhất trong nhiều trường hợp. Mặc dù chênh lệch độ chính xác chỉ 1-2% so với big-v3 nhưng nó chạy nhanh hơn 6 lần. VRAM cũng đã được giảm từ 10GB xuống 6GB, do đó nó có thể chạy ngay cả với GPU tầm trung.

Độ chính xác phiên âm tiếng Nhật của Whisper có ở mức thực tế không?

Âm thanh rõ ràng ở mức thực tế. Tuy nhiên nó kém hơn một chút so với tiếng Anh. Có ba điều cần ghi nhớ:

  • Độ chính xác nhận dạng của danh từ riêng (tên người, tên địa danh, tên công ty) có thể thấp.
  • Có trường hợp thuật ngữ kỹ thuật (điều khoản pháp lý, điều khoản bất động sản…) được chuyển đổi không chính xác.
  • Việc xác định từ đồng âm phụ thuộc vào ngữ cảnh và không chính xác 100%.

Trong một thử nghiệm, CER (tỷ lệ lỗi ký tự) đối với lời nói qua điện thoại của người Nhật là khoảng 4-5%. Nó có thể được sử dụng cho các cuộc trò chuyện và phỏng vấn chung. Tuy nhiên, trong các lĩnh vực chuyên ngành như y học, luật, bất động sản, việc hiệu đính sau khi chết là điều kiện tiên quyết.

Ngoài ra còn có các thủ thuật để cải thiện độ chính xác. Độ chính xác của chuyển đổi có thể được cải thiện bằng cách chuyển danh sách các danh từ riêng tới tham số init_prompt trong phiên bản mã nguồn mở cục bộ (openai-whisper) và tham số nhắc trong API OpenAI (thì thầm-1) (lưu ý rằng tên tham số khác nhau; xem tài liệu chính thức để biết chi tiết).

result = model.transcribe(
    "audio.mp3",
    language="ja",
    initial_prompt="以下は不動産に関する会話です。礼金、敷金、築年数、内見などの用語が登場します。"
)

Whisper giá bao nhiêu? Cách sử dụng phiên bản API và giá cả

Đây là chủ đề chính. Whisper có hai tùy chọn giá: API trả tiền khi bạn sử dụng và miễn phí tại địa phương. Đầu tiên, hãy xem phiên bản API dễ dàng.

Phí API (mô hình thì thầm-1)

Giá của OpenAI Whisper API (whisper-1) đã được cố định ở mức 0,006 USD/phút trong một thời gian dài (xác nhận lần cuối vào ngày 28/06/2026, xem bảng giá chính thức để biết thông tin mới nhất). Một giờ nghe âm thanh có giá khoảng 0,36 USD, tương đương khoảng 54 yên Nhật bằng yên Nhật Nhật.

mụcNội dung
người mẫuthì thầm-1 (dựa trên v2 lớn)
Phí0,006 USD/phút (làm tròn đến giây gần nhất, giới hạn ở mức thì thầm-1)
mỗi giờKhoảng $0,36 (khoảng 54 yên Nhật)
Giới hạn tập tin25MB
Các định dạng tương thíchmp3, mp4, mpeg, mpga, m4a, wav, webm

Nói cách khác, nếu bạn muốn chép lại hàng chục giờ thì chỉ tốn vài trăm yên Nhật. Xem xét lượng thời gian cần thiết để viết mã, đó là một món hời.

Tuy nhiên, kể từ năm 2026, cơ cấu phí đang chuyển động lặng lẽ. Whisper-1 đã biến mất khỏi bảng giá hiện tại và đang được tích hợp vào phiên bản kế nhiệm gpt-4o-transcribe / gpt-4o-mini-transcribe. Theo quan chức của OpenAI (developers.openai.com, xác nhận ngày 28-06-2026), giá của mô hình nhận dạng giọng nói hiện tại như sau.

người mẫuTỷ lệ/phútmỗi giờđịnh vị
thì thầm-10,006 USDKhoảng 0,36 USDMô hình thông thường (duy trì khả năng tương thích)
gpt-4o-tán âm0,006 USDKhoảng 0,36 USDNgười kế nhiệm/độ chính xác cao
gpt-4o-mini-tán âm0,003 USDKhoảng 0,18 USDNhẹ/rẻ nhất

Nói cách khác, nếu bạn muốn làm điều đó với giá rẻ, gpt-4o-mini-transcribe có giá chỉ bằng một nửa ở mức 0,003 USD/phút. Hãy nhớ kiểm tra bảng giá chính thức và tài liệu tham khảo API để biết giá, các hạn chế và lựa chọn kiểu máy mới nhất.

Các bước để lấy khóa API

Trước khi sử dụng phiên bản API, bạn sẽ cần được cấp một khóa và gửi một khoản tiền nhỏ. Quy trình gồm 4 bước.

  1. Truy cập nền tảng OpenAI
  2. Tạo một tài khoản (hoặc đăng nhập)
  3. Tạo khóa từ "Khóa API" trên menu bên trái
  4. Gửi tối thiểu $5 trong cài đặt Thanh toán (nên tắt tính phí tự động)

Triển khai bằng Python (SDK chính thức)

Quá trình cài đặt hoàn tất với một pip.

pip install openai

Đây là mã cơ bản để phiên âm.

from openai import OpenAI
client = OpenAI(api_key="sk-...")

# 文字起こし(Transcription)
with open("meeting.mp3", "rb") as audio_file:
    transcript = client.audio.transcriptions.create(
        model="whisper-1",
        file=audio_file,
        language="ja",  # 日本語を指定(省略で自動検出)
        response_format="verbose_json",  # タイムスタンプ付き
    )

print(transcript.text)

Bản dịch sang tiếng Anh cũng có thể được gọi mà không cần thay đổi mô hình.

# 英語への翻訳(Translation)
with open("japanese_audio.mp3", "rb") as audio_file:
    translation = client.audio.translations.create(
        model="whisper-1",
        file=audio_file,
    )

print(translation.text)

Xử lý file lớn hơn 25MB

Giới hạn kích thước tệp API là 25MB. Vì âm thanh hội nghị kéo dài một giờ vượt quá giới hạn này nên âm thanh dài sẽ được phân chia bằng pydub trước khi gửi.

from pydub import AudioSegment
audio = AudioSegment.from_file("long_meeting.mp3")
chunk_length_ms = 10 * 60 * 1000  # 10分ごとに分割

chunks = [audio[i:i+chunk_length_ms] for i in range(0, len(audio), chunk_length_ms)]

full_text = ""
for i, chunk in enumerate(chunks):
    chunk.export(f"/tmp/chunk_{i}.mp3", format="mp3")
    with open(f"/tmp/chunk_{i}.mp3", "rb") as f:
        result = client.audio.transcriptions.create(
            model="whisper-1",
            file=f,
            language="ja",
        )
    full_text += result.text + "\n"

print(full_text)

Bây giờ chúng ta đã biết phí API, chúng ta có thể chuyển sang thực thi cục bộ với mức phí có thể giảm xuống 0 yên Nhật.

Whisper có được sử dụng miễn phí không? Cách bắt đầu thực thi cục bộ (phiên bản mã nguồn mở)

Nó miễn phí để sử dụng. Nếu bạn chạy nó tại địa phương, phí hoàn toàn là 0 yên Nhật. Hơn nữa, vì dữ liệu không được gửi đến máy chủ của OpenAI nên nó an toàn từ góc độ quyền riêng tư. Đối với những người phiên âm hàng chục giờ mỗi tháng thì đây là khoản tiết kiệm lớn nhất.

Chỉ có một điều kiện miễn phí. Cần có GPU để chạy các mô hình lớn một cách thoải mái. Tiny/base có thể chạy mà không cần GPU, nhưng nếu bạn muốn đạt được tốc độ thực tế, GPU NVIDIA (6GB VRAM trở lên) hoặc máy Mac có Apple Silicon sẽ thực tế hơn.

Điều kiện tiên quyết

  • Python 3.9-3.12
  • FFmpeg (cần thiết để xử lý âm thanh)
  • GPU được đề xuất (GPU NVIDIA + CUDA hoặc Apple Silicon)

Hướng dẫn cài đặt

Chỉ cần cài đặt FFmpeg và Whisper và bạn đã sẵn sàng.

# 1. FFmpegをインストール
# macOS
brew install ffmpeg

# Ubuntu/Debian
sudo apt update && sudo apt install ffmpeg

# Windows(Chocolatey)
choco install ffmpeg

# 2. Whisperをインストール
pip install openai-whisper

Cách sử dụng cơ bản

Tải và chạy mô hình từ Python.

import whisper

# モデルの読み込み(初回はダウンロードが入る)
model = whisper.load_model("large-v3-turbo")

# 文字起こし
result = model.transcribe(
    "meeting.mp3",
    language="ja",
    fp16=False,  # CPU実行時はFalseにする
)

print(result["text"])

# セグメントごとのタイムスタンプも取得可能
for segment in result["segments"]:
    print(f"[{segment['start']:.1f}s - {segment['end']:.1f}s] {segment['text']}")

Sử dụng dòng lệnh

Bạn cũng có thể chạy nó trực tiếp từ thiết bị đầu cuối mà không cần viết bất kỳ mã nào.

# 基本
whisper audio.mp3 --language ja --model large-v3-turbo

# SRT字幕ファイルを出力
whisper audio.mp3 --language ja --model large-v3-turbo --output_format srt

# 複数ファイルを一括処理
whisper *.mp3 --language ja --model medium --output_dir ./transcripts/
Tóm tắt cho đến nay: Có hai tùy chọn để định giá Whisper: API trả tiền khi bạn sử dụng ($0,006/phút cho lời thì thầm-1) hoặc miễn phí tại địa phương (chỉ hóa đơn tiền điện). Nếu sự tiện lợi là ưu tiên hàng đầu của bạn, hãy chọn API và nếu chi phí là ưu tiên hàng đầu của bạn, hãy chọn địa phương. Bây giờ chúng ta sẽ xem xét cách triển khai giúp địa phương nhanh hơn nữa.

So sánh công cụ tăng tốc: quick-whisper/whisper.cpp/mlx-whisper

Mặc dù Whisper chính thức có độ chính xác cao nhưng lại gặp vấn đề về tốc độ suy luận. Việc triển khai của bên thứ ba sau đây nhanh hơn nhiều với cùng một mô hình và cùng mức phí miễn phí. Tất cả giá đều là 0 yên Nhật, vì vậy hãy chọn dựa trên tốc độ.

Bảng so sánh

Nếu liệt kê các đề xuất theo môi trường thì sự lựa chọn của bạn chủ yếu sẽ phụ thuộc vào loại máy bạn đang sử dụng.

thực hiệnngôn ngữcải thiện tốc độĐặc trưngMôi trường được đề xuất
openai-thì thầm (chính thức)Python1x (tiêu chuẩn)chính thức, ổn địnhMáy được trang bị GPU
thì thầm nhanh hơnPythonlên đến 4xDựa trên CTranslate2, tiết kiệm bộ nhớGPU CUDA
thì thầm.cppC++2-3 lầnCPU được tối ưu hóa cho biênMôi trường CPU/nhúng
mlx-thì thầmPython2x thì thầm.cppTối ưu hóa Apple SiliconMac (M1/M2/M3/M4)

Nói cách khác, thì thầm nhanh hơn là tiêu chuẩn cho GPU NVIDIA, mlx-whisper cho Mac và thì thầm.cpp nếu bạn chỉ có CPU.

Cách sử dụng lời thì thầm nhanh hơn

Nếu bạn có một máy có GPU CUDA thì đây là cách tốt nhất.

pip install faster-whisper
from faster_whisper import WhisperModel
# large-v3-turboモデルをGPUで実行(float16)
model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")

# CPU実行の場合
# model = WhisperModel("large-v3-turbo", device="cpu", compute_type="int8")

segments, info = model.transcribe("meeting.mp3", language="ja", beam_size=5)

print(f"検出言語: {info.language} (確率: {info.language_probability:.2f})")
for segment in segments:
    print(f"[{segment.start:.1f}s - {segment.end:.1f}s] {segment.text}")

thì thầm nhanh hơn sử dụng khoảng một nửa bộ nhớ của phiên bản chính thức. Có thể chạy các model lớn hơn với cùng GPU khá hiệu quả.

Cách sử dụng mlx-whisper (chỉ dành cho máy Mac)

Nếu bạn có máy Mac có Apple Silicon, mlx-whisper cực kỳ nhanh.

pip install mlx-whisper

Nó có thể được gọi từ dòng lệnh hoặc từ Python.

# コマンドラインで実行
mlx_whisper --model mlx-community/whisper-large-v3-turbo audio.mp3
import mlx_whisper

result = mlx_whisper.transcribe(
    "meeting.mp3",
    path_or_hf_repo="mlx-community/whisper-large-v3-turbo",
)
print(result["text"])

Trong điểm chuẩn tháng 1 năm 2026, mlx-whisper nhanh hơn 2,03 lần so với thì thầm.cpp. M4 Mac mini có thể xử lý một giờ âm thanh trong vài phút. Hơn nữa, phí là 0 yên Nhật.

Cách sử dụng thì thầm.cpp

Thì thầm.cpp được tối ưu hóa cho CPU phù hợp với môi trường không có GPU hoặc các thiết bị biên như Raspberry Pi.

# ビルド
git clone https://github.com/ggerganov/whisper.cpp.git
cd whisper.cpp
cmake -B build && cmake --build build --config Release

# モデルのダウンロード
bash models/download-ggml-model.sh large-v3-turbo

# 実行(WAV形式に変換してから)
ffmpeg -i meeting.mp3 -ar 16000 -ac 1 -c:a pcm_s16le meeting.wav
./build/bin/whisper-cli -m models/ggml-large-v3-turbo.bin -l ja -f meeting.wav

Bây giờ chúng ta đã biết cả API địa phương và API, chúng ta sẽ so sánh giá của các "công ty cung cấp dịch vụ lưu trữ" nằm giữa hai loại này.

So sánh giá thì thầm giữa Groq và các công ty hosting

"Tôi không có GPU cục bộ nhưng tôi muốn sử dụng nó dễ dàng và rẻ như API." Đối với những người đó, có một lựa chọn thứ ba: các công ty cung cấp dịch vụ lưu trữ. Phiên bản mã nguồn mở của Whisper chạy trên cơ sở hạ tầng của mỗi công ty và có thể được sử dụng thông qua API.

Trong số đó, Groq là một trường hợp đặc biệt. Theo thông tin chính thức của Groq (groq.com/pricing, xác nhận ngày 28-06-2026), giá của dòng Whisper như sau.

lời đề nghịngười mẫuPhí/giờChuyển đổi (/ phút)thời gian thực
API OpenAIthì thầm-10,36 USD0,006 USD
API OpenAIgpt-4o-mini-tán âm0,18 USD0,003 USD
Groqthì thầm0,02 USD0,00033 USD
Groqlớn-v3-turbo0,04 USD0,00067 USD
Groqlớn-v30,111 USD0,00185 USD
Thì thầm địa phươnglớn-v3-turbomiễn phí$0

Nói cách khác, nếu bạn muốn cắt giảm chi phí lưu trữ, Groq là lựa chọn của bạn. 0,04 USD/giờ đối với big-v3-turbo thấp hơn khoảng 9 lần so với API OpenAI ($0,36/giờ). Xin lưu ý rằng tất cả các mẫu ASR đều có "mức phí tối thiểu 10 giây cho mỗi yêu cầu" (chính thức của Groq).

Azure và Google Cloud cũng cung cấp STT tương đương với Whisper. Tuy nhiên, cấu trúc giá thay đổi theo từng phút và giá bao gồm các tính năng dành cho doanh nghiệp (SLA và hỗ trợ tại chỗ). Chúng được liệt kê cùng nhau trong bảng so sánh cạnh tranh dưới đây.

So sánh với các dịch vụ cạnh tranh

Bảng so sánh phí, tốc độ và độ chính xác

Đây là danh sách các dịch vụ STT chính ngoài Whisper về giá cả và chức năng.

dịch vụTỷ lệ/phútChi phí 1.000 giờ mỗi thángtốc độHỗ trợ tiếng Nhậtthời gian thực
API thì thầm OpenAI0,006 USD$3601x
Deepgram Nova-30,0043 USD$25830 lần
Google Cloud STT v20,016 USD$9605x
Phiên âm AWS0,024 USD$1,4402x
Người ghi chép ElevenLabs0,006 USD$360tốc độ cao
Thì thầm địa phươngmiễn phí$0phụ thuộc vào GPU

Đó là điều hiển nhiên khi bạn nhìn vào những con số. Nếu bạn dành 1.000 giờ mỗi tháng thì $0 cho việc thực thi cục bộ là quá nhiều. Nếu bạn muốn sự tiện lợi của đám mây, Deepgram có giá rẻ.

chọn cái nào

Nếu bạn sắp xếp mọi thứ theo mục đích, hầu hết sự nhầm lẫn sẽ biến mất.

Chi phí là tối quan trọng → Chạy Whisper cục bộ (miễn phí) hoặc sử dụng Groq để lưu trữ (large-v3-turbo 0,04 USD/giờ)

Tập trung vào tính đơn giản của API → API OpenAI Whisper. Hoạt động với 5 dòng mã

Phiên âm thời gian thực → Deepgram hoặc Google Cloud STT. Whisper chỉ dành cho xử lý hàng loạt

Độ chính xác của thuật ngữ tiếng Nhật → Google Cloud STT mạnh về địa chỉ và danh từ riêng. Cũng hỗ trợ từ điển tùy chỉnh

Bảo mật doanh nghiệp → Dịch vụ giọng nói Azure. Mô hình tùy chỉnh/hỗ trợ tại chỗ có sẵn

Đối với những người không muốn viết mã và muốn có những công cụ có thể sử dụng ngay lập tức, việc tìm kiếm công cụ là cách nhanh hơn. Nhiều người trong số họ sử dụng Whisper làm công cụ nội bộ, vì vậy nếu lần đầu tiên so sánh các công cụ phiên âm AI, bạn có thể nhanh chóng thu hẹp các tùy chọn của mình. Nếu bạn đang tìm kiếm các tùy chọn miễn phí, chúng tôi khuyên dùng công cụ phiên âm miễn phí, nếu bạn đang tìm kiếm cuộc họp, chúng tôi khuyên dùng công cụ ghi phút AI và nếu bạn đang tìm kiếm tiếng Nhật, chúng tôi khuyên dùng Hướng dẫn hoàn chỉnh bằng giọng nói Rimo. Bạn có thể tìm kiếm tất cả các công cụ liên quan đến giọng nói từ danh mục ai-voice.

Trường hợp sử dụng thực tế

1. Lập biên bản cuộc họp

Đây là ví dụ về việc tự động bỏ qua các phần im lặng và ghi lại chúng trong phút Markdown.

from faster_whisper import WhisperModel
model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")
segments, info = model.transcribe(
    "meeting_2026-04-03.mp3",
    language="ja",
    beam_size=5,
    vad_filter=True,  # 無音区間を自動スキップ
    vad_parameters=dict(min_silence_duration_ms=500),
)

# Markdown形式で出力
with open("minutes.md", "w") as f:
    f.write("# 議事録\n\n")
    for seg in segments:
        minutes = int(seg.start // 60)
        seconds = int(seg.start % 60)
        f.write(f"<strong>[{minutes:02d}:{seconds:02d}]</strong> {seg.text}\n\n")

2. Tạo phụ đề cho video YouTube (định dạng SRT)

Đây là 2 lệnh trích xuất âm thanh bằng yt-dlp và chuyển thành phụ đề bằng Whisper.

# yt-dlpで音声をダウンロード
yt-dlp -x --audio-format mp3 "https://www.youtube.com/watch?v=XXXXX" -o audio.mp3

# Whisperで字幕生成
whisper audio.mp3 --language ja --model large-v3-turbo --output_format srt

3. Phiên âm và tóm tắt podcast

Đây là ví dụ về việc kết nối mọi thứ từ phiên âm đến tóm tắt ChatGPT cùng một lúc.

from faster_whisper import WhisperModel
from openai import OpenAI
# Step 1: 文字起こし
whisper_model = WhisperModel("large-v3-turbo", device="cuda", compute_type="float16")
segments, _ = whisper_model.transcribe("podcast.mp3", language="ja")
full_text = " ".join([seg.text for seg in segments])

# Step 2: ChatGPTで要約
client = OpenAI()
summary = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[
        {"role": "system", "content": "以下のPodcast文字起こしを、要点を箇条書きで要約してください。"},
        {"role": "user", "content": full_text}
    ]
)
print(summary.choices[0].message.content)

Đánh giá biên tập

AI phiên âm được đánh giá khác nhau dựa trên "độ chính xác", "chi phí" và "dễ triển khai". Chúng tôi đã tiến hành đánh giá thẳng thắn dựa trên thông tin công khai, tập trung vào Whisper.

So sánh và tổ chức từ thông tin công cộng

Đây là cách triển khai chính được sắp xếp theo giá cả, môi trường và sự phù hợp.

mụcAPI OpenAI (Thì thầm)cục bộ lớn-v3thì thầm nhanh hơnmlx-thì thầm
Phí0,006 USD/phútchỉ hóa đơn tiền điệnchỉ hóa đơn tiền điệnchỉ hóa đơn tiền điện
Môi trường thực thiđám mâyNguyên tắc GPU 10GBTương thích với cả GPU/CPUChỉ dành cho Apple Silicon
Hỗ trợ tiếng Nhật◯ (Độ chính xác cao nhất)
sử dụng thương mạiTuân thủ Điều khoản dịch vụ của OpenAIgiấy phép MITgiấy phép MITgiấy phép MIT
trường hợp phải đối mặtNguyên mẫu/quy mô nhỏDữ liệu bí mật/độ chính xác caoHoạt động sản xuất máy chủMac địa phương

*Giá cả và thông số kỹ thuật là thông tin công khai kể từ ngày 28 tháng 06 năm 2026. Vui lòng tham khảo từng tài liệu chính thức để biết thông tin mới nhất.

Nhận định toàn diện của ban biên tập

Đánh giá trung thực dựa trên thông tin công khai.

  • API OpenAI: Một lựa chọn tốt cho các cá nhân và nhóm nhỏ muốn dùng thử trước. Nếu nó có giá khoảng 54 yên Nhật cho một vài dòng mã/1 giờ thì không còn chỗ để xem xét.
  • Lưu trữ Groq: Không thể đánh bại nếu bạn muốn chạy số lượng lớn với mức giá thấp. Large-v3-turbo có giá 0,04 USD/giờ, bằng khoảng 1/9 API OpenAI và có hiệu quả hợp lý.
  • Whisper nhanh hơn (cục bộ): Hữu ích cho các công ty xử lý âm thanh nhạy cảm. Không có dữ liệu nào được gửi lên đám mây và chi phí nằm trong hóa đơn tiền điện.
  • mlx-whisper: Tốc độ xử lý vượt trội dành cho người dùng Mac. Hoàn toàn cục bộ và miễn phí, hoàn hảo để tạo phụ đề và phút
  • Thành thật mà nói, nó không tốt: Tiêu chuẩn không hỗ trợ tách loa hoặc thời gian thực. Nếu bạn cần điều này, Deepgram/Google STT sẽ tốt hơn

Các câu hỏi thường gặp (FAQ)

H. Whisper có hoàn toàn miễn phí sử dụng không?

Nó hoàn toàn miễn phí nếu bạn chạy nó cục bộ. Vì nó là nguồn mở (giấy phép MIT) nên không có vấn đề gì khi sử dụng cho mục đích thương mại. Khi sử dụng API, sẽ có khoản phí trả theo mức sử dụng là 0,006 USD/phút (khoảng 0,9 yên Nhật/phút) (kể từ ngày 28 tháng 6 năm 2026).

H. Cách tốt nhất để giữ chi phí Whisper ở mức thấp nhất là gì?

Nếu bạn có GPU của riêng mình, mức giá thấp nhất là 0 yên Nhật cho việc thực thi cục bộ. Nếu bạn không có GPU, dịch vụ lưu trữ Groq ($0,04/giờ trên big-v3-turbo, kể từ ngày 28 tháng 06 năm 2026 groq.com) chỉ bằng khoảng 1/9 API OpenAI ($0,36/giờ), cho phép bạn đạt được cả tính dễ sử dụng của API và chi phí thấp.

Câu hỏi: Giá giữa thì thầm-1 và gpt-4o-transcribe có khác nhau không?

Theo quan chức của OpenAI (được xác nhận vào ngày 28-06-2026), cả thì thầm-1 và gpt-4o-transcribe đều có giá 0,006 USD/phút. Gpt-4o-mini-transcribe nhẹ hơn thậm chí còn có giá chỉ bằng một nửa ở mức 0,003 USD/phút. Kiểm tra bảng giá chính thức để biết giá mới nhất.

H. Whisper có thể hoạt động mà không cần GPU không?

Nó di chuyển. Tuy nhiên, nếu bạn sử dụng CPU thì tốc độ xử lý sẽ chậm hơn đáng kể. CPU rất thiết thực cho các mẫu máy nhỏ và cơ bản, nhưng GPU được khuyên dùng cho các mẫu máy lớn. Máy Mac có Apple Silicon sẽ chạy nhanh hơn với mlx-whisper.

H. Whisper có hỗ trợ nhận dạng giọng nói theo thời gian thực không?

Standard Whisper chỉ dùng để xử lý hàng loạt (xử lý các tập tin đã ghi). Nếu bạn cần chép lời theo thời gian thực, hãy sử dụng thư viện trình bao bọc như WhisperLive hoặc thì thầm_streaming hoặc xem xét API thời gian thực của OpenAI, Deepgram hoặc Google Cloud STT.

Q. Phiên âm tiếng Nhật chính xác đến mức nào?

Nếu âm thanh rõ ràng thì độ chính xác là thực tế. CER (tỷ lệ lỗi ký tự) là khoảng 4-5% trong cuộc trò chuyện thông thường. Tuy nhiên, danh từ riêng và thuật ngữ kỹ thuật có thể dễ dàng bị nhận dạng sai, vì vậy chúng tôi khuyên bạn nên chuyển danh sách các thuật ngữ trong dấu nhắc ban đầu hoặc kết hợp hiệu đính sau khi thực tế.

Câu hỏi: Tôi nên chọn cái nào, big-v3 hay big-v3-turbo?

big-v3-turbo là tốt nhất trong hầu hết các trường hợp. Độ chính xác chênh lệch chỉ 1-2% và tốc độ xử lý nhanh gấp 6 lần. Yêu cầu VRAM cũng giảm từ 10GB xuống 6GB. Tuy nhiên, turbo không phù hợp với tác vụ dịch thuật (ngôn ngữ khác → tiếng Anh), và v3 lớn và trung bình thì chính xác hơn.

Q. Có thể thực hiện tách loa (ghi nhật ký loa) bằng Whisper không?

Lời thì thầm một mình không được hỗ trợ. Điều này có thể đạt được bằng cách kết hợp với thư viện tách loa như pyannote-audio. Whisper nhanh hơn được tích hợp sẵn vad_filter (phát hiện khoảng thời gian bằng giọng nói) và có thể bỏ qua các khoảng im lặng.

Tôi cũng muốn đọc nó

  • [Mới nhất năm 2026] Hướng dẫn đầy đủ cách sử dụng ElevenLabs | Giải thích kỹ lưỡng về phí, nhân bản giọng nói và hỗ trợ tiếng Nhật
  • [Mới nhất năm 2026] 7 công cụ sao chép AI được đề xuất | So sánh kỹ lưỡng các tùy chọn miễn phí và trả phí
  • [Mới nhất năm 2026] 10 Công cụ tóm tắt AI được đề xuất | Cách tóm tắt tệp PDF, video và văn bản miễn phí

Đọc cái này vào lần sau. Nếu bạn muốn chọn cái nào phù hợp nhất với mình, bao gồm cả các công cụ sử dụng Whisper làm công cụ nội bộ, thì hãy xem phần so sánh các công cụ phiên âm AI. Các sản phẩm miễn phí và trả phí được liệt kê cạnh nhau nên giá cả có liên quan trực tiếp đến việc lựa chọn sản phẩm.

Bài liên quan