Từ điển thuật ngữ AI
1.363 thuật ngữ được giải thích ngắn gọn bằng tiếng Việt — đủ để hiểu tài liệu kỹ thuật mà không cần tra thêm.
ASR (nhận dạng giọng nói)
ASR (Tự động nhận dạng giọng nói) là công nghệ tự động chuyển đổi giọng nói của con người thành văn bản. Với sự phổ biến của các…
AivisSpeech (tổng hợp giọng nói tiếng Nhật)
AivisSpeech là một công cụ tổng hợp văn bản thành giọng nói mã nguồn mở của Nhật Bản, có thể tạo ra giọng nói đầy cảm xúc của…
Barge-in (phát hiện giọng nói bị gián đoạn)
Barge-in (phát hiện giọng nói bị ngắt quãng) là cơ chế phát hiện thời điểm người dùng bắt đầu nói trong khi AI đang phản hồi bằng…
Beamforming (bộ sưu tập âm thanh mảng micrô)
Beamforming (bộ sưu tập âm thanh mảng micrô) là công nghệ sắp xếp nhiều micrô thành một mảng và xử lý độ lệch pha để nhấn mạnh và…
Bài phát biểu LLM
Speech LLM là một mô hình ngôn ngữ quy mô lớn có thể hiểu và tạo ra giọng nói một cách trực tiếp mà không cần thông qua chuyển…
Bộ giải mã âm thanh thần kinh
Bộ giải mã âm thanh thần kinh là công nghệ mã hóa/giải mã sử dụng mạng thần kinh để nén dạng sóng âm thanh đến giới hạn tối đa…
Bộ phát âm
Bộ mã hóa giọng nói là công nghệ chuyển đổi và tổng hợp giọng nói nhằm phân tích và tham số hóa các đặc tính tần số của giọng nói…
Bộ thay đổi giọng nói theo thời gian thực
Công cụ thay đổi giọng nói theo thời gian thực là công nghệ sử dụng mô hình AI để chuyển đổi giọng nói đầu vào từ micrô thành…
Cartesia (mô hình tổng hợp giọng nói)
Cartesia là thuật ngữ dùng để chỉ một công ty khởi nghiệp phát triển mô hình tổng hợp giọng nói có độ trễ thấp (TTS) bằng cách sử…
Chuyển văn bản thành âm thanh
Chuyển văn bản thành âm thanh là công nghệ AI tự động tạo ra dữ liệu nguồn âm thanh như giọng nói, hiệu ứng âm thanh và âm nhạc…
Chuyển đổi giọng
Chuyển đổi giọng nói là công nghệ AI giọng nói chỉ thay thế giọng phát âm bằng một giọng khác trong khi vẫn giữ được chất lượng…
Chuyển đổi giọng hát
Chuyển đổi giọng hát là công nghệ AI chỉ thay thế chất lượng giọng nói của nguồn âm thanh do người này hát bằng giọng của người…
Chuyển đổi giọng nói
Chuyển đổi giọng nói là công nghệ AI giúp chuyển đổi chất lượng giọng nói và âm sắc của người này sang người khác hoặc bất kỳ…
Chuẩn hóa văn bản
Chuẩn hóa văn bản là quá trình tiền xử lý giúp chuyển đổi thống nhất các số, ngày tháng, chữ viết tắt, ký hiệu, v.v. thành ký…
Chuẩn hóa âm lượng
Chuẩn hóa âm lượng là công nghệ tự động cân bằng âm lượng cảm nhận được của giọng nói và âm nhạc dựa trên tiêu chuẩn LUFS, loại…
Chú thích âm thanh
Tạo phụ đề âm thanh là công nghệ sử dụng AI để chuyển đổi các âm thanh và hiệu ứng âm thanh trong môi trường không phải giọng…
Chỉnh sửa cao độ
Hiệu chỉnh cao độ là một công nghệ xử lý âm thanh giúp phát hiện độ lệch cao độ trong giọng hát hoặc giọng nói và tự động tiếp…
Chỉnh sửa âm thanh AI (loại bỏ phụ)
Chỉnh sửa âm thanh AI là công nghệ sử dụng AI để tự động phát hiện và loại bỏ các phần đệm như “ừm” và “ừm” cũng như các phần im…
CoeFont (tổng hợp giọng nói tiếng Nhật)
CoeFont là dịch vụ tổng hợp giọng nói AI dành cho người Nhật, có chức năng tìm hiểu chất lượng giọng nói từ một lượng nhỏ dữ liệu…
Content ID (tự động phát hiện bản quyền âm nhạc)
Content ID là cơ chế tự động phát hiện nội dung được bảo vệ bản quyền trong âm thanh và video bằng cách sử dụng tính năng so khớp…
Căn chỉnh bắt buộc
Căn chỉnh bắt buộc là một công nghệ xử lý âm thanh giúp tương quan tạm thời với dữ liệu âm thanh và văn bản được phiên âm của nó…
Cấu Trúc Bài Hát Tags
Thẻ cấu trúc bài hát là một ký hiệu chỉ định cấu trúc phần của bài hát, chẳng hạn như [Verse] hoặc [Chorus], trong lời nhắc tới…
Dia (đối thoại tổng hợp giọng nói)
Dia là mô hình AI tổng hợp giọng nói đàm thoại mã nguồn mở do Nari Labs ở Mỹ phát triển và là công nghệ có thể tạo ra mọi thứ từ…
Dấu thời gian cấp độ từ
Dấu thời gian từng từ là công nghệ ghi lại thời gian bắt đầu và kết thúc của mỗi từ tính bằng mili giây khi phiên âm âm thanh.
Dịch giọng nói theo thời gian thực (Dịch giọng nói sang giọng nói)
Dịch giọng nói theo thời gian thực là công nghệ AI giúp chuyển đổi giọng nói của người nói sang giọng nói của ngôn ngữ khác gần…
Giao diện người dùng bằng giọng nói (VUI)
VUI là giao diện hội thoại dựa trên giọng nói cho phép bạn vận hành các ứng dụng và thiết bị gia dụng bằng lời nói thay vì sử…
Giảm âm vang
Giảm âm là công nghệ xử lý âm thanh sử dụng công nghệ xử lý AI để giảm tiếng vang trong phòng và các thành phần vang có trong âm…
Giọng nói song công hoàn toàn
Hội thoại giọng nói song công hoàn toàn là giao diện giọng nói AI xử lý việc gửi và nhận cuộc gọi song song, đồng thời có thể xử…
Giọng nói thời gian thực
Giọng nói thời gian thực là công nghệ trong đó AI nhận dạng và tạo đầu vào bằng giọng nói với độ trễ gần như bằng 0, đạt tốc độ…
Hiểu ngôn ngữ nói (SLU)
Hiểu ngôn ngữ nói (SLU) là một công nghệ trích xuất ý định và thực thể từ các lời nói đã được phiên âm bằng cách sử dụng nhận…
Hiệu chỉnh phiên âm LLM (Hiệu chỉnh sau)
Chỉnh sửa phiên âm LLM là một quá trình xử lý hậu kỳ trong đó LLM tự động sửa lỗi chính tả, thiếu sót và cụm từ không tự nhiên…
Hình mờ âm thanh
Hình mờ âm thanh là công nghệ nhúng thông tin nhận dạng phát hiện trong âm thanh hoặc âm nhạc do AI tạo sinh theo cách mà tai…
Kokoro (TTS nhẹ)
Kokoro là mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở nhẹ, có thể tạo ra giọng nói chất lượng cao với một số lượng…
Kết nối mạng điện thoại SIP (Telephony hợp tác)
Kết nối mạng điện thoại SIP (Telephony link) là cơ chế kết nối agent thoại AI với điện thoại cố định, tổng đài hoặc hệ thống…
Loại bỏ tiếng vang (AEC)
Khử tiếng vang (AEC) là công nghệ sử dụng xử lý tín hiệu để loại bỏ theo thời gian thực các âm thanh hú và dội lại xảy ra khi âm…
Loại bỏ tiếng ồn AI (Khử tiếng ồn)
Loại bỏ tiếng ồn AI là công nghệ sử dụng mô hình học máy để tự động loại bỏ tiếng ồn và tiếng ồn xung quanh khỏi âm thanh và…
Làm chủ AI
Làm chủ AI là một quy trình sản xuất âm nhạc trong đó AI phân tích cân bằng âm lượng, EQ và áp suất âm thanh của bài hát và tự…
Lồng tiếng AI
AI lồng tiếng là công nghệ AI tự động dịch và tổng hợp âm thanh của nội dung video và thay thế bằng âm thanh tự nhiên bằng ngôn…
MFCC (Cepstrum tần số Mel)
MFCC là một tính năng được sử dụng rộng rãi trong nhận dạng giọng nói và nhận dạng người nói, thực hiện phân tích phổ của dạng…
Moshi (kiểu âm thanh song công hoàn toàn)
Moshi là mô hình AI hội thoại song công hoàn toàn do viện nghiên cứu AI Kyutai của Pháp phát triển, có thể nghe và nói cùng lúc…
Mureka (tạo nhạc Mureka)
Mureka là một dịch vụ tạo nhạc AI có thể tự động tạo các bài hát có lời bài hát, giọng hát và nhạc đệm từ lời nhắc bằng văn bản…
MusicGen (mô hình tạo nhạc)
MusicGen là mô hình tạo nhạc AI của Meta, tự động tạo nhạc từ đầu vào văn bản và giai điệu.
Mã thông báo âm thanh
Mã thông báo giọng nói là dữ liệu giọng nói được chia thành các đơn vị riêng biệt có thể được xử lý bằng AI tổng hợp giọng nói và…
Mười một phòng thí nghiệm
Dịch vụ hàng đầu để tạo giọng nói AI. Bạn có thể sao chép giọng nói của chính mình và sử dụng nó để tường thuật đa ngôn ngữ.
Nhân bản giọng nói
Nhân bản giọng nói là công nghệ tổng hợp giọng nói AI giúp tái tạo chất lượng giọng nói, phong cách nói và ngữ điệu của một người…
Nhân bản giọng nói đa ngôn ngữ
Nhân bản giọng nói đa ngôn ngữ là công nghệ tổng hợp lời nói bằng một ngôn ngữ khác mà người nói chưa học mà vẫn giữ được đặc…
Nhúng loa (Nhúng loa / x-vector)
Nhúng loa là công nghệ chuyển đổi các đặc điểm giọng nói từ âm thanh thành các vectơ có độ dài cố định có thể được xác định và so…
Nhúng âm thanh
Nhúng âm thanh là công nghệ chuyển đổi các đặc điểm âm thanh thành các vectơ số chiều cao, giúp chúng dễ dàng xử lý hơn trong quá…
Nhạc AI miễn phí bản quyền (quyền sử dụng thương mại)
Nhạc AI miễn phí bản quyền là định dạng cấp phép cho phép các bài hát do AI tạo sinh được sử dụng cho mục đích thương mại mà…
Nhận dạng cảm xúc lời nói
Nhận dạng cảm xúc lời nói là công nghệ ước tính trạng thái cảm xúc của người nói dựa trên tần số, ngữ điệu và tốc độ của giọng…
Nhận dạng giọng nói trực tuyến (Streaming ASR)
Nhận dạng giọng nói trực tuyến (Streaming ASR) là công nghệ chuyển đổi dữ liệu âm thanh thành văn bản ngay khi được nói ra, thay…
Nhận dạng loa
Nhận dạng người nói là công nghệ AI giúp xác định và đối chiếu ''ai đang nói'' từ dữ liệu giọng nói, xác định và phân loại các cá…
Nhận dạng ngôn ngữ
Nhận dạng ngôn ngữ là công nghệ trong đó mô hình AI tự động xác định ngôn ngữ có trong dữ liệu âm thanh hoặc văn bản.
Nhận dạng phương ngữ
Hỗ trợ phương ngữ đề cập đến khả năng nhận dạng giọng nói và tổng hợp giọng nói AI để nhận dạng và xử lý chính xác cách phát âm,…
Nhật ký loa
Tách loa là một công nghệ máy học tự động xác định và phân loại ''ai nói và khi nào'' từ âm thanh cuộc trò chuyện của nhiều…
Orpheus (TTS mở)
Orpheus là mô hình tổng hợp giọng nói (TTS) nguồn mở dựa trên Llama do Canopy Labs xuất bản. Nó được đặc trưng bởi khả năng…
Phát hiện deepfake giọng nói
Phát hiện deepfake âm thanh là công nghệ sử dụng máy học để xác định giọng nói giả và giọng nói giả mạo được tạo ra bằng cách…
Phát hiện nhịp
Phát hiện nhịp là công nghệ tự động phân tích và xác định vị trí cũng như nhịp độ của nhịp, đóng vai trò là tiêu chuẩn nhịp điệu…
Phát hiện rẽ
Phát hiện lần lượt là một công nghệ trong hội thoại bằng giọng nói AI, xác định theo thời gian thực xem người nói đã nói xong hay…
Phát hiện sự kiện âm thanh
Phát hiện sự kiện âm thanh là công nghệ tự động xác định và phân loại các âm thanh cụ thể trong luồng âm thanh, chẳng hạn như…
Phân tích giọng nói
Phân tích cuộc gọi là công nghệ sử dụng AI để tự động chuyển đổi và phân tích các cuộc gọi thoại từ tổng đài, v.v. thành văn bản,…
Phần mở rộng bài hát
Mở rộng bài hát là chức năng tự động tạo phần tiếp theo của bài hát được tạo ban đầu bởi dịch vụ tạo nhạc AI và kéo dài thời…
Phục hồi dấu câu
Dấu câu là công nghệ tự động chèn các dấu câu thích hợp dựa trên ngữ cảnh vào văn bản mà không cần dấu câu thu được thông qua…
Prosody kiểm soát (Prosody)
Kiểm soát ngữ điệu là công nghệ kiểm soát cao độ, nhịp điệu, giọng nói, ngữ điệu và tốc độ nói trong quá trình tổng hợp giọng nói…
Quang phổ Mel
Biểu đồ phổ mel là một đặc điểm âm thanh hai chiều giúp phân chia các thành phần tần số của dạng sóng âm thanh bằng cách sử dụng…
RTF (Yếu tố thời gian thực)
RTF (Hệ số thời gian thực) là thước đo thời gian xử lý âm thanh chia cho độ dài của âm thanh. Giá trị nhỏ hơn 1 có nghĩa là xử lý…
RVC (Chuyển đổi giọng nói dựa trên tìm kiếm)
RVC là công nghệ giọng nói AI sử dụng Chuyển đổi giọng nói dựa trên truy xuất để chuyển đổi giọng nói của người nói thành một…
ReasonSpeech (kho ngữ liệu tiếng Nhật)
ReazonSpeech là kho ngữ liệu mở lớn nhất Nhật Bản về nhận dạng giọng nói tiếng Nhật được xây dựng từ âm thanh phát sóng trên…
Riffusion (mô hình tạo nhạc)
Riffusion là mô hình AI chuyển đổi dạng sóng âm thanh thành hình ảnh quang phổ và tạo ra âm nhạc bằng cách áp dụng công nghệ mô…
SSML (Ngôn ngữ đánh dấu tổng hợp giọng nói)
SSML là ngôn ngữ đánh dấu dựa trên XML cho phép kiểm soát chi tiết cách phát âm, tốc độ, tạm dừng, ngữ điệu, v.v. cho các công cụ…
Sesame (mẫu giọng nói hội thoại)
Sesame là mô hình AI bằng giọng nói dành riêng cho cuộc hội thoại được phát triển bởi công ty Sesame AI của Hoa Kỳ và là công…
Style-Bert-VITS2 (mã nguồn mở tổng hợp giọng nói tiếng Nhật)
Style-Bert-VITS2 là một công cụ tổng hợp giọng nói mã nguồn mở (mã nguồn mở) có thể tổng hợp giọng nói tiếng Nhật tự nhiên bằng…
Suno
Dịch vụ tạo nhạc AI. Tạo một bài hát hoàn chỉnh trong 1 phút bằng cách chỉ định lời bài hát và thể loại.
Sơn âm thanh
Speech inpainting là công nghệ sử dụng AI để tạo ra các dạng sóng tự nhiên từ bối cảnh xung quanh nhằm bổ sung những phần còn…
TTS (tổng hợp giọng nói)
TTS (tổng hợp giọng nói) là công nghệ AI chuyển đổi dữ liệu văn bản thành giọng nói giống con người. Nó được sử dụng trong nhiều…
TTS cảm xúc
TTS cảm xúc là một công nghệ không chỉ đơn giản là đọc thành tiếng văn bản mà còn tổng hợp nó thành giọng nói bắt chước cảm xúc…
TTS đa ngôn ngữ
TTS đa ngôn ngữ là công nghệ chuyển văn bản thành giọng nói hỗ trợ nhiều ngôn ngữ. Nội dung đa ngôn ngữ có thể được phiên âm theo…
Tham khảo phong cách âm nhạc (Tham khảo âm thanh)
Tham chiếu phong cách âm nhạc (Tham chiếu âm thanh) là phương pháp trong đó bài hát hoặc clip âm thanh hiện có được đọc vào AI…
Thiết kế giọng nói
Thiết kế giọng nói là phương pháp thiết kế và xác định chất lượng giọng nói, giọng điệu, biểu cảm cảm xúc và phong cách nói của…
Thì thầm
Mô hình nhận dạng giọng nói nguồn mở của OpenAI. Hỗ trợ 99 ngôn ngữ và có độ chính xác cao trong tiếng Nhật.
Thư viện giọng nói
Thư viện giọng nói là tập hợp các tài liệu âm thanh có thể được chọn từ một số lượng lớn giọng nói (chất lượng giọng nói, ngôn…
Thế hệ sách nói AI (AI Audiobook)
Thế hệ sách nói AI là công nghệ sử dụng tổng hợp giọng nói AI để đọc sách và bản thảo văn bản, đồng thời tự động chuyển đổi chúng…
Truy vấn của Humming
Tìm kiếm ngân nga là công nghệ tìm kiếm bằng giọng nói giúp chuyển đổi giai điệu do người dùng nhập bằng cách ngâm nga hoặc ngâm…
Truyền phát TTS
Truyền trực tuyến TTS là một phương pháp tổng hợp giọng nói giúp giảm đáng kể độ trễ phản hồi nhận thấy bằng cách phát lại từng…
Trích xuất loa mục tiêu
Trích xuất loa mục tiêu là một công nghệ xử lý âm thanh giúp tách và trích xuất giọng nói của một loa mục tiêu cụ thể khỏi các…
Trả lời điện thoại AI (bot giọng nói)
Trả lời điện thoại AI (voicebot) là hệ thống kết hợp nhận dạng giọng nói và tổng hợp giọng nói để tự động xử lý các yêu cầu và…
Trộn AI (Trộn tự động)
AImix là công nghệ sử dụng AI để tự động điều chỉnh cân bằng âm lượng, EQ và nén nhiều bản âm thanh để hoàn thiện một bài hát.
Tách thân
Tách gốc là công nghệ sử dụng AI để tách và trích xuất từng phần như giọng hát, trống và âm trầm thành các bản nhạc riêng lẻ từ…
Tìm kiếm thông tin âm nhạc (MIR)
Truy xuất thông tin âm nhạc (MIR) là một lĩnh vực kỹ thuật tự động trích xuất và phân tích thông tin như nhịp độ, phím, hợp âm,…
Tóm tắt âm thanh
Tóm tắt bằng âm thanh là công nghệ sử dụng AI để tự động ghi lại dữ liệu âm thanh từ các cuộc họp và bài giảng, trích xuất các…
Tạo MIDI
Tạo MIDI là công nghệ trong đó AI tự động xuất các tệp MIDI chứa các nốt, tiến trình hợp âm và thông tin nhịp độ từ đầu vào chẳng…
Tạo hiệu ứng âm thanh
Tạo hiệu ứng âm thanh là công nghệ trong đó AI tự động tạo ra các hiệu ứng âm thanh như âm thanh nổ, âm thanh môi trường và âm…
Tạo lời bài hát AI
Tạo lời bài hát AI đề cập đến một công nghệ trong đó AI tự động tạo lời bài hát được đề xuất cho một bài hát chỉ bằng cách chỉ…
Tạo nhạc đệm
Tạo nhạc đệm là công nghệ trong đó AI tự động soạn các tiến trình hợp âm, nhịp điệu và các phần nhạc cụ theo giai điệu đầu vào và…
Tạo podcast AI
Tạo podcast AI là công nghệ sử dụng AI để tự động tổng hợp, chỉnh sửa và thêm nhạc nền dựa trên bản thảo văn bản và ghi chú có…
Tạo thành tích (Kênh phụ)
Backchannel là công nghệ trong đó AI đối thoại bằng giọng nói sẽ chèn các nhận xét như "Ừ", "Có" và "Tôi hiểu rồi" vào thời điểm…
Tạo tiến trình hợp âm
Tạo tiến trình hợp âm là công nghệ trong đó AI tự động tạo ra các chuỗi hợp âm tự nhiên về mặt âm nhạc (tiến trình hợp âm) chỉ…
Tạo âm thanh
Soundscape thế hệ là công nghệ sử dụng AI để tự động tổng hợp âm thanh môi trường, nhạc nền và hiệu ứng âm thanh để tạo ra âm…
Tạo âm thanh không gian
Tạo âm thanh không gian là công nghệ sử dụng AI để tái tạo ba chiều vị trí và độ lan tỏa của nguồn âm thanh, đồng thời tự động…
Tốc độ lấy mẫu (16kHz / 48kHz)
Tốc độ lấy mẫu là đơn vị cho biết có bao nhiêu mẫu (mẫu) âm thanh analog được số hóa mỗi giây.
Tốc độ nói
Kiểm soát tốc độ nói là một chức năng cho phép bạn điều chỉnh chính xác tốc độ đọc thành tiếng của AI tổng hợp giọng nói.
Tổng hợp giọng hát
Tổng hợp giọng hát là công nghệ trong đó AI tự động tạo ra giọng hát của con người dựa trên bản nhạc, lời bài hát và thông tin…
Tổng hợp giọng nói Zero-shot (TTS Zero-shot)
Tổng hợp giọng nói zero-shot là công nghệ tìm hiểu chất lượng giọng nói và ngữ điệu của người nói chỉ từ vài giây mẫu âm thanh và…
Từ điển phát âm (đọc từ điển)
Từ điển phát âm (đọc từ điển) là dữ liệu từ điển đăng ký cách phát âm và trọng âm cho từng từ để AI tổng hợp giọng nói và hệ…
Udio
Udio là một dịch vụ tạo nhạc AI có thể tạo các bài hát, lời bài hát và giọng hát cùng một lúc từ lời nhắc bằng văn bản.
VAD (phát hiện khoảng thời gian bằng giọng nói)
VAD là công nghệ chỉ tự động trích xuất những phần có lời nói của con người từ luồng âm thanh. Nó phân biệt giọng nói với sự im…
VALL-E (Mô hình giọng nói không bắn)
VALL-E là mô hình tổng hợp giọng nói zero-shot, tái tạo chất lượng giọng nói của người nói chỉ bằng vài giây âm thanh mẫu và đọc…
VOICEVOX (Tổng hợp giọng nói tiếng Nhật miễn phí)
VOICEVOX là phần mềm tổng hợp giọng nói tiếng Nhật miễn phí được phát triển bởi nhà phát triển cá nhân Hiroshiba, cho phép bạn…
Video thành âm thanh (V2A/thêm âm thanh từ video)
Video-to-audio (V2A) là công nghệ AI tự động tạo và thêm hiệu ứng âm thanh, âm thanh môi trường và âm nhạc phù hợp với chuyển…
Wake Word Phát hiện (Wake Word)
Phát hiện từ đánh thức là cơ chế trong đó thiết bị liên tục giám sát đầu vào micrô và chỉ bắt đầu xử lý nhận dạng giọng nói ngay…
WebRTC (Nền tảng giao tiếp bằng giọng nói thời gian thực)
WebRTC là công nghệ giao tiếp tiêu chuẩn mở cho phép trình duyệt và ứng dụng điện thoại thông minh gửi và nhận âm thanh cũng như…
agent giọng nói
agent giọng nói là AI agent sử dụng giọng nói làm giao diện chính để tự động hiểu, suy luận và thực hiện các cuộc hội thoại.…
gỡ băng tự động (Phiên âm nhạc)
Ký hiệu tự động là công nghệ sử dụng AI để phân tích dữ liệu âm thanh của màn trình diễn và giọng hát, đồng thời tự động chuyển…
kotoba-whisper (mô hình nhận dạng giọng nói của Nhật Bản)
kotoba-whisper là một mô hình nhận dạng giọng nói được chắt lọc và thu gọn từ Whisper của OpenAI dành riêng cho giọng nói tiếng…
tạo nhạc
Tạo nhạc là công nghệ trong đó AI tự động tạo ra các bài hát bao gồm giai điệu, hợp âm và nhịp điệu dựa trên dữ liệu đầu vào như…
Âm thanh cá
Fish Audio là một nền tảng tổng hợp giọng nói AI có thể sao chép giọng nói từ một vài giây mẫu âm thanh và tạo ra tính năng…
Âm thanh siêu phân giải
Âm thanh siêu phân giải là công nghệ sử dụng AI để ước tính và bổ sung các thành phần tần số cao bị mất trong âm thanh tốc độ lấy…
Âm thanh ổn định (tạo hiệu ứng âm nhạc/âm thanh)
Stable Audio là mô hình AI được phát triển bởi Stability AI, có thể tạo ra âm nhạc và hiệu ứng âm thanh từ văn bản. Có phiên bản…
Đa ngôn
Chatterbox là mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở do Resemble AI phát hành, đây là công nghệ có thể tái tạo…
Đăng ký từ vựng tùy chỉnh (Từ vựng tùy chỉnh)
Đăng ký từ vựng tùy chỉnh là một cơ chế trong đó các danh sách từ như thuật ngữ kỹ thuật, danh từ riêng và tên công ty được đăng…
Đơn âm
Âm vị là đơn vị âm thanh nhỏ nhất tạo ra sự khác biệt về ý nghĩa trong ngôn ngữ và là thành phần cơ bản của nhận dạng giọng nói…
Ước tính cao độ (Phát hiện cao độ / F0)
Ước tính cao độ là công nghệ ước tính tần số cơ bản (F0) từ dạng sóng của giọng nói hoặc giai điệu âm nhạc và trích xuất cao độ…
Ấm cúngVoice
CosyVoice là mô hình chuyển văn bản thành giọng nói (TTS) mã nguồn mở được phát triển bởi nhóm nghiên cứu của Tập đoàn Alibaba và…
Ẩn danh giọng nói
Ẩn danh giọng nói là công nghệ loại bỏ và biến đổi các tính năng có thể nhận dạng người nói từ dữ liệu được ghi lại, khiến không…