OmniVoice Studio – AI Clone Giọng Nói Miễn Phí Thay Thế ElevenLabs Chạy 100% Offline
Số tiền bạn thanh toán là công sức tôi tổng hợp và hỗ trợ bạn cài đặt hoặc thắc mắc khi dùng.
Dự án mã nguồn mở OmniVoice Studio là một phần mềm desktop mã nguồn mở kiểu “ElevenLabs alternative”, tập trung vào AI giọng nói chạy local trên máy tính, không cần API key, không cần tài khoản, không gửi audio lên cloud. Hỗ trợ voice cloning, video dubbing, dictation và chạy local với nhiều ngôn ngữ.
Mô tả chi tiết
Dự án OmniVoice Studio là một phần mềm desktop mã nguồn mở kiểu “ElevenLabs alternative”, tập trung vào AI giọng nói chạy local trên máy tính, không cần API key, không cần tài khoản, không gửi audio lên cloud. README ghi nó hỗ trợ voice cloning, video dubbing, dictation và chạy local với nhiều ngôn ngữ.
Nó có thể làm được gì?
1. Clone giọng nói từ audio ngắn
Bạn đưa một đoạn giọng mẫu khoảng 3 giây, hệ thống có thể tạo voice clone kiểu zero-shot. Repo nói hỗ trợ hơn 600/646 ngôn ngữ tùy phần mô tả.
Ứng dụng thực tế:
- Clone giọng để đọc script video.
- Tạo giọng AI cho kênh YouTube/TikTok.
- Tạo nhiều giọng nhân vật cho truyện, phim ngắn, quảng cáo.
- Làm bản đọc tiếng Việt/tiếng Anh mà không phải thuê voice.
2. Tạo giọng mới theo thiết kế
Có phần Voice Design, cho phép chỉnh các yếu tố như giới tính, tuổi, accent, pitch, tốc độ, cảm xúc, dialect.
Ứng dụng:
- Tạo giọng nữ bán hàng.
- Tạo giọng nam trầm đọc video triết lý.
- Tạo giọng trẻ trung cho TikTok.
- Tạo giọng nhân vật khác nhau cho video hoạt hình/kịch bản.
3. Dubbing video tự động
Nó có pipeline: đưa YouTube URL hoặc file video vào, hệ thống sẽ transcribe → translate → re-voice → export MP4.
Ứng dụng rất phù hợp với bạn:
- Dịch video nước ngoài sang tiếng Việt.
- Làm lại video quảng cáo bằng giọng Việt.
- Dubbing video YouTube sang nhiều ngôn ngữ.
- Tạo video bán hàng đa thị trường: Việt, Thái, Trung, Anh…
README còn nói dubbing có các tính năng như chia cảnh, gán giọng theo speaker, timing thông minh, QC lần hai.
4. Chuyển giọng nói thành văn bản
Nó có nhiều engine ASR như WhisperX, Faster-Whisper, MLX Whisper, FunASR, sherpa-onnx… dùng cho dictation, video dubbing và phụ đề.
Ứng dụng:
- Tự động tạo phụ đề SRT/VTT.
- Gỡ lời thoại từ video.
- Ghi âm cuộc họp rồi chuyển thành text.
- Tạo transcript cho video YouTube.
5. Làm audiobook và truyện nhiều giọng
Nó có Audiobook Editor, nhập text, EPUB hoặc PDF, tự chia chương, chuẩn âm lượng và xuất file .m4b.
Ngoài ra có phần Stories multi-voice editor, cho phép gán giọng từng dòng và xuất audio nhiều nhân vật.
Ứng dụng:
- Làm truyện audio.
- Làm video kể chuyện nhiều nhân vật.
- Làm kịch bản phim ngắn bằng giọng AI.
- Làm nội dung YouTube dạng “cổ nhân dạy”, “truyện nhân quả”, “triết lý”.
6. Dictation toàn hệ thống
Có widget bấm phím tắt để nói, hệ thống tự chuyển thành text và dán vào app đang dùng. README mô tả hotkey mặc định là ⌘ + ⇧ + Space.
Ứng dụng:
- Nói để viết bài.
- Nói để tạo prompt.
- Nói để ghi chú nhanh.
- Dùng như trợ lý nhập liệu tiếng nói.
7. Có API local giống OpenAI Audio API
Nó mở API local tại http://localhost:3900/v1, có endpoint TTS, transcription và danh sách voice.
Điểm này rất quan trọng nếu bạn muốn tích hợp vào hệ thống agent/video automation của mình:
- Agent tạo script → gọi OmniVoice tạo voice.
- Workflow HTML-to-video/Remotion → lấy audio từ OmniVoice.
- Chatbot/AI livestream → dùng OmniVoice làm TTS local.
- Hệ thống dubbing video hàng loạt → gọi API nội bộ thay vì ElevenLabs.
8. Chạy local, không cần cloud
Repo nhấn mạnh không cần API key, không cần account, không cần cloud, không subscription.
Ưu điểm:
- Không mất tiền theo ký tự như ElevenLabs.
- Dữ liệu giọng không gửi ra ngoài.
- Dùng được cho workflow nội bộ.
- Không bị giới hạn số lần tạo voice, trừ giới hạn phần cứng máy.
Máy cần cấu hình thế nào?
Theo README, cấu hình tối thiểu:
| Thành phần | Tối thiểu | Khuyến nghị |
|---|---|---|
| RAM | 8 GB | 16 GB+ |
| VRAM | 4 GB | 8 GB+ |
| Ổ cứng | 10 GB trống | 20 GB+ SSD |
| GPU | Không bắt buộc | NVIDIA CUDA / Apple Silicon / ROCm Linux |
Repo nói CPU vẫn chạy được nhưng sẽ chậm hơn; GPU không bắt buộc.
Lưu ý: nếu dùng Windows + AMD GPU, README nói sẽ chạy CPU-only vì PyTorch không có ROCm wheel cho Windows; tăng tốc GPU trên Windows chủ yếu là NVIDIA/CUDA.
Có phù hợp với nhu cầu của bạn không?
Có, khá phù hợp nếu mục tiêu của bạn là:
- Làm video YouTube/TikTok bằng giọng AI.
- Tạo voiceover tiếng Việt cho video tự động.
- Dubbing video sang tiếng Việt.
- Tạo nhân vật AI livestream có giọng nói.
- Xây workflow agent: viết script → tạo giọng → ghép video → xuất bản.
- Muốn tránh chi phí ElevenLabs/OpenAI TTS theo tháng/ký tự.
Nhưng nên xem nó là dự án đang beta, chưa nên coi là sản phẩm ổn định 100%. README cũng cảnh báo OmniVoice Studio đang active beta, có thể lỗi giữa các bản release, và khuyên chạy từ source để có bản mới nhất.
Kết luận ngắn
OmniVoice Studio có thể dùng như một “xưởng giọng AI local”: clone giọng, tạo giọng mới, đọc văn bản, chuyển speech-to-text, dubbing video, tạo audiobook, tạo phụ đề, và cung cấp API local để tích hợp vào hệ thống agent/video automation.
Với hướng bạn đang làm về AI vi
Hướng dẫn riêng
Sản phẩm có hướng dẫn riêng chỉ hiển thị sau khi mua hàng
Video hướng dẫn độc quyền
Mua sản phẩm để xem video hướng dẫn sử dụng chi tiết
Đánh giá của khách hàng
Đăng nhập để xem phần đánh giá và viết nhận xét sau khi mua.