Content Creator Studio · Tự triển khai riêng

Biến chiếc máy tính bạn đã có thành studio video không bao giờ nghỉ.

Đưa vào hình ảnh và kịch bản. Studio viết phụ đề, lồng tiếng bằng giọng thật, thêm chuyển động, và dựng ra file MP4 sẵn sàng đăng — trên chính GPU của bạn, không tính phí mỗi video và không tải gì lên đám mây của ai cả.

Tự triển khai riêng qua Docker Compose trên chính GPU NVIDIA của bạn — không phải hàng đợi dựng hình trên đám mây.

GPU của bạn nhàn rỗi trong khi hàng chờ ngày càng dài

Điều đang làm bạn chậm lại

Một video tốn 20 phút với các thao tác lặp lại

Cắt, thêm phụ đề, canh chỉnh vị trí chữ, xuất file — cùng một quy trình thủ công cho từng video một.

Phụ đề gõ lại bằng tay

Xem lại toàn bộ đoạn clip chỉ để gõ lại đúng những gì đã được nói.

Phí dựng hình trên đám mây tăng theo tham vọng của bạn

Càng đăng nhiều, hóa đơn tính theo phút hoặc theo lượt dựng càng tăng — đúng lúc khối lượng cần rẻ hơn chứ không phải đắt hơn.

Sản lượng nhiều hơn, không cần thêm giờ hay hóa đơn lớn hơn

Bạn nhận được gì

01

Tăng sản lượng mà không tốn thêm giờ

Một lượt dựng là một tác vụ, không phải một buổi ngồi canh máy — xếp hàng, theo dõi tiến độ, quay lại nhận file hoàn chỉnh.

Cách làm: các tác vụ nền truyền tiến độ trực tiếp qua cùng kết nối mà bảng điều khiển dùng để kiểm tra trạng thái.
02

Chi phí biên bằng không cho mỗi video

Mã hoá, phiên âm và lồng tiếng đều chạy trên phần cứng bạn đã sở hữu — chi phí duy nhất là những gì bạn chủ động chọn dùng thêm.

Cách làm: mã hoá video NVENC, phiên âm Whisper qua CUDA, và ba engine giọng nói cục bộ — không có API tính phí nào nằm trên đường xử lý chính.
03

Sản xuất chạy không cần giám sát

Thiết lập lịch một lần; hệ thống tiếp tục sản xuất trong khi bạn làm bất cứ việc gì khác.

Cách làm: một vòng lặp tự động hoá dự án chạy mỗi phút và đẩy dự án của bạn tiến thêm một bước mỗi lần — tạo nội dung, rồi xuất file.

Từ nguyên liệu thô đến file MP4 hoàn chỉnh

Cách hoạt động

1

Đưa vào hình ảnh & kịch bản

Tải ảnh tĩnh hoặc clip lên, hoặc lấy ảnh stock — rồi viết hoặc dán kịch bản lồng tiếng.

2

Chọn giọng đọc

Ba engine chuyển văn bản thành giọng nói cục bộ, bao gồm tiếng Việt và nhân bản giọng nói — tất cả dựng trên chính GPU của bạn.

3

Chọn chuyển động, tỉ lệ khung hình & phụ đề

Hướng chuyển động Ken Burns, tỉ lệ khung hình, kiểu và vị trí phụ đề — có xem trước trực tiếp trước khi xác nhận.

4

Dựng & nhận file

Theo dõi tiến độ từng giai đoạn, rồi tải file MP4 cùng phụ đề SRT đi kèm từ thư viện media.

Studio thực sự trông như thế nào

Xem thực tế

Mô phỏng đại diện cho bảng điều khiển thật — không phải ảnh minh họa.

Công cụ

Video GeneratorHình ảnh + lồng tiếng → MP4 có phụ đề
Text to SpeechKokoro, VieNeu, Chatterbox — chạy cục bộ
Subtitle VideoPhụ đề Whisper, chỉnh sửa được, gắn cứng
Sound WaveformVideo minh họa sóng âm phản ứng theo nhạc

Bảy công cụ, mỗi công cụ là một quy trình độc lập, tập trung.

Trình chỉnh kiểu phụ đề

Phông chữBe Vietnam Pro
Cỡ chữ42px
Vị tríGiữa dưới
Hiệu ứng vào/raMờ dần
bình minh hôm nay khác lạ quá

Bản xem trước dùng đúng engine hiển thị như khi xuất file thật.

Trình minh họa sóng âm

4 chế độ × 10 bảng màu, tạo thành một lớp video thứ hai thật sự từ âm thanh.

Nhật ký xuất file

ep12-morning-routine.mp41080×1920 · 41 giây · dựng trong 22.4 giây
hoàn tất
ep13-city-walk.mp41080×1920 · đang chờ
đang xử lý

Mỗi lượt dựng đều lưu chi tiết thời gian từng giai đoạn, không chỉ kết quả đạt/không đạt.

Toàn bộ quy trình xử lý

Tất cả tính năng

Hình ảnh + lồng tiếng → MP4 có phụ đề

Toàn bộ quy trình trong một lượt xử lý — không cần chỉnh sửa timeline thủ công.

Chuyển động Ken Burns, 6 hướng + lấp đầy màn hình

Siêu lấy mẫu 4× để các lượt zoom chậm mượt mà, không bị giật.

6 tỉ lệ khung hình, lên đến 4K

9:16, 16:9, 1:1, 4:5, 4:3, 21:9 — mỗi tỉ lệ có bốn mức chất lượng.

Mã hoá NVENC, tự động chuyển sang CPU

Dùng GPU khi có thể, giảm nhẹ khi không có.

Phụ đề Whisper có thể chỉnh sửa

Xem lại và sửa bản ghi trước khi gắn cứng — từng dòng một, kèm thanh kéo nghe âm thanh.

Dịch phụ đề + phụ đề song ngữ

Anh, Việt, Nhật, Trung, Hàn — bản gốc và bản dịch gắn cứng ở hai vị trí cùng lúc.

3 engine giọng nói cục bộ

Kokoro (đa ngôn ngữ), VieNeu (tiếng Việt, có nhân bản giọng), Chatterbox (nhân bản giọng) — tất cả tự triển khai riêng.

Video sóng âm phản ứng theo nhạc

4 chế độ × 10 bảng màu, phủ trên ảnh, video hoặc nền màu đơn sắc.

Thẻ giới thiệu, lời kêu gọi cuối video, đồng hồ đếm & lớp phủ

Đồng hồ đếm ngược hoặc đếm lên, nhiều thông điệp chữ độc lập, hiệu ứng mờ dần theo từng clip.

Trộn nhạc an toàn cho tai người nghe

Nhạc nền được giảm âm dưới lời lồng tiếng và chuẩn hoá về −14 LUFS / −1 dBTP.

Nhập workflow ComfyUI

Mang theo workflow ảnh/video của riêng bạn và chạy ngay trong studio.

Sản xuất theo lịch

Vòng lặp tự động hoá dự án tạo nội dung và xuất file theo đúng lịch bạn đặt ra.

Thẳng thắn về việc cài đặt — đây là sản phẩm tự triển khai riêng

Cần gì để vận hành

Docker Compose

Chạy dưới dạng các container trên máy của bạn hoặc một server tại nhà — chỉ cần docker compose up là hoạt động.

Một GPU NVIDIA

Vận hành mã hoá NVENC, phiên âm CUDA và toàn bộ giọng nói cục bộ — hỗ trợ các dòng card đời mới (bao gồm cả RTX 50-series).

Vẫn chạy được chỉ với CPU

Chậm hơn, nhưng không có bước nào bị khoá cứng vào GPU — mọi bước mã hoá và phiên âm đều có phương án dự phòng bằng CPU.

Cấp phép theo từng lượt cài đặt

Một mã bản quyền được xác thực với OurAI Tech kích hoạt sản phẩm — cấp khi bạn đăng ký.

Hiện chưa có trình cài đặt một chạm — việc thiết lập là chạy Docker Compose trên hạ tầng bạn kiểm soát, không phải một ứng dụng desktop tải về.

Trả lời thẳng thắn

Câu hỏi thường gặp

Tôi có cần GPU không?

Không bắt buộc — mọi thứ đều có phương án dự phòng bằng CPU. Nhưng GPU mới là thứ giúp mã hoá, phiên âm và giọng nói cục bộ chạy nhanh, và đó chính là trọng tâm của "phần cứng của bạn, không tính phí mỗi lượt dựng".

Chi phí để làm một video là bao nhiêu?

Dựng hình, mã hoá, phiên âm và cả ba giọng đọc tích hợp đều chạy trên chính GPU của bạn — không tính phí mỗi video. Chi phí tính phí duy nhất là các nhà cung cấp AI tuỳ chọn (cho tạo ảnh/video AI hoặc dịch phụ đề) mà bạn chủ động bật bằng API key của riêng mình.

Video của tôi có rời khỏi máy không?

Không, đối với quy trình xử lý cốt lõi — dựng hình, phiên âm và giọng nói cục bộ đều chạy trong chính container của bạn. Nó chỉ rời khỏi máy khi bạn chủ động bật một nhà cung cấp tuỳ chọn trên đám mây.

Có thể tự đăng lên TikTok hay YouTube giúp tôi không?

Không — nó tạo ra file MP4 hoàn chỉnh và lưu nhật ký đăng để bạn theo dõi, nhưng việc tải lên nền tảng hiện vẫn là một bước thủ công.

Có hỗ trợ giọng đọc và phụ đề tiếng Việt không?

Có — một engine chuyển văn bản thành giọng nói tiếng Việt chuyên biệt kèm nhân bản giọng, và phụ đề với bộ font tiếng Việt đã được kiểm tra cùng khả năng dịch qua lại tiếng Việt.

Tôi có thể dùng mô hình ảnh AI của riêng mình không?

Có — nhập một workflow ComfyUI (định dạng API) và chạy ngay trong studio, cùng với các nhà cung cấp ảnh/video tuỳ chọn từ OpenAI và Google.

Sẵn sàng khi bạn cần

Để GPU của bạn làm việc trong khi bạn làm việc khác

Thiết lập một lần trên chính phần cứng của bạn — mọi lượt dựng sau đó chỉ tốn tiền điện.

Quay lại trang chủ