Whisper STT: transkrypcja mowy na tekst w 3 minuty
Miesiąc testów gratis, żeby sprawdzić jakość na własnych nagraniach.
Czym jest Whisper STT i jak działa transkrypcja mowy?
Whisper to model AI od OpenAI, wytrenowany na 680 000 godzin nagrań. Udostępniamy go jako proste API: wysyłasz plik audio, odbierasz gotowy tekst. Bez kolejek i bez limitów minutowych.
- Model open-source od OpenAI
- Ponad 99 języków i dialektów
- Automatyczne wykrywanie języka
- Znaczniki czasowe słów i segmentów
- Pliki audio/wideo do 1 GB
Transkrypcja nagrań: jakie problemy rozwiązuje?
Ręczna transkrypcja kosztuje godziny pracy przy każdym nagraniu. Whisper robi to samo w kilka minut.
Oszczędność czasu
Godzinne nagranie w około 3 minuty zamiast całego dnia ręcznej pracy.
Redukcja kosztów
Koszt transkrypcji spada do ułamka stawki transkrybenta, a wynik masz po kilku minutach.
99+ języków
Automatyczna transkrypcja w niemal dowolnym języku. Bez dodatkowych narzędzi.
Przeszukiwanie treści
Zamień nieszukalne audio w tekst i znajdź dowolny fragment w sekundy.
Jak działa API do transkrypcji mowy?
- 1
Wyślij plik
Upload audio/wideo przez API: MP3, WAV, MP4, WEBM i inne.
- 2
GPU przetwarza
Whisper analizuje nagranie na kartach NVIDIA. Godzina audio ≈ 3 minuty.
- 3
Odbierz tekst
Gotowa transkrypcja w wybranym formacie, z timestampami lub bez.
Tak wygląda wynik transkrypcji
Format wybierasz przy wysyłaniu pliku. JSON daje segmenty ze znacznikami czasu i wykrytym językiem, a SRT i VTT wgrywasz prosto do odtwarzacza wideo albo na YouTube.
{
"language": "pl",
"duration": 3612.4,
"segments": [
{
"id": 0,
"start": 0.0,
"end": 4.32,
"text": "Dzień dobry, zaczynamy spotkanie zarządu."
},
{
"id": 1,
"start": 4.32,
"end": 9.18,
"text": "Pierwszy punkt to wyniki sprzedaży za trzeci kwartał."
}
]
}Whisper API na GPU NVIDIA: dlaczego szybsze niż chmura?
GPU, nie CPU
Karty NVIDIA A100 i H100. Godzina nagrania to około 3 minuty przetwarzania.
Dane w Polsce
Twoje pliki nie opuszczają kraju. Pełna zgodność z RODO.
Ty wybierasz format
Wybierasz wariant (Ekspres, Standard albo Precyzja), format (SRT/VTT/JSON) i język nagrania.
Prosta integracja
Jeden endpoint REST i dokumentacja OpenAPI. Przykłady w Pythonie, Node.js i cURL dostajesz od nas.
Skaluje się z Tobą
Od jednego pliku po tysiące nagrań dziennie. Infrastruktura rośnie automatycznie.
Prawdziwi ludzie
Wsparcie techniczne od zespołu, który sam zbudował i utrzymuje to API.
Transkrypcja mowy: napisy do filmów, protokoły, analiza rozmów
Policz, ile kosztuje transkrypcja
Ustaw, ile nagrań przetwarzasz w miesiącu. Płacisz tylko za przetworzone minuty.
Twoja cena na start
54 zł/ mies.108 zł
Przy tym wolumenie płacisz 0,009 zł za minutę nagrania, w 99+ językach, z eksportem do SRT/VTT/JSON.
W AWS Transcribe ten sam wolumen kosztuje ok. 135 zł miesięcznie.
Progi wolumenowe
rabat wolumenowy -10%- pierwsze 50 godz.0,01 zł / min
- od 50 do 200 godz.0,008 zł / min
- od 200 do 1000 godz.0,007 zł / min
- powyżej 1000 godz.0,006 zł / min
Progi liczymy osobno, jak w podatkach: za wolumen z niższego progu płacisz stawkę tego progu. Ceny w tabeli zawierają rabat -50% na start.
Pierwszy miesiąc testów masz gratis. Rabat -50% dla nowych klientów obowiązuje po nim.
Zamów taki pakiet
Zostaw kontakt. Wyliczony wolumen trafi do nas razem z zapytaniem, a my odezwiemy się w ciągu 24h z dostępem i szczegółami.
Przetestuj transkrypcję przez miesiąc, za darmo
Wrzuć własne nagrania i sprawdź, jak Whisper STT radzi sobie z Twoim materiałem: akcentami, żargonem i jakością dźwięku.
Odpowiadamy w ciągu 24h. Pomagamy przy wdrożeniu.