Używamy plików cookies, aby zapewnić prawidłowe działanie strony. Możesz zarządzać swoimi preferencjami lub zapoznać się z naszą polityką prywatności

Whisper STT

Whisper STT: transkrypcja mowy na tekst w 3 minuty

Whisper STT przetwarza godzinę audio w 3 minuty. Obsługa 99+ języków, znaczniki czasowe, format SRT/VTT/JSON, na serwerach w Polsce.

Miesiąc testów gratis, żeby sprawdzić jakość na własnych nagraniach.

Co to jest

Czym jest Whisper STT i jak działa transkrypcja mowy?

Whisper to model AI od OpenAI, wytrenowany na 680 000 godzin nagrań. Udostępniamy go jako proste API: wysyłasz plik audio, odbierasz gotowy tekst. Bez kolejek i bez limitów minutowych.

  • Model open-source od OpenAI
  • Ponad 99 języków i dialektów
  • Automatyczne wykrywanie języka
  • Znaczniki czasowe słów i segmentów
  • Pliki audio/wideo do 1 GB
Problemy

Transkrypcja nagrań: jakie problemy rozwiązuje?

Ręczna transkrypcja kosztuje godziny pracy przy każdym nagraniu. Whisper robi to samo w kilka minut.

Oszczędność czasu

Godzinne nagranie w około 3 minuty zamiast całego dnia ręcznej pracy.

Redukcja kosztów

Koszt transkrypcji spada do ułamka stawki transkrybenta, a wynik masz po kilku minutach.

99+ języków

Automatyczna transkrypcja w niemal dowolnym języku. Bez dodatkowych narzędzi.

Przeszukiwanie treści

Zamień nieszukalne audio w tekst i znajdź dowolny fragment w sekundy.

Jak to działa

Jak działa API do transkrypcji mowy?

  1. 1

    Wyślij plik

    Upload audio/wideo przez API: MP3, WAV, MP4, WEBM i inne.

  2. 2

    GPU przetwarza

    Whisper analizuje nagranie na kartach NVIDIA. Godzina audio ≈ 3 minuty.

  3. 3

    Odbierz tekst

    Gotowa transkrypcja w wybranym formacie, z timestampami lub bez.

Wynik

Tak wygląda wynik transkrypcji

Format wybierasz przy wysyłaniu pliku. JSON daje segmenty ze znacznikami czasu i wykrytym językiem, a SRT i VTT wgrywasz prosto do odtwarzacza wideo albo na YouTube.

{
  "language": "pl",
  "duration": 3612.4,
  "segments": [
    {
      "id": 0,
      "start": 0.0,
      "end": 4.32,
      "text": "Dzień dobry, zaczynamy spotkanie zarządu."
    },
    {
      "id": 1,
      "start": 4.32,
      "end": 9.18,
      "text": "Pierwszy punkt to wyniki sprzedaży za trzeci kwartał."
    }
  ]
}
Korzyści

Whisper API na GPU NVIDIA: dlaczego szybsze niż chmura?

GPU, nie CPU

Karty NVIDIA A100 i H100. Godzina nagrania to około 3 minuty przetwarzania.

Dane w Polsce

Twoje pliki nie opuszczają kraju. Pełna zgodność z RODO.

Ty wybierasz format

Wybierasz wariant (Ekspres, Standard albo Precyzja), format (SRT/VTT/JSON) i język nagrania.

Prosta integracja

Jeden endpoint REST i dokumentacja OpenAPI. Przykłady w Pythonie, Node.js i cURL dostajesz od nas.

Skaluje się z Tobą

Od jednego pliku po tysiące nagrań dziennie. Infrastruktura rośnie automatycznie.

Prawdziwi ludzie

Wsparcie techniczne od zespołu, który sam zbudował i utrzymuje to API.

Zastosowania

Transkrypcja mowy: napisy do filmów, protokoły, analiza rozmów

Transkrypcja spotkań i konferencji
Napisy do filmów i podcastów
Dokumentacja medyczna i prawna
Analiza rozmów call center
Indeksowanie audio dla wyszukiwarek
Dostępność dla osób niesłyszących
Cennik

Policz, ile kosztuje transkrypcja

Ustaw, ile nagrań przetwarzasz w miesiącu. Płacisz tylko za przetworzone minuty.

-50% na start
Wariant jakości
Nagrania miesięcznie100 godz.

Twoja cena na start

54 zł/ mies.108 zł

Przy tym wolumenie płacisz 0,009 zł za minutę nagrania, w 99+ językach, z eksportem do SRT/VTT/JSON.

W AWS Transcribe ten sam wolumen kosztuje ok. 135 zł miesięcznie.

Progi wolumenowe

rabat wolumenowy -10%
  • pierwsze 50 godz.0,01 zł / min
  • od 50 do 200 godz.0,008 zł / min
  • od 200 do 1000 godz.0,007 zł / min
  • powyżej 1000 godz.0,006 zł / min

Progi liczymy osobno, jak w podatkach: za wolumen z niższego progu płacisz stawkę tego progu. Ceny w tabeli zawierają rabat -50% na start.

Pierwszy miesiąc testów masz gratis. Rabat -50% dla nowych klientów obowiązuje po nim.

Zamów taki pakiet

Zostaw kontakt. Wyliczony wolumen trafi do nas razem z zapytaniem, a my odezwiemy się w ciągu 24h z dostępem i szczegółami.

Przetestuj transkrypcję przez miesiąc, za darmo

Wrzuć własne nagrania i sprawdź, jak Whisper STT radzi sobie z Twoim materiałem: akcentami, żargonem i jakością dźwięku.

Odbierz miesiąc testów

Odpowiadamy w ciągu 24h. Pomagamy przy wdrożeniu.