Jakie modele trzeba pobrać i ile ważąModele są dwa, oba pobierają się raz: model rozpoznawania mowy — 181 MB, zamienia głos w tekst; model językowy (LLM) — 1 GB, rozkłada tekst na pola przeglądu.