Udostępniamy kolejne modele AI na Hugging Face
PKO Bank Polski udostępnił 3 nowe modele AI, które pomagają zrozumieć semantykę tekstu oraz pozwalają klasyfikować, grupować i wyszukiwać podobne stwierdzenia w dużych zbiorach tekstów. 2026-08-10Nowe modele embeddingowe pomagają rozumieć znaczenie tekstu i przedstawiają je w postaci, którą można łatwo wykorzystać w dalszej analizie. Mogą wspierać między innymi:
- klasyfikację dokumentów i wiadomości, w szczególności w trybie few-shot,
- wyszukiwanie podobnych sformułowań,
- grupowanie podobnych spraw i zgłoszeń,
- porównywanie semantyczne tekstów.
Nowe modele to:
- embed-modernbert-68m
- embed-modernbert-395m
- embed-roberta-8k
Zaprojektowane z myślą o długich dokumentach
Wszystkie trzy modele obsługują kontekst o długości do około 8 tys. tokenów, co pozwala analizować długie dokumenty bez konieczności dzielenia ich na mniejsze fragmenty. Ma to znaczenie np. w pracy z dokumentami, korespondencją czy wielowątkowymi rozmowami z klientami.
Modele testowaliśmy na publicznych benchmarkach i na zanonimizowanych danych z obszaru bankowo-finansowego. Wyniki potwierdziły ich wysoką skuteczność w zadaniach związanych z rozumieniem, grupowaniem i klasyfikacją tekstu. Według naszych analiz są to aktualnie najskuteczniejsze modele reprezentacyjne dla języka polskiego w specjalnej klasie – embederów ogólnego przeznaczenia.
Kolejny krok w rozwoju polskich modeli AI
Udostępnienie nowych modeli jest kolejnym etapem rozwoju kompetencji AI w PKO Banku Polskim.
O modelu, który wcześniej udostępniliśmy pisaliśmy tutaj Dołączyliśmy do społeczności Hugging Face
Model RoBERTa ma już ponad 1 mln pobrań na Huging Face. Został też wykorzystany do stworzenia modelu Sójka (Bielik-Guard), który wykrywa niebezpieczne treści w internecie i znajduje kolejne zastosowania na rynku.
Dla zainteresowanych polecamy publikację naukową, której współautorami są nasi eksperci zaangażowani w rozwój modeli językowych: Long-Context Encoder Models for Polish Language Understanding
Wszystkie modele językowe, które stworzyliśmy i udostępniliśmy na Hugging Face, to efekt naszej współpracy z Ośrodkiem Przetwarzania Informacji – Państwowego Instytutu Badawczego:
- nazwa projektu: "Budowa innowacyjnych polskich domenowych modeli językowych i platformy usługowej do serwowania modeli wielozadaniowych wewnątrz Banku”
- finansowanie: NCBR, (numer projektu: FENG.01.01-IP.01-A028/23-00, wysokość wkładu z Funduszy Europejskich: 9,2 mln zł)