Udostępniamy kolejne modele AI na Hugging Face

PKO Bank Polski udostępnił 3 nowe modele AI, które pomagają zrozumieć semantykę tekstu oraz pozwalają klasyfikować, grupować i wyszukiwać podobne stwierdzenia w dużych zbiorach tekstów.
około min czytania

Nowe modele embeddingowe pomagają rozumieć znaczenie tekstu i przedstawiają je w postaci, którą można łatwo wykorzystać w dalszej analizie. Mogą wspierać między innymi:

  • klasyfikację dokumentów i wiadomości, w szczególności w trybie few-shot,
  • wyszukiwanie podobnych sformułowań,
  • grupowanie podobnych spraw i zgłoszeń,
  • porównywanie semantyczne tekstów.

Nowe modele to:

  • embed-modernbert-68m 
  • embed-modernbert-395m 
  • embed-roberta-8k

Zaprojektowane z myślą o długich dokumentach

Wszystkie trzy modele obsługują kontekst o długości do około 8 tys. tokenów, co pozwala analizować długie dokumenty bez konieczności dzielenia ich na mniejsze fragmenty. Ma to znaczenie np. w pracy z dokumentami, korespondencją czy wielowątkowymi rozmowami z klientami.

Modele testowaliśmy na publicznych benchmarkach i na zanonimizowanych danych z obszaru bankowo-finansowego. Wyniki potwierdziły ich wysoką skuteczność w zadaniach związanych z rozumieniem, grupowaniem i klasyfikacją tekstu. Według naszych analiz są to aktualnie najskuteczniejsze modele reprezentacyjne dla języka polskiego w specjalnej klasie – embederów ogólnego przeznaczenia.

Kolejny krok w rozwoju polskich modeli AI

Udostępnienie nowych modeli jest kolejnym etapem rozwoju kompetencji AI w PKO Banku Polskim.

O modelu, który wcześniej udostępniliśmy pisaliśmy tutaj Dołączyliśmy do społeczności Hugging Face

Model RoBERTa ma już ponad 1 mln pobrań na Huging Face. Został też wykorzystany do stworzenia modelu Sójka (Bielik-Guard), który wykrywa niebezpieczne treści w internecie i znajduje kolejne zastosowania na rynku.

Dla zainteresowanych polecamy publikację naukową, której współautorami są nasi eksperci zaangażowani w rozwój modeli językowych: Long-Context Encoder Models for Polish Language Understanding

Wszystkie modele językowe, które stworzyliśmy i udostępniliśmy na Hugging Face, to efekt naszej współpracy z Ośrodkiem Przetwarzania Informacji – Państwowego Instytutu Badawczego:

  • nazwa projektu: "Budowa innowacyjnych polskich domenowych modeli językowych i platformy usługowej do serwowania modeli wielozadaniowych wewnątrz Banku”
  • finansowanie: NCBR, (numer projektu: FENG.01.01-IP.01-A028/23-00, wysokość wkładu z Funduszy Europejskich: 9,2 mln zł)