„Opracowanie głębokiego modelu językowego przy wykorzystaniu uczenia instrukcjami przystosowanego do wykorzystania w automatyzacji pracy w przedsiębiorstwach.”
Emplocity Spółka Akcyjna, NIP 5223007585
Emplocity Spółka Akcyjna, NIP 5223007585
Kody CPV
Zadanie 1 i Zadanie 2 Opracowanie głębokiego modelu językowego przy wykorzystaniu uczenia instrukcjami przystosowanego do wykorzystania w automatyzacji pracy w przedsiębiorstwach.
Opracowanie głębokiego modelu językowego przy wykorzystaniu uczenia instrukcjami przystosowanego do wykorzystania w automatyzacji pracy w przedsiębiorstwach.
Olsztyn, Olsztyn, warmińsko-mazurskie
Kryterium cenowe
Cena – waga kryterium 100% Oferty oceniane według kryterium – cena (waga 100) P= C min/Cb *100 gdzie: P – liczba punktów przyznanych Wykonawcy w postępowaniu Cmin – najniższa zaoferowana w postępowaniu cena brutto. Cb – cena brutto zaoferowana w ofercie. Wygrywa oferta z największą liczbą punktów.
o Wykonawca wykonał w okresie ostatnich 5 lat przed upływem terminu składania ofert, a jeżeli okres prowadzenia działalności jest krótszy – w tym okresie, co najmniej 1 usługi zakresie przetwarzania dużej ilości danych /big data/ oraz wdrożenia produkcyjnego algorytmów przetwarzania dużych wolumenów danych tekstowych o wartości powyżej 500 000,00 zł brutto każdy. Warunek ten będzie uznany za spełniony, jeżeli Wykonawca złoży stosowne oświadczenie i przedstawi listę zrealizowanych usług w tym zakresie według wzoru stanowiącego Załącznik nr 2 do Zapytania ofertowego.
o Warunek ten będzie uznany za spełniony jeśli Wykonawca złoży stosowne oświadczenie i przedstawi listę potencjału osobowego umożliwiającego realizację przedmiotu zamówienia w tym minimum 2 specjalistów posiadających stopień naukowy, co najmniej doktora (w zakresie informatyki, matematyki lub nauk pokrewnych) oraz opisze zasoby techniczne, które przeznaczy na realizację usługi według wzoru stanowiącego Załącznik nr 2 do Zapytania ofertowego.
o Warunek ten będzie uznany za spełniony, jeżeli wykonawca złoży oświadczenie, że znajduje się w sytuacji ekonomicznej i finansowej zapewniającej wykonanie przedmiotu zamówienia według wzoru stanowiącego załącznik nr 2 do Zapytania ofertowego.
o Wykonawca oświadczył, iż nie jest podmiotem powiązanym osobowo i kapitałowo z Zamawiającym. Przez powiązania kapitałowe lub osobowe rozumie się wzajemne powiązania między Zamawiającym lub osobami upoważnionymi do zaciągania zobowiązań w imieniu Zamawiającego lub osobami wykonującymi w imieniu Zamawiającego czynności związane z przygotowaniem i przeprowadzeniem procedury wyboru wykonawcy, a wykonawcą, polegające w szczególności na: i. uczestniczeniu w spółce, jako wspólnik spółki cywilnej lub spółki osobowej, ii. posiadaniu co najmniej 10 % udziałów lub akcji, iii. pełnieniu funkcji członka organu nadzorczego lub zarządzającego, prokurenta, pełnomocnika, iv. pozostawaniu w związku małżeńskim, w stosunku pokrewieństwa lub powinowactwa w linii prostej, pokrewieństwa drugiego stopnia lub powinowactwa drugiego stopnia w linii bocznej lub w stosunku przysposobienia, opieki lub kurateli.
o Wykonawca przekaże prawa majątkowe i autorskie do powstałych w ramach projektu rozwiązań (w tym wszelkich instrukcji, kodu źródłowego, projektów, testów i danych) na rzecz Zamawiającego.
01.01.2024 - 31.08.2024
Przedmiotem Zadania 1 będzie Wsparcie Zamawiającego w badaniach mających na celu stworzenie automatycznego systemu generowania, anotacji i augmentacji danych na potrzeby tworzonego systemu sztucznej inteligencji dla wsparcia klientów Zamawiającego w obsłudze zapytań dedykowanych obszarów tematycznych a) Implementacja narzędzia do generowania danych Podwykonawca odpowiedzialny będzie za zaimplementowanie narzędzie, które umożliwi generowanie danych służących do trenowania modeli generatywnych. Dane będą zawierały instrukcje lub zapytanie napisane w języku naturalnym wraz z odpowiedzią i możliwością oceny. Narzędzie powinno umożliwić przypisanie uzupełniającej informacji lub kontekstu do instrukcji w dodatkowym polu. b) Generowanie danych Zadaniem podwykonawcy będzie przygotowanie zbioru danych składających się przynajmniej z 250 000 instrukcji. Każdy z elementów zbioru powinien zawierać instrukcję, prawidłową odpowiedź na zadany problem i opcjonalnie pomocniczy tekst do zapytania. c) Dostosowanie wygenerowanych danych Wykonawca opracuje specyficzne obszary rozmów w których chatbot powinien udzielać odpowiedzi. Zostaną także wyodrębnione domeny rozmowy, w przypadku których eksperymentalny moduł konwersacyjny nie będzie udzielał wygenerowanej odpowiedzi, a jedynie wcześniej zdefiniowaną przez podwykonawcę formułę. Po określeniu obszarów rozmowy, podwykonawca przetworzy wygenerowane wcześniej dane tak, aby ograniczyć je jedynie do pożądanych tematów dialogów. Następnie wykona procedurę zwiększenia jakości danych poprzez przeprowadzenie takich czynności jak usuwanie duplikatów, formatowanie, indeksowanie i zwielokrotnianie danych. d) Przygotowanie zbioru danych pozwalających na wzmocniony trening na podstawie informacji zwrotnych od użytkowników (RLHF). W ramach tego Podzadania wykonawca przeprowadzi anotację danych, która pozwoli ocenić poprawność odpowiedzi chatbota według rozmówcy. Tak uzyskane dane od użytkowników pozwolą na trening modelu techniką ze wzmocnieniem przy użyciu odpowiedzi użytkownika (Reinforcement Learning from Human Feedback (RLHF)). e) Dodatkowa anotacja danych wytrenowanych modeli Podwykonawca oznaczy przynajmniej 3000 przykładów w danych z wygenerowanego w poprzednich Podzadaniach zbioru. Pomocnicza anotacja będzie wskazywać czy na podstawie instrukcji model powinien wygenerować odpowiedź w sposób jednoznaczny. Zebrane w ten sposób dane zostaną oddzielone od zbioru treningowego i oznaczone jako zbiór walidacyjny. Umożliwi to w kolejnym etapie automatyczne porównanie jakości wytrenowanych modeli.
01.09.2024 - 30.04.2025
Przedmiotem Zadania 2 będą badania i eksperymenty w zakresie wyworzenia i wytrenowania modeli sieci neuronowej typu transformer , które będą trenowane na danych powstałych w poprzednim etapie. W szczególności Podwykonawca odpowiedzialny będzie za wykonanie następujących prac: a) Opracowanie i implementacja architektury sieci neuronowej typu transformer z wykorzystaniem danych zawierających instrukcje. Zadaniem podwykonawcy będzie opracowanie i implementacja optymalnej architektury modelu opartej na sztucznych sieciach neuronowych. Zaprojektowany w ten sposób model ma odpowiedni dla danych przygotowanych w ramach poprzedniego etapu i umożliwiać dotankowywanie instrukcjami b) Implementacja metod adaptacyjnych Zadaniem podwykonawcy będzie integracja metod z wykorzystaniem adapterów do zaimplementowanego wcześniej modelu. Podwykonawca zgodnie z testami i ich wynikami wybierze odpowiednią metodę adapterów np. metodę Low-Rank Adaptation albo metodę (IA)^3. Wybrana metoda wykorzystania adapterów musi poprawić szybkości treningu modelu przy mniejszym obciążeniu obliczeniowym. c) Kwantyzacja wytrenowanego modelu opartego na architekturze transformer Zadaniem podwykonawcy będzie optymalizacja modelu przy użyciu metody kwantyzacji zmieniając dokładność parametrów modelu z 32-bitowych do wybranych wartości optymalnych wybranych w trakcie testów i eksperymentów. Podwykonawca powinien wykazać wpływ z zastosowania tej techniki na rozmiar modelu, a także na czas inferencji. d) Implementacja architektury modelu RLHF Wykonawca zaimplementuje model językowy oparty na architekturze transformera, dla którego możliwe będzie iteracyjne dotrenowywanie na podstawie danych zwrotnych uzyskiwanych od anotatorów a następnie użytkowników. Taki sposób treningu będzie prowadził do uzyskiwania większej precyzji generowanego tekstu przez model. e) Implementacja metryk porównujących modele z różnymi adapterami i modele przed i po kwantyzacji W ramach tego Podzadania podwykonawca będzie musiał zaimplementować metryki określające jakość wytrenowanych modeli. Podwykonawca odpowiedzialny będzie także za porównanie wytrenowanych wcześniej modeli na zaazotowanym w pierwszym etapie zbiorze walidacyjnym, aby określić najbardziej skuteczną metodę odpowiedzi przez chatbota. f) Detekcja nieadekwatnych wiadomości użytkownika Zadaniem podwykonawcy będzie implementacja modelu, który będzie określał czy wiadomość wpisana przez użytkownika jest zgodna z określonymi tematami rozmów