$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Wielokanałowe sygnały cykliczne i dystrybucja danych
Przeanalizowano reprezentatywne wielokanałowe sygnały z cykli oraz rozkłady wydajności, aby scharakteryzować zachowanie odpowiedzi na cykle baterii litowo-jonowych. W badaniu wykorzystano pięć zbiorów danych baterii litowo-jonowych reprezentujących wiele układów chemicznych, w tym tlenek litu i kobaltu (LCO), tlenek niklu, kobaltu i glinu (NCA), tlenek niklu, manganu i kobaltu (NMC) oraz LFP (Tabela 1). Podstawowe zmienne cykliczne, takie jak napięcie, prąd, pojemność, temperatura, rezystancja wewnętrzna oraz sprawność kulombowska lub energetyczna, zostały zintegrowane z cechami inżynieryjnymi, takimi jak charakterystyki przyrostowej pojemności i różnicowego napięcia, w celu ustanowienia wielokanałowej struktury charakterystyki. Profile pojemność-napięcie i rozkłady SOH dla zbioru danych CALCE (Rysunek 3A), profile średniego napięcia i rozkłady SOH dla zbioru danych SANYO (Rysunek 3B), trajektorie starzenia dla zbioru danych PANASONIC (Rysunek 3C), mapy ciepła ewolucji napięcia dla zbioru danych KOKAM (Rysunek 3D) oraz profile rozkładu napięcia dla zbioru danych GOTION (Rysunek 3E) wykazały odmienne zachowania degradacyjne w oceniających składach chemicznych baterii. Na przykład zbiór danych GOTION IFP20100140A wykazał schodkową charakterystykę napięcia typową dla systemów LFP, podczas gdy zbiór danych PANASONIC NCR18650BD wykazał postępującą degradację pojemności wraz z przesunięciami profilu napięcia podczas długotrwałego cyklowania.
| Id zbioru danych | Typ / model baterii | Chemia | Format | Liczba ogniw | Suma przeanalizowanych cykli | Wykorzystane okna wczesnych cykli | Punkty próbkowania na cykl | Podstawowe kanały cyklowania | Dodatkowe kanały stanu | Cechy pochodne | Cele predykcji |
| Zbiór danych #1 | bateria CALCE LCO | LCO | Saszetkowa (Pouch) | 38 | 4 216 | Pierwsze 50, pierwsze 100, pierwsze 20% życia | 128 | Napięcie, prąd, czas, pojemność | Temperatura, rezystancja wewnętrzna | dQ/dV, dV/dQ, czas ładowania, energia rozładowania | SOH, RUL, energia możliwa do rozładowania |
| Zbiór danych #2 | SANYO UR18650E | NCA | Walcowa 18650 | 24 | 2 487 | Pierwsze 50, pierwsze 100, pierwsze 20% życia | 128 | Napięcie, prąd, czas, pojemność | Temperatura, wydajność kulombiczna | dQ/dV, nachylenie plateau napięcia, wydajność energetyczna | SOH, RUL, energia możliwa do rozładowania |
| Zbiór danych #3 | PANASONIC NCR18650BD | NCA | Walcowa 18650 | 42 | 5 134 | Pierwsze 50, pierwsze 100, pierwsze 20% życia | 128 | Napięcie, prąd, czas, pojemność | Temperatura, rezystancja wewnętrzna, wydajność kulombiczna | dQ/dV, dV/dQ, czas ładowania, przepływ energii | SOH, RUL, energia możliwa do rozładowania |
| Zbiór danych #4 | KOKAM SLPB533459H4 | NMC | Saszetkowa (Pouch) | 19 | 1 968 | Pierwsze 50, pierwsze 100, pierwsze 20% życia | 128 | Napięcie, prąd, czas, pojemność | Temperatura, rezystancja wewnętrzna | dQ/dV, czas rozładowania, nachylenie napięcia | SOH, RUL, energia możliwa do rozładowania |
| Zbiór danych #5 | GOTION IFP20100140A | LFP | Pryzmatyczna | 57 | 6 482 | Pierwsze 50, pierwsze 100, pierwsze 20% życia | 128 | Napięcie, prąd, czas, pojemność | Temperatura, rezystancja wewnętrzna, wydajność energetyczna | dQ/dV, czas trwania plateau, energia ładowania/rozładowania | SOH, RUL, energia możliwa do rozładowania |
Tabela 1: Charakterystyka zbiorów danych baterii litowo-jonowych, wielokanałowych zmiennych cyklicznych, opracowanych cech i celów predykcji wykorzystanych w odtwarzalnym procesie DL. Tabela podsumowuje zbiory danych baterii litowo-jonowych uwzględnione w niniejszym badaniu, w tym chemię baterii, format ogniwa, liczbę ogniw, całkowitą liczbę analizowanych cykli, okna obserwacji, gęstość próbkowania, wielokanałowe zmienne cykliczne, opracowane cechy elektrochemiczne oraz cele predykcji wykorzystane do opracowania i ewaluacji modelu. Skróty: SOH = stan zdrowia (state of health); RUL = pozostały okres użytkowania (remaining useful life); LCO = tlenek litu i kobaltu; NCA = tlenek niklu, kobaltu i glinu; NMC = tlenek niklu, manganu i kobaltu; LFP = fosforan litu i żelaza.

Rycina 3. Reprezentatywne wielokanałowe profile cykliczne i rozkłady stanu zdrowia baterii w zbiorach danych baterii litowo-jonowych. (A) Profile pojemność-napięcie i rozkłady SOH dla zbioru danych baterii litowo-kobaltowych CALCE. (B) Średnie profile napięcia i rozkłady SOH dla zbioru danych baterii niklowo-kobaltowo-glinowych SANYO. (C) Trajektorie starzenia i skumulowane rozkłady SOH dla zbioru danych baterii niklowo-kobaltowo-glinowych PANASONIC. (D) Mapy ciepła ewolucji napięcia i rozkłady próbek SOH dla zbioru danych baterii niklowo-manganowo-kobaltowych KOKAM. (E) Profile rozkładu napięcia i zależności SOH od rezystancji wewnętrznej dla zbioru danych baterii litowo-żelazowo-fosforanowych GOTION. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.
Ogólna wydajność predykcyjna dla magazynowania energii
Zaproponowany schemat pracy wykazał niskie błędy predykcji i spójną wydajność prognostyczną we wszystkich zadaniach ewaluacyjnych (Tabela 2). W przypadku szacowania SOH model osiągnął wartość MAE wynoszącą 0,021 na zbiorze walidacyjnym i 0,024 na zbiorze testowym, przy odpowiadających im wartościach R2 wynoszących odpowiednio 0,962 i 0,955. Wyniki te wskazują na stabilną wydajność prognostyczną w zakresie ciągłego szacowania stanu zdrowia baterii w ocenianych warunkach. Schemat wykazał również niezawodną zdolność predykcyjną w szacowaniu RUL oraz energii rozładowywalnej, osiągając wartości R2 na zbiorze testowym odpowiednio 0,927 i 0,941. Aby dalej ocenić stabilność predykcji, wszystkie parametry wydajności obliczono dla pięciu niezależnych inicjalizacji modelu z wykorzystaniem identycznych partycji zbioru danych. Wynikowe odchylenia standardowe oraz wartości współczynnika zmienności pozostały niskie w powtórzonych ewaluacjach, co wskazuje na ograniczoną wrażliwość na stochastyczną inicjalizację i stabilne zachowanie prognostyczne w powtarzalnych warunkach trenowania. Ponadto 95% przedziały ufności wykazały niewielką zmienność w powtórzonych uruchomieniach, co potwierdza odporność i powtarzalność zaproponowanego wielokanałowego schematu pracy.
| Zadanie predykcyjne | Podział zbioru danych | MAE | RMSE | MAPE (%) | R² |
| Szacowanie SOH | Walidacja | 0.021 | 0.029 | 2.47 | 0.962 |
| Szacowanie SOH | Test | 0.024 | 0.033 | 2.83 | 0.955 |
| Predykcja RUL | Walidacja | 18.6 | 25.9 | 8.74 | 0.938 |
| Predykcja RUL | Test | 21.4 | 29.7 | 9.63 | 0.927 |
| Predykcja energii rozładowywalnej | Walidacja | 0.087 | 0.121 | 3.18 | 0.948 |
| Predykcja energii rozładowywalnej | Test | 0.094 | 0.129 | 3.56 | 0.941 |
Tabela 2: Wydajność predykcyjna powtarzalnego przepływu pracy DL w celu szacowania parametrów akumulatorów litowo-jonowych w zestawach walidacyjnych i testowych.Tabela podsumowuje wydajność predykcyjną proponowanego przepływu pracy dla szacowania SOH, przewidywania RUL oraz przewidywania energii rozładowywalnej z wykorzystaniem zestawów walidacyjnych i testowych. Metryki wydajności obejmują średni błąd bezwzględny (MAE), pierwiastkowy błąd średniokwadratowy (RMSE), średni bezwzględny błąd procentowy (MAPE) oraz współczynnik determinacji (R2). Skróty: SOH = stan zdrowia (state of health); RUL = pozostały okres użytkowania (remaining useful life); MAE = średni błąd bezwzględny; RMSE = pierwiastkowy błąd średniokwadratowy; MAPE = średni bezwzględny błąd procentowy.
Porównanie wydajności różnych architektur DL
Ocena różnych architektur sieci i konfiguracji wejściowych wykazała znaczną zmienność w wydajności predykcyjnej (Tabela 3). Rozkłady RMSE przed i po wyborze architektury w oparciu o powtarzalność przedstawiono na Rysunku 4A. Architektura głębokiej sieci neuronowej generowała porównawczo wyższe wartości MAE i RMSE w stosunku do architektur opartych na sekwencjach oraz architektur hybrydowych. Porównania różnych konfiguracji wejściowych wielokanałowych podsumowano na Rysunku 4B. Modele łączące lokalną ekstrakcję cech z czasowym modelowaniem międzycyklicznym wykazały poprawioną dokładność predykcyjną w ocenianych warunkach. Modele wykazujące mniejszą zmienność predykcji zazwyczaj skupiały się przy wyższych średnich wynikach wydajności z mniejszymi odchyleniami standardowymi (Rysunek 4C). Zależności między średnią wydajnością a odchyleniem standardowym dla ocenianych konfiguracji wejściowych zilustrowano na Rysunku 4D. Wśród testowanych konfiguracji architektura CNN–LSTM osiągnęła najniższą wartość MAE (0,024) oraz najwyższą wartość R2 (0,955) w ramach ocenianych zbiorów danych i ustawień eksperymentalnych. Ponadto zintegrowanie cech inżynieryjnych z pełnymi wejściami wielokanałowymi zredukowało MAE do 0,022 przy wartości R2 wynoszącej 0,961, podczas gdy wejścia oparte wyłącznie na pojemności wykazały niższą wydajność predykcyjną.
| Kategoria | Model / Konfiguracja wejścia | MAE | RMSE | MAPE (%) | R² |
| Architektura głębokiego uczenia | DNN | 0.031 | 0.042 | 3.58 | 0.928 |
| CNN | 0.027 | 0.037 | 3.14 | 0.941 |
| LSTM | 0.026 | 0.036 | 3.05 | 0.944 |
| CNN–LSTM | 0.024 | 0.033 | 2.81 | 0.955 |
| Transformer | 0.025 | 0.034 | 2.89 | 0.951 |
| Konfiguracja wejścia | Tylko pojemność | 0.034 | 0.046 | 3.92 | 0.916 |
| Napięcie + prąd | 0.029 | 0.039 | 3.29 | 0.936 |
| Pełne wejście wielokanałowe | 0.024 | 0.033 | 2.83 | 0.955 |
| Wielokanałowe + cechy wygenerowane | 0.022 | 0.031 | 2.61 | 0.961 |
Tabela 3: Porównanie wydajności predykcyjnej dla różnych architektur DL i konfiguracji wejściowych. Tabela przedstawia porównanie wydajności predykcyjnej różnych architektur DL oraz konfiguracji wejściowych zastosowanych w powtarzalnym wielokanałowym przepływie pracy. Metryki wydajności obejmują średni błąd bezwzględny (MAE), pierwiastnik błędu średnio kwadratowego (RMSE), średni procentowy błąd bezwzględny (MAPE) oraz współczynnik determinacji (R2). Skróty: DNN = głęboka sieć neuronowa; CNN = konwolucyjna sieć neuronowa; LSTM = długa krótkotrwała pamięć; MAE = średni błąd bezwzględny; RMSE = pierwiastnik błędu średnio kwadratowego; MAPE = średni procentowy błąd bezwzględny.

Rycina 4. Porównanie architektur modeli i konfiguracji wejściowych w oparciu o powtarzalność. (A) Rozkłady średniokwadratowego błędu przed i po wyborze architektury w oparciu o powtarzalność. (B) Rozkłady średniokwadratowego błędu dla różnych konfiguracji wejściowych przed i po wyborze stabilnego modelu. (C) Porównanie średniej wydajności i odchylenia standardowego dla kandydujących architektur modeli, gdzie kolor wskazuje średniokwadratowy błąd, a otwarte kółka oznaczają wybrane stabilne modele. (D) Porównanie średniej wydajności i odchylenia standardowego dla konfiguracji wejściowych, gdzie kolor wskazuje średniokwadratowy błąd, a otwarte kółka oznaczają wybrane optymalne konfiguracje. Proszę kliknąć tutaj, aby zobaczyć powiększoną wersję tej ryciny.
Rozkład błędów i ocena spójności
Rozkłady błędów bezwzględnych przeanalizowano w celu oceny stabilności predykcji dla konwencjonalnych modeli bazowych ML oraz architektur DL. Tradycyjne modele ML wykazywały szersze rozkłady błędów i wydłużone ogony błędów wysokich, co wskazuje na mniejszą stabilność w złożonych zadaniach predykcji wzorców degradacji. Wśród ocenianych modeli DL architektura CNN–LSTM wykazała porównawczo węższe rozkłady błędów i krótsze ogony błędów wysokich, co sugeruje lepszą integrację ekstrakcji cech lokalnych i modelowania sekwencji czasowych (Rysunek 5). Włączenie zmiennych związanych z temperaturą, rezystancją wewnętrzną i sprawnością wiązało się z sukcesywnym zmniejszaniem rozproszenia błędów predykcji w analizowanych zbiorach danych.

Rysunek 5. Rozkłady błędów bezwzględnych dla konwencjonalnych modeli bazowych uczenia maszynowego (ML) i wielokanałowych modeli DL. Wykresy skrzydłowe (violin plots) porównujące rozkład bezwzględnych błędów predykcji dla konwencjonalnych modeli bazowych ML, architektur DL oraz wielokanałowych konfiguracji wejściowych. Czarne linie wskazują średni błąd bezwzględny, a kolorowe linie oznaczają średnią ± odchylenie standardowe. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Powtarzalność i odporność w różnych scenariuszach walidacji
Przepływ pracy zachował spójną wydajność predykcyjną w powtarzanych cyklach trenowania oraz przy zastosowaniu wielu strategii walidacji (Tabela 4). Powtórzone uruchomienia przeprowadzone z wykorzystaniem stałych partycji danych i stałych wartości ziarna losowego (random-seed) pozwoliły uzyskać stabilne wskaźniki wydajności, przy czym wartości R2 konsekwentnie utrzymywały się powyżej 0,95, a odchylenia standardowe MAE pozostały na niskim poziomie. Dodatkowa ocena z wykorzystaniem pięciokrotnej walidacji krzyżowej oraz zewnętrznych zbiorów walidacyjnych wykazała ograniczoną zmienność wydajności w powtarzalnych warunkach eksperymentalnych. Faza walidacji zewnętrznej opierała się wyłącznie na zbiorze danych GOTION, który został całkowicie wyłączony z procedur trenowania modelu i optymalizacji hiperparametrów. Ponieważ zbiór ten reprezentuje odmienną chemię LFP i konfigurację ogniw pryzmatycznych, ocena zewnętrzna zapewniła rygorystyczną weryfikację zdolności do generalizacji między zbiorami danych w heterogenicznych warunkach elektrochemicznych i strukturalnych. Ponadto analizy współczynnika zmienności oraz oceny powtórnych uruchomień wykazały niską dyspersję predykcyjną w niezależnych eksperymentach, co potwierdza odporność i powtarzalność zaproponowanego wielokanałowego przepływu pracy.
| Ustawienia walidacji | Metryka wydajności | Średnia | SD | Minimum | Maksimum | Współczynnik zmienności (%) |
| Powtórzone uruchomienia ze stałym podziałem danych (n = 5) | MAE | 0.023 | 0.0021 | 0.021 | 0.026 | 9.13 |
| RMSE | 0.032 | 0.0028 | 0.029 | 0.036 | 8.75 |
| MAPE (%) | 2.76 | 0.24 | 2.48 | 3.11 | 8.7 |
| R² | 0.957 | 0.006 | 0.949 | 0.964 | 0.63 |
| Powtórzone uruchomienia z różnymi ziarnami losowymi (n = 5) | MAE | 0.024 | 0.0024 | 0.021 | 0.027 | 10 |
| RMSE | 0.033 | 0.0031 | 0.029 | 0.037 | 9.39 |
| MAPE (%) | 2.84 | 0.27 | 2.52 | 3.19 | 9.51 |
| R² | 0.954 | 0.007 | 0.946 | 0.962 | 0.73 |
| Pięciokrotna walidacja krzyżowa | MAE | 0.025 | 0.003 | 0.022 | 0.029 | 12 |
| RMSE | 0.034 | 0.0034 | 0.03 | 0.039 | 10 |
| MAPE (%) | 2.95 | 0.31 | 2.57 | 3.41 | 10.51 |
| R² | 0.951 | 0.009 | 0.94 | 0.961 | 0.95 |
| Walidacja zewnętrzna | MAE | 0.027 | 0.0032 | 0.023 | 0.031 | 11.85 |
| RMSE | 0.037 | 0.0038 | 0.032 | 0.042 | 10.27 |
| MAPE (%) | 3.18 | 0.35 | 2.76 | 3.67 | 11.01 |
| R² | 0.944 | 0.011 | 0.931 | 0.956 | 1.17 |
Tabela 4: Analiza powtarzalności i odporności proponowanego wielokanałowego przepływu pracy DL w ramach wielokrotnych uruchomień treningowych i strategii walidacyjnych.Tabela podsumowuje wyniki powtarzalności i odporności proponowanego przepływu pracy podczas wielokrotnych uruchomień z ustalonymi partycjami danych, wielokrotnych uruchomień z różnymi ziarnami losowymi, pięciokrotnej walidacji krzyżowej oraz walidacji zewnętrznej. Metryki wydajności obejmują średni błąd bezwzględny (MAE), pierwiastek błędu średniokwadratowego (RMSE), średni bezwzględny błąd procentowy (MAPE), współczynnik determinacji (R2), odchylenie standardowe (SD) oraz współczynnik zmienności. Skróty: MAE = średni błąd bezwzględny; RMSE = pierwiastek błędu średniokwadratowego; MAPE = średni bezwzględny błąd procentowy; SD = odchylenie standardowe.
Wrażliwość hiperparametrów i ablacja cech
Analiza czułości hiperparametrów wykazała, że wydajność predykcji różniła się w zależności od wielkości okna obserwacyjnego, funkcji aktywacji, rozmiarów wymiarów ukrytych oraz głębokości modelu sekwencyjnego. Wpływ wielkości okna obserwacyjnego na rozkłady błędów predykcji przedstawiono na Rysunku 6A. W ocenianych warunkach okna obserwacyjne od 100 do 200 cykli wiązały się z niższymi błędami predykcji, podczas gdy dłuższe okna obserwacyjne wykazywały malejące przyrosty dokładności predykcyjnej. Zmienność predykcji zależna od funkcji aktywacji podsumowano na Rysunku 6B. Funkcje aktywacji ReLU (rectified linear unit) oraz GELU (Gaussian error linear unit) wykazały niższe błędy predykcji w porównaniu z alternatywnymi funkcjami aktywacji w ocenianych warunkach. Czułość wydajności predykcji na rozmiar wymiaru ukrytego oraz głębokość modelu sekwencyjnego przedstawiono na Rysunku 6C. Wymiary ukryte wynoszące 128 oraz od dwóch do trzech warstw modelowania sekwencyjnego wiązały się z poprawioną wydajnością predykcyjną, natomiast płytkie architektury i zredukowane wymiary ukryte wiązały się ze zwiększonym błędem predykcji. Analiza ablacji cech dodatkowo wykazała, że usunięcie cech inżynieryjnych lub zmiennych związanych z wydajnością zwiększyło MAE w stosunku do pełnej konfiguracji wielokanałowej (Tabela 5), co sugeruje, że połączone wejścia wielokanałowe i inżynieryjne cechy elektrochemiczne przyczyniły się do poprawy wydajności predykcyjnej.

Rysunek 6. Wrażliwość wydajności predykcji na zmiany hiperparametrów. (A) Wpływ rozmiaru okna wejściowego na rozkład błędu predykcji. (B) Wpływ wyboru funkcji aktywacji na rozkład błędu predykcji. (C) Mapa ciepła przedstawiająca wrażliwość predykcji na rozmiar wymiaru ukrytego i liczbę warstw modelu sekwencyjnego. Linie czarne oznaczają średni błąd absolutny, a linie kolorowe oznaczają średnią ± odchylenie standardowe, gdzie dotyczy. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
| Kategoria | Ustawienia | MAE | RMSE (pierwiastek błędu średniokwadratowego) | MAPE (%) | R² |
| Rozmiar okna wejściowego | 20 cykli | 0.031 | 0.043 | 3.74 | 0.927 |
| 50 cykli | 0.026 | 0.036 | 3.08 | 0.944 |
| 100 cykli | 0.023 | 0.032 | 2.71 | 0.957 |
| 150 cykli | 0.022 | 0.031 | 2.63 | 0.96 |
| 200 cykli | 0.022 | 0.031 | 2.59 | 0.961 |
| 250 cykli | 0.023 | 0.032 | 2.67 | 0.958 |
| 300 cykli | 0.024 | 0.033 | 2.79 | 0.955 |
| Funkcja aktywacji | ReLU | 0.023 | 0.032 | 2.74 | 0.957 |
| GELU | 0.022 | 0.031 | 2.61 | 0.961 |
| tanh | 0.026 | 0.036 | 3.05 | 0.946 |
| Sygmoidalny | 0.034 | 0.047 | 3.96 | 0.918 |
| Wymiar ukryty / Liczba kanałów na warstwę | 32 | 0.028 | 0.039 | 3.22 | 0.939 |
| 64 | 0.024 | 0.033 | 2.81 | 0.954 |
| 128 | 0.022 | 0.031 | 2.58 | 0.961 |
| 256 | 0.023 | 0.032 | 2.69 | 0.958 |
| Liczba warstw modelowania sekwencji | 1 | 0.027 | 0.038 | 3.14 | 0.942 |
| 2 | 0.023 | 0.032 | 2.73 | 0.956 |
| 3 | 0.022 | 0.031 | 2.6 | 0.961 |
| 4 | 0.024 | 0.034 | 2.86 | 0.952 |
| Ablacja cech | Pełne wielokanałowe + cechy zaprojektowane | 0.022 | 0.031 | 2.61 | 0.961 |
| Bez cech inżynieryjnych | 0.024 | 0.033 | 2.84 | 0.955 |
| Bez temperatury | 0.025 | 0.034 | 2.93 | 0.951 |
| Bez oporu wewnętrznego | 0.026 | 0.035 | 3.01 | 0.949 |
| Bez zmiennych związanych z efektywnością | 0.025 | 0.034 | 2.95 | 0.95 |
| Tylko napięcie + prąd | 0.029 | 0.039 | 3.29 | 0.936 |
| Wydajność | 0.034 | 0.046 | 3.92 | 0.916 |
Tabela 5: Analiza wrażliwości wydajności modelu przy różnych ustawieniach hiperparametrów i konfiguracjach ablacji cech.Tabela podsumowuje wpływ rozmiaru okna wejściowego, funkcji aktywacji, rozmiaru wymiaru ukrytego, głębokości modelu sekwencyjnego oraz strategii ablacji cech na wydajność predykcji w proponowanym wielokanałowym przepływie pracy DL. Metryki wydajności obejmują średni błąd absolutny (MAE), pierwiastkowy błąd średniokwadratowy (RMSE), średni procentowy błąd absolutny (MAPE) oraz współczynnik determinacji (R2). Skróty: MAE = średni błąd absolutny; RMSE = pierwiastkowy błąd średniokwadratowy; MAPE = średni procentowy błąd absolutny; ReLU = jednostka liniowa z prostowaniem; GELU = jednostka liniowa z błędem Gaussa.