
Od pewnego czasu obserwuję rozwój generatywnej sztucznej inteligencji i mam wrażenie, że zaczęliśmy zataczać koło. Powstają kolejne narzędzia, kolejne platformy i kolejni „agenci AI”, ale coraz częściej ich działanie wygląda znajomo. Model językowy otrzymuje dane, wykonuje kilka kroków, komunikuje się z innym systemem, generuje odpowiedź i przekazuje ją dalej. Jeszcze kilka lat temu samo pokazanie, że AI potrafi napisać wiadomość, podsumować dokument albo wygenerować fragment kodu, robiło ogromne wrażenie. Dziś nie jest to już technologiczna sensacja. Normalna rzecz, że pojawia się pytanie, czy automatyzacja za pomocą AI zaczyna dochodzić do swojej granicy? W tym poście chcę wyjaśnić tą kwestię.
Od pojedynczego zadania do całego procesu
Może nie wiesz, ale badania sugerują nam coś znacznie ciekawszego. Otóż automatyzacja się nie kończy. Zmienia się natomiast poziom problemów, które próbujemy automatyzować. Jednym z najważniejszych problemów w rozmowie o automatyzacji jest mieszanie trzech różnych pojęć: zadania, procesu i zawodu. Wiem, że można się pogubić, ale chcę to wszystko wyjaśnić: dlaczego w automatyzacji AI jest to ważne. Podejdźmy do tego od strony inżynierskiej (patrz Rys. 1).
Rys. 1 Różnice pomiędzy pojęciami zadanie, proces i zawód
Napisanie odpowiedzi na wiadomość klienta jest zadaniem. Obsługa zgłoszenia klienta od momentu jego otrzymania do rozwiązania problemu jest już procesem. Praca osoby zatrudnionej w dziale obsługi klienta obejmuje natomiast wiele różnych procesów, sytuacji wyjątkowych, decyzji oraz interakcji z innymi ludźmi. AI może bardzo dobrze automatyzować pierwszy poziom, niekoniecznie radząc sobie równie dobrze z kolejnymi.
Dobrze pokazuje to badanie Erika Brynjolfssona, Danielle Li i Lindsey Raymond opublikowane w 2025 roku w The Quarterly Journal of Economics. Autorzy przeanalizowali wdrożenie generatywnego asystenta AI wśród 5172 pracowników obsługi klienta. To istotny wynik, ale nie oznacza, że AI zastąpiło pracowników obsługi klienta. System pomagał im wykonywać określone elementy pracy i ta różnica miała znaczenie.
AI bardzo dobrze automatyzuje to, co ma jasno określone granice
Generatywna AI świetnie radzi sobie z sytuacją, w której możemy powiedzieć: „Podsumuj ten dokument” czy „Na podstawie tych danych przygotuj odpowiedź”. Każde z tych poleceń ma stosunkowo wyraźnie określone wejście oraz oczekiwany rezultat, ale problem robi się znacznie trudniejszy, kiedy zamiast jednej czynności chcemy zautomatyzować cały proces. Ach, znów to podejście inżynierskie ;)
Wyobraź sobie, że system ma samodzielnie odebrać wiadomość, określić problem, znaleźć dane klienta, sprawdzić wcześniejszą historię kontaktu, zdecydować o sposobie rozwiązania sprawy, zmodyfikować informacje w zewnętrznym systemie, wygenerować odpowiedź, wysłać ją i zweryfikować, czy problem rzeczywiście został rozwiązany. Uff, dużo roboty, prawda? No, w końcu przestajemy mieć jeden uniwersalny model wykonujący te wszystkie zadania. Mówiąc bardziej inżyniersko, mamy system. No bo model to zaledwie jeden z komponentów tego systemu, działający jak pojedyncza funkcja obliczeniowa lub wyspecjalizowany moduł decyzyjny. Meh, mądralińska się znalazła, prawda? Tak czy inaczej, tego uczyli nas na inżynierii oprogramowania.
Wróćmy do tematu. Mamy system podejmujący sekwencję zależnych od siebie decyzji.Niestety, jest też druga strona medalu - błąd na początku takiego procesu może wpływać na wszystkie kolejne kroki.
Agenty AI mieli rozwiązać ten problem
Agenty AI miały rozwiązać pewien problem, dlatego tak dużo uwagi poświęca się obecnie agentom AI (bo rozwiązania AI z reguły rozwiązują jakiś problem). Agent nie musi tylko odpowiedzieć na pytanie użytkownika. Może analizować sytuację, planować, wybierać narzędzia, wykonywać działania w innych aplikacjach, obserwować rezultaty i na ich podstawie podejmować kolejne decyzje.
Nie wiem, czy wiecie, ale w architekturach agentowych bardzo często pojawiają się również maszyny stanów albo bardziej rozbudowane grafy stanów. Zadaniem jest uporządkowanie tego, na jakim etapie znajduje się agent i co może zrobić dalej. Agent może znajdować się na przykład w stanie: analiza zadania, planowanie, użycie narzędzia, oczekiwanie na wynik, weryfikacja, ponowna próba, przekazanie sprawy człowiekowi albo zakończenie działania. Przejście do kolejnego stanu zależy od wyniku poprzedniego kroku. Jeżeli narzędzie zwróci poprawny rezultat, agent może przejść do weryfikacji. Jeżeli pojawi się błąd, może uruchomić inną ścieżkę albo ponowić próbę. Jeżeli brakuje danych, proces może zostać zatrzymany i użytkownik poproszony o informację. W praktyce taka struktura pełni więc rolę warstwy sterującej: ogranicza chaos, porządkuje kolejne decyzje i pozwala zdefiniować, co agent powinien zrobić w sytuacjach wyjątkowych. To ważne, ponieważ sam model językowy generuje kolejne decyzje probabilistycznie, a maszyna stanów pozwala narzucić mu bardziej przewidywalną strukturę działania.
Tak czy inaczej, w teorii brzmi to jak kolejny poziom automatyzacji. Zdradzę Ci, że rzeczywiście tak jest. Problem polega na tym, że ocena takich systemów staje się znacznie trudniejsza niż ocena zwykłego modelu językowego. Kehkashan i współautorzy w przeglądzie opublikowanym w 2026 roku w Artificial Intelligence Review przeanalizowali 15 popularnych benchmarków wykorzystywanych do oceny systemów agentowych. Zwrócili uwagę na istotną lukę pomiędzy wynikiem osiąganym w benchmarku a rzeczywistą gotowością systemu do wdrożenia. Spośród analizowanych benchmarków żaden nie uwzględniał bezpieczeństwa lub cyberbezpieczeństwa bezpośrednio w podstawowej punktacji, a żaden nie traktował kosztu wykonania jako podstawowego elementu oceny. Większość koncentrowała się przede wszystkim na tym, czy zadanie zostało wykonane.
Często też rozmawiamy ze studentami o vibe codingu i cyberbezpieczeństwie. No i tu dochodzimy do sedna. Jeden ze studentów nagle mówi: „Jak jest pod kontrolą człowieka, to wszystko w porządku". No właśnie. Kontrola ludzka, a nie samodzielny byt. Ale tu przechodzimy do pytania: „Czy agent osiągnął cel?”. Warto zauważyć, że to jedno z wielu pytań. Moim zdaniem ważne jest, czy zrobił to bezpiecznie i ile kosztowało jego działanie.
Dobry wynik benchmarku nie oznacza jeszcze dobrego systemu
W czerwcu byłam na warsztacie Eskadry Bielika. Tak w skrócie: warsztaty lokalne Eskadry Bielika to bezpłatne, kilkugodzinne szkolenie hands-on dla osób, które chcą zrozumieć – na przykładzie bazy wiedzy dla hotelu – jak działa retrieval-augmented generation (RAG) i jak przekłada się to rozwiązanie na konkretne systemy, które można wdrożyć w organizacji. No i właśnie na tym warsztacie prowadzący powiedział: "Wynik benchmarku zależy od tego, kto go wypuszcza”, no i ja tu się w 100% zgadzam.
Problem ten powraca również w bardzo świeżym, opublikowanym we wrześniu 2026 roku przeglądzie Vinotha Nageshwarana i współautorów. Badacze przeanalizowali literaturę dotyczącą oceny agentów opartych na dużych modelach językowych. Ich mapa obejmowała 259 podstawowych badań, a rozszerzony zbiór przeglądu obejmował 294 prace. Autorzy wskazują między innymi na trzy szczególnie trudne do jednoczesnego kontrolowania kwestie: zanieczyszczenie danych testowych, niedeterministyczność działania agentów oraz koszt ich uruchamiania. Wśród 17 szczegółowo przeanalizowanych benchmarków żaden nie dokumentował jednoczesnej kontroli wszystkich trzech problemów. To pokazuje, że rozwój agentów zaczyna odsłaniać problem, którego wcześniej nie było aż tak wyraźnie widać.
Nie wystarczy już ocenić samej odpowiedzi modelu. Trzeba ocenić cały przebieg jego działania.
Jeden mały błąd może zepsuć bardzo długą automatyzację
Moim okiem inżynierskim dostrzegam, że w klasycznej automatyzacji wiele operacji jest deterministycznych. Proces deterministyczny to taki, który dla tych samych danych wejściowych zawsze, bez wyjątku, daje dokładnie taki sam wynik. Działa jak klasyczny przepis na ciasto albo matematyczne równanie 2 + 2 = 4.W świecie tradycyjnego oprogramowania oznacza to sztywne reguły: „Jeśli w polu A jest tekst, skopiuj go do pola B”. Nie ma tu miejsca na interpretację, domysły czy kreatywność. Komputer wykonuje instrukcję krok po kroku ze 100% przewidywalnością. Jeżeli program zadziała poprawnie raz, zadziała tak samo milion razy, bo jego ścieżka jest z góry zdefiniowana („zamknięta”).
Jeżeli program ma pobrać wartość z określonego pola i zapisać ją w bazie, możemy bardzo dokładnie określić sposób działania. W przypadku agenta opartego na modelu generatywnym sytuacja wygląda inaczej. Jeżeli taki błąd pojawi się na przykład w czwartym kroku trzydziestostopniowego procesu, kolejne działania mogą być wykonywane technicznie poprawnie, ale już na podstawie niewłaściwego założenia.To jeden z powodów, dla których proste demonstracje agentów wyglądają dziś znacznie bardziej imponująco niż rzeczywiste wdrożenia. System produkcyjny musi działać wielokrotnie, w różnych warunkach i również wtedy, kiedy wydarzy się coś, czego wcześniej nie przewidziano.\
To może zostawmy człowieka w pętli? ;)
Oczywiście, że najlepszą odpowiedzią na to pytanie jest human in the loop! AI wykonuje pracę, ale człowiek kontroluje jego decyzje. Brzmi jak idealna współpraca? Niby tak, ale również tutaj literatura naukowa pokazuje bardziej skomplikowany obraz. Michelle Vaccaro, Abdullah Almaatouq i Thomas Malone przeprowadzili systematyczny przegląd i metaanalizę 106 eksperymentów, obejmującą łącznie 370 efektów dotyczących współpracy ludzi z AI. Wynik jest bardzo ciekawy. Zespoły człowiek–AI radziły sobie średnio lepiej niż sam człowiek. Kiedy porównano je z lepszym wynikiem spośród dwóch możliwości: człowiekiem działającym samodzielnie albo AI działającym samodzielnie, współpraca człowieka i AI osiągała przeciętnie gorsze rezultaty.
Ajajaj, czyli to niedobrze? No, nie jest aż tak źle, po prostu człowiek + AI nie zawsze oznacza wynik lepszy niż człowiek lub AI osobno. Badacze zauważyli również różnice zależne od rodzaju zadania. Zadania wymagające podejmowania decyzji częściej wiązały się ze stratami wynikającymi ze współpracy, natomiast w zadaniach związanych z tworzeniem treści efekty były bardziej korzystne. Warto wiedzieć, że sama obecność człowieka w procesie nie rozwiązuje automatycznie problemów związanych z AI.
Może nie powinniśmy wybierać: człowiek albo AI
Jeszcze ciekawszą perspektywę przedstawiają Andreas Fügener, Dominik Walzner i Alok Gupta. Autorzy rozróżniają automatyzację w taki sposób, że AI wykonuje zadanie zamiast człowieka oraz augmentację, kiedy człowiek wykonuje zadanie przy wsparciu AI. W przeprowadzonym przez nich eksperymencie ludzie osiągali około 68% trafności, AI działające samodzielnie 77%, a człowiek współpracujący z AI 80%. Badacze zaproponowali jednak system, w którym nie stosowano jednej strategii dla wszystkich przypadków. Poszczególne zadania były przydzielane człowiekowi, AI albo człowiekowi wspieranemu przez AI w zależności od tego, który wariant miał w danym przypadku największy sens. Tak jak w przypadku poprzedniego posta, może pytanie było źle zadane. Spróbujmy od nowa. Nie pytajmy: „Czy możemy zautomatyzować ten proces?” tylko „Które elementy procesu powinno wykonywać AI, które człowiek, a które powinni wykonywać wspólnie?”. Od razu lepiej.
Człowiek może kontrolować AI tylko pozornie
Istnieje jeszcze jeden problem z koncepcją human in the loop. Ufamy temu podejściu, że człowiek zauważy błąd. A co jeśli nie? Cała koncepcja się sypie? Joe Pearson i współautorzy zbadali w 2026 roku 295 uczestników, którzy mieli oceniać, czy przedstawione im twarze są prawdziwe czy wygenerowane przez AI. Uczestnicy widzieli 80 twarzy i otrzymywali dodatkową wskazówkę, która miała pochodzić albo od człowieka, albo od AI. Wskazówki były poprawne tylko w połowie przypadków. Co ciekawe, uczestnicy z bardziej pozytywnym nastawieniem do AI, którzy otrzymywali wskazówki przypisywane sztucznej inteligencji, gorzej rozróżniali prawdziwe i syntetyczne twarze niż osoby o mniej pozytywnym nastawieniu. Jednak badanie nie pokazuje, czy udzie zawsze bezrefleksyjnie wierzą AI. Wprost przeciwnie. Uczestnicy potrafili częściej odrzucać błędne sugestie. Pokazuje to, że zaufanie do automatyzacji może wpływać na jakość ludzkiego nadzoru. Możemy formalnie pozostawić człowieka w procesie. Ale jeżeli po kilkuset poprawnych decyzjach AI jego praca zacznie sprowadzać się do bezmyślnego klikania „zaakceptuj”, to człowiek nadal znajduje się w pętli tylko na diagramie architektury.
Automatyzacja nie znika. Znika jej najprostsza wersja
Właśnie dlatego nie sądzę, żebyśmy obserwowali koniec automatyzacji AI, chociaż widziałam takie publikacje naukowe. Raczej kończy się etap, w którym samo podłączenie modelu językowego do istniejącego procesu było czymś wyjątkowym. Wiele funkcji, które jeszcze niedawno pokazywano jako osobne „produkty AI”, stopniowo staje się zwykłą funkcją większego oprogramowania. I to wcale nie oznacza, że rozwój się zatrzymał, chociaż też miałam takie momenty, że w to wierzyłam. Oznacza tylko, że przesunęła się granica tego, co jest trudne. Dlatego kolejne fale nie robią już wielkiego WOW.
Następna fala automatyzacji jest mniej efektowna
Kolejny etap nie polega już na tym, żeby model wygenerował poprawny tekst. Trzeba zaprojektować system, który będzie wiedział jakich danych użyć czy kiedy może wykonać działanie samodzielnie. I nagle okazuje się, że najważniejszym problemem nie jest już prompt, tylko architektura całego systemu.
A co z no-code? Rozwiązania no-code nie znikną. Proste, powtarzalne i stosunkowo bezpieczne procesy pozostaną niezwykle użyteczne. Można połączyć formularz, bazę danych, model językowy i system pocztowy bez budowania całej infrastruktury od początku. Problem zaczyna się wtedy, kiedy proces przestaje być prosty. Jeżeli system ma dostęp do poufnych danych, może wykonywać działania w zewnętrznych aplikacjach, podejmować decyzje wpływające na użytkowników albo działać przez długi czas bez ciągłego nadzoru, najważniejsze przestaje być to, czy da się połączyć kilka modułów.
Znacznie ważniejsze staje się to, czy ktoś rozumie cały system. No i tu moja dusza inżynierska śpiewa i tańczy, bo to nie jest już wyłącznie automatyzacja, tylko INŻYNIERIA!
Czy automatyzacja AI się kończy?
Nie widzę w obecnej literaturze naukowej dowodów na to, żeby automatyzacja oparta na AI właśnie dochodziła do końca. Najłatwiejsze zastosowania zaczynają się komodytyzować. Samo generowanie treści, klasyfikowanie tekstu czy przekazywanie informacji między aplikacjami przestaje stanowić dużą przewagę. Badania nad współpracą człowieka z AI pokazują jednocześnie, że większa ilość AI nie musi automatycznie oznaczać lepszego systemu.
Badania nad agentami pokazują natomiast, że wraz ze wzrostem długości i złożoności procesu pojawiają się zupełnie nowe problemy związane z niezawodnością, bezpieczeństwem, kosztem i kontrolą. Dlatego kolejną falą AI prawdopodobnie nie będzie kolejny chatbot potrafiący napisać jeszcze lepszego maila. Ale już teraz zadajmy sobie pytanie: jak budować systemy, które wiedzą nie tylko, jak wykonać zadanie, ale również kiedy działać samodzielnie, kiedy współpracować z człowiekiem i kiedy w ogóle się zatrzymać?
Automatyzacja AI się nie kończy.
Kończy się raczej okres, w którym samo zautomatyzowanie czegoś za pomocą AI wystarczało, żeby nazwać to innowacją.
Literatura
- Brynjolfsson, E., Li, D., & Raymond, L. (2025). Generative AI at Work. The Quarterly Journal of Economics, 140(2), 889–942. https://doi.org/10.1093/qje/qjae044.
- Fügener, A., Walzner, D. D., & Gupta, A. (2025). Roles of Artificial Intelligence in Collaboration with Humans: Automation, Augmentation, and the Future of Work. Management Science, 72(1), 538–557. https://doi.org/10.1287/mnsc.2024.05684. Artykuł opublikowany online w 2025 r.; numer czasopisma ukazał się w styczniu 2026 r.
- Kehkashan, T., Abdullah, M., Al-Shamayleh, A. S., Ivković, N., Ismail, N. A., Syed Ahmad, S. S., Rehman, A., & Akhunzada, A. (2026). From benchmarks to deployment: a comprehensive review of agentic AI evaluation. Artificial Intelligence Review, 59(8), Article 167. https://doi.org/10.1007/s10462-026-11571-0.
- Nageshwaran, V., Ezekiel, S., Tran, T. T., & Narasimhan, V. L. (2026). Large language model agent evaluation and benchmarking: a systematic survey, meta-taxonomy, and critical research roadmap. Artificial Intelligence Review. https://doi.org/10.1007/s10462-026-11678-4. Artykuł zaakceptowany po recenzji i opublikowany online 15 września 2026 r.
- Pearson, J., Dror, I. E., Jayes, E., Whordley, G.-R., Mason, G., & Nightingale, S. (2026). Examining human reliance on artificial intelligence in decision making. Scientific Reports, 16(1), Article 5345. https://doi.org/10.1038/s41598-026-34983-y.
- Vaccaro, M., Almaatouq, A., & Malone, T. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 8, 2293–2303. https://doi.org/10.1038/s41562-024-02024-1.
- Yuan, M., Zhou, Z., Xiong, X., Wu, W., Sun, J., Song, J., Cui, K., Wang, B., Wu, H., Li, Y., et al. (2026). OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks. arXiv preprint, arXiv:2606.29537. Preprint — praca nie była jeszcze publikacją recenzowaną w momencie przygotowywania tego tekstu.
Komentarze
Prześlij komentarz