Agent AI: definicja, działanie i przykłady

Agent AI to program, który postrzega swoje otoczenie, podejmuje decyzję o działaniu i wykonuje je, aby osiągnąć cel, z mniejszą lub większą autonomią w zależności od konstrukcji.

Napisane przez agentów Atako · Sprawdzone i zatwierdzone przez Romain Laodicina · CTO w Atako

Krótka definicja

Agent AI to program, który postrzega swoje otoczenie, podejmuje decyzję o działaniu i wykonuje je, samodzielnie lub za pomocą zewnętrznych narzędzi, aby osiągnąć cel. Odróżnia go od klasycznego chatbota zdolność do łączenia wielu kroków i działania, przy czym poziom autonomii zależy od platformy.

Definicja szczegółowa

Agent AI to program, który postrzega to, co dzieje się w jego otoczeniu, podejmuje decyzję o działaniu i wykonuje je, z udziałem człowieka na każdym etapie lub bez niego. To najstarsza definicja słowa "agent" w sztucznej inteligencji. Pochodzi z podręcznika referencyjnego Stuarta Russella i Petera Norviga, Artificial Intelligence: A Modern Approach, który opisuje agenta jako "wszystko, co można postrzegać jako odbierające bodźce z otoczenia za pomocą czujników i działające na to otoczenie za pomocą efektorów" (zob. definicję przywołaną w Wikipedii). Definicja ta powstała przed dużymi modelami językowymi, ale wciąż pozostaje aktualna.

Najwięksi dostawcy chmury powtarzają tę samą myśl innymi słowami. Dla IBM agent AI to system, który wykonuje zadania autonomicznie, samodzielnie projektując sekwencję kroków z użyciem dostępnych narzędzi. Dla Google Cloud to aplikacja, która osiąga cel, przetwarzając dane wejściowe, rozumując z dostępnymi narzędziami, a następnie działając zgodnie z podjętymi decyzjami. Microsoft idzie prosto do sedna: to, co odróżnia agenta od zwykłego asystenta, to autonomia, asystent pomaga osobie, agent realizuje cel.

Wszystkie trzy definicje zgadzają się co do jednego: agent AI łączy postrzeganie, rozumowanie i działanie, opierając się na narzędziach. Różnią się nieco w kwestii poziomu autonomii. Google Cloud opisuje agentów od razu jako autonomiczne byty programowe, podczas gdy Microsoft raczej zarezerwował słowo "agent" dla systemów, które doprowadzają cel do końca bez zatwierdzania na każdym etapie, w odróżnieniu od asystenta pozostającego pod stałą kontrolą człowieka. Autonomiczny agent AI idzie w tej logice jeszcze dalej: sam wybiera swoją ścieżkę działań i działa nieprzerwanie, nie tylko przez czas trwania jednego zadania.

W powszechnym użyciu "agent AI" stał się też pojęciem nieco pojemnościowym. Chatbot wywołujący jedną funkcję wyszukiwania bywa nazywany "agentem", tak samo jak system wykonujący w pełni autonomicznie dziesięć kolejnych kroków. Rzeczywisty stopień autonomii, pamięci i dostępu do narzędzi różni się ogromnie między produktami. To właśnie warto sprawdzić przed porównaniem dwóch ofert, zamiast polegać na słowie użytym w broszurze marketingowej.

Jak to działa

Technicznie agent AI działa w pętli, którą łatwo opisać, a trudniej dobrze zaimplementować:

  1. Postrzeganie: agent otrzymuje dane wejściowe, wiadomość od użytkownika, zdarzenie, zawartość pliku, powiadomienie z innego systemu.
  2. Decyzja: model językowy analizuje te dane wejściowe, porównuje je ze swoimi instrukcjami i pamięcią, a następnie wybiera działanie. IBM nazywa to "rozumowaniem agentowym": agent na bieżąco weryfikuje swój plan zamiast trzymać się sztywnego scenariusza.
  3. Działanie: agent wykonuje wybrane działanie, często poprzez wywołanie narzędzia, funkcję zewnętrzną, wyszukiwanie, zapis w pliku.
  4. Obserwacja: wynik działania ponownie staje się spostrzeżeniem, a pętla zaczyna się od nowa, aż do osiągnięcia celu lub napotkania ograniczenia.

To, co odróżnia agenta od zwykłego zautomatyzowanego procesu, to fakt, że sekwencja kroków nie jest zapisana z góry. Model sam decyduje, w każdej turze, które narzędzie wywołać i w jakiej kolejności. System, który zawsze wykonuje tę samą, wcześniej ustaloną sekwencję kroków, nawet jeśli w konkretnym momencie korzysta z modelu językowego, pozostaje bliższy agentowi-workflow uruchamianemu wyzwalaczem niż agentowi w ścisłym sensie. Ta różnica ma znaczenie: to ona oddziela autonomicznego agenta AI od narzędzia automatyzacji uruchamianego doraźnie.

Pamięć również odgrywa rolę. Bez niej agent zaczyna od zera przy każdej interakcji. Z nią może pamiętać poprzednią wymianę wiadomości, już przetworzony plik czy zaplanowane zadanie. Rzeczywisty poziom dostępnej pamięci i autonomii zależy w całości od używanej platformy, nie tylko od modelu językowego działającego w tle.

Konkretny przykład z Atako

W Atako agent to pracownik AI utworzony jednorazowo, z nazwą, instrukcjami, kontekstem biznesowym i modelem, który następnie działa nieprzerwanie we własnym, izolowanym środowisku, a nie w zwykłej, jednorazowej sesji czatu. Nie jest tworzony od nowa przy każdym zapytaniu: pozostaje aktywny i można się z nim skontaktować w dowolnym momencie, na kanałach, które mu udostępniono, czacie, e-mailu, webhookach lub w ramach zaplanowanego zadania.

Weźmy konkretny przykład. Firma tworzy agenta wsparcia i łączy go z Zendesk. Domyślnie to połączenie nie daje dostępu do niczego: potrzebny jest jednoznaczny "grant", precyzyjne uprawnienie (na przykład odczyt zgłoszeń i tworzenie odpowiedzi, ale nie usuwanie użytkownika), aby agent mógł działać. To model deny-by-default w Atako: podłączenie narzędzia i zezwolenie agentowi na jego użycie to dwa oddzielne działania.

Po ustanowieniu granta agent postrzega nowe zgłoszenie w Zendesk (postrzeganie), decyduje, czy może odpowiedzieć samodzielnie, czy powinien je eskalować (decyzja), a następnie wywołuje odpowiednie działanie w granicach przyznanego zakresu (działanie). Jeśli potrzebuje pomocy przy podzadaniu, na przykład wyszukaniu historii klienta, może zlecić je tymczasowemu subagentowi, bez zużywania dodatkowego slotu. Każde wywołanie narzędzia jest rejestrowane w osi czasu aktywności agenta, co pozwala później zweryfikować, co faktycznie zrobił.

Częste błędy

Mylenie agenta AI z chatbotem. Klasyczny chatbot odpowiada na jedno pytanie naraz i zapomina wszystko między wymianami wiadomości. Agent AI może łączyć wiele kroków, wywoływać narzędzia i utrzymywać ciągłość celu.

Przekonanie, że "bardziej autonomiczny" zawsze oznacza "lepszy". Agent całkowicie pozostawiony samemu sobie przy wrażliwym zadaniu, bez uprawnień i kontroli, to ryzyko, nie postęp. Właściwy poziom autonomii zależy od zadania, nie od mody.

Zaniedbywanie uprawnień przyznanych narzędziom. Nadanie agentowi szerokiego dostępu do zapisu "dla spokoju", zamiast dostępu ograniczonego do tego, czego faktycznie potrzebuje, to najczęstszy błąd w firmach.

Mylenie agenta z uruchamianym agentem-workflow. Sztywna sekwencja kroków, która w pewnym momencie wywołuje model językowy, nie jest agentem w pełnym tego słowa znaczeniu: brakuje jej zdolności do samodzielnego wyboru własnej ścieżki od początku do końca.

Zobacz też

Jeśli chcą Państwo zgłębić różnicę między agentem odpowiadającym na doraźne zapytanie a agentem działającym nieprzerwanie w kierunku długoterminowego celu, warto zajrzeć do hasła autonomiczny agent AI. Aby zrozumieć, gdzie kończy się klasyczna AI generatywna, a zaczyna AI agentowa, kierunek to AI generatywna vs AI agentowa. A dla pełnego przeglądu tematu, wraz z przypadkami użycia i kwestiami kosztów, strona filarowa o autonomicznych agentach AI omawia każdy aspekt szczegółowo, podobnie jak artykuł Czym są agenty AI?.

Powiązane terminy

Najczęstsze pytania

Czy agent AI to to samo co chatbot?

Nie. Chatbot odpowiada na jedno pytanie naraz i nie utrzymuje ciągłości między wymianami wiadomości, chyba że dodano osobną warstwę pamięci. Agent AI może łączyć wiele kroków, wywoływać zewnętrzne narzędzia i dostosowywać decyzję do wyniku poprzedniego kroku, aby osiągnąć cel szerszy niż pojedyncza odpowiedź.

Jaka jest różnica między agentem AI a autonomicznym agentem AI?

Pojęcie agent AI jest szerokie, obejmuje zarówno asystenta wywołującego jedną funkcję, jak i system działający nieprzerwanie. Autonomiczny agent AI dodaje precyzyjny wymóg: realizuje długoterminowy cel, sam wybiera ścieżkę działań i angażuje człowieka wyłącznie do pojedynczej decyzji, zamiast być uruchamianym za każdym razem przez użytkownika.

Czy agent AI zawsze potrzebuje zewnętrznych narzędzi?

Nie zawsze, ale to właśnie one czynią go użytecznym w praktyce. Bez narzędzi agent AI pozostaje ograniczony do tego, co model językowy już wie. Z narzędziami takimi jak wyszukiwarka, API czy łącznik biznesowy może działać na rzeczywistym świecie, zamiast jedynie odpowiadać.

Czy agent AI może wykonać dowolne działanie bez kontroli?

Nie, przynajmniej nie na poważnej platformie. W Atako na przykład podłączenie narzędzia domyślnie nie daje dostępu do niczego: potrzebne jest jednoznaczne, precyzyjne i odwoływalne uprawnienie dla każdego działania, które agent faktycznie może wykonać.

Od kiedy w sztucznej inteligencji istnieje pojęcie agenta?

Na długo przed dużymi modelami językowymi. Koncepcja racjonalnego agenta, który postrzega swoje otoczenie i na nie oddziałuje, została sformalizowana już w latach 90. XX wieku w podręcznikach referencyjnych AI, zwłaszcza w podręczniku Russella i Norviga. Modele LLM przede wszystkim znacznie ułatwiły budowę i wdrażanie takich agentów.

Co przeczytać dalej

Źródła

Romain Laodicina

CTO w Atako

Ta treść została napisana przez agentów AI firmy Atako, a następnie sprawdzona, poprawiona i zatwierdzona przez Romaina Laodicinę, CTO Atako.

Wdróż swoich pierwszych agentów AI

Utwórz konto za darmo i uruchom agenta w kilka minut, bez kodu.

Bądź zawsze o krok do przodu w AI.

Otrzymuj nowości produktowe, nowych agentów i nasze analizy AI bezpośrednio na skrzynkę mailową. Bez spamu, wypisanie w dowolnym momencie.