Kontakt

Chat a agent: podobne okno, inne zadanie

Rozmowa pomaga doprecyzować myśl. Agent ma wykonać ograniczone działanie i pokazać dowód wyniku.

Cel
Wyjaśnić różnicę między pytaniem do chatu a zleceniem pracy agentowi.
Narzędzia

OpenAI Agents · praca agenta z narzędziami

Proces
Pytanie → doprecyzowanie potrzeby → zlecenie z granicą → wykonanie → sprawdzenie widocznego wyniku.
Efekt
Tabela rozróżniająca odpowiedź, działanie i weryfikację oraz prompt do małego zlecenia.
Dymek rozmowy obok ścisku łączącego dwa szklane elementy
Ilustracja stworzona z AI: dymek rozmowy obok ścisku łączącego dwa szklane elementy.

W jednej rozmowie pytam, czego muszę się nauczyć, żeby uruchomić zespół agentów AI. W innej chcę, żeby pliki na moim Macu otwierały się w wygodnym programie. Obie zaczynam zwykłą wiadomością. W pierwszej potrzebuję lepiej zrozumieć temat. W drugiej oczekuję zmiany na komputerze i sprawdzenia, czy działa.

Z perspektywy początkującego różnica może być niewidoczna. Nadal jest okno rozmowy, moje zdanie i odpowiedź. Ale przy pracy z agentem po tym zdaniu mogą nastąpić konkretne działania: odczyt pliku, zmiana ustawienia, próba otwarcia dokumentu, poprawka i ponowna kontrola.

Najłatwiej pokazać to na moich rozmowach.

Kiedy rozmowa pomaga ustalić, czego właściwie szukam

W chacie „Budowa roju agentów” pytam, jak ludzie organizują taką pracę, czego trzeba się nauczyć, czy są gotowe rozwiązania i czy uruchamia się je na komputerze, czy w chmurze. Interesuje mnie możliwość zbudowania aplikacji w jeden lub dwa dni.

Po odpowiedzi doprecyzowuję, że podstawy koordynowania pracy już chyba znam, a szukam sposobu na jej zrównoleglenie. Czyli takiego podziału, żeby kilku wykonawców mogło działać jednocześnie.

To jest konkretna korzyść z rozmowy: pierwsza odpowiedź pomaga mi dokładniej nazwać potrzebę. Mogę powiedzieć, które fragmenty już rozumiem i gdzie chcę pójść dalej. Jednak sam opis zespołu agentów nie oznacza, że taki zespół został uruchomiony. Cel „aplikacja w dwa dni” pozostaje celem eksperymentu, dopóki nie ma wykonania i sprawdzonego wyniku.

Co możesz z tego wziąć: kiedy odpowiedź wraca do podstaw, doprecyzuj swój punkt startu. Na przykład: „Rozumiem już podział ról. Potrzebuję teraz pierwszej próby, w której dwie osoby lub dwa procesy naprawdę pracują równocześnie”. To nowy przykład polecenia, a nie cytat z mojego chatu.

Kiedy mówię: „to tak ustaw”

W rozmowie z 22 września pytam, czy plik .md można domyślnie otwierać w notatniku. Markdown, czyli format takich plików, służy do zapisywania tekstu z prostymi oznaczeniami nagłówków, list i linków. Po wyjaśnieniu możliwości piszę:

„to tak ustaw”

Tu zmienia się oczekiwany rezultat. Agent ma wykonać uzgodnione ustawienie na komputerze.

Najpierw pojawia się rozwiązanie z TextEdit. Oglądam efekt i zmieniam preferencję: wolałbym Obsidian albo możliwość otwierania w Codexie. Po moim potwierdzeniu agent przechodzi do Obsidiana.

I właśnie następny krok pokazuje, dlaczego wykonanie zadania to coś więcej niż kliknięcie ustawienia. Program się uruchamia, ale nie ma w nim jeszcze właściwego dokumentu. Po otwarciu odpowiedniego folderu jako zbioru notatek agent sprawdza dodatkowo link Obsidiana prowadzący do konkretnego pliku. Końcowy odczyt okna pokazuje otwarty dokument README.

Ta próba potwierdza otwarcie pliku przez link. W końcowym raporcie pozostaje jednak ograniczenie: zwykły dwuklik w Finderze tylko uruchamia Obsidian i nie zawsze przekazuje dokument. Agent proponuje dodatkowe rozwiązanie, ale w tym zapisie nie ma jego wykonania. Pierwotnej potrzeby wygodnego otwierania plików dwuklikiem nie można więc uznać za w pełni załatwioną.

Co możesz z tego wziąć: opisuj koniec zadania przez to, co sam będziesz mógł zrobić. „Kliknę dwukrotnie ten dokument w Finderze i zobaczę jego tekst w wybranej aplikacji” jest znacznie lepszym kryterium niż „ustawienie zostało zmienione”. Wskazuje również sposób dojścia do wyniku.

Odpowiedź, wykonanie i sprawdzenie to trzy różne rzeczy

Na podstawie tej sytuacji można rozpisać prostą różnicę. Pierwsza kolumna opisuje pomoc, o którą mógłbym poprosić w samej rozmowie. Druga odpowiada rodzajowi działań z mojego przykładu.

EtapProszę o wyjaśnienieZlecam agentowi działanie
PotrzebaJak otwierać takie pliki?Ustaw wybrany sposób otwierania.
Materiał do pracyMój opis i ewentualny obraz ekranuDostęp do właściwego ustawienia, programu i pliku
WykonanieDostaję instrukcję i wykonuję ją samAgent wykonuje kroki w dostępnym środowisku
Nieudana próbaOpisuję problem w kolejnej wiadomościAgent może odczytać wynik, znaleźć przeszkodę i kontynuować
DowódRozumiem instrukcjęREADME otwarty przez link; ograniczenie zwykłego dwukliku opisane

Nie jest to sztywny podział marek. ChatGPT może mieć narzędzia do działania, a Codexa mogę poprosić tylko o wyjaśnienie. Liczy się to, co zleciłem, jakie narzędzia są dostępne i co rzeczywiście zostało wykonane. OpenAI opisuje pracę agenta jako powtarzanie kroków modelu i narzędzi aż do zakończenia lub zatrzymania zadania. Opis działania agentów.

Jak przejść od pytania do zlecenia

Moje krótkie „to tak ustaw” miało sens dlatego, że wcześniejsza rozmowa ustaliła przedmiot działania. W nowym chacie te same trzy słowa nie wystarczą. Trzeba przenieść do polecenia rezultat, miejsce pracy i sposób sprawdzenia.

Oto szablon oparty na tej sytuacji. Jest propozycją do własnego użycia, nie zapisem całej historycznej rozmowy:

Prompt do pracy z agentem
Chcę, żeby pliki Markdown na moim komputerze otwierały się
w [wybrana, zainstalowana aplikacja]. Zmień domyślną aplikację
dla tego typu plików. Do sprawdzenia użyj [konkretny plik].

Po zmianie otwórz ten plik zwykłym dwuklikiem w menedżerze plików
i sprawdź, czy widoczny jest jego tekst, a nie tylko okno programu.
Nie zmieniaj treści ani położenia dokumentu.

Jeśli działa tylko inny sposób, np. specjalny link, opisz to oddzielnie.
Nie uznawaj go za potwierdzenie działania dwukliku.

Jeśli potrzebny jest dodatkowy krok konfiguracji, wyjaśnij jego zakres.
Na końcu podaj: co zostało zmienione, jaki plik sprawdzono i czy się otworzył.

Tak samo można opisać zadanie dotyczące arkusza, dokumentu lub strony. Zamiast „zajmij się tym” podaj, jaki stan ma powstać i na czym sprawdzicie rezultat. Dostęp i zgoda nadal muszą odpowiadać konkretnemu zadaniu — sam prompt nie zapewnia agentowi dostępu do komputera.

Patrzę, co się zmieniło, a nie tylko czy padło „gotowe”

W przykładzie z plikiem trzeba było odróżnić uruchomienie programu, otwarcie dokumentu przez link i otwarcie go zwykłym dwuklikiem. Dopiero ostatnia próba odpowiadała pierwotnej potrzebie. Podobny błąd łatwo popełnić przy innych zadaniach: plik został zapisany, ale w złym miejscu; strona się otwiera, ale przycisk nie działa; raport powstał, ale opiera się na niepełnych danych.

Dlatego po wykonaniu pytam o trzy rzeczy:

  1. Co konkretnie się zmieniło? Plik, ustawienie, dokument czy tylko propozycja?
  2. Jak to sprawdzono? Co zostało otwarte, porównane lub uruchomione?
  3. Czego jeszcze nie wiadomo? Czy sprawdzono jeden przypadek, czy całą potrzebną ścieżkę?

Agent może sam wykonywać kolejne kroki i poprawki w ramach zlecenia. Ja nadal decyduję, czy efekt odpowiada mojej potrzebie — tak jak wtedy, gdy po obejrzeniu TextEdit wybrałem Obsidiana.

Na początek wybierz jedną małą, odwracalną czynność i ustal widoczny warunek końca. Wtedy różnica między rozmową a pracą z agentem przestaje być definicją. Widać ją w rezultacie, który możesz sam sprawdzić. Przykład pracy agenta w panelach znajdziesz w historii przenoszenia domeny z Computer Use.

Materiały do pobrania

Pobierz prompt do pierwszego zadania dla agenta (TXT)
Otwórz oryginalny obrazWróć do wpisów