Trenowanie inteligentnych systemów edukacyjnych wymaga danych od wielu różnych uczniów, co jest kosztowne i czasochłonne. Zespół badawczy z Microsoft proponuje rozwiązanie: cyfrowe repliki uczniów, które naśladują rzeczywiste zachowania, popełniają typowe błędy i reagują na wskazówki nauczyciela. Ich system StudentSim okazał się skuteczniejszy niż duże modele językowe w tej roli.
Dlaczego dotychczasowe metody nie wystarczały
Rozwój tutorów opartych na sztucznej inteligencji napotykał na poważną przeszkodę. Gromadzenie danych od wystarczająco dużej i zróżnicowanej grupy uczniów jest zbyt drogie i zajmuje zbyt wiele czasu, przez co postęp w tej dziedzinie pozostawał w tyle za ogólnym rozwojem modeli AI.
Istniejące podejścia radziły sobie tylko z połową zadania. Niektóre systemy uczyły się na prawdziwych danych i wiernie odtwarzały zachowania uczniów, ale nie potrafiły korzystać z wyjaśnień nauczyciela. Inne to modele językowe instruowane, by wcielać się w rolę ucznia — te z kolei chętnie podążały za podpowiedziami, lecz nie odzwierciedlały rzeczywistych umiejętności symulowanej osoby.
Jak działa StudentSim
Badacze przekształcili oba niezbędne skills w mierzalne cele. System ocenia, jak blisko replika odwzorowuje odpowiedzi ucznia — wraz z charakterystycznymi pomyłkami — oraz jak szybko modyfikuje odpowiedź po otrzymaniu wskazówki. Trening tutora wymaga bowiem zarówno realistycznego punktu wyjścia, jak i symulowanego ucznia, który reaguje na instrukcje.
Trening dwuetapowy rozwiązuje problem braku danych
Największym wyzwaniem okazał się niedobór materiałów. W zbiorze dotyczącym pisania po angielsku mediana uczniów napisała zaledwie trzy eseje, a ponad dwie trzecie — pięć lub mniej. Bezpośredni trening na tak skąpych przykładach prowadzi do overfittingu, czyli nadmiernego dopasowania modelu do niewielkiej próbki.
Rozwiązaniem jest dwuetapowe szkolenie. Najpierw model bazowy uczy się wspólnych wzorców w ramach danego przedmiotu na zagregowanych danych wszystkich uczniów — typowych błędów i sposobów poprawiania odpowiedzi po podpowiedzi. Następnie dostraja się go do konkretnej osoby na podstawie nielicznych dostępnych zapisów. We wszystkich przedmiotach system wykorzystuje jako bazę model Qwen3-4B-Instruct od Alibaba.
Wyniki przewyższają GPT-5.4
Metodę przetestowano na 60 uczniach w trzech dziedzinach: szachach, angielskim jako języku obcym oraz matematyce. Wykorzystano publiczne zbiory danych zawierające zapisy rzeczywistych osób uczących się.
StudentSim okazał się lepszy od większego modelu GPT-5.4 we wszystkich trzech przedmiotach, gdy ten był instruowany do wcielenia się w ucznia. W szachach system trafnie przewidywał następny ruch gracza około dwa razy częściej i niemal zawsze podążał za korekcyjnymi wskazówkami.
Różnice uwidoczniły się w konkretnym scenariuszu: trzech prawdziwych graczy wybrało trzy odmienne posunięcia. StudentSim odtworzył każdy z tych wyborów osobno, podczas gdy wyspecjalizowany model szachowy wskazał ten sam najbardziej prawdopodobny ruch dla wszystkich, a GPT-5.4 pomylił się w każdym przypadku.
Symulowany uczeń poprawia jakość nauczyciela
Jako dodatkowy dowód koncepcji badacze wykorzystali replikę ucznia do udoskonalenia tutora szachowego. Zawodowi gracze ocenili trzy wersje: bez dodatkowego treningu, trenowaną z GPT-5.4 w roli ucznia oraz trenowaną ze StudentSim.
Wersja oparta na StudentSim uzyskała najwyższe wyniki we wszystkich trzech miarach. Popełniła najmniej poważnych błędów merytorycznych i zdobyła najlepsze oceny za jakość wyjaśnień oraz dopasowanie do indywidualnego ucznia. Co istotne, w tym przypadku uczeń preferował pytania naprowadzające na rozwiązanie zamiast bezpośrednich instrukcji.
Zaskakujący okazał się wynik tutora trenowanego z GPT-5.4 — wypadł gorzej pod względem poprawności faktograficznej niż wersja bez żadnego dodatkowego szkolenia. Autorzy zastrzegają jednak, że to jedynie dowód koncepcji, a nie twierdzenie o zbudowaniu najlepszego możliwego nauczyciela.
Ograniczenia i kierunki rozwoju
Szachy sprawdzają się jako przypadek testowy, ponieważ silnik potrafi obiektywnie ocenić, czy dany ruch jest dobry w konkretnej pozycji. Pisanie esejów i otwarte zadania matematyczne są trudniejsze — brakuje wiarygodnych funkcji oceniających swobodne odpowiedzi.
Kolejnym krokiem zespołu będzie modelowanie tego, jak uczniowie przyswajają, utrwalają i zapominają wiedzę podczas wielu sesji ćwiczeniowych. Kod rozwiązania udostępniono na GitHubie.
Warto spojrzeć na ten projekt w szerszym kontekście. W 2024 roku badacze wykorzystali agentów AI do replikowania około tysiąca rzeczywistych osób na podstawie dwugodzinnych wywiadów. Osobne badanie pokazało jednak, jak podatne na błędy bywają takie repliki — dziewięć otwartych modeli językowych imitujących zachowania użytkowników na platformach X, Bluesky i Reddit stawało się mniej precyzyjne w treści, im bardziej przekonująco brzmiało po ludzku.
Microsoft testuje też tutorów AI z prawdziwymi uczniami. W pilotażu w Nigerii uczniowie pracowali z Copilot dwa razy w tygodniu przez sześć tygodni, a przyrost ich wyników testowych odpowiadał niemal dwóm dodatkowym latom nauki. OpenAI i Google oferują własne tryby uczenia się — Study Mode i Guided Learning — oparte na instrukcjach systemowych i modelach dostrojonych do nauczania. Żaden z nich nie utrzymuje jednak modelu indywidualnego ucznia. Bez takiego dostosowania pomoc AI może wręcz szkodzić — badania pokazują, że użytkownicy osiągają gorsze wyniki po krótkiej interakcji ze sztuczną inteligencją niż osoby, które od początku pracowały samodzielnie.
StudentSim wskazuje kierunek, w którym mogą podążać systemy edukacyjne nowej generacji: zamiast uniwersalnych modeli, tworzenie cyfrowych bliźniaków konkretnych uczniów. Pytanie brzmi, czy uda się przenieść te wyniki z szachownicy do bardziej złożonych dziedzin, gdzie nie istnieje jedno obiektywne kryterium poprawności.

