Η ερευνητική ομάδα Seed της ByteDance δημοσίευσε το HarnessDev, ένα σημείο αναφοράς (benchmark) που εξετάζει αν τα μεγάλα γλωσσικά μοντέλα (LLM) μπορούν να σχεδιάσουν και να βελτιώσουν το δικό τους «περίβλημα πράκτορα» (agent harness) — δηλαδή τον βρόχο εκτέλεσης, τα εργαλεία, τη διαχείριση πλαισίου και τους μηχανισμούς επαλήθευσης γύρω από ένα μοντέλο — αντί να αξιολογεί μόνο τις τελικές απαντήσεις. Η εργασία αναρτήθηκε στο arXiv την 1η Σεπτεμβρίου 2026, με συν-συγγραφείς από το Singapore University of Technology and Design και το Georgia Institute of Technology, και παρουσιάστηκε από το MarkTechPost στις 11 Σεπτεμβρίου.
Η αξιολόγηση γίνεται σε δύο στάδια. Στο στάδιο της δημιουργίας, έξι μοντέλα — Opus 4.8, GPT-5.5, Gemini 3.1 Pro, DeepSeek V4 Pro, Qwen 3.7 Max και Seed 2.0 Pro — χτίζουν ένα περίβλημα από ελάχιστα αρχικά συστατικά. Στο στάδιο της εξέλιξης, κάθε μοντέλο αναθεωρεί το δικό του περίβλημα με βάση την ανατροφοδότηση από τα αποτελέσματα εκτέλεσης. Οι ερευνητές δοκίμασαν τα περιβλήματα σε 2.207 περιπτώσεις εργασιών από πέντε υπάρχοντα σημεία αναφοράς: BrowseComp (1.266 εργασίες έρευνας στο διαδίκτυο), SWE-bench Pro (731 εργασίες μηχανικής λογισμικού), Terminal-Bench 2.1 (89 εργασίες γραμμής εντολών), MLE-bench (75 εργασίες μηχανικής μάθησης) και EQ-Bench3 (46 εργασίες γραφής).
Ισχυρά στη γραφή, αδύναμα στην αναζήτηση
Τα περιβλήματα που έφτιαξαν μόνα τους τα μοντέλα ισοφάρισαν ή ξεπέρασαν τα ανθρώπινα περιβλήματα αναφοράς σε εργασίες γραφής, όπου το Opus 4.8 σημείωσε 84,6 στο EQ-Bench3 έναντι 83,7 της αναφοράς, καθώς και σε πειραματισμό μηχανικής μάθησης, με 32,9 έναντι 24,0. Αλλού, όμως, υστέρησαν σημαντικά: 52,6 έναντι 92,2 στο BrowseComp και 68,8 έναντι 88,8 στο Terminal-Bench 2.1. Στο σύνολο της αξιολόγησης, το καλύτερο αυτο-κατασκευασμένο περίβλημα έφτασε το 67,8, έναντι 86,2 του ανθρώπινου περιβλήματος αναφοράς.
Το πιο αξιοσημείωτο εύρημα αφορά το στάδιο της εξέλιξης. Από τις 64 τροποποιήσεις που δοκίμασαν τα μοντέλα, μόνο στις 34 — ποσοστό 53,1% — η ανατροφοδότηση και οι βαθμολογίες στις κρυφές εργασίες κινήθηκαν προς την ίδια κατεύθυνση· δηλαδή περίπου οι μισές αυτοκατευθυνόμενες αλλαγές δεν γενικεύτηκαν σε εργασίες που τα μοντέλα δεν είχαν δει κατά την ανάπτυξη. Τα περιβλήματα αποδείχθηκαν επίσης στενά συνδεδεμένα με το μοντέλο που τα εκτελεί: ένα περίβλημα του Opus 4.8 σημείωσε 69,3 στο SWE-bench Pro αλλά έπεσε στο 33,0 όταν το εκτέλεσε άλλο μοντέλο, ενώ το ποσοστό διπλότυπων ερωτημάτων ανέβηκε από 10,1% σε 88,2% μετά την αλλαγή του μοντέλου εκτέλεσης. Οι αυτοαναφερόμενες επιτυχίες αποδείχθηκαν αναξιόπιστες: από 99 επιτυχίες που δηλώθηκαν, μόλις 48 πέρασαν την επαλήθευση.
Γιατί έχει σημασία
Τα ευρήματα αφορούν μια ζωντανή συζήτηση για συστήματα τεχνητής νοημοσύνης (ΤΝ) που βελτιώνουν τα δικά τους εργαλεία: η εργασία δείχνει ότι αυτή η αυτοβελτίωση παραμένει περιορισμένη, ασυνεπής ανά τομέα και δεμένη με το συγκεκριμένο μοντέλο που εκτελεί το περίβλημα. Το κόστος επίσης διαφέρει δραματικά: το GPT-5.5 πέτυχε δείκτη μεταλλίων 19,1 στο MLE-bench καταναλώνοντας 29,3 εκατ. tokens, ενώ το DeepSeek V4 έφτασε το 19,6 με 208,4 εκατ. tokens. Για όσους αναπτύσσουν αυτόνομους πράκτορες κώδικα ή έρευνας, αυτό σημαίνει ότι ένα περίβλημα προσαρμοσμένο σε ένα μοντέλο ενδέχεται να μην αποδίδει αν το μοντέλο αλλάξει.