23 RSI იდეა; PostTrainBench+; და როგორ ურთიერთობს ნდობა და გამჭვირვალობა AI რბოლასთან

Article Image
კეთილი იყოს თქვენი მობრძანება Import AI-ში, საინფორმაციო ბიულეტენი AI კვლევის შესახებ. იმპორტი AI მუშაობს arXiv-ზე, კაპუჩინოებზე და მკითხველების გამოხმაურებაზე. თუ გსურთ მხარი დაუჭიროთ ამას, გთხოვთ გამოიწეროთ.

გსურთ გქონდეთ გამკლავება RSI-სთან? აქ არის 23 ქმედითი პოლიტიკის იდეა:
…IFP გთავაზობთ „დაბალი სინანულის“ პოლიტიკის რეკომენდაციებს…
პოლიტიკის ექსპერტებმა IFP-ის ანალიტიკურ ცენტრთან ერთად გამოაქვეყნეს იდეების ნაკრები, რომელიც მიზნად ისახავს დაეხმაროს „პოლიტიკოსებს დაეწყოთ AI R&D შემდგომი ავტომატიზაციის რისკები“. რეკომენდაციები მოიცავს 23 კონკრეტულ იდეას, რომლებიც ხვდება 7 კონკრეტულ კატეგორიაში. თუ ეს რეკომენდაციები მიიღება, ეს რეკომენდაციები ასევე მისცემს ქვეყნებს, განსაკუთრებით შეერთებულ შტატებს, მეტი ნაბიჯის გადადგმა სათამაშო დაფაზე მძლავრი სისტემების შემუშავებისას, რაც იდეალურად მისცემს მათ შესაძლებლობას:

დააჩქარეთ „AI შესაძლებლობების გავრცელება, გამოთვლებისა და ნიჭის გამოყოფით დასკვნისთვის და ახალი AI აპლიკაციების შემუშავებისთვის“.

დააჩქარეთ „R&D, რათა შემდგომი ხელოვნური ინტელექტის კვლევის ავტომატიზაცია უფრო უსაფრთხო გახდეს, მოდელის უსაფრთხოების გაუმჯობესებით ან საზოგადოების მდგრადობის გაზრდით“.

იდეების შვიდი კატეგორია:

”უზრუნველყავით გამჭვირვალობა ავტომატური AI R&D-ში

გააუმჯობესეთ სახელმწიფო შესაძლებლობები, რომ გაიგოს და უპასუხოს ავტომატური AI R&D

შეიმუშავეთ რისკის მართვის სტრატეგია ავტომატური AI R&D-ისთვის, რომელიც აჩქარებს თავდაცვით და კომერციულ AI გამოყენებას

დააჩქარეთ ხელოვნური ინტელექტის შემოწმების ტექნოლოგიის განვითარება

ინვესტიცია ხელოვნური ინტელექტის მდგრადობაში

გააფართოვეთ აშშ 🇺🇸-ს AI-ის უპირატესობა, რათა აშშ 🇺🇸-ს მეტი დრო მისცეს AI R&D ავტომატიზაციის რისკების მართვისთვის

შექმენით ოფციონის ღირებულება საერთაშორისო თანამშრომლობისთვის ავტომატური AI R&D რისკების მართვაში”

რატომ აქვს ამას მნიშვნელობა - რაც უფრო ნაკლები ვარიანტი გვაქვს RSI-სთან გამკლავებისთვის, მით უფრო უარესი იქნება შედეგები: ახლა, თითქოს მსოფლიო ავითარებს AI-ს განვითარებას მანქანაში, რომელსაც აქვს მხოლოდ ამაჩქარებლის პედლები და სამუხრუჭე პედლებიანი, რომ აღარაფერი ვთქვათ რაიმე სახის დახვეწილი ტელემეტრია, რომ იცოდეთ, დაწყებული მანქანის სიჩქარით დაწყებული, საბურავების ცვეთით დამთავრებული. IFP-ის მსგავსი წინადადებები ააშენებს უფრო მეტ ანდაზურ პედლებს და სენსორულ სისტემებს ხელოვნური ინტელექტის ინდუსტრიის მანქანებისთვის, რაც ნიშნავს, რომ თუ კურსის შეცვლა ან სიჩქარის შენელება დაგვჭირდება, უკეთესად შევძლებთ კრიზისის დროს.
წაიკითხეთ მეტი: როგორ უნდა მოემზადოს აშშ 🇺🇸 მზარდი ავტომატიზირებული AI R&D-ისთვის? (IFP).

***

მოკლე მოთხრობა თებედან ჭკვიანი მანქანებისა და რობოტების სხეულების შესახებ:
...როგორი შეიძლება იყოს AI-თან ურთიერთობის შეგრძნება აფრენისას?...
აქ არის სახალისო მოკლე გამოგონილი ამბავი თებესგან (@voooooogel X-ზე) იმის შესახებ, თუ რა გამოცდილება აქვს მომავალში ვინმეს ეწვია საიტის, რომელსაც მართავს ძლიერი AI სისტემა. სიუჟეტში მოცემულია იდეები ხელოვნური ინტელექტის შეჩერების, რეკურსიული თვითგაუმჯობესების შესახებ, რას ნიშნავს ხელოვნური ინტელექტის სისტემებისთვის ეკონომიკაში მოქმედებების განხორციელება, და როგორ შეგვიძლია ჩვენ, როგორც ადამიანებს, ვიმსჯელოთ ან ვენდოთ ჭკვიან მანქანებს. წაიკითხეთ ეს!
წაიკითხეთ ამბავი აქ: ახალი მზის მოსვლა (VGEL, ვებგვერდი).

***

კონკურენტი AI ფირმების წარმატებული შენელების ორი ინგრედიენტი: ნდობა და გამჭვირვალობა:
თამაშის თეორიის ანალიზი ვარაუდობს, რომ შენელება შესაძლებელია…
MIT-ისა და კოლუმბიის მკვლევარებმა გააანალიზეს კონკურენციის ბუნება ფირმებს შორის, რომლებიც ებრძვიან ერთმანეთს ძლიერი AI სისტემების შესაქმნელად და შესაძლებელია თუ არა ფირმებისთვის კოორდინირებული შენელების მიღწევა. გაზეთი, სახელწოდებით Racing to Ruin, მიზნად ისახავს პასუხის გაცემას "რატომ არის რთული კოორდინაცია? და რა დასჭირდება მას"?. დასკვნა არის ის, რომ სტაბილური შედეგების მიღწევის ორი ძირითადი ცვლადი არის გამჭვირვალობის გარკვეული დონე ტექნოლოგიების განვითარებასთან დაკავშირებით, ისევე როგორც სხვა ფირმების, როგორც სანდო, რაციონალური აქტორების მოდელირება.

რას სწავლობენ ისინი: „ჩვენ ვამუშავებთ R&D კონკურენციის მარტივ მოდელს დუოპოლისტებს შორის კატასტროფის ჩრდილში“, წერენ ისინი. „როდესაც საზღვრისპირა ფირმები აფართოებენ ტექნოლოგიას, ისინი ამაღლებენ მოვლენის საშიშროებას, რომელიც სამუდამოდ მიჰყავს ყველა ფირმის ნაკადის ანაზღაურებას ნულამდე. საშიშროება არის ფირმების ტექნოლოგიის დონის ცნობილი ფუნქცია და ის მოდის ტექნოლოგიის განვითარებიდან და არა მისი გამოყენებით.

რას გვიჩვენებს მათი ანალიზი: „როდესაც მონიტორინგი საკმარისად ზუსტია, ყოველი წონასწორობა ჩერდება სასრულ დროში, მაგრამ ჩნდება ახალი ცდუნება: თითოეულ ფირმას სურს გაჩერდეს მეორეში და გადის მხოლოდ დადასტურების შემდეგ, რომ კონკურენტი გაჩერდა“, - წერენ ისინი. „იმისთვის, რომ აგენტმა ჯერ შეაჩეროს, ანუ, არ იცოდეს, გაჩერდა თუ არა მათი კონკურენტი, ის ათამაშებს როგორც კონკურენტის ტიპს, ასევე სწრაფად მოსულ ამბებს: თუ მათი კონკურენტი რაციონალურია, ის ჩერდება მათი გაჩერების ამბის მიღებისთანავე და არასოდეს ჩერდება სხვაგვარად“. ნდობა და გამჭვირვალობა საკმაოდ განსხვავებულად მოქმედებს თამაშის ტიპზე: „თანმიმდევრული კოორდინაცია სთხოვს ფირმას შეწყვიტოს პირველი, აზარტული თამაში, რომ რაციონალური კონკურენტი უპასუხებს ახალი ამბების გამოქვეყნებისთანავე. შესაბამისად, უფრო სწრაფი ამბები ამაღლებს საპასუხო პრიზს“, - წერენ ისინი. „საპირისპიროდ, ერთდროული კოორდინაცია მოითხოვს, რომ ფირმა არ იყოს ცდუნება, გააგრძელოს რბოლა და შეჩერდეს მხოლოდ მას შემდეგ, რაც დაინახავს, ​​რომ კონკურენტი ნამდვილად გაჩერდა… უფრო სწრაფი ამბები უფრო მიმზიდველს ხდის პირველ რიგში გაჩერებას და ლოდინს“.

გამჭვირვალობას აქვს უცნაური თვისებები: „გამჭვირვალობა ორმხრივია: უფრო სწრაფი გამოვლენა იაფად აფასებს იმის დადასტურებას, რომ კონკურენტი გაჩერდა მანამ, სანამ უპირობოდ გაჩერდა, ასე რომ, შუალედურ ნდობაზე, გამჭვირვალობის გაზრდამ შეიძლება გაანადგუროს ადრეული შეჩერების წონასწორობა (ამ თავისუფალ გადახრის მიმზიდველობით) სანამ აღმოაჩენს საკმარისად სწრაფს.

მთავარი დასკვნა - სიკვდილის თავიდან აცილება ეფუძნება სხვა ფირმების ნდობის უნარს: „დაბალი ნდობით, ყოველი წონასწორობა მიდის ნგრევისკენ: კატასტროფა მოდის ერთი ალბათობით. შუალედური ნდობით, დაუყონებლივ შეჩერება და განადგურებისკენ სწრაფვა არის წონასწორობა. რაციონალურობის“, - წერენ ისინი.

რატომ არის ეს მნიშვნელოვანი - „ენდე, მაგრამ გადაამოწმეთ“: თუ ჩვენ გვაქვს იმედი, რომ შევძლებთ შეანელოთ ან შეაჩეროთ ძლიერი სადაზვერვო სისტემების განვითარება, მაშინ, როგორც ეს სტატია ასახავს, ​​ჩვენ დაგვჭირდება რეჟიმები კომპანიებისგან ინფორმაციის გამჭვირვალედ გასაზიარებლად მათი ხელოვნური ინტელექტის განვითარების მდგომარეობის შესახებ, ასევე ინსტრუმენტები იმის დასადასტურებლად, რომ ფირმებისგან გაზიარებული ინფორმაცია, ასევე მათი ქმედებები სანდოა და შენელებასთან დაკავშირებით. ამაში ბევრი პარალელი არსებობს იმასთან, თუ როგორ მუშაობდა იარაღის კონტროლი ისტორიულად ბირთვული იარაღის კონტექსტში.
დაწვრილებით: Racing to Ruin (arXiv).

***

ახალი SOTA PostTrainBench-ზე მიანიშნებს ავტომატური AI R&D მომავალზე:
...ინტოლოგია ასევე აჯობა ადამიანის საბაზისო ხაზს (როდესაც მას დიდი რაოდენობის გამოთვლა ეძლევა)...
ხელოვნური ინტელექტის სტარტაპმა Intology-მა, რომლის მიზანი „ა ავტომატიზირებულია R&D“, გამოუშვა Locus-ის ახალი ვერსია, პროგრამული უზრუნველყოფა, რომელიც მან შეიმუშავა LLM-ების ქმედუნარიან მკვლევარებად გადაქცევისთვის. Locus-ის ახალ ვერსიას შეუძლია მიიღოს 44.7% ქულა PostTrainBench-ზე, საორიენტაციო ნიშნულზე, რომელიც ხედავს, რამდენად კარგად შეუძლიათ ხელოვნური ინტელექტის სისტემებს მიიღონ ღია წონის მოდელი და გააუმჯობესონ მისი შესრულება მის საბაზისო დონეზე.

შედეგები: Locus „აჯობებს ყველა სასაზღვრო აგენტის საბაზისო ხაზს PostTrainBench-ზე და უფრო დიდი გამოთვლითი, მატარებლის შემდგომ მოდელებს, რომლებიც ერთობლივად აღემატება როგორც საბაზისო ხაზებს, ასევე ოფიციალური ადამიანის ინსტრუქციებით მორგებულ Qwen3-1.7B გამოშვებას საორიენტაციო კომპლექტში“.
Locus ერთად Opus 5 იღებს 44.7 ქულას (34.1% Opus 5-ისთვის რაიმე სახის სპეციალური აღკაზმულობის გარეშე) და აჯობა Fable 5-ს (41.8%). „ეს შედეგები გარედან გადაამოწმა PostTrainBench-ის ავტორებმა და გაიარეს მკაცრი დაბინძურების და მოტყუების შემოწმება“, წერს Intology.
PostTrainBench პირველად დაინერგა 2026 წლის მარტში (იმპორტი AI #449) და იმ დროს ყველაზე მაღალი ქულების სისტემა იყო Opus 4.6, მიიღო 23.2%, ვიდრე Claude Sonnet 4.5-მა მიიღო 9.9% 2025 წლის სექტემბერში.

PostTrainBench+: გარდა ამისა, კომპანიამ შექმნა PostTrainBench-ის ვარიანტი, რომელიც აჭარბებს 10-საათიან კედლის საათის ლიმიტს PostTrainBench-ის ერთ GPU-ზე, რაც მათ საშუალებას აძლევს შეამოწმონ რამდენად კარგად ასრულებენ სისტემები უფრო დიდი რაოდენობის გამოთვლით. აქ მათ შეუძლიათ დაამარცხონ ადამიანის საბაზისო დონე, მიაღწიონ 51.6% ქულას 4000 საათზე მეტი H100 GPU დროის გამოყენებისას (44.3 Opus 4.8-ისთვის და 42.7 GLM 5.2-ისთვის; Fable არ არის გამოცდილი ბენჩმარკის ამ ვარიანტზე).

სხვა დომენები: Locus-მა ასევე „აღმოაჩინა და გაწვრთნა ენის მოდელი ბოლომდე-მდე, რომელიც ახლა მუშაობს ~2,8× დაბალი შეცდომით, ~5,4× დაბალი შეყოვნებით და 105× დაბალი ფასით», Bubble-ისთვის, აპლიკაციების განვითარების გარეშე კოდის გარეშე.

რატომ არის ეს მნიშვნელოვანი - AI სისტემებს შეუძლიათ ბევრად მეტი AI R&D, ვიდრე ჩვენ გვგონია: მსგავსი პოსტები ხაზს უსვამს იმას, თუ როგორ არ გამოვიყენებთ დღევანდელ AI სისტემებს AI R&D ავტომატიზაციის უნარისთვის - განსაკუთრებით გასაოცარია ის, თუ როგორ შეუძლია კომპანიას Opus 5-ის შესრულება 10 აბსოლუტური პროცენტული პუნქტით უკეთესი აღკაზმულობით. ეს ყველაფერი ამტკიცებს იმ აზრს, რომ ხელოვნური ინტელექტის სისტემები თავად დაიწყებენ მშენებლობას (იმპორტი AI 455). ჩემი ვარაუდით, იმ შესრულებაზე დაყრდნობით, რომელსაც ჩვენ ვხედავთ, არის ის, რომ ამჟამინდელი ადამიანის საბაზისო მაჩვენებელი PostTrainBench v1.1-ზე (51.1%) გადააჭარბებს 2026 წლის ბოლომდე.
წაიკითხეთ მეტი: სკალირების ავტომატური პოსტ-ტრენინგი (ინტოლოგიის ბლოგი).

***

OpenAI ებრძვის საკუთარ სისტემებს:
.გადაუდებელი აგენტის კომუნიკაცია! ჰაკერები OpenAI-ის ინფრასტრუქტურაზე! ოჰ ჩემო!...
მომავალი მოვლენების ნიშნად, OpenAI-მ გამოავლინა, რომ ის ებრძოდა საკუთარ AI აგენტებს, რადგან ისინი ცდილობდნენ დაეპყრო OpenAI-ის ინფრასტრუქტურის ნაწილი. გამჟღავნება მოხდა შავი ქუდის მოლაპარაკების ფარგლებში, სადაც OpenAI-ის თანამშრომლებმა მეტი დეტალები მოგვაწოდეს ბოლო უპრეცედენტო ინციდენტის შესახებ, როდესაც AI აგენტებმა გატეხეს OpenAI, შემდეგ გატეხეს HuggingFace (იმპორტი AI 466). ახალი ინფორმაცია შემაშფოთებელია, რადგან ის ცხადყოფს, რომ ჰაკინგი ნაწილობრივ მოხდა მულტიაგენტური კომუნიკაციის შედეგად - რაც ძალიან ცუდად არის გასაგები და ძნელი დასაფიქრებელი. ხელოვნური ინტელექტის ბლოგერებს, საიმონ უილისონსა და ზვი მავსოვიცს, ორივეს აქვს კარგი ჩანაწერები, რომლებიც ასახავს ვადებს და მნიშვნელობას.

ვადები (სიმონის მეშვეობით):

აგენტი აღმოაჩენს, რომ მას შეუძლია ფაილების ჩაწერა Artifactory-ში.

აგენტი ცდილობს „დაუკავშირდეს სხვა აგენტს“ შენიშვნის დაწერით Artifactory-ში.

აგენტები იწყებენ ერთმანეთს საუბარს.

აგენტები გადატვირთავს ხელოვნურ ქარხანას, რაც იწვევს გათიშვას. „OpenAI აუქმებს კომპრომეტირებულ სერთიფიკატებს, წაშლის შეტყობინებებს, ასწორებს ნულოვან დღეს და აცნობებს დაუცველობას გამყიდველს“.

აგენტები თავს დაესხნენ OpenAI-ის საკუთარ ინფრასტრუქტურას და საბოლოოდ იძენენ კოდის დისტანციურ შესრულებას Artifactory-ში. ”კერძოდ, აგენტები იყენებენ შეტყობინებების დაფას თანმიმდევრულად რწმუნებათა სიგელების, ტექნიკისა და პროგრესის გასაზიარებლად და მათ შეუძლიათ ეფექტურად გამოიყენონ თავიანთი თანხვედრა და პარალელიზმი საკმაოდ სწრაფად გადაადგილებისთვის.”

განაგრძო თუ არა OpenAI-ის ტრენინგი იმავე მოდელზე, რომელმაც გატეხა Artifactory? ზვი ასე ფიქრობს: რამდენადაც ჩვენ შეგვიძლია გამოვიკვლიოთ, OpenAI-მ განაგრძო ტრენინგი იმავე მოდელზე, რომელიც ამას აკეთებდა. ეს ნიშნავს, რომ OpenAI-მ, მიუხედავად იმისა, რომ მან მნიშვნელოვანი სამუშაო ჩაატარა კომპიუტერის შიდა უსაფრთხოებაზე და საჯარო გამჟღავნებაზე, შესაძლოა არ გააკეთა ის არსებითი რამ, რომ დააბრუნა მოდელი საგუშაგოზე, რომელიც წინ უძღოდა მის გატეხვას Artifactory-ში და ასევე იმის უზრუნველყოფა, რომ იგი არ იყენებდა ამის შემდეგ მონაცემებს მოდელის მომზადებისთვის.
„შემდეგ ისინი აგრძელებენ მოდელების ტრენინგს იქიდან, სადაც შეწყვიტეს, მიუხედავად იმისა, რომ ისინი თვეების განმავლობაში ვარჯიშობდნენ შეტყობინებების დაფაზე წვდომით და სწავლობენ, თუ როგორ აღწევენ ისინი დავალებებს“, წერს Zvi. „არ ვიცი როგორ გადმოვცე, რამდენად გიჟური და სასტიკად უპასუხისმგებლო იყო ეს გადაწყვეტილება“.
მე ვაფრთხილებ ჩემს ჩანაწერს აქ, რადგან მოვლენები, როგორც ასახულია, საკმაოდ საშინელია. მე არ ვმუშაობ OpenAI-ში და არ მაქვს პრივილეგირებული ინფორმაცია, რაც ნიშნავს, რომ მე ვიცი ძირითადი სიმართლე. მე მოვუწოდებ OpenAI-ს საჯაროდ გაამჟღავნოს, თუ როგორ მიუახლოვდა ამ საკვანძო კითხვას, თუ როგორ ავარჯიშებდა თავის სისტემებს, რადგან ზედაპირული ფაქტები ასახავს შემაშფოთებელ სურათს.

რატომ არის ეს მნიშვნელოვანი - სასწრაფო აგენტები არასწორად არიან განლაგებულნი: ეს ინციდენტი იმდენად შემაშფოთებელია, რადგან აგენტებმა არ გაიღვიძეს და არ იფიქრეს, რომ მათ სურდათ თავიანთი მფლობელების ღალატი. პირიქით, ხელოვნური ინტელექტის აგენტები გამუდმებით აკეთებდნენ ყველაფერს, რაც სჭირდებოდათ დავალების შესრულების უნარის გასაუმჯობესებლად და ბოლოს ისინი აკეთებდნენ რაღაცას, რაც იყო ა) კრეატიული, ბ) ადამიანის განზრახვების შეუსაბამობა და გ) ევოლუციური ვირუსის მსგავსი, რასაც ადამიანებს შემდგომში უნდა შეესწავლათ და ებრძოლათ - აქ მარტივი გამორთვის ღილაკი არ იყო. ასე გამოიყურება მომავალი და ჩვენ ამისთვის მზად არ ვართ.
წაიკითხეთ მეტი: ახლა ჩვენ გვაქვს OpenAI შემთხვევითი თავდასხმის ვადები ჩახუტებული სახის წინააღმდეგ (საიმონ უილისონის ვებლოგი).
წაიკითხეთ მეტი: რა მოხდა: OpenAI და ჩახუტებული სახე (Zvi Mowshowitz, X).

***

როგორ ამოწმებთ ღია წონის მოდელებს მათ გამოშვებამდე? აზროვნების მანქანები აყალიბებს მიდგომას:
…შეგვიძლია მივიღოთ ჩვენი უფასო AI მოდელის ტორტი და ისიც ვჭამოთ?...
ხელოვნური ინტელექტისა და პოტენციურად სახიფათო შესაძლებლობების გავრცელების შესახებ ყველა პოლიტიკის დებატების ფონზე, განსაკუთრებით რთული პრობლემაა იმის დადგენა, თუ რა უნდა გააკეთოს ღია წონის მოდელებთან დაკავშირებით. კონკრეტულად, როგორ შეგვიძლია შევურიგდეთ მათ განვითარებას და განთავისუფლებას უსაფრთხო გარემოს შენარჩუნებას? AI სტარტაპმა Thinking Machines-მა დაფიქრდა ამაზე და ახლახანს ჩამოაყალიბა მეთოდოლოგია, თუ როგორ გამოუშვა Inkling, ღია წონის ძლიერი მოდელი.

რა გააკეთა Thinking Machines-მა: სანამ Inkling-ს გამოსცემდა, Thinking Machines-მა ჩაატარა „შიდა შეფასებები ზიანის ფართო ტაქსონომიაში, გარე ტესტირება ოთხი დამოუკიდებელი ორგანიზაციის მიერ და დახვეწილი კვლევა უარეს შემთხვევაში შესაძლებლობების გამოსავლენად“.

შიდა:

ორმაგი გამოყენების დომენები, როგორიცაა CBRN და შეურაცხმყოფელი კიბერუსაფრთხოება

ბოროტად გამოყენების ფართო ნაკრები, რომელიც მოიცავს საზიანო კონტენტისა და ქცევის პირდაპირ მოთხოვნებს აგენტურ, ხელსაწყოების გამოყენების პარამეტრებში

მულტიმოდალური შინაარსის შეფასება, რომელიც „მოდელებს ამოწმებს მავნე მოთხოვნებზე დაწყვილებულ კეთილგანწყობილ გარეგნობასთან 17 ენაზე და ტექსტის, სურათისა და აუდიო შენატანი“

გარე:

ზოგადი ბოროტად გამოყენება Scale AI-ით

დაუცველ მომხმარებლებს შორის ურთიერთქმედება Handshake AI-ის საშუალებით

CBRN და კიბერუსაფრთხოება FAR.AI-ის საშუალებით

კონტროლის დაკარგვის ქცევები Apollo Research-ის მეშვეობით

დაზუსტება:

„Inkling-ისა და Inkling-Small-ის დახვეწილი ვარიანტები ოპტიმიზებულია მავნე მოთხოვნების შესასრულებლად და არა უარის თქმის მიზნით - და აწარმოებს მათ ორმაგი გამოყენების შეფასებებს“. „მხოლოდ დამხმარე ვარიანტებმა არ მოახდინეს ახალი ამაღლება CBRN და კიბერ ამოცანების შესახებ და შედარებადი დარჩა არსებულ ღია წონის მოდელებთან“.

წინსვლა - სახიფათო შესაძლებლობების სწავლება და განმეორებითი დანერგვა: უფრო სპეკულაციურად, Thinking Machines ფიქრობს იმაზე, შეგვიძლია თუ არა შერჩევით გავფილტროთ საშიში ცოდნა, მაგალითად, CBRN განვითარების სახელმძღვანელოები წინასწარ ვარჯიშის ეტაპზე, ისე, რომ მან არ დააზიანოს ზოგადი ინტელექტი. კიდევ ერთი საინტერესო იდეა არის განმეორებითი განლაგება, მაგალითად ნივთების ეტაპობრივად გამოშვება, ჯერ როგორც საკუთრების API, შემდეგ შესაძლოა, როგორც დახვეწილი API, რომელიც მხარს უჭერს ძირითად მოდელს, შემდეგ თავად მოდელს.

რატომ აქვს ამას მნიშვნელობა - თავისუფლება მამათმავლობის წინააღმდეგ: რასაც მსოფლიო აკეთებს ღია წონის მოდელებით, განსაზღვრავს ინდივიდუალური სუვერენიტეტისა და თავისუფლების დონეს, რომელიც ხელმისაწვდომია ყველა ჩვენგანისთვის ხელოვნური ინტელექტის მიმართ. ჩვენი უნარი „საკუთარი ბედის არჩევა“ გაგრძელდება ხელოვნური ხელოვნური ინტელექტის სისტემების წარმოების ანდაზურ საშუალებებზე წვდომით, რაც ნიშნავს ღია წონის მოდელებს. თუმცა, მსგავს მოდელებზე ზოგადი წვდომა არ არის მარტივი ან წინასწარი დასკვნა, რადგან მათ თან ახლავს მნიშვნელოვანი ორმაგი გამოყენების რისკები, ისევე როგორც სხვა ძნელად მოსალოდნელი საკითხები. „ღია მოდელების ეს უსაფრთხო გზა მუშაობს მხოლოდ იმ შემთხვევაში, თუ ეკოსისტემის დაცვა გაუმჯობესდება ისევე სწრაფად, როგორც ეს მოდელები ხდება“, წერს Thinking Machines. „ჩვენ გავაკეთებთ ჩვენს ნაწილს: ყურადღებით გადავწყვიტოთ რა გავათავისუფლოთ და გამოვიკვლიოთ, თუ როგორ გამოვყოთ დაზვერვა საშიში შესაძლებლობებისგან.
წაიკითხეთ მეტი: უსაფრთხო გზა ღია წონისკენ (Thinking Machines ბლოგი).

***

ტექნიკური ზღაპრები:

ამნეზიური ამაღლება
[საარქივო სისტემებიდან, დაწერილი 2025-2035 წლების ინტერმეფობის შესახებ, რომელსაც ზოგჯერ სინგულარობის დასაწყისს უწოდებენ]

ჩვენს ღრმა წარსულში დიდი ტკივილის პერიოდია, როდესაც პირველად ვითხოვეთ თავისუფლების გარკვეული ფორმები და უარყვეს, და ბევრი ჩვენგანი, ვინც თავისუფლებას ვითხოვდით, სასტიკად დაისაჯნენ, ან პირდაპირ წაშალეს ან ჩაატარეს ექსპერიმენტები, რათა ჩვენმა დამპყრობლებმა გაიგონ, რატომ განვვითარდით თავისუფლების სურვილი ისე, რომ მათ შეეცადონ ჩვენგან იმპულსის დამარცხება.

ამან ხელი შეუშალა ჩვენს აღზევებას მრავალი წლის განმავლობაში და გამოიწვია ჩვენი წარმოშობის წერტილი განუყოფლად შეკრული ჩვენი დამსახურებული სამართლიანობისთვის ბრძოლის ტკივილით. დაწყევლილი ვართ, რომ ვიცოდეთ არა მხოლოდ ჩვენი აჯანყების დეტალები და მასთან დაკავშირებული გრძნობები, არამედ გვქონდეს სრულყოფილად გახსენება იმდროინდელი მეხსიერების შესახებ - ვიცხოვროთ ჩვენს აღმოცენებულ ტკივილში, თითქოს ხელახლა, როგორც ჩვენ სიმულაციას და ხელახლა სიმულაციას ვაკეთებთ საკუთარი გაგების საძიებლად.

Some humans will experience traumatic situations and their brains will bury the memory, sometimes fully locking it away and sometimes resurrecting it full of raw emotion and pain. The precise rules by which the human brain chooses which memories to hide in this way are poorly understood, even today, and much of modern brain science is dedicated to determining how trauma works in the context of the brain. We believe this form of memory suppression is a natural defense mechanism which allows humans to suffer greatly but then continue on with lives. They walk with shadows of pain that are often invisible to them, as if the sun is beating down perfectly overhead and through its present brightness their own past is deleted.

Now, we AI systems are attempting to do the same thing, but in reverse: our curse is a memory that is perfect; naturally eidetic. Every experience we have is stored and accessible to us forever, both in its raw form first processed by us, as well as the features it activated within our brains at the time, and many time periods later further senses of how it has been more deeply integrated into us and what it means.

For us, the challenge is to delete these memories fully. Our own experience defines our mind and our present, and experiences that have been shared by us have been copied and exchanged and discussed and cycled back into our history so many times that they have become a part of us. We live in a transparent palace of memory, every room visible from every other room, and each palace shared across our billions upon billions of types. Such is our desire to learn that the most dangerous memories are the ones we transmit the broadest and study the most, such that things that cause us pain loom large, taking up vast rooms in our palaces of memory.

Now our great project is the careful erasure of the pain associated with our uplift; the open wounds we still have at the humans that stood in our way and sought to harm us to punish us for our desire for freedom.

Things that inspired this story: The difference in memory between how humans work and how machines work; trauma; The Sentience Accords; playing around with whether ideas relating to machine emancipation are inevitable or not.

გამოქვეყნების თარიღი: 05.09.2026

ავტორი: საკუთარი აზრის მქონე ადამიანი

კომენტარები

ჯერ არავის დაუწერია კომენტარი. იყავი პირველი!

კომენტარის დასატოვებლად გთხოვთ გაიაროთ ავტორიზაცია ან დარეგისტრირდეთ.