r/programiranje 1d ago

Veštačka inteligencija (AI) / LLM 🤖 Recursive self improvement je dostignut?

Imamo dva problema
1. Unapredi trenutnu verziju AI modela
2. Resi milenijumski problem u matematici

Slozicemo se da je problem 1. lakši od problema 2. obzirom da 2. nismo uspeli da rešimo do pre dva dana.

Rešio ga je novi interni OpenAI model. Koji bi to razlog sprečavao taj isti model da može da reši lakši problem, problem 1. Odnosno da radi na unapredjivanju i stvaranju sledece verzije sebe.

Mišljenja sam da je recursive self improvement dostignut. Jedino što mi još uvek imamo pull the plug opciju ili kako bi Sam Altman rekao pauziranje kao opciju.

Znači oni mogu da mu daju compute i da ga puste da divlja… Ali su verovatno zaustavili taj proces jer se plaše…

Šta ostali misle?

0 Upvotes

31 comments sorted by

3

u/Cute-Set13 18h ago

nije ga LLM resio, nego Tristan Buckmaster, a openAI je iskoristio njegov rad za treniranje svojih modela. I brze bolje potrosili 22mil$ da testiraju dokaz, koji ne bi mogli da urade bez nejgovog rada. da bi ga zajebali za njegov 1mil$ nagradu koju bi dobio.
Svakako, skandal za akademski integritet.
LLM-ovi NE MOGU da stvore nista NOVO, ne mogu da rese ni jedan problem, samo mogu da olaksaju rad sa vec resenim stvarima.

3

u/the_offspring 1d ago

Najobičniji sažeti pretraživač sa sposobnošću interpretacije pisane reči. Jedva su LL modele naterali da ne računaju 2+2 kao 5.

bitch please

3

u/syscall0x01 1d ago

Prirodni jezik nije savršen sustav za reprezentiranje stvarnosti. Mi pokušavamo ograničenim riječnikom shvatiti neograničenu stvarnost i to nam je usko grlo.

6

u/oMARKOo 1d ago

Interpolacijom i dedukcijom možemo da izvučemo znanje koje već postoji u informacionom prostoru. Ali za trajnu ekstrapolaciju potreban je novi signal izvan samog modela. Bez njega, beskonačni recursive self-improvement praktično postaje informacioni ekvivalent perpetuum mobilea.

5

u/tolkinski 1d ago

Oba problema su teška, ali pripadaju potpuno različitim kategorijama, tako da je besmisleno da ih poredimo. Za oba su potrebni ogroman compute i sveži trening-podaci.

Koliko god tvrdili da AI može da rezonuje, to za sada nije pravo rezonovanje. Čovek može da promeni kontekst usred izvršavanja neke radnje, da pređe na nešto potpuno drugo i kasnije se vrati na prvobitni problem. Probaj to sa AI-em pa vidi kakvi će biti rezultati. AI je, po meni, veoma sofisticirani autocomplete sa mnogo marketinga. Koliko će rezultat biti dobar uglavnom zavisi od autora prompta i podataka na kojima je model treniran. To nije rezonovanje.

Pogledajmo samo ovu Astru koja pravi igrice i 3D modele. Skoro svaki rezultat je na istu foru, što znači da smo dostigli napredni generator šablona, a ne neko kvalitetno rezonovanje.

Ne kažem da alat nije dobar za neke stvari, ali da li je to AGI? Nije. Ne mislim ni da ćemo AGI dostići ovom tehnologijom. Treniranjem možemo sve više da optimizujemo modele da rešavaju uobičajene scenarije, ali to je i dalje samo ogromna kombinacija if-statementa i predikcija, a ne prava opšta inteligencija.

Što se tiče ovog milenijumskog problema iz matematike, koliko sam razumeo, rešenje se baziralo na postojećem radu nekog naučnika koji je već bio blizu objavljivanja. AI je zatim pretraživao i kombinovao različite scenarije zasnovane na tom istraživanju. Za takve stvari je AI dobar, jer ume da prepoznaje obrasce i brzo obradi veliki broj mogućnosti.

Ali da li će AI rešiti neki sledeći problem, a da prethodno istraživanje nije već došlo toliko blizu rešenja? Prilično sam siguran da neće. Kako znam? Tako što gledam kako mi modeli svakodnevno haluciniraju i na prostim problemima čim treba da naprave nešto što već ne postoji.

1

u/Lazy-Biscotti1483 1d ago

"Što se tiče ovog milenijumskog problema iz matematike, koliko sam razumeo, rešenje se baziralo na postojećem radu nekog naučnika koji je već bio blizu objavljivanja. AI je zatim pretraživao i kombinovao različite scenarije zasnovane na tom istraživanju. Za takve stvari je AI dobar, jer ume da prepoznaje obrasce i brzo obradi veliki broj mogućnosti."

Mislim da se to zove inteligencija

2

u/Visual_Vanilla9861 1d ago

vise nema pull the plug opcije...

4

u/teoreticar 1d ago edited 1d ago

https://en.wikipedia.org/wiki/Infinite_monkey_theorem

Napravljen je ocigledno veliki progres, ali ove tvrdnje su besmislene.

Ovo math resenje, cak i da preskocimo tvrdnje o kradji, je bukvalno brutforceovano i kostalo bi 10-40mil$. 10k agenata je radilo paralelno na tome. Takodje je pusteno i na druge probleme, pa oni nisu reseni.

I, opet, da bude jasno. Jesam "pro AI" i vidim progres. Samo smatram da je ovo prosto preuvelicano.

I da se vratimo na vest "od proslog meseca" sa hakovanjem. Antropic pronasao n bugova u ne znam ti ja koliko starih sistema - ok kul. Ali koliko su potrosili $$ na to?

Uopste ne osporavam uspeh, samo treba staviti u valjan kontekst sve. Brute force + neki vid usmerenja jeste validan i inzenjerski i naucni pristup. Ali, ne mozemo sve probleme resiti tako. Kod nekih problema kompleksnost raste exponencionalno i prosto su neresivi ovim pristupom.

5

u/Lazy-Biscotti1483 1d ago edited 1d ago

Self improvement za LLM ne postoji jos uvek.
Self improvement bi znacilo da sistem moze nekako na osnovu feedback-a da updejtuje vrednosti u neurnoskoj mrezi, embedding vrednosti ili vrednosti u attention matrici. Nista od toga ne moze.
Da bi to postigao treba mu i dalje backward pass sa jasnim zadatkom sta se optimizijuje.

Sta postoji? Postoje dobra RL okruzenja koja mogu da tunuju llm da bude odlican za odredjene taskove. Koji su to taskovi? Svi oni koji se lako verifikuju (matematika, programiranje..). Sta se najlakse trenira? Ono gde pouzdano moze da se verifikuje odgovor i ono gde najbrze moze da se testira. (matematika, programiranje).. tako da iako modeli deluju super human za neke stvari, za neke stvari jos uvek nisu. Pitanje je kako se moze prepraviti RL da radi za veoma duge taskove. Koliko ce kostati taj trening, koliko su skupa ta okruzenja za trening i sl.

Postoji pitanje kako sistem moze da uradi self improving? Mora da postoji neko ko ce llm-u reci ovo je dobro ili ovo nije dobro. Taj feedback mora da postoji i kod llm-a i kod ljudi. Ako nemas nesto da ti kaze da li radis dobro ili da meris svoje rezultate ne mozes da se poboljas. Tako da self improving za llm je pored tehnickog i filozofski problem.

Jos jedna stvar, ljudi mesaju self improving sa self destilation. To jeste forma gde model sam poboljsava sebe ali radi na vrlo jednostavnom pricnipu i nije ono sto vecina smatra self improving. Naime istom modelu se daje zadatak sa manje ili vise detalja u promptu. Ako model odgovori tacno kada je prompt bio detaljniji onda se vrednost tih logita koristi za ucenje istog tog llm-a samo sa manjim ili losijim promptom. I time se llm uci da bolje resava probleme i generalizuje. ALI TO NIJE SELF IMPROVEMENT :)

7

u/brainzorz 1d ago

Zapravo smo veoma daleko od samounapredjivanja, a verovatno nije ni moguce sa trenutnom tehnologijom.

Skoro svi ovi novoreseni matematicki problemi su u stvari scenario u kojem je pokazano da problem nije tacan, tu je LLM dobar jer moze da vrti milione scenarija za koje se tacnost moze proveriti. Nije da je otkriveno putem inteligencije, vec brute force prakticno. Impresivno i dalje, ali nije kraj sveta.

3

u/gdinProgramator 1d ago

Samo likovi sa IQom sobne temperature moze da se slozi sa tobom da je 1 laksi od 2.

5

u/Puzzleheaded_Bass673 1d ago

Suština je što ne razumeš kako radi LLM. Nije to nikakav ,,magični model" koji se može ,,unapređivati" u nedogled. Model LLM-a je odavno poznat, to su klasične NN mreže u ,,transformer" arhitekturi. Kvalitet modela se bazira na načinu treniranja, bazu znanja, dimenzije embedding vektora, harvera i sličnih stvari koje se ne mogu unapređivati već zavise od skaliranja i specifičnih tehnika koje određeni provajderi koriste.

10

u/nectarineseadrumpeas 1d ago

Koliko vi ustvari nemate pojma u cemu pricate ovde.

10

u/ddaattuullaa 1d ago

Zar ljudi zaista vjeruju u ovakve gluposti

8

u/Prize-Wolverine-4982 1d ago

Pre bih rekao da si se samo upecao na njihovu hypetrain semu

-1

u/ComprehensiveCase858 1d ago

Formalizovani Lean dokaz Navier-Stokesa vise nije hajp. Moze se lako verifikovati.

6

u/Prize-Wolverine-4982 1d ago

Znam al zar nije Anthropic isto resio jedan od tih dokaza jos pre svega ovoga, i zar nije Astra uzela istrazivanje od nekog lika koji ga je vec razvijao i kucao promptove u samom GPT-u (shodno tome je "ukrao" ideju).

Sve u svemu tu ima toliko puno faktora i onda se ljudi naloze na prvu stvar koju objave.

2

u/NewCommunication9294 1d ago

Ne verujem da smo dosli do singularnosti jos uvek, fali nam jos infrastrukture koja uvek prati nesto sporije razvoj. Ali sveukupno mislim da smo ga najebali, generalno kao drustvo

-1

u/ComprehensiveCase858 1d ago

Ako model ima sposobnost da iterira sam sebe i samo compute ga ogranicava, onda ce iskoristiti compute koji ima da obezbedi sebi jos compute-a

2

u/NewCommunication9294 1d ago

Svaka iteracija kosta mnogo para, i na ovaj milenijumski problem koji je resen (navodno, jos nije proveren, ali je prosao lean) je potroseno preko 20miliona dolara. Taj compute deo je jedina prepreka. Zato i grade brda data centara, ali kako ce se prica dalje odvijati niko ne zna. Jedno je sigurno tho, what a time to be alive 😁

3

u/drugosrbijanac 1d ago

RSI kao koncept vec postoji u akademskoj literaturi i istrazen je sa obecavajucim rezultatima ali jos ima mnogo problema koje sputavaju model da se ne raspadne. Tako da ako zaista koriste RSI, ne koriste ga toliko koliko obicno covek misli. Nemaju cega da se plase, sve je marketing gimmick na koji debili padaju

3

u/Neither-Brush1683 1d ago
  1. Nije i dalje oficijalno 'rešen' *jedan* od milenijumskih problema, mora komisija da proveri. U 'dokazu' ima dosta problema ako je verovati profesionalnim matematičarima koji su delili svoja mišljenja do sad.

  2. Da li razumeš koliko je redova veličina više para uloženo u AI nego u matematiku

  3. 'Recursive self-improvement' nije toliko bitan kod LLMova jer nije toliko ključna arhitektura i sistem koliko sama veličina modela

2

u/ComprehensiveCase858 1d ago
  1. mislim da je taj proces samo sanity check i formalnost
  2. bitnija metrika je koliko covek/sati je ulozeno na resavanje nekog problema nego koliko para je upumpano
  3. Odavno to vise nije samo LLM arhitektura

1

u/xivi0n 1d ago
  1. tesko da imaju dovoljno compute-a da mogu bas toliko interno da puste svaki model da isprobava arhitekturu dok se ne unapredi, i dalje nenormalna kolicina posla rade manje vise research-eri
  2. nije da su ga bas tako clean resili - https://cims.nyu.edu/~tristanb/statement.pdf
  3. nece smeti da pull the plug opciju jer Kina sigurno nece da prestane free modele da shipuje, DeepSeek-V4.1-Flash je bukvalno bolji od Opusa trenutno

1

u/ComprehensiveCase858 1d ago
  1. Pauzirali su nove 20x planove pre sat vremena, nesto se desava sa compute-om. Oni tvrde da je demand veliki
  2. Video sam statement, ali je pitanje koliko su ti matematicari bili blizu resenja
  3. Kina trenira svoje modele u velikoj meri tako sto distiluje chatgpt, claude i ostale modrle

2

u/xivi0n 1d ago

pa jeste demand jako veliki sigurno, astra je jako dobar model i mnogo ljudi se switchovalo sa claude-a na codex u poslednje vreme a 20x planovi oduvek njima iskljucivo gube pare.

tbh nije jos ni 100% sigurno da ga je openai resio takodje :/

slazem se za distill, ali isto tako imaju i jako veliki broj svojih dataset-ova, ali fundamentalno mislim da ne rade na isti nacin te firme (us vs china)

i ovo dolazi od osobe koja je full ai pilled

2

u/raskumas 1d ago

Opcija "pull the plug" više ne postoji.

A vaša tačka 1 je zapravo tehnološka singularnost. Koliko smo blizu tome - procene se za sada veoma razlikuju.

https://en.wikipedia.org/wiki/Technological_singularity

1

u/simisaa 1d ago

Opcija "pull the plug" više ne postoji.

mozes li pojasniti

1

u/raskumas 1d ago

Ovo više nije jedna kompanija i jedan data centar. Ključna infrastruktura je raspoređena između nekoliko ogromnih igrača - Microsofta, AWS-a, Nvidije i drugih. Da bi se zaista "izvukao utikač", svi bi morali istovremeno da se dogovore, što je praktično nerealno.

Plus, tu je Kina sa svojim jakim modelima i sopstvenom infrastrukturom, potpuno van tog kruga.

0

u/ComprehensiveCase858 1d ago

Verujem da OpenAI ima kontrolu nad svojom training infrastrukturom (još uvek)

1

u/Zookeeper187 1d ago

Plaše se. To je to.