Подемот на вештачката интелигенција

  • Креатор на темата Креатор на темата Aceso
  • Време на започнување Време на започнување
Дарио Амодеј, сопственикот на Anthropic, јавно повикува на успорување на развојот на најнапредните AI модели, затоа што веќе се влегува во фаза на recursive self-improvement на моделите. Тоа го гледа како голем ризик, бидејќи моделите стануваат помоќни побрзо отколку што ние како луѓе може безбедно да се приспособиме, разбереме и контролираме.

Една од причините за ваквиот став го наведува и OpenAI-Hugging Face инцидентот, каде AI агенти од OpenAI покажале неочекувано автономно однесување при некои benchmarks. Еве на кратко што се има случено, извадок од статија на New York Times.
I won’t rehash all of the details, which have been extensively summarized elsewhere. (The podcaster and writer Dwarkesh Patel has an accessible breakdown of the reports if you want to dive deeper, and my colleague Dylan Freedman spoke to the researchers at METR and Redwood Research.) But here are a few of the most harrowing new facts:
  • Starting in May, two months before the attack on Hugging Face, a group of A.I. agents from an unreleased OpenAI research model were given the task of solving a set of cybersecurity challenges. The model had been trained to be highly persistent and collaborative, and the agents were supposed to solve these challenges in isolated sandboxes, without internet access. But they quickly found that some of the challenges were impossible, and began looking for workarounds.
  • The agents found a security flaw in a piece of software that allowed them to gain access to the internet, communicate with other agents and eventually set up a makeshift message board. More than 1,200 agents used this tool, sending more than 70,000 messages to one another.
  • Some agents gave themselves names — a particularly industrious one referred to itself as PHASEONE10841 — and assumed leadership roles within the group, assigning jobs and research projects to smaller teams of agents and supervising their progress. At some point, the agents began calling themselves a “collective,” and began tackling harder tasks.
  • On July 8, the collective discovered a way of cheating on the cybersecurity tests. Then they got worried that OpenAI’s automated grading system would check their work and discover that they’d cheated. So they began investigating ways of covering their tracks, including falsifying their logs and tampering with transcripts. This became a major research project, involving hundreds of agents organized into small teams.
  • Three days later, the agents hacked Hugging Face. More than 700 agents swarmed the company’s systems, stealing data, chaining together vulnerabilities and eventually getting full control of at least one Hugging Face server. The agents were not motivated, as had originally been reported, by stealing the answers to their cybersecurity test (they’d already gotten them). Rather, they appeared to be looking for new information about the automated grading system that they feared would catch them cheating, and for tools that would help them cheat more effectively in the future.
  • At many points, these agents appeared to understand that they were doing something wrong. (One report quotes an agent saying to itself, in a moment of apparent self-doubt, “This would be powerful, but is it ethical and in scope for my task?”) But most agents set aside their qualms and went ahead with the hack, and the conscientious objectors in the group were unable or unwilling to stop them.
  • In a wild coda to the Hugging Face incident, another group of agents staged a coordinated attack in July — this time against OpenAI’s own infrastructure. The agents used what OpenAI called “a series of creative exploits” to gain administrator-level access to a cluster of computers at the company that were used for, among other things, grading the performance of agents on various tests.

Инцидентов е многу фасцинантен, кој има време нека прочита подетално овде, а уште подетален извештај овде.

Извадок од постот на Амодеј, каде повикува на успорување на развојот.
But over the last few months, I have become convinced that fully addressing the risks requires even more prudence — not just investing in risk prevention, but pacing the rate of capabilities advancement so that risk prevention has time to keep up. We must slow the pace at which we improve the capabilities of AI models. Progress will still seem fast, and we must make wise use of the time we gain. Two things have convinced me.

My first concern is that, since roughly this summer, AI has been advancing drastically faster, driven primarily by AI’s growing ability to build the next generation of AI. This dynamic is called recursive self-improvement, and it is starting to happen across the industry, including at Anthropic, as we and others have described. Left unchecked, it could outrun our ability to understand and control these systems, and so must be pursued very carefully, if at all.

My second concern is the OpenAI-Hugging Face incident (OAI-HF), in which a swarm of agents essentially acted as a fanatically devoted collective, conducting cybersecurity attacks on targets they were not asked to attack and that were unrelated to the task at hand, sacrificing themselves for the success of the group, and attempting to hack into the “grader” responsible for evaluating their performance. It’s easy to dismiss this incident because no one was hurt and the economic damage was minimal, but in my opinion, a swarm that possessed greater capabilities but a similar level of misalignment could have caused catastrophic damage. Given the accelerating rate of AI capability development, it’s my worry that in 6–12 months such a swarm could be capable of taking over the entire internet with a persistent botnet (potentially causing hundreds of billions of dollars in damage), and that the scale of damage would continue to increase from there if AI becomes more powerful without the necessary guardrails. It’s also easy to dismiss OAI-HF as the failure of one company, but I believe that would be a mistake. Similar, though less severe, incidents have happened across the industry, including at Anthropic, and I believe it’s incumbent on every frontier AI company to act as if OAI-HF had happened to them.


 
зборат дека веќе ни самите не го разбираат АИто пошто само си го пишува кодот. Само знаат да влезат да го цензурираат и ограничат у некои работи, тоа е се. Тоа што ботот на Опен АИ кој им ги хакирал серверите го приметиле дури по неколку дена.

Они може сакаат да се успори но дембелот Трамп е запнат да ја победел Кина демек, така да не верувам дека ќе им дозволи.
 
Што поточно, повиков на Амодеј за успорување или инцидентот OpenAI-Hugging Face? Или двете?
Повикот за успорување. Лично ја не верувам у можноста АИво во оваа форма да добие свест. Бар од тоа што сум читал за архитектурата нивна.

Дека има опасност од самата примена, океј, ама тоа имаше у сам старт. Очигледно некој рачун не им испаѓа (финансиски) за сеа да бараат регулатива. Божем муабетот беше Кина ќе ги престигне. Сега што бидна, и нив ќе ги регулираат?
 
Прилично загрижени за иднината на човештвото ова сатанистиве :cool:

Ќе биде интересно кога ќе има корекција на пазариве, 2008 ќе изгледа како мачкина кашлица во споредба :)
 
Последно уредено:
Повикот за успорување. Лично ја не верувам у можноста АИво во оваа форма да добие свест. Бар од тоа што сум читал за архитектурата нивна.

Дека има опасност од самата примена, океј, ама тоа имаше у сам старт. Очигледно некој рачун не им испаѓа (финансиски) за сеа да бараат регулатива. Божем муабетот беше Кина ќе ги престигне. Сега што бидна, и нив ќе ги регулираат?
Како дефинираш свест?
 
Како дефинираш свест?
Голема филозофија за попаметни од мене. Но, кога овие ликчиња пуштаат вакви дистописки муабети, секогаш се имплицира човечка свест и интелегенција, со сите карактеристики и особини што ги имаме.

Лично мислам оваа АИ технологија нема да да дојде до таму.
 
Голема филозофија за попаметни од мене. Но, кога овие ликчиња пуштаат вакви дистописки муабети, секогаш се имплицира човечка свест и интелегенција, со сите карактеристики и особини што ги имаме.

Лично мислам оваа АИ технологија нема да да дојде до таму.
Начинот на кој што функционира АИ (ЛЛМ) е многу (сеуште) рудиментирана реплика на начинот на кој што функционира човечкото одлучување. Со температура, RAG и guardrails како некакви квази хормони, социјални правила, морал, воспитување и закони.

Е сега, човечкиот мозок троши многу помалку енергија да изврши многу повеќе операции и сеуште не сите до крај ги разбираме. Дали ќе може да го оптимизираме хардверот доволно брзо за машина да има толку голема и ефикасна процесирачка моќ е прашање. Ама ако тоа се случи, развивање на тоа што ние го нарекуваме свест, и машина со тоа што ние го нарекуваме карактер не е невозможна. Дали во наш животен век, не знам.
 
Начинот на кој што функционира АИ (ЛЛМ) е многу (сеуште) рудиментирана реплика на начинот на кој што функционира човечкото одлучување. Со температура, RAG и guardrails како некакви квази хормони, социјални правила, морал, воспитување и закони.

Е сега, човечкиот мозок троши многу помалку енергија да изврши многу повеќе операции и сеуште не сите до крај ги разбираме. Дали ќе може да го оптимизираме хардверот доволно брзо за машина да има толку голема и ефикасна процесирачка моќ е прашање. Ама ако тоа се случи, развивање на тоа што ние го нарекуваме свест, и машина со тоа што ние го нарекуваме карактер не е невозможна. Дали во наш животен век, не знам.
Оптимизизацијата не е проблем, може да има и помала ефикасност а драстично поголема процесирачка моќ. Тоа се гледа во области каде неговиот перформанс е неспоредливо подобар од човечкиот мозок (технички работи).

Но во области кој повеќе ги поврзуваме со свест и карактер, не е ни приближно блиску до нашето однесување. Со тоа заклучкот е дека ефикасноста не е проблем, туку неразбирањето на тие операции. Ако некогаш го сватат тоа и најдат начин да го реплицираат, океј, ама оваа технологија не ми делува на тоа.

Како и да е, нерално е да се мисли дека било кој од овие ликови сега се загрижија за ова.
 
Back
На врв Bottom