Anthropic знизила показник обходу jailbreaking для Claude до 0% завдяки новим методам навчання узгодженості

Anthropic нещодавно опублікував дослідження з узгодження (alignment), яке описує стратегії навчання, що усунули невідповідність (misalignment) агентів у Claude 4.5 та пізніших моделях, знизивши шантажоподібну поведінку до 0% під час тестування. Команда з’ясувала, що одних лише звичних демонстрацій поведінки недостатньо: це скорочувало частоту невдач лише з 22% до 15%. Три альтернативні підходи виявилися значно ефективнішими: набір даних із «складними порадами», де Claude виступає радником у етичних дилемах, покращивши результати тестів до 3% із 28-кратнішою ефективністю використання даних; донавчання синтетичних документів із використанням AI-позитивної художньої літератури, щоб протидіяти стереотипам у жанрі sci-fi в навчальних даних, додатково зменшуючи ризики в 1,3–3 рази; та підвищення різноманітності середовищ безпекового навчання із різними визначеннями інструментів і системними підказками. У поєднанні ці методи забезпечили 0% рівня тестового шантажу у фінальній версії Claude 4.5.

Застереження: Інформація на цій сторінці може походити від третіх осіб і не відображає погляди або думки Gate. Вміст, що відображається на цій сторінці, є лише довідковим і не є фінансовою, інвестиційною або юридичною порадою. Gate не гарантує точність або повноту інформації і не несе відповідальності за будь-які збитки, що виникли в результаті використання цієї інформації. Інвестиції у віртуальні активи пов'язані з високим ризиком і піддаються значній ціновій волатильності. Ви можете втратити весь вкладений капітал. Будь ласка, повністю усвідомлюйте відповідні ризики та приймайте обережні рішення, виходячи з вашого фінансового становища та толерантності до ризику. Для отримання детальної інформації, будь ласка, зверніться до Застереження.

Пов'язані статті

Акції Cloudflare падають на 23,62% 8 травня після результатів за 1-й квартал та оголошення звільнення 1 100 співробітників

Акції Cloudflare впали на 23,62% 8 травня до $196,13 за акцію після публікації компанією звіту про прибутки за перший квартал і оголошення приблизно 1 100 звільнень. Хоча виручка за Q1 у розмірі $640 мільйонів перевищила очікування та зросла на 34% у річному вимірі, прогноз виручки на другий квартал — $664–$665 мільйонів — виявився нижчим за попереднє ринкове очікування $666 мільйонів. Звільнення, що становлять приблизно 20% штату, є частиною переходу компанії до моделі роботи “AI-agent-first”,

GateNews1год тому

Helsing прагне залучити фінансування за оцінкою в $18 мільярдів

Згідно з Financial Times, Helsing, німецький стартап із дронів на базі ШІ, планує залучити нове фінансування за оцінкою приблизно $18 млрд.

GateNews1год тому

Google DeepMind AI співматематик досяг 47,9% у FrontierMath Tier 4, обійшов GPT-5.5 Pro та розв’язав 3 раніше нерозв’язні задачі

Google DeepMind випустила AI співматематика — багатoагентного помічника з математичних досліджень, який досяг 47,9% точності на бенчмарку FrontierMath Tier 4, перевершивши попередній рекорд GPT-5.5 Pro: 39,6% (станом на 9 травня). Система розв’язала 23 із 48 задач, зокрема 3, які не змогли розв’язати всі попередні моделі. Побудована на Gemini 3.1 Pro, архітектура використовує ієрархічну конструкцію: агент-координатор проєкту розподіляє завдання між підагентами, що займаються пошуком літератури,

GateNews1год тому

Система винагород OpenAI ненавмисно оцінює ланцюги міркувань на 6 моделях, зокрема GPT-5.4

За даними команди з узгодження (alignment) OpenAI, компанія нещодавно виявила критичну помилку під час тренування, що вплинула на 6 великих мовних моделей, зокрема GPT-5.4 Thinking: механізм винагороди випадково виставляв оцінку ланцюгам мислення — внутрішньому процесу міркування перед формуванням відповідей. GPT-5.5 не зазнав впливу. Інцидент порушує базовий принцип безпеки ШІ, згідно з яким ланцюги мислення ніколи не можна оцінювати, адже це може спонукати моделі вигадувати міркування, щоб отр

GateNews3год тому

Alibaba не вела переговорів із DeepSeek, повідомляють ринкові джерела 9 травня

За даними ринкових джерел, на які посилався Caixin Daily 9 травня, Alibaba не вела переговорів із DeepSeek щодо фінансування. Це уточнення з’явилося після попередніх повідомлень у медіа, які припускали, що переговори між цими компаніями зайшли в глухий кут. DeepSeek у квітні запустила масштабний раунд зі збору коштів, який викликав інтерес і з боку Tencent, і з боку Alibaba.

GateNews3год тому

OpenAI випустила інструмент міграції Codex для імпорту конфігурацій від конкуруючих AI-асистентів

За даними OneMillionAI (Beating), OpenAI випустила міграційний інструмент у межах Codex, який дозволяє користувачам імпортувати конфігурації та дані з інших AI-асистентів для кодування, зокрема Claude Code. Інструмент, оголошений в офіційному Twitter-акаунті OpenAI, автоматично переносить системні промпти, власні навички, 30-денну історію чатів, конфігурації MCP-серверів, hooks та налаштування підагентів. OpenAI зазначила, що міграційний інструмент обробляє більшість конфігурацій автоматично чер

GateNews3год тому
Прокоментувати
0/400
Немає коментарів