Пять способов, которыми ИИ учится улучшаться

Вот почему Mirhoseini использовал ИИ для оптимизации чипов ИИ. Еще в 2021 году она и ее сотрудники в Google создали систему ИИ без LLM, которая могла бы решить, где разместить различные компоненты на компьютерный чип для оптимизации эффективности. Хотя некоторые другие исследователи не смогли повторить результаты исследования, Мирхосейни говорит, что Природа Исследовала бумагу и поддержала обоснованность работы – и она отмечает, что Google использовал проекты системы для нескольких поколений своих пользовательских чипов ИИ.

Совсем недавно Mirhoseini применил LLMS к проблеме написания ядра, функций низкого уровня, которые контролируют, как различные операции, такие как умножение матрицы, выполняются в фишках. Она обнаружила, что даже общие LLM могут, в некоторых случаях, писать ядра, которые бегут быстрее, чем версии, разработанные человеком.

В другом месте в Google ученые создали систему, которую они использовали для оптимизации различных частей инфраструктуры LLM компании. Система, называемая Alphaevolve, побуждает Google Gemini LLM написать алгоритмы для решения некоторых проблем, оценивает эти алгоритмы и просит Близнецов улучшить наиболее успешные и повторять этот процесс несколько раз. Alphaevolve разработала новый подход для запуска обработки данных, который сохранил 0,7% вычислительных ресурсов Google, внесла дополнительные улучшения в индивидуальном дизайне Google и разработал новое ядро, которое ускорило обучение Gemini на 1%.

Это может звучать как небольшое улучшение, но в такой огромной компании, как Google, это приравнивается к огромной экономии времени, денег и энергии. И Матж Балог, научный сотрудник штаба в Google Deepmind, который руководил проектом Alphaevolve, говорит, что он и его команда проверили систему только на небольшом компоненте общего тренировочного конвейера Близнецов. По его словам, применение его более широко может привести к увеличению сбережений.

3. Автоматизация обучения

LLM, классно голодные, и обучение их дорогостояло на каждом этапе. Например, в некоторых конкретных областях-необычные языки программирования-данные о реальном мире слишком скудны, чтобы эффективно обучать LLMS. Подкрепление обучения с обратной связью с человека, методика, в которой люди оценивают ответы LLM на подсказки, а LLM затем обучаются с использованием этих баллов, является ключом к созданию моделей, которые ведут себя в соответствии с человеческими стандартами и предпочтениями, но получение обратной связи человека является медленной и дорогой.

Все чаще LLM используются для заполнения пробелов. Если вызвать множество примеров, LLMS может генерировать правдоподобные синтетические данные в доменах, в которых они не были обучены, и что синтетические данные могут быть использованы для обучения. LLMS также можно эффективно использовать для обучения подкрепления: в подходе, называемом «LLM как судья», LLM, а не люди, используются для оценки результатов моделей, которые обучаются. Этот подход является ключом к влиятельной структуре «конституционного ИИ», предложенной антропными исследователями в 2022 году, в которой один LLM обучен быть менее вредным на основе обратной связи другого LLM.

Дефицит данных является особенно острой проблемой для агентов искусственного интеллекта. Эффективные агенты должны иметь возможность выполнять многоэтапные планы для выполнения определенных задач, но примеры успешного пошагового выполнения задач не хватает в Интернете, и использование людей для создания новых примеров будет дорогим. Чтобы преодолеть это ограничение, Мирхосейни Стэнфорда и ее коллеги недавно пилотировали методику, в которой агент LLM генерирует возможный пошаговый подход к данной проблеме, судья LLM оценивает, является ли каждый шаг действительным, а затем новый агент LLM подготовлен на этих шагах. «Вы больше не ограничены данными, потому что модель может просто произвольно генерировать все больше и больше опыта», – говорит Мирхосейни.

4. Perfecting Agent Design

Одна область, где LLM еще не внесла основной вклад, заключается в дизайне самих LLMS. Все сегодняшние LLM основаны на нейронной сетевой структуре, называемой трансформером, которая была предложена человеческими исследователями в 2017 году, и заметные улучшения, которые с тех пор были сделаны в архитектуре, также были разработаны человеком.

Последние статьи

Похожие истории