Гамарджоба, дорогие мои!
Кто-то из вас уже знает про моё немного странное хобби. Когда мне хочется изучить какую-то технологию, я делаю нового питомца. Это крохотные и, как правило, полностью бесплатные сервисы, которые немного упрощают жизнь.
1/6
For my first post, I’m sharing a letter @NVIDIA signed on why open models matter.
AI will transform every industry, power every company, and be built by every country.
Open models strengthen safety and cybersecurity, accelerate innovation and diffusion, and enable sovereignty.
The world needs both frontier closed models and frontier open models.
https://t.co/AUKzoQ5Ikb
Да, правила, влияние и динамика другие. Но это всё равно просто технология. Которая может приумножить как ум, так и глупость. В том числе и при создании контента.
Так что давайте уже относиться к ней без стыда.
Кто не пишет с AI, пусть бросит в меня камень.
Я — пишу. И статьи, и посты, и даже лекции. Сейчас кто-то скажет «ах ты шарлатан, а мы тебе верили». И они будут правы и не правы. Правы — ибо молодцы, что верили. Не правы — потому что не шарлатан.
1/10
Итого.
Странно рассматривать использование AI как читерство. Вы же не называете читерами людей, которые первыми начали использовать проверку орфографии в ворде? Или которые перешли с калькуляторов на эксель? ИИ сейчас — такой же мультипликатор, как IT в 90е и нулевые.
9/10
Время поделиться моим вариантом.
Моя иишка:
- генерирует чистые (или нет) ответы;
- сама выбирает роль и отвечает от её имени;
- в спорных моментах задаёт уточняющие вопросы;
- указывает на источники и проверяет ссылки;
- ну и так, по мелочи.
Ловите: https://t.co/nmk01s9KH4
В этих наших интернетах тьма советов о том, как персонализировать GPT. Если кто не знает, то это такие пользовательские инструкции, которые добавляются в контекст при каждом запросе. Они помогают не писать каждый раз одно и то же, типа «не выдумывай, отвечай по фактам».
1/2
Выступал вчера на форуме «Цифровые решения». Говорили о том, как создавать продукты, которыми пользуются. Давно не участвовал в таких сессиях, приятно было вспомнить. От софитов жарко пиздец
Первая статья в цикле про PoDPR — метод приоритизации, который учитывает не только важность проблемы/задачи и сложность реализации, но и вероятность «попадания», риски и обратимость решения
https://t.co/IOW2ja4OXj
Новое интервью Андреем Карпатым (топовый AI-чувак), такое мы смотрим! Говорит, «до нормальных умненьких AI-агентов нам еще лет десять, уж поверьте мне – деду, который в индустрии 15 лет, и всяких обещаний успел наслушаться».
Но вообще, мне там вот какой момент показался забавным: Карпатый говорит, что обучение с подкреплением – это «ужасный способ учиться»; просто все остальные доступные нам сейчас варианты обучения нейронок еще хуже. Дескать, при RL (reinforcement learning) происходит «всасывание обучения через соломинку».
Грубо говоря, чтобы научиться решать какую-либо задачу таким макаром, нейронке надо сначала вслепую попробовать порешать ее сотней разных способов. И те способы, что случайно привели к правильному решению, вознаграждаются в форме усиления тех весов (условно, нейронных связей), которые участвовали в «успешных» способах. Но при этом поощряются вообще все совершенные действия в рамках давшего результат способа – даже какие-то глупые случайные метания, которые реально ничего полезного в себе не несут.
Люди учатся совсем не так: они делают гораздо меньше попыток, но зато потом сильно вдумчивее разбирают результат – пытаются понять, что конкретно реально сыграло роль в успехе, а что нет.
Так вот, для тренировки моделей так тоже иногда пытаются сделать – каким-то образом поощрять их не только за финальное решение, но и за промежуточные «правильные» шаги. Правда, делать это силами людей – практически неподъемная задача (слишком дорого). Поэтому… да, вы угадали: исследователи пытаются заставить одни языковые модели разбирать решения других, и оценивать их по шагам.
Но там возникает другая проблема: очень часто «обучающаяся» модель находит хитрые лайфхаки, как ей обмануть «модель-учителя» – и заставить ее поощрять не шаги к правильному решению, а какую-то бессмыслицу. К примеру, случайно выясняется, что у модели-оценщика есть какой-то странный кинк на последовательность букв «dhdhdhdh»: каждый раз, когда она ее видит в решении, она дичайше кайфует и сразу ставит за это наивысшую оценку. Видя это, модель-ученик начинает все свои «решения» писать исключительно в формате «dhdhdhdhdhdhdhdhdhdh» (думаю, не стоит уточнять, что реально решить поставленную задачу это не помогает вообще никак).
Мне кажется, здесь есть забавная аналогия с веществами для людей. В чистом виде химические соединения в такой концентрации, от которой «торчат» люди, в природе не встречаются – вот люди и не эволюционировали, чтобы иметь возможность противостоять им. Так что, когда люди занюхивают какой-нибудь пресловутый порошочек – их «функция вознаграждения» приходит в экстаз и просит еще и еще такого же.
Получается, с нейронками происходит примерно то же самое: в огромном корпусе текстов, на которых они тренировались, никогда не встречалась эта бессмысленная последовательность «dhdhdhdh». Но по некой случайности веса модели сложились так, что она (без всякого глубокого смысла) кайфует именно от этих символов в этой последовательности. И когда модель внезапно встречает эту штуку в своей жизни – она уходит в неконтролируемый запой и трясущимися руками пытается потребить как можно больше именно этой наркоты.
В общем, ждем появления нейроройзмана, который будет пристегивать LLM к нейробатареям…