Sly32

Рейтинг
391
Регистрация
29.03.2012
Должность
Software engineer
yalol :
У меня давно заблокированы боты AI к индексированию моего информационного сайта. Сейчас думаю, а правильно ли это? Может быть так трафик бы шел оттуда? Что думаете?
каких именно ботов ты блокируешь? Ты знаешь, что есть три разных вида ИИ ботов?
ArbNet #:
Да это не плохой способ, но у него есть минус того, что всё же нужен словарь из ~50000 токенов и пересчёт каждого при добавлении нового токена в ответ.
ты мне не обьясняй то чего не знаешь, хотя что нормальный токенайзер включает не 50 а до 126000 токенов. 
Я спрашивал тебя - как ты будешь свою разбивку по словам применять для ЛЛМ. 
Пока что ты написал хеш для каждого символа, не более. Что не применяется в ЛЛМ по причине отсутствия связей между двумя хэшами.

ArbNet #:
У меня другой подход, пока я не хочу о нём рассказывать.
Ну так в таком случе не выпендривайся тут. Это болтовня а не подход. 
ArmenDomain #:
о точно, PayPal оказывается не он создал. Пиарщик от Бога.
а должен был? Может просто погуглишь его роль в развити палки?  Так и ракеты он не самолично создает и запускает и теслу. Однако все это есть благодаря ему. При всех его странностях это глупо отрицать
ArbNet #:
Нет, не дешёвая это операция,
Именно дешевая в плане выполнения. Ты не ответил на вопрос - в твоей системе что дает разбивка слов таким образом и что является минимальной единицей информации.

И давай счас не выяснять кто круче а обсуждать теорию твою и варианты решения. Мне это интересно.
ArbNet #:
У нейросети могут быть несколько слоёв, а слой может быть типа RNN, LSTM, Mamba, Transformer
Ну если не придираться - соглашусь. Как можно описать твой. подход? К чему ближе и что он решает?
ArbNet #:
Поэтому разработчики нейросетей пошли по самому простому пути дробить слова на кусочки и прогнозировать ответы на основе предыдущего контента пересчитывая вероятности на каждой итерации все 50000 токенов для добавления нового кусочка\токена к ответу.
Не совсем так. Дробление уже подчинено алгоритму. Как по твоему будет разбиваться слово "алгоритм"? Как угодно или на логическую единицу - "алго" + "ритм"? что такое  BPE?
ArbNet #:
По мне это очень тупой способ требовательный больших вычислительных мощностей и много лишней работы(хотя на графических процессорах просчёт всех токенов происходит практически мгновенно за один такт, всё равно это очень много лишней работы).
какая там лишняя работа? Какая алгоритмическая сложность этой задачи? Я тебе скажу - это линейная операция O(1) - самое дешевое в мире вычислений.
Sly32 #:
Я тестил другой подход. Эти функции это прототипы, 64 это токенов русских букв строчных и заглавных без и́ё. Я кодирую слово в числа, а не разбиваю на части токенов по несколько букв. Подход удачный получился.
тут нужна пояснительная бригада. Правильно ли я понял что у тебя 1 токен - одна буква(символ)? Если да, как ты  дальше строишь систему. Ты хочешь вообще уйти от трансформера с его слоями? Это будет что-то типа графа? 

В любом случае, до полноценной гибели браузеров и сайтов уже далеко. Но, как я и пытался сказать - трансформация идет. Собственно, будущее уже описано в фантастических фильмах, 20 лет назад это казалось полной выдумкой - умный дом, голосовой помощник, а сейчас? Кого это удивляет - "Алиса, включи свет, какая погода на сегодня?" Скороее всего мы придем к общению через агента со всем миром, а он уже будет работать с информацией. Как вариант - покупать доступ к информационному порталу, учебному/образовательному, развлекательному.

Я тут подсел на игры в виртуальной реальности - это нечто! Играю в Халф-лайф в полноценном VR. Ну блин - это совсем другое дело! Или гонки...
Но этот шлем стоит каких-то немыслимых денег, но недавно видел уже в продаже очки с виртуальным дисплеем. Вполне доступно.

romancher #:

Конечно связано, все ведь дело в канистрах, а не в дефиците бензина, если бы везде разрешили наливать в любые ёмкости, продажи новых автомобилей выросли бы на 146%. 

Точно! Именно это я имел ввиду! Спасибо за уточнение. Меньше канистр -  меньше авто. Ясно-понятно

ArbNet #:

Не смеши, с этой мамбой 😁

Дело вообще не в методе кодирования, а в скорости генерации, обучаемости на не больших данных и осознанности. Что трансформер, что мамба и далее по списку всем нужно очень много данных для обучения чтобы генерация ответов была осознанной такой же как если бы отвечал человек, а не набор слов или букв. Я пишу мини-lm чтобы можно было запустить на любом компе, обучить нужным данным и получать хорошие результаты с быстрыми ответами. С теми алгоритмами на каких работают существующие нейросети то, что я хочу просто не реализовать(хотя кому я объясняю, всё равно не поймёшь).

ЗЫ. Что трансформер, что мамба, на каждой итерации просчитываются вероятности всех токенов, у мамба есть скрытое состояние от которого делаются расчёты(балбесы вроде тебя думают, что это ускорение, но на самом деле это не ускорение по большому счёту). Я делаю кодирование слов в числа чтобы не просчитывать тысячи токенов каждый раз, а чтобы по кодам слов находились паттерны и генерировались нужные слова. Не понимаешь же наверное всё равно ничего..

Как ты будешь строить паттерн? В твоем кодировании нет никаких связей между кодами слов

Всего: 8310