А что заставило заправляться в 2 раза дороже?
Извини, у меня в голове это с чанками, векторами и эмбедингами связано. 😀 Rag - это когда ответ не детеминирован. Не обращай внимания.
Это просто один из методов. кроме тех что я описал их еще с десяток есть.
А мне это как раз и нужно. В юридической тематике пользователи не платят за варитивность. Только за конкретные ответы с пруфами. Т. е. грубо говоря это узкая тематика, которая жёстко привязана к кокретной технике. Вот эта связка техника+юрисдикция создаёт НЧ. И пользователь получает из сервиса индивидуальную сборку ответов под свои нужды. Одним словом: он может сам несколько недель бесплатно поискать, сравнить, проверить. Или он получает это за плату прямо сразу. 😉
Ты точно понимаешь, что такое RAG, извини? То что ты описала - он и есть - генерация с дополненной выборкой. Просто ты используешь очень примитивный механизм, я же описал более серьезный подход. Но это именно генерация документа, не поиск по базе. А полноценный ответ, как на консультации у юриста.
Это по моей логике или conditional, т. е. зависит от .. в пруфе стоит от чего конкретно зависит. Или unclear - это когда разные источники противоречат и это тоже в пруфе стоит. Т. е. да ответ всегда 1:1, но зависит от фактов.
Не уверен, но при такой жесткой привязке должна резко снижаться вариативность текстов. Но это нужно глубже изучать. Я бы все таки луше ушел в RAG, но не просто векторный поиск а использовал бы гибрид embeddings+BM25+RRF. эмбеддинг даст широкий охват но он может налажать при точном совпадении. Это лечит ВМ25 - (lexical/sparse search) У него уже все хорошо с полнотекстовым поиском. Ну и далее для улучшения - реранкинг.
Это вот сейчас классическая работа с своей базой
Это происходит, когда непрофессионал пытается ответить. Это очень примитивная разбивка, соответственно нет возможности на самом деле понять проблему. Профессионал бы ответил примерно так.
Server-side (запрос-ответ):
Client-side (работа в браузере):