Локальные LLM
Есть несколько способов запускать АИшки локально, самый простой - это https://ollama.ai/
Но зачем?)) У @Astartsky 64ГБ ОЗУ и он иногда этим пользуется, распросил его об этом.
Astartsky
- дисклеймер: я не ML специалист, просто энтузиаст. Поэтому мои ответы стоит воспринимать с определенной долей скептицизма 🙂
artalar
- На сколько часто пользуешься и по каким вопросам?
Astartsky
- Редко пользуюсь локальными моделями, так как для общих задач gpt4/opus намного эффективнее (и быстрее); для кодовых задач copilot лучше и быстрее локальных решений. По крайней мере, пока. Вижу применение локальных моделей сейчас, в первую очередь, для конфиденциальности. Иногда использую для анализа данных из моего obsidian, когда нет желания делиться информацией с openai (например, личный дневник). Для всего остального использую chatgpt или gpt4/opus через raycast.
artalar
- Пробовал дообучать для каких-то своих задач?
Astartsky
- Не пробовал делать fine-tuning, т.к. у меня нет достаточно вычислительной мощности для этого. Вообще, многие такие вопросы закрывает управление контекстом. Можно делать руками, можно через embeddings. Идея простая: отправлять в рамках контекста кусок релевантной информации. Откуда она взялась, не так важно.
artalar
- Какая скорость? Сравнивал ли с облачными решениями? Вообще для личных задач у тебя какой набор АИшек и как часто какими ты пользуешься?
Astartsky
- Скорость у локальных, конечно, ниже облачных решений. Для 8b приемлемая, ответа от 70b надо ждать довольно долго, может занимать несколько минут. Поэтому, если речь не идет о конфиденциальности, облачное решение выглядит оптимально.
artalar
- Она же только текстовая или еще чето умеет сканировать / генерить? Гуглить умеет и делает ли это?
Astartsky
- Есть мультимодальные модели типа llava, они умеют рассматривать фотки, могут ответить на вопросы по ним. Для генерации картинок есть отдельные модели типа dalle. Для поиска информации есть много решений типа tavily, которые дают удобное апи для получения результата и его контекста. По сути, то, о чем ты спрашиваешь, называется RAG (retrieval augumented generation) и агенты (когда у тебя много разных инструментов и нейронок, которые друг с другом как-то взаимодействуют для решения твоей задачи)
artalar
- cold / hot start? Те ты каждый раз заного запускаешь или оно в фоне висит? Через сколько начинает отвечать?
Astartsky
- Я использую ollama (там классический llama.cpp под капотом), он очень удобно позволяет из командной строки или через апи работать с практически любыми моделями. На hugging-face полно gguf файлов от нейронок на любой вкус, любую их них можно запихать в ollama и вызывать из командной строки. При этом можно задать сколько будет висеть в памяти модель при запросе. Можно, например, поставить полчаса — и тогда через полчаса idle она оттуда будет выгружена. Если модель уже в памяти, она мгновенно начинает стримить ответ, что удобно, конечно. При холодном старте нужно сначала загрузить модель в оперативку, что может занять какое-то время.
artalar
- Сколько жрет в простое / при работе? Как это влияет на остальные задачи, те нет ли такого что в момент работы все процессы уходят в своп и потом ты чувствуешь лаг в их восстановлении?
Astartsky
- 70б жрет 100% процессора и гпу и разряжает батарейку только в путь. Заниматься чем-то еще параллельно можно, но неудобно, видео лагает, звук тоже. Модельки поменьше (8б, 14б) никаких проблем не вызывают, можно спокойной их использовать в фоне и не выгружать из памяти, если ее хватает (у меня 64).
artalar
- Какой интерфейс юзаешь?
Astartsky
- ollama. Раньше использовал oougabouga, но он неудобный и часто у меня падал. Вижу, что сейчас стандартом для запуска становится ollama, как раньше уже был консенсус об апи, повторяющем openai.
Post #1327
3.69K
- 👍 20
- ❤ 6
- 🥱 4