Есть такая LLM модель о который вы скорее всего не слышали, но она заслуживает вашего внимания - Apertus.
Интересна она по нескольким причинам:
Во первых это действительно новая с нуля обученная модель а не модфикация glm или дипсика которые дестиляции клоды и gpt.
Во вторых, в противостоянии США и Китая появился новый игрок - Европа (EPFL, ETH Zürich и Swiss National Supercomputing Centre, модели тренируют на суперкомпьютере Alps в Лугано).
В третьих - это самая открытая модель - в опенсорсе не только веса, но и информация о всех датасетах на которой ее тренеровали, рецепеты и детали процесса обучения. Лицензия тоже достаточно свободная (Apache 2.0)
С датасетами тут особо заморочились - используются только полностью открытые training data, стараются соблюдать opt-out владельцев контента и специально применяют методы для уменьшения memorization, т.е. модель запоминает факты, закономерности, стиль, но не конкретные фрагменты. А это значит что нарушить авторское право используя эту модель шансов намного меньше чем с другими моделями
А что умеет? Она нативно-мультимодальная, т.е. умеет в текст, картинки, звук в обе стороны. thinking mode, tool use тоже на борту.
P.S. Надо будет проверить, может это будет единственная модель в мире которая умеет переводить на шотландский?
Post #643
321