Напишите нам прямо сейчас, наши специалисты расскажут об услугах и ответят на все Ваши вопросы.
Напишите нам прямо сейчас, наши специалисты расскажут об услугах и ответят на все Ваши вопросы.
Наш специалист свяжется с Вами, обсудит оптимальную стратегию сотрудничества, поможет сформировать бизнес требования и рассчитает стоимость услуг.
Наш специалист свяжется с Вами, обсудит оптимальную стратегию сотрудничества, поможет сформировать бизнес требования и рассчитает стоимость услуг.
Заполните онлайн-заявку и получите выгодное спецпредложение прямо сейчас.
За вами будет закреплен персональный менеджер, который расскажет о платформе, ответит на все ваши вопросы и сформирует для вас коммерческое предложение.
Наш специалист свяжется с Вами и
обсудит время собеседования.
В крупных организациях системы хранения данных занимают значительную долю стоимости ИТ-инфраструктуры (по оценкам специалистов – до 25%). Эта цифра может существенно вырасти. Причины – рост объема данных и увеличение потребности в емкостях систем хранения данных (СХД), в том числе из-за законов, которые обязывают эти данные хранить. В то же время компании активно стараются экономить ИТ-бюджеты, что вынуждает их находиться в постоянном поиске наиболее выгодных технологических решений, которые бы позволили сократить эти расходы не в ущерб качеству сервиса. Это же относится к хранению и обработке данных.
Требования заказчиков к снижению стоимости владения ИТ-инфраструктурой заставляют поставщиков инвестировать в разработки и предлагать новые технологии. Одна из них — программно-определяемые системы хранения данных (Software-Defined Storage, SDS). Компании начинают задумываться о внедрении SDS, когда процедуры работы с данными становятся неэффективными и их поиск отнимает много времени.
Концепция SDS позволяет получить такие преимущества, как:
— абстрагирование от нижнего уровня (аппаратной платформы),
— масштабируемость,
— упрощенная инфраструктура хранения,
— низкая стоимость решений.
Благодаря технологиям SDS можно значительно снизить стоимость СХД и их администрирования. По прогнозам Gartner, к 2020 году 70–80% неструктурированных данных будут храниться на недорогих системах, управляемых с помощью SDS, а уже к 2019 году 70% существующих массивов хранения станут доступны в полностью программной версии.
Когда и зачем нужна SDS
ПО управления СХД должно обеспечивать гибкую организацию хранения данных, а также:
— дедупликацию,
— репликацию данных,
— динамическое выделение емкости,
— снимки данных,
— соблюдение политик хранения.
SDS определяют в Storage Networking Industry Association (SNIA, Ассоциация производителей и потребителей систем хранения) как виртуализированную среду хранения данных с интерфейсом управления сервисами, которая должна включать в себя:
— автоматизацию — упрощенное управление, снижающее издержки на обслуживание инфраструктуры хранения данных;
— стандартные интерфейсы — API для управления, выделения и освобождения ресурсов, обслуживания сервисов и устройств хранения;
— виртуализацию путей доступа к данным — блочный, объектный и файловый доступ в соответствии с интерфейсами приложений;
— масштабируемость — изменение инфраструктуры хранения без снижения требуемого уровня доступности или производительности;
— прозрачность — мониторинг потребляемых ресурсов хранения, управление ими и контроль их стоимости.
Отмечу, что для SDS нужен стандартизированный интерфейс управления – такой, как SNIA Storage Management Initiative Specification (SMI-S). Он является составной частью концепции программно-определяемых дата-центров (SDDC). Эта программная логика облачной инфраструктуры хранения и облачных аппаратных платформ может быть элементом и традиционных ЦОД. Сервисы хранения и обработки данных могут выполняться на серверах, специализированных устройствах хранения (storage appliance) или на обеих этих платформах, устраняя традиционные границы.
Сравниваем SDS-решения
Software-Defined Storage предлагают многие вендоры:
— Dell EMC (решения Dell Nexenta, EMC ScaleIO),
— HPE (решение StoreVirtual VSA),
— IBM (решение Spectrum Storage),
— NetApp (решение ONTAP Select),
— VMware (решение vSAN),
— Red Hat (решение Red Hat Storage),
— StoneFly (решения SCVM, SDUS),
— DataCore (решение SANsymphony),
— SwiftStack,
— Pivot3 и др.
Уточню, что решение RedHat Storage представлено двумя продуктами: RedHat Ceph Storage и RedHat Gluster Storage (RH Storage Server). Здесь они подразумеваются оба, но в приведенном ниже сравнении они не участвовали, так как значительно отличаются от других упомянутых решений.
Ceph — не совсем коробочный продукт. Его использование без штата разработчиков достаточно затруднительно, что сделало его неинтересным для нашей компании. Поэтому этого решения нет в сравнительной таблице.
Условно все SDS-решения можно разделить на три категории:
— классические (CEPH, Red Hat Storage Server, EMC ScaleIO),
— на основе традиционных систем хранения (NetApp ONTAP Select, HPE StoreVirtual VSA),
— в составе вычислительных комплексов (VMware vSAN).
Некоторые производители предлагают как комплексные решения, так и программную часть (Huawei, Dell EMC). Это позволяет гибко подходить к подбору продуктов и использовать унаследованное «вычислительное» оборудование для решения менее ресурсоемких задач хранения данных. Еще одной заслугой SDS стала возможность применения в некоторых классических СХД виртуализации дисковых массивов.
Решения архитектурно строятся по двум принципам:
— слабо связанные,
— распределенные (без общих элементов).
В первом случае отказоустойчивость обеспечивается за счет распределенных копий данных, но из-за избыточности коммуникаций между узлами (нодами) снижается скорость записи. Критичным местом является сеть передачи данных, поэтому такие решения обычно реализованы на основе InfiniBand. По такому принципу построены решения VMware vSAN, HPE StoreVirtual VSA, Dell EMC ScaleIO.
В системах без общих элементов данные записываются на один узел, а потом с заданной периодичностью копируются на другие для обеспечения отказоустойчивости. При этом записи не являются транзакционными. Такой подход наиболее дешев. Чаще всего в качестве интерконнекта в нем используется Ethernet. Данная архитектура удобна с точки зрения масштабируемости. Яркий ее представитель — CEPH.
Сейчас многие компании занимаются разработкой как программной SDS (например, Atlantis Computing, Maxta, StarWind, DataCore Software, Sanbolic, Nexenta, CloudByte), так и выпуском комплексных решений (Dell EMC, IBM) или специализированных устройств (Tintri, Nimble, Solidfire).
Из наиболее известных на рынке мы выбрали для сравнения семь решений, которые интереснее всего для задач «Онланты». Это:
— VMware vSAN,
— HPE StoreVirtual VSA,
— NetApp ONTAP Select,
— EMC ScaleIO,
— Huawei Fusion Storage,
— StarWind Virtual SAN,
— Datacore SANsymphony.
В этой таблице мы сравнили их основные характеристики.
Инструмент будущего
Технология SDS начала развиваться еще в начале 2000-х, но пока не смогла заменить классические СХД по целому ряду причин — сейчас мы их обсуждать не будем. Но производители активно занимаются развитием своих продуктов и интерес к технологиям SDS растет. По нашим оценкам, в ближайшее время они станут тем инструментом, который позволит сокращать стоимость ИТ-инфраструктуры при росте потребности в увеличении емкости СХД.
В заключение отмечу, что в настоящем материале я не пытался предложить варианты выбора подходящего для вас решения. Такое решение нужно выбирать, исходя из нагрузки, SLA и т.д. В предлагаемой таблице сравниваются лишь возможности решений, и не сравниваются производительность, скорость репликации, время переключения нод и др. Т.е. это именно сравнительный анализ возможностей, а не продуктивное тестирование.
После тщательного знакомства с продуктами SDS мы пришли к выводу, что в текущей своей реализации под наши задачи они подходят не очень хорошо. Для себя мы все же выбрали классическое решение, внедрением которого мы в данный момент занимаемся, и о чём, возможно, в ближайшее время вам расскажем.
Но надеюсь, что представленные результаты сравнения помогут вам сориентироваться, сэкономят время и облегчат задачу выбора, какое решение подходит в вашем случае.
— GPT-J: разработана EleutherAI. Считается более мощной и эффективной по сравнению со своим предшественником GPT-Neo. У нее шесть миллиардов параметров, и она очень производительна при обработке естественного языка. Модель обучали на большем объеме данных, поэтому она умеет генерировать качественный текст.
— BERT: модель от Google, которая стала основой для многих последующих моделей. Широко используется для классификации и анализа текста. Еще есть улучшенная версия RoBERTa от Facebook AI*, которая демонстрирует лучшие результаты на многих задачах.
— LLaMA: разработка от Meta*, предназначенная для обработки естественного языка. Включает несколько моделей с различным количеством параметров (от 7 до 65 миллиардов). Это позволяет пользователям выбирать модель в зависимости от их потребностей и вычислительных ресурсов.
— T5: еще одна языковая модель от Google, представленная в 2020 году. Использует единый фреймворк для всех задач NLP, включая перевод, суммирование, классификацию и генерацию текста. Каждая задача формулируется как преобразование одного текста в другой, что упрощает процесс обучения.
— Mistral: современная языковая модель, разработанная Mistral AI. Качественно обрабатывает текстовые данные и доступна в различных конфигурациях, включая модели с большим числом параметров. Обучена на разных источниках информации, поэтому генерирует разнообразные и качественные ответы.
— Yandex YaLM: языковая модель от Яндекса. Была представлена в 2023 году для обработки естественного языка. Модель обучена на русскоязычных и англоязычных источниках, что улучшает качество генерации текста. Доступна для пользователей в нескольких версиях, различающихся по количеству параметров.
— Сбор данных: в качестве источников могут выступать книги, сайты в интернете, статьи. Важно, чтобы модель училась на разных примерах и большом количестве данных.
— Обработка: информацию делят на более мелкие части, чтобы модель могла понять структуру языка.
— Обучение: для этого используют специальный алгоритм. Например, модель пытается предсказать следующее слово в предложении, основываясь на предыдущих словах. При ошибке алгоритм корректирует ее, чтобы в следующий раз она могла предсказать лучше. Этот процесс повторяется миллионы раз, поэтому требует больших вычислительных мощностей и занимает много времени.
— Тестирование и доработка: инженеры оценивают, насколько хорошо модель справляется с различными задачами. Важно, чтобы финальное тестирование проходило на новых данных, которые LLM еще не видела. При необходимости модель дорабатывают и улучшают.
После этого LLM загружают в приложение, где она может начать работу. При этом разные модели будут давать разные ответы на один и тот же вопрос, ведь они обучались на разных данных.
Обучение LLM — это ресурсоемкий процесс, который требует значительных временных и вычислительных затрат, но все зависит от размера модели и количества данных, на которых она обучается. Для небольшой модели, типа BERT, нужно несколько недель на нескольких GPU. Обучение большой модели, как GPT-4, займет месяцы на суперкомпьютерах. Нужны тысячи GPU или TPU, работающих параллельно, куча терабайтов текстовых данных для обучения, высокое электропотребление и специалисты. Поэтому это дорогостоящий процесс, который не все могут себе позволить.
Это тип искусственного интеллекта, который специально разработан для работы с текстами. Он может их понимать и анализировать, писать самостоятельно, давать ответы на вопросы.
Самый известный разработчик LLM сегодня — американская компания OpenAI. Однако есть и другие: например, свою LLM развивает Meta* (модели OPT, OPT-IML и LLaMA), а также Google (PaLM, Gemini и BERT).
Бизнесу доступны сервисы:
— SymFormer — оптимальное решение для генерации музыки;
— Kandinsky 3.0 — сервис создания картинок и видео;
— SaluteSpeech — синтез и распознавание речи;
— DST AI — AI-ассистент для панели управления в CMS системе;
— GigaCode — AI-ассистент разработчика.
Мультимодальность языковых моделей позволяет решать различные задачи. GigaChat можно попросить сгенерировать презентацию и нарисовать картинки к ней.
Генерировать тексты и контент. Программы на базе больших языковых моделей анализируют стиль, смысл и содержание и создают контент, на который у человека ушло бы много времени и усилий.
Например, для digital-агентства генеративная модель GigaChat за три секунды может создать продающий контент любой сложности по указанным характеристикам. При этом описание товаров и услуг для сайта нейронная сеть сделает сразу с SEO-оптимизацией.
Делать проще взаимодействие с клиентами. На основе LLM создаются чат-боты, которые отвечают клиентам на вопросы о товаре или услуге, вычисляя намерения пользователя. Такие программы рассказывают о характеристиках и преимуществах продукта в режиме реального времени. С их помощью можно получить контакт потенциального покупателя и даже проводить продажи. Использование чат-ботов позволяет уменьшить затраты на обслуживание клиентов на 80%.
Выполнять функции виртуальных помощников. Виртуальные ассистенты на базе LLM обрабатывают запросы пользователя и помогают решать повседневные разнообразные задачи, например, организацию дел. Их главная сила — умение работать с расплывчатыми и нечёткими запросами.
Сокращать длинные тексты до резюме. Чат-боты на основе LLM вычленяют главное из текста и делают понятные выжимки. Людям, для которых это важно (научным работникам, менеджерам), не нужно перечитывать 100 страниц текста, чтобы понять суть. Им можно лишь поместить скрипт в чат-бота — и получить качественный материал в виде текста или таблицы.
Создавать интерактивные обучающие программы. Отдельного внимания заслуживает потенциал LLM в образовании: ИИ генерирует учебные материалы и системы, которые в реальном времени помогают студентам лучше усваивать предмет.
Помогать со здоровьем. В сфере здравоохранения продвинутые алгоритмы Large Language Models используются для создания виртуальных диагностов, которые помогают пациентам находить связные ответы на вопросы и следить за своим здоровьем. А докторам — проводить анализ данных из истории болезней людей и ставить предварительные диагнозы.
Переводить тексты с множества языков. При переводе программы LLM учитывают специфику текста, терминологию, стиль, интонацию, пунктуацию. Полученные тексты иногда превосходят те, над которыми работал профессиональный переводчик. А ещё — одна модель часто знает больше языков, чем один человек.
LLM могут автоматически исправлять ошибки и предлагать варианты улучшения текста. Это особенно полезно для авторов, редакторов и переводчиков, работающих с большими объёмами текстов.
Проводить расширенный интеллектуальный поиск. LLM эффективно обрабатывает информацию из интернета, используя смысловые запросы вместо просто ключевых слов.
Разновидности языковых моделей LLM
Известные языковые модели — GPT OpenAI (GPT-3.5 и GPT-4 в ChatGPT), PaLM и Gemini от Google (Bard), Copilot от Microsoft и другие.
Российский аналог — GigaChat. Он поддерживает более 100 языков, но фокусируется преимущественно на английском и русском. Точность ответа зависит от сложности задачи и качества пользовательских запросов (промптов).
GigaChat — генеративная нейросеть. Это значит, что она умеет создавать статьи и изображения. Генерация картинок и текста стала возможной благодаря ruGPT-3.5 с 29 млрд параметров, Kandinsky 3.0, ruCLIP и FRED-T5.
Уже сейчас нейросети умеют создавать видеоролики на несколько минут и писать музыку, а в будущем научатся обрабатывать жесты и даже распознавать геном человека.
В 2023 году GigaChat сдал ЕГЭ по обществознанию на 67 баллов, а в 2025 — сдал экзамен по специальности «Кардиология» в ВолгГМУ.
LLM: термины и понятия
Архитектура: это структура модели, которая определяет, как она обрабатывает и генерирует текст. Примеры архитектур — трансформеры (современный подход), RNN (устаревший метод).
Предобучение: начальная фаза, где модель обучается на больших наборах данных и решает общие задачи (например, предсказывает следующее слово), чтобы понять структуру языка.
Дообучение (fine-tuning): процесс дополнительного обучения модели на более узком наборе данных для выполнения конкретной задачи, например, классификации или составления списков.
Оценка эффективности: методы и метрики, используемые для оценки производительности работы модели. Например, перплексия измеряет, насколько хорошо модель предсказывает текст, а BLEU и ROUGE оценивают качество перевода или генерации текста.
Трансформеры: базовая архитектура LLM, которая с помощью механизма внимания эффективно обрабатывает длинные контексты, выделяя ключевую информацию.
Тренировка (обучение): процесс, в ходе которого модель обучается на большом объеме текстовых данных. Включает этапы предобучения и дообучения (fine-tuning).
DST Интернет-магазин обладает рядом преимуществ, которые делают его привлекательным для пользователей. Среди них:
Мощный функционал, который позволяет эффективно управлять магазином.
Дружественный интерфейс, который делает работу с магазином удобной и приятной.
Простота установки, что позволяет быстро запустить магазин.
Кроме того, DST интернет-магазин имеет следующие преимущества:
Адаптация под мобильные устройства, что позволяет пользователям удобно просматривать товары и совершать покупки с помощью смартфона или планшета.
Техническая поддержка со стороны разработчиков, что обеспечивает быструю помощь в случае возникновения проблем.
Удобная работа с товарами и категориями, что позволяет легко находить нужные товары и управлять ими.
Интеграции по API, что позволяет интегрировать магазин с другими сервисами и платформами.
Открытый системный код, что позволяет разработчикам создавать дополнительные функции и улучшения.
Встроенный конструктор шаблонов, что позволяет создавать уникальные дизайны для магазина.
Широкие возможности для маркетинга, что позволяет эффективно продвигать товары и привлекать новых клиентов.
Несколько агрегаторов приёма платежей, что обеспечивает удобство и безопасность при оплате товаров.
Подробные отчёты о продажах и статусе заказов, что позволяет отслеживать эффективность работы магазина.
Встроенные инструменты для SEO, что помогает улучшить позиции магазина в поисковых системах.
Кроме того, система интернет-магазина DST позволяет эффективно взаимодействовать с покупателями благодаря форме обратной связи, рассылкам, блогу и отзывам.