Краткое содержание:
- Корпоративными данными становится сложнее управлять, поскольку агенты ИИ создают больше запросов, требуют более свежего контекста и полагаются на точный поиск по различным типам данных.
- VeloDB, созданная на основе Apache Doris, объединяет аналитику SQL, полнотекстовый поиск и векторный поиск в одну аналитическую базу данных в реальном времени. Он призван стать уровнем данных и контекста для корпоративного ИИ.
- VeloDB является частью программы аккредитации IMDA, целью которой является поддержка роста перспективных сингапурских корпоративных технологических компаний. Узнайте больше о том, как это может вам помочь.
Увидеть проблему на собственном опыте часто является наиболее прямым путем к ее пониманию.
Десять лет назад Линьцзян Лянь создавал крупномасштабную инфраструктуру анализа данных для крупных интернет-компаний. Эти компании обслуживали миллионы пользователей, и для принятия решений им нужны были актуальные данные.
Этот спрос привел к созданию Apache Doris, аналитической базы данных с открытым исходным кодом, работающей в режиме реального времени.
Исходя из этого, Лиан и его соучредители решили создать VeloDB, стартап по работе с базами данных, целью которого было превратить Apache Doris в облачный продукт, который предприятия могли бы легко внедрить и использовать.
«Наша цель — сделать аналитику быстрой и простой для всех», — говорит Лиан, генеральный директор VeloDB.
В конце концов, данные в режиме реального времени необходимы, чтобы помочь командам ускорить обнаружение мошенничества, оптимизировать цепочки поставок, персонализировать обслуживание клиентов и управлять рисками, среди прочего. По данным IBM, в 63% случаев корпоративного использования данные должны обрабатываться в течение нескольких минут, чтобы они оставались полезными.
И по мере того, как отрасль переходит от пассивного искусственного интеллекта, такого как чат-боты, к автономным агентам, потребность в данных и аналитике в реальном времени становится все более острой. Сегодня предприятия должны оценить, может ли их инфраструктура данных действительно идти в ногу с той высокой скоростью, которая требуется агентам ИИ.
Фрагментированные данные замедляют работу ИИ
Многие предприятия сталкиваются с серьезным препятствием, ограничивающим их возможности использования ИИ: фрагментацией данных. Эта проблема возникает потому, что информация часто попадает в разрозненные системы организации.
«Каждый тип данных имеет свою собственную базу данных», — объясняет Лиан. «Например, хранилище структурированных записей, поисковая система для текста и журналов или векторная база данных для встраивания».
Хотя каждая система, возможно, имела смысл, когда она была впервые представлена, вместе они создают разрастание данных. Агентический ИИ усложняет поддержание этой ситуации.
«Один автономный агент может сгенерировать за час больше запросов, чем целая команда аналитиков за неделю», — отмечает Лиан.
Это оказывает давление на инфраструктуру данных предприятия по трем причинам:
- Параллелизм. Поскольку организации развертывают дополнительных агентов ИИ, системам приходится управлять растущим объемом межмашинных запросов.
- Точность поиска. Агентам, извлекающим информацию из различных баз данных, требуется согласованный и релевантный контекст, а не просто схожие данные.
- Свежесть. Для чувствительных ко времени приложений, таких как реагирование на инциденты или обнаружение мошенничества, данные должны отражать последние изменения, а не устаревать на несколько минут.
Фрагментация также меняет уравнение затрат. Рабочие нагрузки агентов могут быть непредсказуемыми и возникать всплески, но компаниям все равно может потребоваться поддерживать базу данных векторов, хранилище журналов и склад, готовые реагировать на вызовы. Со временем, как отмечает Лиан, затраты на обслуживание нескольких систем, даже когда некоторые из них простаивают, становится все труднее оправдать.
«Агент хорош настолько, насколько хорош контекст, который он извлекает», — говорит Лиан. «Этот контекст должен быть свежим, точным и способным поддерживать большие объемы запросов».
Один механизм для мультимодальных данных
Ответ VeloDB — объединить различные рабочие нагрузки в один движок. Он предлагает аналитическую и поисковую базу данных в режиме реального времени, которая позволяет организациям анализировать бизнес-данные, искать журналы и текст, а также получать контекст, соответствующий ИИ, с одной унифицированной платформы. Однако одной консолидации недостаточно. По словам Лиана, многие базы данных «все в одном» испытывают проблемы, когда разные рабочие нагрузки конкурируют за одни и те же ресурсы.
«Большинство баз данных «все в одном» разрушаются при смешанных рабочих нагрузках», — говорит Лиан. Это связано с тем, что ресурсоемкий анализ замедляет обновления в реальном времени, а загрузка больших объемов данных приводит к отставанию результатов поиска.
Чтобы решить эту проблему, VeloDB был создан с изоляцией рабочей нагрузки. Например, команда службы поддержки клиентов может выводить данные в реальном времени на панель мониторинга в режиме реального времени, в то время как другая команда использует тот же набор данных для анализа структуры расходов клиентов в фоновом режиме. Это позволяет различным рабочим нагрузкам работать на общем основании данных, не замедляя работу друг друга.
Это может упростить получение контекста агентами ИИ. Вместо того, чтобы обращаться к складу, поисковой системе и векторной базе данных, агент может выполнить один запрос и получить свежую, консолидированную и ранжированную информацию из одного места. Одним из примеров того, как это выглядит на практике, является ByteDance. Перейдя на Apache Doris 4.0, версию базы данных с открытым исходным кодом, использованную в этом развертывании, ByteDance смогла объединить векторный поиск, текстовый поиск и агрегацию SQL в едином механизме, чтобы повысить точность поиска при очень небольших затратах на оборудование.
По данным VeloDB, задержка при развертывании составила 400 миллисекунд – в 7 раз быстрее, чем чистый векторный поиск – и имела точность 89%. Что еще более важно, он показал, как поиск ИИ может стать более надежным, когда семантический поиск, сопоставление ключевых слов и структурированные данные обрабатываются вместе, а не объединяются в отдельные системы.
«Агентам нужна корректность так же, как и скорость», — говорит Лиан. «Когда результаты поиска и аналитика поступают из одной строки в один и тот же момент времени, согласовывать нечего».
Какое место VeloDB занимает в истории искусственного интеллекта
По мере развития внедрения ИИ VeloDB хочет играть более важную роль в инфраструктуре внедрения ИИ на предприятии. Работа компании нашла применение в таких отраслях, как банковское дело, игры, SaaS и другие.
Лиан описывает амбиции компании как создание «уровня данных и контекста» для агентов ИИ. Это означает помощь предприятиям в хранении и анализе различных видов данных — от структурированных таблиц и нотации объектов JavaScript (JSON) до текста, журналов и векторов — при поддержке гибридного поиска и аналитики в реальном времени. «Мы называем это контекстной инженерией — созданием конвейеров данных в реальном времени, которые доставляют контекст в системы искусственного интеллекта», — говорит Лиан.
Решение VeloDB предназначено для обслуживания различных заинтересованных сторон внутри организации. Для инженеров платформа упрощает консолидацию и управление данными. Инженеры по обработке данных могут использовать платформу в качестве унифицированного решения для приложений реального времени, хранения данных, генерации с расширенным поиском и контекстной инженерии. Между тем, бизнес-команды могут извлечь выгоду из долгосрочного потенциала более оперативного и разумного принятия решений и анализа.
В рамках аккредитации IMDA, которая поддерживает перспективные сингапурские технологические компании в построении доверия и развития бизнеса, VeloDB позиционирует себя на рынке, где внедрение ИИ все больше зависит от качества базы данных компании.
«Модели будут постоянно меняться, а потребность в свежем и точном контексте останется неизменной», — говорит Лиан. «Мы хотим, чтобы VeloDB был там, где живет этот контекст».
Программа аккредитации IMDA, запущенная в 2014 году, направлена на ускорение роста перспективных сингапурских технологических компаний. Это помогает им завоевать репутацию, наращивать обороты бизнеса, конкурировать на мировом рынке и получать больше возможностей для демонстрации своих решений для стимулирования внедрения технологий. Узнайте здесь, как аккредитация IMDA может расширить возможности вашей организации.
VeloDB — это коммерческая база данных для анализа и поиска в реальном времени, созданная на базе Apache Doris, ведущей аналитической базы данных с открытым исходным кодом, работающей в реальном времени. Платформа призвана демократизировать понимание для всех пользователей данных, чтобы они имели доступ к самой актуальной информации для принятия решений в режиме реального времени. Узнайте больше о VeloDB здесь.