Обновлено: 11:59, 27.08.26
|
Новости

История и развитие нейросети DeepSeek

История и развитие нейросети DeepSeek

Пока лидеры рынка искуственного интеллекта OpenAI, Google и Anthropic мерялись миллиардными бюджетами и раздували дефицит оперативной памяти, в начале 2025 года из тени скромно вышла китайская модель DeepSeek. Результат, однако, скромным не был — она обошла американских гигантов по ряду ключевых параметров, потратив на обучение модели в десятки раз меньше денег. Как стартап из Ханчжоу смог за два с половиной года превратиться в главного технологического конкурента Запада, какие технологические хитрости этому поспособствовали, и при чём здесь трейдеры — расскажем в этом материале.


Когда появился DeepSeek и чья это компания

Hangzhou DeepSeek Artificial Intelligence Fundamental Technology Research Co., Ltd. — это китайская компания, занимающаяся разработкой больших языковых моделей и технологий искусственного интеллекта. Её основали, как дочерний проект хедж-фонда High-Flyer, ранее применявшего ИИ в финансовой сфере. Разработки по алгоритмической торговле оказались очень успешными, поэтому High-Flyer не нуждались в средствах венчурных инвесторов, и смогли заняться исследованием новой перспективной технологии "на свои". Это позволило "Дипсику" развиваться тихо, в своём темпе и без внешнего давления, и когда нейросеть была готова предстать перед публикой, для многих она стала неожиданностью.

Основатель Лян Вэньфэн и хедж-фонд High-Flyer

DeepSeek основал Лян Вэньфэн, родившийся в 1985 году в Чжаньцзяне, провинция Гуандун. Молодой выпускник Чжэцзянского университета, получивший специальности по компьютерным наукам и электронной информатике, сперва занялся изучением машинного зрения, но потом увлёкся изощрёнными идеями математика Джима Саймонса, основателя алгоритмического трейдинга.

Несколько лет Лян оттачивал свои алгоритмы, а когда они стали приносить прибыль, в 2015 году вместе со своими однокурсниками Сюй Цзинем и Чжэн Давэем он основал хедж-фонд High-Flyer Quantitative Investment Management — он же 幻方量化, который иногда дословно переводят, как Magic Square Quantification.

Лян Вэньфэн, основатель DeepSeek
Лян Вэньфэн, основатель DeepSeek и сооснователь хедж-фонда High-Flyer. Идея торговать на бирже с помощью математических алгоритмов, прогнозирующих тренды зародилась у друзей ещё во время учёбы, в период финансового кризиса 2008 года

Это был так называемый "количественный" инвестиционный фонд (quantitative hedge fund) — в противовес "качественному" такие фонды используют для принятия решений большой массив данных и статистические закономерности, а не оценку качеств компании экспертами-трейдерами. Аналитики-"кванты" используют высшую математику, а сам основатель алгоритмического трейдинга Джим Саймонс активно "хантил" специалистов по теоретической физике и теории струн.

High-Flyer стал птицей высокого полёта — он стремительно рос и в итоге стал первым китайским количественным хедж-фондом, объём активов под управлением которого превысил 100 миллиардов юаней. На самом пике, в 2021 году, компания уже "ворочала" триллионом юаней, превратившись в главного "квант-гиганта" Китая. Прибыль фонда стала основным источником финансирования для ИИ-амбиций Ляна. В мае 2023 года он объявил о разработке общего искусственного интеллекта и запустил DeepSeek, став генеральным директором этого подразделения.

Философия компании: демократизация AGI и open-source

В отличие от закрытых экосистем OpenAI и Google, DeepSeek с самого начала выбрала стратегию публикации весов своих моделей и исходного кода. Основатель компании неоднократно подчёркивал, что DeepSeek будет придерживаться полностью открытой стратегии, включая самые передовые модели. По его мнению, закрытые модели не продемонстрировали неоспоримых преимуществ, тогда как открытый подход способствует развитию всей технологической экосистемы.

Однако, не стоит принимать подобный стратегический ход за благотворительность. Открывая свои наработки, DeepSeek привлекает к разработке специалистов со всего мира, которые помогают улучшать модели, создают вокруг них экосистему приложений и находят уязвимости. Открытый код также способствует выживанию Дип Сика в долгосрочной перспективе — децентрализованная альтернатива американским монополистам получает естественную поддержку со стороны людей, стремящихся  к технологической независимости.


Как появился DeepSeek: от количественных финансов к ИИ-гиганту

Переход от управления хедж-фондом к созданию главной китайской ИИ-лаборатории был обусловлен не только амбициями и биографией основателя. На то, что математические и финансовые успехи фонда High-Flyer кристаллизовались в алмаз, повлияло давление внешних обстоятельств.

Предыстория: как алгоритмическая торговля привела к собственному ИИ

В 2019 году, когда использование математических моделей доказало свою финансовую эффективность и High-Flyer заработала свои первые 10 млрд. юаней (≈$1,48 млрд), Лян Вэньфэн начал скупать графические процессоры NVIDIA тысячами для масштабирования своей компании. А когда NVIDIA выпустила чип А100, обучающий нейросети в 20 раз лучше предыдущих разработок, Лян был одним из первых, кто получил доступ к этой технологии.

В 2021–2022 годах фонд столкнулся с серьёзным вызовом: из-за экспортных санкций США доступ к передовым чипам NVIDIA для китайских компаний был существенно ограничен. Гигантский кластер из 10 тыс. карт A100 стал последним для High-Flyer, а к тому времени вся деятельность компании уже напрямую зависела от вычислительных мощностей. Поиск решения этой проблемы и стал катализатором для технологической трансформации компании.

Видеокарта Nvidia A100

Вместо того, чтобы сдаться под давлением санкций, High-Flyer направила свои немалые деньги на создание собственных вычислительных кластеров и разработку эффективных алгоритмов, требующих меньше ресурсов. Компания сформировала исследовательское подразделение под названием Fire-Flyer ("Светлячок"), которое занималось глубоким обучением нейронок.

Необходимость максимальной оптимизации кода в условиях ограниченных вычислительных ресурсов заложила фундамент, который впоследствии позволил DeepSeek обучать модели с беспрецедентной эффективностью. Удивляет ли теперь, что DeepSeek оказался так силён в математике?

Дата создания DeepSeek AI и первые шаги

"Ханчжоуская компания по исследованию фундаментальных технологий искусственного интеллекта DeepSeek" (так звучит полное название компании в переводе) была официально зарегестрирована 17 июля 2023 года. Компания сразу стала свободной от каких-либо финансовых обязательств. В её стартовый бюджет вошли сотни миллионов долларов из собственных средств High-Flyer, а дополнительные вливания она получает из общего портфеля фонда (1,5% в год) и от его прибыли с превышения целевых показателей (25%).

Лян Вэньфэн собрал команду из лучших китайских исследователей ИИ, некоторые из которых ранее работали в ведущих мировых лабораториях, но большинство (9 из 10) — не покидали Китая. Встав на путь борьбы с давлением из-за рубежа, Лян сознательно отказался от найма иностранных специалистов и решил выращивать домашних гениев, отдавая предпочтение выпускникам Пекинского университета и Университета Цинхуа.

Молодым исследователям он сразу предлагал зарплату вдвое выше, чем на китайском рынке. Годовая зарплата "топов" в $1,3 млн. долларов при этом была тоже более, чем конкурентной по миру. Разработка велась без какого-либо пиара, в тишине и секретности. Некоторые ИИ-инженеры, которые получали предложение о работе от "некоего Дип Сика", просто игнорировали оффер, не найдя ничего о компании. И это тоже укладывалось в философию Ляна — ему были нужны люди, проявившие не только способности, но и энтузиазм.

Оставаясь непререкаемым лидером, Лян Вэньфэн создал в компании непринуждённую обстановку без иерархии и бюрократии, способствующую научному творчеству. Любой человек с идеей может обратиться хоть к самому Ляну, получить необходимые ресурсы и команду.

Таким образом, имея практически неограниченный бюджет собственных денег и инкубатор для горящих молодых учёных, Вэньфэн смог сразу замахнуться на высокое — исследование общего искуственного интеллекта (AGI).


Этапы развития: хронология релизов моделей DeepSeek

DeepSeek развивался осторожно и не спешил бросаться в атаку на ChatGPT. Прежде чем выйти на широкий рынок с универсальной моделью, которая стала бы прямым конкурентом для лидера рынка, компания разработала несколько узкоспециализированных моделей, которые привлекли внимание разработчиков. Завоевав их интерес и лояльность успешным продуктом с открытым кодом, компания Вэньфэна получила ценную и безвозмездную поддержку энтузиастов, смогла наработать экспертизу, избавиться от наиболее существенных ошибок и подготовиться к выходу на универсальный рынок.

2023–2024: DeepSeek Coder и DeepSeek Math

Первой публичной моделью DeepSeek стал DeepSeek-Coder, выпущенный в ноябре 2023 года. Это была модель с плотной архитектурой (dense model) объёмом от 1,3 до 33 млрд. параметров, специализирующаяся на генерации и понимании кода на множестве языков программирования. Эта открытая модель превзошла многие проприетарные аналоги в задачах генерации кода и быстро завоевала популярность среди разработчиков.

Вслед за ней, в феврале–апреле 2024 года, компания выпустила DeepSeek-Math — нейросеть-математика. Она продемонстрировала впечатляющие результаты на олимпиадных задачах и способность DeepSeek конкурировать с лучшими мировыми разработками в узких областях.

2024: DeepSeek-V2 и V3 – революция архитектуры и снижение стоимости

Май 2024 года стал поворотным моментом: DeepSeek выпустила DeepSeek-V2 — первую универсальную большую языковую модель компании. Её главной инновацией стала архитектура DeepSeekMoE (Mixture of Experts) — вариант "коктейля экспертов", в котором при каждом запросе активируется только часть параметров нейросети. Общий объём параметров модели составлял 236 миллиардов, но MoE задействовал лишь небольшую их часть при каждом вычислении. Это позволило радикально снизить вычислительные затраты как на обучение, так и на обработку запросов без потерь в качестве.

В декабре 2024 года последовал DeepSeek-V3 — ещё более мощная модель с 671 миллиардом параметров, также построенная на DeepSeekMoE. Модель уже понимала многие языки за пределами английского и китайского, и была нацелена на задачи программирования и математики. Для её обучения потребовалось 2,8 миллиона часов вычислений на чипах NVIDIA H800, созданных специально для обхода санкций 2022 года. Стоимость этого обучения V3 составила всего $5,6 млн. — сумма, которая в мире ИИ считается мизерной по сравнению с сотнями миллионов, которые тратили конкуренты.

2025–2026: DeepSeek-R1 и прорыв в reasoning-моделях

20 января 2025 года DeepSeek выпустила DeepSeek-R1 — модель с продвинутыми способностями к цепочке рассуждений (reasoning), ставшую прямым и более доступным ответом на OpenAI o1. R1 специализировалась на многошаговых логических рассуждениях, решении сложных математических задач и доказательствах, и проходила бенчмарки не хуже o1 за 1/30 от её стоимости.

Стоимость обучения R1 оказалась буквально невероятной: согласно опубликованным данным, на дообучение модели ушло всего $249-294 тыс. При этом R1 использовала кластер всего из 2048 графических карт. В мировом ИИ-сообществе были шокированы таким успехом за такие скромные деньги, и это отразилось на бирже. Уже через неделю акции NVIDIA и ASML упали на 8-17%, а общие котировки биржи Nasdaq и S&P 500 снизились на 2,6%.

Успех DeepSeek вызвал панику среди инвесторов и утрату доверия к американским компаниям, как непререкаемым лидерам ИИ-рынка
Успех DeepSeek вызвал панику среди инвесторов и утрату доверия к американским компаниям, как непререкаемым лидерам ИИ-рынка

В первые же дни DeepSeek стал приложением №1 в AppStore США и Китая, "отхватил" 4% доли рынка и стал самой обсуждаемой нейросетью во всём мире, а американские гиганты зашевелились на своём монопольном ложе в поисках инноваций.


Секрет успеха: технологические инновации DeepSeek

Технологический успех DeepSeek — результат продуманной работы с "железом", софтом и математическими алгоритмами обучения. Чтобы обойти американские санкции и при этом обучать модели мирового уровня, компании пришлось пересмотреть буквально все звенья цепочки: от выбора чипов до методов оптимизации, и добывать передовые технологии не совсем "рыночными" путями.

Архитектура MoE и MLA

Основу успеха DeepSeek составляют две ключевые технологии: Multi-Head Latent Attention (MLA) и Mixture of Experts (MoE).

MLA — это инновация, впервые представленная в DeepSeek-V2. В стандартных архитектурах трансформеров ключи и их значения (Key-Value cache) занимают огромные объёмы видеопамяти, ограничивая размер пакета и скорость инференса (запроса). MLA решает эту проблему, сжимая эту информацию с потерями, но сохраняя критически важные детали. Объём кэша сокращается на 93,3% — это позволило DeepSeek-V2 поддерживать очень длинные контекстные окна на одной видеокарте и увеличило пропускную способность инференса в 5,76 раз.

DeepSeekMoE стал второй технической новинкой по оптимизации вычислений. Вместо того, чтобы активировать все 671 млрд. параметров модели при каждом запросе, MoE динамически направляет запрос только к тем "экспертам" (подсетям), которые наиболее релевантны для конкретной задачи. Это позволяет достичь производительности, сопоставимой с "плотными" моделями, при значительно меньших вычислительных затратах.

Оптимизация затрат: как обучить модель за $6 млн вместо $100 млн

Оценочная стоимость обучения GPT-4 составляла $100 млн. и более. DeepSeek-V3 обошлась в 5,6 миллиона, а DeepSeek-R1 — ещё в 249–294 тысячи на дообучение. Это стало возможным благодаря инновационным архитектурам нейросетей, упомянутым выше, которые радикально снизили требования к вычислительным ресурсам.

Кроме того, снижению стоимости обучения поспособствовали кластеры на базе чипов Huawei Ascend с оптимизированным фреймворком для обучения больших моделей ИИ DeepSpeed от Microsoft. Из-за того, что доступ к чипам NVIDIA сильно затруднился, DeepSeek с партнёрами решили воспользоваться "домашними" процессорами, оптимизировав под них алгоритмы обучения нейросетей.

Учить нейронки на процессорах Ascend было непросто. Первая попытка была предпринята ещё с DeepSeek-V2, но из-за проблем со стабильностью пришлось вернуться к решениям на базе NVIDIA. Только в апреле 2026 года DeepSeek-V4 гордо указал китайские чипы в списке поддерживаемого оборудования наравне с топовыми американскими видеокартами.

Наконец, согласно неподтверждённым обвинениям американского Конгресса, в руки DeepSeek попали чипы NVIDIA Blackwell, которые находятся под строжайшим экспортным контролем. Как они попали в Китай, и помогала ли в этом сама NVIDIA (как они это сделали с чипами H800, что позволило DeepSeek ещё год покупать их продукцию, пока санкционные списки не сформулировали более точно) — доподлинно неизвестно.


Планы и перспективы DeepSeek до 2030 года

Лян Вэньфэн сформулировал очень чёткую стратегию по развитию DeepSeek, задекларировав стремление к AGI (универсальному искуственному интеллекту) в качестве основной цели. Широкой публике она стала известна из стенограммы со встречи с инвесторами в мае 2026 года, которую Вэньфэн провёл в рамках возможного выхода своей компании на IPO. Рыночная оценка стоимости DeepSeek перевалила за $70 млрд, и Лян рассматривает возможность свободной продажи акций компании на бирже STAR Market в 2027 году.

Стратегия представляет из себя дорожную карту в шесть шагов:

  • Надёжная языковая модель как фундамент, без которого невозможны дальнейшие надстройки;
  • Цепочка рассуждений — способность модели последовательно рассуждать, демонстрируя ход своих мыслей. Этот этап компания прошла с выпуском DeepSeek-R1;
  • ИИ-агенты — рубеж, на преодолении которого компания сфокусирована сейчас. Модель должна научиться превращать рассуждения в действия, взаимодействовать с внешними инструментами, принимать самостоятельные решения, ведущие к выполнению задачи, не сбиваться на протяжении долгого времени и без надзора человека. Приоритет DeepSeek — универсальные агенты и агенты-программисты;
  • Непрерывное обучение — ключевой барьер, который, по мнению Ляна, отделяет современные модели от настоящего AGI. Сейчас модели застывают после обучения — они не накапливают опыт в процессе работы, как это делает человек. Лян говорит: "Искусственный интеллект пока не может заменить вашего сотрудника. Но если ИИ получит способность к непрерывному обучению, он сможет, как и ваш работник, прийти в компанию, пару месяцев поучиться — и тогда заменит кого угодно." Следующее поколение моделей должно обладать способностью обучаться непрерывно, чтобы стать настоящим прорывом;
  • Самостоятельная итерация (сингулярность) — момент, когда ИИ получит способность сам разрабатывать свои собственные следующие версии. Получив способность непрерывно накапливать знания, ИИ сможет выпускать апдейты для самого себя быстрее и лучше, чем это делает человек;
  • Воплощённый интеллект — финальная точка маршрута. Основатель DeepSeek считает, что в конечном итоге ИИ обретёт физическое тело и сможет взаимодействовать с реальным миром.

Лян подчёркивает: нельзя перепрыгивать через ступени. Каждый этап необходим для того, чтобы заложить базу под следующий. И пока инженеры и учёные DeepSeek оттачивают автономность агентов, управленцы заранее подготавливают материальную базу под вершину всей пирамиды. Они уже инвестировали 140 миллионов юаней в стратегическое размещение акций Unitree — китайской компании, разрабатывающей роботов-гуманоидов.


Итоги

История DeepSeek доказывает, что инновации в архитектуре и эффективности важнее простого наращивания вычислительных мощностей, санкции не являются непреодолимым барьером, а ограничения могут стимулировать прорывные решения. Компания навсегда изменила правила игры, сделав передовой ИИ доступным и продемонстрировав, что открытые модели могут побеждать закрытые экосистемы. Вопрос о том, может ли DeepSeek выдержать конкуренцию с OpenAI, уже не стоит — интереснее, как скоро компания сможет добиться поставленной цели. А какую модель вы считаете лучшей для своих задач в 2026 году?


Часто задаваемые вопросы (FAQ)

Когда придумали DeepSeek?
Чья компания DeepSeek и кто её владелец?
Каково происхождение искусственного интеллекта DeepSeek?
Чем DeepSeek отличается от ChatGPT?
Безопасно ли использовать DeepSeek для корпоративных данных?
Как получить доступ к API или веб-версии DeepSeek в 2026 году?

Читать по теме

Проверено редактором:
Даниил Антонов
Редактор
Реклама 18+
Комментарии
Реклама 18+