사용 사례/의료

레이크하우스로 데이터를 민주화하여 Amgen의 신약 개발 및 공급 속도를 높이는 방법

스누피18 2023. 11. 22. 09:45

원문: 링크

 

이 글은 Amgen의 Product Owner인 Jaison Dominic과 Distinguisehd Software Engineer인 Kerby Johnson이 작성한 게스트 기고문입니다.

세계 최대의 독립 생명공학 기업인 Amgen은 오랫동안 혁신의 대명사였습니다. 40년 동안 새로운 신약 제조 공정을 개척하고 생명을 구하는 의약품을 개발하여 전 세계 수백만 명의 삶에 긍정적인 영향을 미쳤습니다. 환자에게 최고의 서비스를 제공한다는 사명을 계속 수행하기 위해 Amgen은 최근 또 다른 혁신의 여정, 즉 완전한 디지털 전환 프로젝트에 착수했습니다.

R&D 생산성 향상부터 공급망 최적화 및 상용화에 이르기까지 비즈니스 전반에 걸쳐 더 나은 결과를 얻기 위해 데이터를 활용하는 방법을 재구상해야 했고, 이 과정에서 데이터 팀이 해결하고자 하는 문제의 유형이 지난 몇 년 동안 크게 달라졌다는 사실을 깨달았습니다. 스킬셋, 부서, 또는 기능에 따라 각기 다른 문제를 직면했던 과거와는 달리, 이제 가장 중대한 문제는 본질적으로 여러 부서에 걸쳐 있었으며, 새로운 방식으로 문제를 해결하기 위해 서로 다른 고유한 전문 지식을 가진 사람들을 한데 모아야 했습니다. 현대화를 추구하는 과정에서 우리는 디지털 혁신 여정의 기반으로 데이터브릭스 레이크하우스 플랫폼을 선택했습니다. 그 결과 다양한 조직에서 데이터의 잠재력을 발휘하여 운영 효율성을 간소화하고 신약 발견을 가속화할 수 있었습니다.

오늘 이 글을 통해 여러분이 우리의 여정에서 교훈을 얻어 각자의 비즈니스 전략에 적용할 수 있기를 바라며 성공 스토리를 공유하고자 합니다.

데이터 웨어하우스에서 데이터 레이크까지 - 그리고 그 안의 문제들

임상시험, 제조, 상업화라는 암젠의 세 가지 핵심 사업 부문에는 가치 있는 데이터가 풍부하게 존재합니다. 그러나 데이터의 양이 증가함에 따라 실제로 데이터를 효율적으로 사용하는 데 어려움이 있었습니다.

비즈니스의 다양한 측면을 통합할 수 없었기 때문에 고객 수가 증가함에 따라 운영 효율성에 영향을 미쳤습니다. 따라서 데이터에 쉽게 액세스하고 이를 처리할 수 있을 뿐만 아니라 데이터에 대해 서로 다른 관점을 가진 다양한 페르소나를 연결하여 협업을 개선할 수 있는 데이터 패브릭을 만드는 것이 키포인트였습니다. 한 두 가지 관점으로만 데이터를 바라본다면 다른 관점에서 중요한 핵심 사항을 놓칠 수 있기 때문입니다.

예를 들어 다음과 같은 질문을 생각해 보시죠: 도움이 필요한 환자에게 적절한 양의 의약품을 제공하기 위해서 어떻게 정밀한 수요 예측을 진행할 수 있을까요? 

만약 우리가 공급망과 제조 관점에서만 답을 찾으려고 했다면 상업화 관점에서의 판매 예측 데이터를 놓칠 수 있습니다. 반면에 상업적 판매 예측을 필요한 생산량의 전부로 받아들여서는 안 됩니다. 제조 관점에서 실제로 이행할 수 있는 생산량이 희망사항인 엄청난 수치의 판매량에 못미칠 수 있기 때문이죠. 

Amgen이 수요를 세밀하게 예측하여 환자에게 적정량의 치료제를 공급할 수 있는 법

오늘날의 문제를 해결하기 위해 기업은 다양한 데이터 관계와 연결에 집중하여 여러 관점에서 동일한 데이터를 살펴볼 수 있어야 하지만, 이를 실행하는 것은 쉽지 않습니다. Amgen에서는 최신 데이터 요구 사항의 기초를 다음과 같이 세분화했습니다:

  • 데이터는 체계적이고 사용하기 쉬워야 합니다.
  • 데이터를 공유하고 다른 사람의 데이터를 쉽게 재사용할 수 있어야 합니다. 
  • 분석은 신뢰할 수 있는 공유 데이터 뷰를 기반으로 작동할 수 있어야 합니다.
  • 설명적(BI)에서 예측적(ML) 분석에 이르기까지 다양한 형태의 분석은 한 버전의 데이터에서 새로운 발견과 예측을 촉진하는 데 도움이 됩니다.
  • 데이터는 새로운 유형이 도입되고, 한 시스템에서 다른 시스템으로 변경되고, 새로운 도메인이 추가되는 등의 변화에 따라 진화할 수 있어야 하지만, 그 모든 것의 핵심은 일관성을 유지하는 것입니다. 

이러한 일관성의 필요성은 대부분의 조직이 알고 있지만, 각 팀마다 데이터를 소유, 관리, 구성하는 방식이 다르고 단순히 데이터를 공유하려면 또 다른 프로젝트를 필요로 하기 때문에 비직관적인 프로세스를 가진 기업에서는 이를 실현하는 것이 특히 어렵습니다. 저희도 몇 년 동안 어떻게 활용해야 할지 모를 만큼 많은 데이터가 축적되었을 뿐만 아니라, 모든 사람이 동일한 데이터로 작업할 수 있게 하는 프로세스와 인프라가 부족하여 어려움을 겪었습니다.


저희는 초기 데이터 요구 사항을 해결하기 위해 몇 년 전 레거시 기술 인프라에서 Hadoop 기반 데이터 레이크로 전환했습니다. Hadoop 데이터 레이크를 통해 정형 및 비정형 데이터를 한곳에 보관할 수 있었지만, 기술적인 측면과 프로세스, 비용, 조직 측면에서 중요한 데이터 과제가 남아있었습니다. 공유 클러스터는 'Noisy Neighbor" 문제를 일으켰고 확장하기가 어렵고 비용이 많이 들었습니다.

플랫폼의 Product Owner인 제 역할에서 단일 공유 클러스터를 관리하는 것은 악몽과도 같았습니다. 항상 켜져 있었고, 버전을 업그레이드할 적절한 시기가 없었으며, 비용이 분산되어 예를 들어 한 그룹에는 높은 스토리지와 낮은 컴퓨팅을, 다른 그룹에는 높은 컴퓨팅과 낮은 스토리지를 청구하는 방법을 알아내야 했습니다. 

또한 이러한 접근 방식은 각 개별 그룹의 요구 사항을 충족하기 위해 다양한 도구를 함께 사용해야 했기 때문에 협업에 상당한 어려움이 있었습니다. 그리고 다른 많은 기업과 마찬가지로 최종 사용자가 데이터를 소비하는 방식도 다양했습니다. Jupyter Notebook, R Studio, Spotfire, Tableau 등 최종 사용자가 데이터를 소비하는 방식이 다양했기 때문에 필요한 사람들이 데이터를 쉽게 사용할 수 있도록 하는 데 복잡성과 어려움이 가중되었습니다.

레이크하우스 아키텍처로 문제를 해결하는 방법

데이터브릭스 레이크하우스 플랫폼을 도입한 후 다양한 팀과 인력이 데이터로 더 많은 일을 할 수 있게 되었습니다. 이러한 통합 및 협업 플랫폼을 통해 모든 유형의 사용자와 그들이 선호하는 도구에 대해 단일 환경을 활용하고 일관된 데이터 집합을 기반으로 운영을 유지할 수 있었습니다.



데이터 분석가와 데이터 과학자 모두가 데이터를 사용하여 공급망을 최적화하고 운영을 개선할 수 있는 공통 데이터 레이어를 제공함으로써 델타 레이크를 활용하여 ACID 규정 준수, 과거 기록 조회를 지원하고 개발자가 코딩을 시작할 수 있는 진입 장벽을 낮추고 있습니다. 또한, 데이터가 하나의 AWS 계정에 저장되어 있든 10개의 다른 계정에 저장되어 있든 상관없이 하나의 데이터 레이크가 될 수 있도록 서로 다른 데이터브릭스 환경을 연결하기 위해 AWS Glue를 활용하고 있으며, 이는 모두 연결되어 있습니다.

이를 통해 데이터 및 분석을 위해 Apache Spark™로 표준화하면서 다양한 요구사항에 대해 충분한 유연성을 제공할 수 있었습니다. 레이크하우스 내의 통합 데이터 레이어를 통해 Amgen은 모든 유형과 크기의 데이터를 안정적으로 처리하는 동시에 애플리케이션 팀에 비즈니스를 발전시킬 수 있는 유연성을 제공할 수 있습니다.

어떤 규모의 클러스터를 원하시나요? 얼마를 사용하고 싶으신가요? 보고서를 한 시간 더 빨리 받는 것이 더 중요할까요, 아니면 비용을 절감하는 것이 더 중요할까요? 이제 개별 팀에서 이러한 결정을 내릴 수 있습니다. 도구와 언어의 표준화, 그리고 데이터 사이언티스트, 애널리스트, 엔지니어를 위한 단일 데이터 원본이 연결된 팀을 가능하게 한 원동력입니다.

현재 데이터 아키텍처는 모든 데이터의 단일 데이터 소스로 Amazon S3를 사용하고, 공통 데이터 레이어로 Delta Lake를 사용하며, 데이터브릭스용 중앙 집중식 메타스토어로 Glue 데이터 카탈로그를 사용하고, Kibana로 모니터링하기 위한 ELK 스택, 오케스트레이션을 위한 Airflow, 그리고 분석가든 데이터 사이언티스트든 모두 데이터브릭스 레이크하우스 플랫폼에서 작동하는 데이터를 이용하고 있습니다.

이러한 공통 데이터 아키텍처와 이 아키텍처 패턴을 통합함으로써 우리는 플랫폼 유지 관리에서 비즈니스가 실제로 원하는 것과 사용자가 관심을 갖는 것을 파악하는 것으로 초점을 전환할 수 있었습니다. 핵심은 레이크하우스 접근 방식을 활용하여 다양한 데이터 팀에서 데이터를 통합하는 동시에 비즈니스 목표에 맞게 조정할 수 있는 능력이었습니다.

데이터를 준비하면 엔지니어링부터 데이터 사이언스, 애널리틱스까지 다양한 데이터 팀이 데이터에 액세스하고 협업할 수 있습니다. 데이터브릭스의 협업 노트북은 선택한 프로그래밍 언어를 지원하여 데이터를 쉽게 탐색하고 다운스트림 분석 및 ML에 활용할 수 있습니다. 분석가들은 Databricks SQL을 사용하기 시작하면서 데이터 웨어하우스로 옮기지 않고도 최신 데이터를 찾고 탐색할 수 있습니다. 성능 저하 없이 쿼리를 실행하고, 내장된 visualization/대시보드 또는 전사에서 주로 사용하는 Tableau 중 원하는 도구를 사용하여 결과를 쉽게 시각화할 수 있습니다.

또한 데이터 사이언티스트들은 Databricks Machine Learning을 사용하여 ML의 모든 측면을 간소화하는 이점을 누릴 수 있습니다. 데이터 사이언티스트들은 데이터 엔지니어링 지원에 의존하지 않고도 데이터를 준비 및 처리하고, 팀 간 협업을 간소화하며, 실험에서 생산에 이르는 전체 수명 주기를 표준화할 수 있습니다. ML 관리에 대한 이러한 개선된 접근 방식은 임상시험 등록에 걸리는 시간을 단축하는 데 직접적인 영향을 미쳤습니다.

 

연결된 데이터와 팀으로 환자 치료 결과 개선

데이터브릭스 레이크하우스 플랫폼의 구현은 궁극적으로 현대 사회에서 환자에게 서비스를 제공하고 신약 개발 라이프사이클을 개선한다는 우리의 목표를 지속적으로 달성하는 데 도움이 되었습니다. 데이터 수집 속도가 크게 향상되어 처리 시간이 75% 개선되어 비즈니스에 인사이트를 2배 더 빠르게 제공할 수 있게 되었으며, 정적 Hadoop 클러스터에 비해 컴퓨팅 비용을 최대 25% 절감할 수 있었습니다.

데이터브릭스를 통해 우리는 단순한 기술이 아닌 데이터, 관계, 연결에 집중함으로써 수많은 사용 사례에 대한 현대적인 접근 방식을 취할 수 있습니다. 2017년 데이터브릭스와 파트너십을 맺은 이후, 회사 전체에서 데이터브릭스를 도입하는 사례가 크게 증가했습니다. 현재까지 데이터 엔지니어링부터 애널리스트까지 2,000명 이상의 데이터 사용자가 데이터브릭스를 통해 400TB의 데이터에 액세스하여 40개 이상의 데이터 레이크 프로젝트와 240개 이상의 데이터 사이언스 프로젝트를 지원하고 있습니다.



실제로는 사용하기 쉽고 찾기 쉬운 데이터를 통해 회사 전체에서 다양한 사용 사례를 지원합니다:

  • 대규모 게놈 탐색 및 연구: 게놈 데이터의 힘을 활용하여 신약 개발 프로세스를 가속화함으로써 심각한 질병을 치료할 수 있는 신약을 찾을 수 있는 가능성을 크게 높일 수 있습니다.
  • 최적화된 임상시험 설계: 이제 구매한 데이터부터 실제 증거에 이르기까지 다양한 데이터를 가져올 수 있으며, 이러한 다양한 임상 데이터에서 얻은 인사이트를 활용하여 성공 가능성을 높이고 잠재적으로 수천만 달러를 절약할 수 있습니다.
  • 공급망 및 재고 최적화: 제조 효율성과 재고 관리는 모든 제조 산업이 직면한 과제이며, 의약품 제조도 예외는 아닙니다. 효율적인 제조와 최적화된 공급망 관리는 비즈니스에 수백만 달러를 절약하고 적절한 의약품을 적시에 적절한 환자에게 공급하는 데 도움이 될 수 있습니다.

Amgen의 성공 사례에서 알 수 있듯이, 오래된 문제에 대한 새로운 해결책을 찾으려면 비즈니스의 플랫폼, 도구, 혁신 방법을 새롭게 바꿔야 합니다. 암젠에서 레이크하우스 접근법의 채택이 계속 증가함에 따라 Delta Sharing 같은 도구를 통해 협업과 투명성을 촉진하는 새로운 방법을 모색할 것입니다. 가치를 제공할 수 있는 또 다른 흥미로운 도구로는 Delta Live Tables가 있는데, 이 도구는 ETL 개발 및 관리를 더욱 간소화하고 다운스트림 데이터 소비자에게도 혜택을 줄 수 있습니다. 궁극적으로, 데이터브릭스는 고급 분석의 출발선을 앞당겨 치료가 필요한 환자에게 혜택을 줄 수 있는 문제 해결에 더 많은 시간을 할애하고, 이를 가능하게 하는 기본 인프라를 재구축하는 데 더 적은 시간을 할애할 수 있도록 도와주었습니다.

다음 단계