Anthropic과 연구 파트너인 AE Studio는 수요일 분리 가능한 분리형 모듈을 사용하여 AI 모델 내에서 위험한 지식을 격리하는 방법을 발표했습니다. GRAM(Gradient-Roated Auxiliary Modules)이라는 이 기술은 AI 모델의 일반적인 성능을 유지하면서 이중 용도 위험 관리를 향상하도록 설계되었습니다.

GRAM은 표준 변압기 아키텍처에 작은 보조 신경 구획을 추가합니다. 각 구획은 바이러스학, 사이버 보안, 핵물리학 등 민감한 지식의 특정 범주를 전담합니다. 모듈을 삭제하면 모델이 해당 특정 데이터에 대해 훈련되지 않은 것처럼 동작하게 되고, 모듈을 활성화하면 포함된 지식에 액세스할 수 있습니다.

연구원들은 웹 텍스트, 코드, 과학 논문 및 4가지 이중 용도 도메인(바이러스학, 사이버 보안, 핵물리학 및 전문 코드)을 혼합하여 8억 개의 매개변수 모델을 훈련했습니다. 이중 용도 데이터는 각 도메인에 대한 훈련 데이터의 약 0.25%를 차지했습니다. 결과에 따르면 GRAM 모듈을 제거하는 것은 데이터에 대한 교육을 전혀 하지 않는 것만큼 효과적이었습니다. 모델은 모든 데이터가 포함되어 설정된 기준선에 가까운 일반적인 성능을 유지했습니다.

이 접근 방식은 일반적으로 지식을 제거하는 것이 아니라 억제하는 사후 학습 해제 방법과 달리 적대적인 미세 조정에 대해 강력한 것으로 입증되었습니다. 이 연구는 트럼프 행정부가 잠재적인 취약점과 관련된 국가 안보 문제로 인해 일시적으로 Anthropic의 Claude 모델에 대한 수출 통제를 시행했기 때문에 AI 거버넌스가 어려운 시기에 나온 것입니다.

  Meta, Instagram 쇼핑 워크플로우를 위한 AI 도우미 구축

이러한 제한은 Anthropic이 확인된 위험을 해결하기 위해 상무부와 협력한 후 6월 30일에 해제되었습니다. GRAM은 전체 모델을 금지하거나 행동 가드레일에만 의존하는 대신 세분화된 액세스 제어를 허용함으로써 정책 결정의 중간 지점을 제공할 수 있습니다.

그러나 연구원들은 그들의 연구 결과가 예비적이며 아직 Anthropic의 생산 모델에 구현되지 않았다고 지적했습니다. 그들은 GRAM을 보다 복잡한 모델로 확장할 수 있는 가능성과 얽힌 지식을 보다 일반적인 기능에서 분리하는 데 따른 잠재적인 어려움에 대해 의문을 제기했습니다. 이 연구는 Anthropic의 Cem Anil 및 Alex Cloud의 도움을 받아 AE Studio가 주도했습니다.

<시간 />

추천 이미지 크레딧