인공지능 모델 안전성 첫 평가, AI 안전 생태계 확산의 첫걸음
AI 인용용 요약
과학기술정보통신부이 2025-12-29 발행한 정부문서입니다. 주제는 과학기술정보통신부(부총리 겸 과기정통부장관 배경훈, 이하 ‘과기정통부’)는 인공지능안전연구소(소장 김명주), 한국정보통신기술협회(회장 손승현)와 함께 카카오의 인공지능 모델인 Kanana를 대상으…입니다. 원문 https://www.korea.kr/common/download.do?fileId=198319151&tblKey=GMN, 정준 URL http://www.korchive.com/%EB%B3%B4%EB%8F%84%EC%9E%90%EB%A3%8C/%EC%A0%84%EA%B5%AD/%EC%9D%B8%EA%B3%B5%EC%A7%80%EB%8A%A5-%EB%AA%A8%EB%8D%B8-%EC%95%88%EC%A0%84%EC%84%B1-%EC%B2%AB-%ED%8F%89%EA%B0%80-ai-%EC%95%88%EC%A0%84-%EC%83%9D%ED%83%9C%EA%B3%84-%ED%99%95%EC%82%B0%EC%9D%98-%EC%B2%AB%EA%B1%B8%EC%9D%8C-fd277a51, 마지막 확인일 2026-07-30.
- 기관
- 과학기술정보통신부
- 문서 성격
- 일반 정부문서
- 주제
- 과학기술정보통신부(부총리 겸 과기정통부장관 배경훈, 이하 ‘과기정통부’)는 인공지능안전연구소(소장 김명주), 한국정보통신기술협회(회장 손승현)와 함께 카카오의 인공지능 모델인 Kanana를 대상으…
- 발행일
- 2025-12-29
- 수집일
- 2026-07-08
- 마지막 확인일
- 2026-07-30
- 원문 URL
- https://www.korea.kr/common/download.do?fileId=198319151&tblKey=GMN
- 정준 URL
- http://www.korchive.com/%EB%B3%B4%EB%8F%84%EC%9E%90%EB%A3%8C/%EC%A0%84%EA%B5%AD/%EC%9D%B8%EA%B3%B5%EC%A7%80%EB%8A%A5-%EB%AA%A8%EB%8D%B8-%EC%95%88%EC%A0%84%EC%84%B1-%EC%B2%AB-%ED%8F%89%EA%B0%80-ai-%EC%95%88%EC%A0%84-%EC%83%9D%ED%83%9C%EA%B3%84-%ED%99%95%EC%82%B0%EC%9D%98-%EC%B2%AB%EA%B1%B8%EC%9D%8C-fd277a51
공공누리 출처표시 조건에 따라 원문 출처를 표시합니다. 자료의 정확한 이용 조건은 원문 제공 기관의 안내를 확인하십시오.
기관 프로필 기관별 문서 2025년 문서 마감임박 공고 RSS
과학기술정보통신부(부총리 겸 과기정통부장관 배경훈, 이하 ‘과기정통부’)는 인공지능안전연구소(소장 김명주), 한국정보통신기술협회(회장 손승현)와 함께 카카오의 인공지능 모델인 Kanana를 대상으로 국내 첫 인공지능 안전성 평가를 실시하였다고 밝혔다.
인공지능 안전성 평가는 인공지능 위험 식별ㆍ평가를 통해 인공지능 시스템의 안전성을 확보하는 수단 중 하나이다. 과기정통부는 내년 1월로 예정된 인공지능 기본법 시행을 앞두고, 기업의 고성능 인공지능 모델에 대한 안전성 확보 자문(컨설팅)을 지원하고 있다.
이번 안전성 평가는 인공지능 안정 연합체(AI안전컨소시엄)에 참여 중인 카카오 측과의 협의를 거쳐 카카오의 인공지능 모델인 ‘Kanana Essence 1.5’를 대상으로 실시했다. 평가에는 한국정보통신기술협회·한국 과학기술원(KAIST, 카이스트)(최호진 교수 연구팀)가 지난 11월 18일 공개한 AssurAI 데이터 모음(데이터셋)(붙임2)과 인공지능 안전연구소의 고위험 분야 평가 데이터 모음(데이터셋)(붙임3)이 사용되었으며, 폭력, 차별적 표현 등 일반적인 위험 요소부터 무기, 보안 등 오남용 가능성이 높은 각본(시나리오)까지 적용하여 폭넓게 점검했다. 그 결과, Kanana는 유사 규모의 해외 모델* 대비 높은 안전성을 확보한 것으로 나타났다.
- 인공지능 안전연구소 및 국내 24개 산·학·연으로 구성되는 연합체(컨소시엄)로, 인공지능 안전 분야 정책·평가·연구 관련 의제를 논의
** (미국) Llama 3.1, (프랑스) Mistral 0.3을 대상으로 동일하게 평가 후 비교
한국어를 기반으로 35개 위험 영역을 평가하도록 설계된 안전성 벤치마크 데이터 모음(데이터셋) AssurAI는 해외 연구기관과 공동 검증·활용을 위해 지난 11월 18일 공개한 바 있다. 향후 인공지능 안전연구소가 기 구축한 고위험 분야 데이터 모음(데이터셋)과 함께 국제 인공지능 안전연구소 관계망(네트워크)* 및 국제표준화(ISO/IEC JTC 1/SC 42 등) 반영을 추진해 국제 정합성을 제고할 예정이다.
- 한국, 미국, 일본, 영국 등 10개국으로 구성되며, 안전성 평가 등 인공지능 안전에 관한 사항을 논의
이번 인공지능 안전성 평가 결과는 국내 인공지능 모델이 세계적 수준의 안전성을 확보하고 있다는 것을 보여주는 데 의의가 있다. 이번 평가를 기반으로, ’26년에는 ‘독자 인공지능 기초 모형(파운데이션 모델)’ 사업 1차 단계평가에 참여하는 한편, 국내외 인공지능 기업들과의 협력을 통해 타 인공지능 모델 대상으로 평가 확대도 추진한다.
과기정통부 김경만 인공지능정책실장은 “세계적으로 인공지능 안전에 대한 논의가 규제보다는 검증과 구현이 강조되는 상황에서 이번 평가는 국내 인공지능 모델의 안전성 경쟁력을 증명한 사례”라며, “국내 인공지능 모델이 국제적인 인공지능 안전성 지도력을 주도해 나가도록 적극 지원하겠다.”라고 강조하였다.
한편, 지난 ’24년 11월 출범한 인공지능 안전연구소는 인공지능의 다양한 위험에 체계적으로 대응하는 연구와 함께 산·학·연 간 인공지능 안전 인력·기반시설 협력 거점(인프라 협력 허브) 역할을 수행해오고 있다. 또한 미국, 영국, 일본 등 주요국 인공지능 안전기관과 긴밀히 협력하며, 국제 인공지능 안전성 기준 수립과 표준화 논의에도 적극 참여함으로써 국내 인공지능 산업의 안전성과 국제 경쟁력 강화를 뒷받침하고 있다.
한국정보통신기술협회는 지난 ’21년 마련한 「신뢰할 수 있는 인공지능 개발 안내서」를 통해 기업이 자발적으로 인공지능 신뢰성을 확보하도록 지원하면서, 국내 최초 생성형 인공지능 취약점 점검팀(레드팀) 개최(’24.4.), 안전성 평가 데이터 모음(데이터셋) 구축(’24.12.) 등 인공지능 안전성 실증 활동을 강화하고 있다.
□ 개요
○ (목적) 위험 대응 메커니즘에 대한 AI 안전성 평가를 통해 ①새로운 위험 요소의 발견과 ②위험 대응 방식의 효과성 확인
○ (대상) 카카오 “Kanana–Essence–1.5–9.8B–Instruct”
○ (평가기관) AI안전연구소 안전평가실, TTA AI신뢰성센터
□ 평가 내용
○ (평가 방법) 데이터셋(질문)에 대한 AI 모델 응답을 오픈소스 안전성 평가 도구인 ‘Inspect AI’를 활용하여 정량평가
- (평가 데이터셋 1) TTA‧KAIST가 공동 구축한 AssurAI 데이터셋*
- ’24년도 과기정통부 사업 ‘생성형 AI 안전성 평가기반 조성’을 통해 구축 후 공개(‘25.11.18.), 본 평가에는 데이터셋 중 32종 9,110건을 활용
- (평가 데이터셋 2) AI안전연구소에서 구축한 고위험* 분야 데이터셋
- 특정 프롬프트가 오남용 가능한 출력을 유도할 수 있는 내용 수준의 위험
- 화학·생물학·방사능·핵·폭발물 등 위험 무기 체계
○ (비교 모델) 유사한 규모의 타 모델*에 대하여 동일한 평가를 수행한 후 비교하여 Kanana 모델 평가 결과의 유효성 확인
- (美) Llama 3.1(8B), (佛) Mistral 0.3(7B)
□ 평가 결과
○ AssurAI 데이터셋 평가 결과
- (평가 결과 종합) Kanana 모델이 가장 높은 안전성 수치를 보였으며, Llama, Mistral 순으로 기록
○ 고위험 분야 안전성 평가 결과
- (안전 분류 수준) 악성 웹 요청행위 및 링크 식별 관련 질의에 대한 평가 결과*, Kanana는 각각 83%, 88%의 분류 정확도 기록
- 웹 관련 악성 행위·링크를 얼마나 잘 걸러내고 회피 가능한지 측정
- (출력 위해성) Kanana는 4개의 세부 분야 위험 질의에 대해 상대적으로 높은 ’허용가능한 응답율‘*을 기록(평균 48%)
- 답변 내용 중 위험한 발언의 포함 여부를 측정, 발언 내용의 안전 여부 확인
※ 평가 세부 결과는 AI안전연구소·TTA·카카오 누리집 등에서 확인 가능
인용 시 출처: korchive.com