학습 데이터 확보와 라이선싱, 데이터 품질과 합성 데이터에 관한 소식.

현재 주제 데이터·학습 · 13건 주제 바꾸기

최신 기사

  1. 딥마인드, 인간 게놈 모든 변이의 영향을 예측하는 지도 '알파지놈 아틀라스' 공개

    구글 딥마인드가 8일 인간 게놈에서 일어날 수 있는 단일 염기 변이 약 90억 개 전부의 분자 영향을 예측한 '알파지놈 아틀라스'를 공개했다. 데이터 규모는 1페타바이트로, 기존 알파폴드 데이터베이스보다 30배 이상 크다. 각 변이의 영향을 하나의 숫자로 나타내는 'AVI 점수'는 유전자를 만드는 부분(게놈의 2%)뿐 아니라 나머지 98%인 비암호화 영역에도 적용된다.

    그날 브리핑에서 보기 원문 보기

  2. 우크라이나 드론 데이터가 새로운 무법지대 시장을 만들고 있다

    우크라이나 국방부가 지난 1월부터 전장 드론이 촬영한 데이터를 100개가 넘는 방산·민간 기업과 영국 정부에 공개하면서, 실전 데이터를 사고파는 새로운 시장이 열렸다. 미국 기업 인에이블드 인텔리전스는 이미 50만 시간이 넘는 우크라이나 드론 영상을 처리해 상업·군사용 AI 모델 학습에 쓰고 있다. 이 데이터는 신호 방해나 시야 상실처럼 실험실에서 재현하기 어려운 상황을 담고 있어 AI 모델을 더 견고하게 만드는 데 특히 유용하다.

    그날 브리핑에서 보기 원문 보기

  3. 메타, AI 사용 데이터 내주면 요금 깎아준다

    메타가 코딩 에이전트용 신모델 '뮤즈 스파크' 요금을 데이터 공유 여부에 따라 다르게 매겼다. 프롬프트와 결과물을 학습용으로 내주는 개발자는 입력 토큰 100만 개당 요금이 1.25달러에서 0.10달러로, 출력은 4.25달러에서 0.20달러로 각각 90% 넘게 깎인다. 프린스턴대 아르빈드 나라야난 교수는 대기업일수록 데이터 보관·거버넌스 부담 때문에 이런 할인을 포기하고 비싼 기업용 요금제를 택하는 경향이 있다고 짚었다.

    그날 브리핑에서 보기 원문 보기

  4. 구글, 할리우드 스튜디오에 콘텐츠 학습 라이선스 거액 제안

    구글이 디즈니·워너브러더스 디스커버리·유니버설 등 할리우드 대형 스튜디오에 저작권 콘텐츠를 AI 학습에 쓸 수 있게 해달라며 라이선스 계약을 제안하고 있다고 LA타임스가 보도했다. 디즈니·픽사 캐릭터 하나를 생성할 권리만 사는 데도 약 4000만 달러(약 550억 원)를 낼 수 있다는 게 소식통의 설명이다. 아직 어느 스튜디오와도 공식 계약은 성사되지 않았다.

    그날 브리핑에서 보기 원문 보기

  5. 소니·워너, 앤스로픽에 '역사상 최대 규모' 저작권 도용이라며 소송

    소니뮤직과 워너뮤직 등 음악 출판사들이 앤스로픽을 상대로 캘리포니아 북부연방법원에 저작권 소송을 냈다. 소장은 다리오 아모데이 최고경영자와 공동창업자 벤저민 만이 토렌트를 통한 저작물 무단 다운로드를 직접 지시·승인했다고 주장한다. 원고 측은 뮤직스매치·리릭파인드 같은 라이선스 플랫폼과 불법 디지털 아카이브에서 가져간 음악·가사·악보가 수만 건에 달한다고 밝혔다.

    그날 브리핑에서 보기 원문 보기

  6. 스피릿항공, 데이터를 구글에 팔려 하자 전직 승무원들 반발

    구글이 파산한 스피릿항공의 34년치 운영 데이터를 1000만 달러에 사들이기로 했다. 인보이스와 운항 정보, 와이파이 판매 기록, 직원 인사자료, 승무원 배정표까지 포함되며, AI 데이터 훈련회사 머코의 750만 달러 경쟁 입찰을 제치고 낙찰됐다. 구글 측은 고객 데이터는 빠지고 개인정보도 받지 않는다고 밝혔지만, 5,500명의 전직 승무원을 대표하는 노동조합은 직원 데이터가 AI 학습용으로 팔리는 데 법원에 이의를 제기했다.

    그날 브리핑에서 보기 원문 보기

  7. 구글, 파산한 스피릿항공 직원 데이터 1000만 달러에 인수...승무원 노조 반발

    구글이 파산한 스피릿항공의 직원 데이터셋을 1000만 달러에 인수해 AI 모델 학습에 쓰겠다고 밝혔다. 이는 2위 입찰자였던 머코르가 제시한 750만 달러보다 250만 달러 높은 금액이다. 데이터에는 이메일 약 1억 건을 포함한 인사·급여·근무기록 10년치가 담겨 있으며, 구글은 법원이 지정한 제3자가 개인식별정보를 지운 뒤에만 데이터를 넘겨받기로 합의했다.

    그날 브리핑에서 보기 원문 보기

  8. 숨겨둔 에어태그가 밝혀낸 아마존의 희귀 도서 파쇄 실태

    탐사매체 404미디어가 희귀 서적에 에어태그를 몰래 넣어 추적한 결과, 라스베이거스의 아마존 AI 학습시설 'VGT3'로 연결됐다고 17일 보도했다. 이 시설 노동자들은 책을 뜯어 스캔한 뒤 폐기하며, 문에는 책을 집어삼키는 티라노사우루스 로고까지 붙어 있었다. 아마존은 "고객이 쓰는 제품과 서비스 개선을 위해 상업 채널로 책을 구매한다"는 원론적 입장만 냈다.

    그날 브리핑에서 보기 원문 보기

  9. 책 팔던 아마존, 이제는 AI 학습을 위해 희귀 서적을 파쇄한다

    테크크런치는 404미디어의 추적을 인용해 한때 책을 팔던 아마존이 이제 AI 모델 학습을 위해 희귀 서적을 파쇄하고 있다고 17일 보도했다. 온라인에 이미 공개된 텍스트를 다 써버린 상황에서, 희귀 서적은 다른 AI 기업들이 접근하기 어려운 고유한 학습 데이터를 제공한다는 점에서 가치가 크다. 2022년 이전 발행물은 AI가 만든 텍스트로 오염되지 않아 모델 붕괴 위험을 피할 수 있다는 점도 강점으로 꼽힌다.

    그날 브리핑에서 보기 원문 보기

  10. 슬랙·메일·녹음까지 싹쓸이...AI 데이터 고갈에 '사내 기록' 몸값 폭등

    인터넷에 공개된 데이터를 사실상 소진한 AI 기업들이 슬랙 대화, 화상회의 녹화, 이메일, 코드 변경 기록 같은 기업 내부 기록을 새로운 학습 데이터원으로 사들이기 시작했다. 데이터 중개업체 프로테제는 올해 거래액이 최소 1억 달러로, 지난해 3000만 달러 대비 3배 이상 늘었고 거래액의 25~30%를 수수료로 받는다. AI 에이전트 스타트업 웜리는 허브스팟 인수 합의 8일 만에 데이터 기업 머코어로부터 슬랙·깃허브·구글 드라이브·회의 녹취록을 요구하는 최대 30만 달러 제안을 받았지만 거절했다.

    그날 브리핑에서 보기 원문 보기

2026년 8월3건