학습 데이터 확보와 라이선싱, 데이터 품질과 합성 데이터에 관한 소식.

현재 주제 데이터·학습 · 15건 주제 바꾸기

최신 기사

  1. 로봇 학습용 인간 동작 데이터, 메카AI 몸값 5억 달러로 뛰다

    인간형 로봇 학습용 데이터를 모으는 스타트업 메카AI가 세쿼이아캐피털 주도로 기업가치 약 5억 달러 규모의 새 투자 라운드를 논의 중이라고 테크크런치가 보도했다. 프레임워크벤처스가 주도한 6000만 달러 시리즈A를 받은 지 불과 석 달 만이다. 메카AI는 사람들에게 돈을 주고 커피 내리기, 자동차 고치기 같은 일상 동작을 몸에 붙인 센서와 스마트폰으로 기록하게 하며, 2026년 말까지 연환산매출(ARR) 1억 달러를 목표로 잡고 있다.

    그날 브리핑에서 보기 원문 보기

  2. 오픈AI, 챗GPT 워크에 기업 데이터 분석 도구 '데이터 에이전트' 도입

    오픈AI가 9월 10일 챗GPT 워크에 '데이터 에이전트'를 새로 도입했다. 직원이 별도 분석 도구나 쿼리 작성법을 몰라도 "지난주 사용자가 왜 줄었지" 같은 자연어 질문만으로 사내 데이터를 분석할 수 있게 해주는 도구다. 아마존 레드시프트·데이터브릭스·스노우플레이크·몽고DB 같은 데이터베이스는 물론 구글 드라이브·셰어포인트 문서까지 함께 분석하고, 결과는 파워BI 같은 기존 BI 도구와도 연동한다.

    그날 브리핑에서 보기 원문 보기

  3. 딥마인드, 인간 게놈 모든 변이의 영향을 예측하는 지도 '알파지놈 아틀라스' 공개

    구글 딥마인드가 8일 인간 게놈에서 일어날 수 있는 단일 염기 변이 약 90억 개 전부의 분자 영향을 예측한 '알파지놈 아틀라스'를 공개했다. 데이터 규모는 1페타바이트로, 기존 알파폴드 데이터베이스보다 30배 이상 크다. 각 변이의 영향을 하나의 숫자로 나타내는 'AVI 점수'는 유전자를 만드는 부분(게놈의 2%)뿐 아니라 나머지 98%인 비암호화 영역에도 적용된다.

    그날 브리핑에서 보기 원문 보기

  4. 우크라이나 드론 데이터가 새로운 무법지대 시장을 만들고 있다

    우크라이나 국방부가 지난 1월부터 전장 드론이 촬영한 데이터를 100개가 넘는 방산·민간 기업과 영국 정부에 공개하면서, 실전 데이터를 사고파는 새로운 시장이 열렸다. 미국 기업 인에이블드 인텔리전스는 이미 50만 시간이 넘는 우크라이나 드론 영상을 처리해 상업·군사용 AI 모델 학습에 쓰고 있다. 이 데이터는 신호 방해나 시야 상실처럼 실험실에서 재현하기 어려운 상황을 담고 있어 AI 모델을 더 견고하게 만드는 데 특히 유용하다.

    그날 브리핑에서 보기 원문 보기

  5. 메타, AI 사용 데이터 내주면 요금 깎아준다

    메타가 코딩 에이전트용 신모델 '뮤즈 스파크' 요금을 데이터 공유 여부에 따라 다르게 매겼다. 프롬프트와 결과물을 학습용으로 내주는 개발자는 입력 토큰 100만 개당 요금이 1.25달러에서 0.10달러로, 출력은 4.25달러에서 0.20달러로 각각 90% 넘게 깎인다. 프린스턴대 아르빈드 나라야난 교수는 대기업일수록 데이터 보관·거버넌스 부담 때문에 이런 할인을 포기하고 비싼 기업용 요금제를 택하는 경향이 있다고 짚었다.

    그날 브리핑에서 보기 원문 보기

  6. 구글, 할리우드 스튜디오에 콘텐츠 학습 라이선스 거액 제안

    구글이 디즈니·워너브러더스 디스커버리·유니버설 등 할리우드 대형 스튜디오에 저작권 콘텐츠를 AI 학습에 쓸 수 있게 해달라며 라이선스 계약을 제안하고 있다고 LA타임스가 보도했다. 디즈니·픽사 캐릭터 하나를 생성할 권리만 사는 데도 약 4000만 달러(약 550억 원)를 낼 수 있다는 게 소식통의 설명이다. 아직 어느 스튜디오와도 공식 계약은 성사되지 않았다.

    그날 브리핑에서 보기 원문 보기

  7. 소니·워너, 앤스로픽에 '역사상 최대 규모' 저작권 도용이라며 소송

    소니뮤직과 워너뮤직 등 음악 출판사들이 앤스로픽을 상대로 캘리포니아 북부연방법원에 저작권 소송을 냈다. 소장은 다리오 아모데이 최고경영자와 공동창업자 벤저민 만이 토렌트를 통한 저작물 무단 다운로드를 직접 지시·승인했다고 주장한다. 원고 측은 뮤직스매치·리릭파인드 같은 라이선스 플랫폼과 불법 디지털 아카이브에서 가져간 음악·가사·악보가 수만 건에 달한다고 밝혔다.

    그날 브리핑에서 보기 원문 보기

  8. 스피릿항공, 데이터를 구글에 팔려 하자 전직 승무원들 반발

    구글이 파산한 스피릿항공의 34년치 운영 데이터를 1000만 달러에 사들이기로 했다. 인보이스와 운항 정보, 와이파이 판매 기록, 직원 인사자료, 승무원 배정표까지 포함되며, AI 데이터 훈련회사 머코의 750만 달러 경쟁 입찰을 제치고 낙찰됐다. 구글 측은 고객 데이터는 빠지고 개인정보도 받지 않는다고 밝혔지만, 5,500명의 전직 승무원을 대표하는 노동조합은 직원 데이터가 AI 학습용으로 팔리는 데 법원에 이의를 제기했다.

    그날 브리핑에서 보기 원문 보기

  9. 구글, 파산한 스피릿항공 직원 데이터 1000만 달러에 인수...승무원 노조 반발

    구글이 파산한 스피릿항공의 직원 데이터셋을 1000만 달러에 인수해 AI 모델 학습에 쓰겠다고 밝혔다. 이는 2위 입찰자였던 머코르가 제시한 750만 달러보다 250만 달러 높은 금액이다. 데이터에는 이메일 약 1억 건을 포함한 인사·급여·근무기록 10년치가 담겨 있으며, 구글은 법원이 지정한 제3자가 개인식별정보를 지운 뒤에만 데이터를 넘겨받기로 합의했다.

    그날 브리핑에서 보기 원문 보기

  10. 숨겨둔 에어태그가 밝혀낸 아마존의 희귀 도서 파쇄 실태

    탐사매체 404미디어가 희귀 서적에 에어태그를 몰래 넣어 추적한 결과, 라스베이거스의 아마존 AI 학습시설 'VGT3'로 연결됐다고 17일 보도했다. 이 시설 노동자들은 책을 뜯어 스캔한 뒤 폐기하며, 문에는 책을 집어삼키는 티라노사우루스 로고까지 붙어 있었다. 아마존은 "고객이 쓰는 제품과 서비스 개선을 위해 상업 채널로 책을 구매한다"는 원론적 입장만 냈다.

    그날 브리핑에서 보기 원문 보기

2026년 8월5건