All posts
News

OpenAI 사이버 안전장치, SQLite CVE 환각 사건, 그리고 이번 주 AI 리서치 동향

OpenAI가 최근 사건들을 겪은 뒤 새로운 서드파티 사이버 평가 안전장치를 발표했습니다. 한때 치명적이라고 보고됐던 SQLite CVE는 알고 보니 AI가 만들어낸 환각이었습니다. 한편 Google DeepMind는 사이클론 예보 모델 WeatherNext와 음악 생성 모델 Lyria 3.5를 선보였고, Microsoft는 에이전틱 AI를 위한 Orchard를 공개했으며, arXiv에는 긴 컨텍스트 코드 모델링, 스킬 네이티브 LLM, 에이전틱 런타임을 다룬 논문들이 올라왔습니다.

Aug 7, 2026Updated Aug 8, 2026 7분 읽기

OpenAI, 서드파티 사이버 평가를 강화하다

OpenAI는 자사 모델과 관련된 최근 서드파티 사이버보안 평가 사고를 인정하고, 외부 연구자들이 AI 시스템을 테스트하는 방식을 강화할 새로운 안전장치를 공개했습니다. 회사 측은 더 명확한 참여 규칙(rules of engagement), 승인된 테스트를 위한 전용 환경, 그리고 발견 사항이 위험을 키우지 않으면서 올바른 팀에 전달되도록 하는 체계적인 공개 프로세스를 제공하겠다고 밝혔습니다. 이번 조치는 공개 레드팀 활동이 책임 있는 공개와 잠재적 악용 사이의 경계를 흐렸던 사례들 이후 나온 것입니다.

OpenAI: Third-party cyber evaluations involving OpenAI models

존재한 적 없는 SQLite CVE

GeekNews의 한 게시글은 환각으로 생성된 코드를 통해 SQLite에서 "치명적(Critical) CVE"가 발견됐다고 주장했습니다. 하지만 자세히 들여다보니 취약점 보고서 자체가 LLM이 생성한 것으로 드러났습니다 — 해당 CVE는 어떤 공식 데이터베이스에도 존재하지 않습니다. 이 사건은 그럴듯하게 들리는 AI 출력이 트리아지 시간을 낭비시키는 보안 경보를 어떻게 만들어낼 수 있는지를 보여주는 좋은 사례입니다. 에스컬레이션하기 전에는 반드시 NVD나 벤더의 권고문에서 CVE ID를 확인해야 합니다.

GeekNews: 할루시네이션으로 생성된 SQLite 취약점에 Critical CVE

엔터프라이즈 LLM 도입의 데이터 프라이버시 공백

Shakthi(v_shakthi)는 엔터프라이즈 팀들이 프롬프트에 들어가는 입력은 분류하면서도, 그 데이터가 프롬프트를 떠난 뒤 무슨 일을 겪는지 — 벤더의 보관 정책, 서브프로세서, 로그 보관, 삭제 조건 — 는 거의 추적하지 않는다고 지적합니다. 진짜 거버넌스의 경계는 프롬프트 필터가 아니라 데이터 경계 그 자체입니다.

X thread: The Data Privacy Gap Most Teams Miss

RAG의 실패는 청킹의 실패다

같은 저자는 대부분의 RAG 실패가 모델이 아니라, 문서의 의미를 깨뜨리는 단순한 토큰 경계 청킹에서 비롯된다고 주장합니다. 제목·표·코드 블록을 존중하는 의미 기반 청킹이야말로 검색 품질을 좌우하는 지렛대입니다.

X thread: Most RAG failures are chunking failures

Codex 사용량 한도 전면 초기화

OpenAI의 Codex 팀은 예상치 못한 사용량 소진을 조사하던 중 모든 계정의 사용량 한도를 전면 초기화했습니다. Tibo Sottiaux는 일요일에 로그를 검토하는 워룸(war-room) 회의가 있었다고 확인했습니다. 이번 초기화에는 적립된 한도까지 포함됐으며, 에이전틱 코딩 도구가 아직 운영상 성장통을 겪고 있다는 점을 다시 한번 보여줍니다.

X thread: OpenAI Codex usage reset

하나의 엔지니어링 스택으로서의 현대 AI

VizuaraAI는 현대 AI를 토큰화, 어텐션, RAG, 디퓨전, 비전 모델, 월드 모델이 함께 쌓인 아이디어의 스택으로 설명합니다. 이 스레드는 LLM 사용자에서 LLM 엔지니어로 넘어가려는 사람들을 위한 간결한 커리큘럼 역할도 합니다.

X thread: Modern AI is a stack of ideas

트랜스포머 이전의 메모리: RNN, LSTM, GRU

VizuaraAI의 또 다른 스레드는 RNN이 시간에 따라 은닉 상태를 어떻게 전달했는지, 기울기 소실(vanishing-gradient) 병목이 무엇이었는지, 그리고 LSTM·GRU와 결국 트랜스포머가 이를 어떻게 해결했는지를 짚어봅니다. 어텐션이 왜 지금과 같은 방식으로 작동하는지 이해하는 데 유용한 사고의 뼈대가 됩니다.

X thread: Before Transformers, there were RNNs

Google DeepMind: WeatherNext, Lyria 3.5, Gemini Robotics ER 2

  • WeatherNext: 그래프캐스트 기반의 새로운 모델이 사이클론 경로와 강도 예보에서 기존 물리 앙상블 모델을 능가합니다 — 순수 ML이 극한 기상 예측에서 하이브리드 접근법을 이긴 드문 사례입니다.
  • Lyria 3.5: Google Flow Music에 출시됐으며, 음악성·가사 일관성·보컬 품질·창작 제어(스타일·구조·악기 편성)가 향상됐습니다.
  • Gemini Robotics ER 2: 로보틱스 파운데이션 모델에 비디오 이해, 멀티태스크 오케스트레이션, 다중 로봇 협업 기능을 추가했습니다.

DeepMind: WeatherNext | DeepMind: Lyria 3.5 | DeepMind: Gemini Robotics ER 2

Microsoft Research: Orchard & Echoverse

  • Orchard: 확장 가능한 에이전틱 AI를 위한 오픈 프레임워크로, 조합 가능한 에이전트, 공유 메모리, 계획·툴 사용·멀티 에이전트 조율을 처리하는 런타임으로 구성됩니다.
  • Echoverse: 컴퓨터 사용 에이전트를 위한 깊고 진화하는 시뮬레이션 환경으로, 에이전트가 장기 과제를 학습하는 지속적인 세계라고 생각하면 됩니다.

MS Research: Orchard | MS Research: Echoverse

arXiv 하이라이트 (2026년 8월 4일–6일)

PaperKey claim
OctoLong리포지토리 간 코드 컨텍스트에 대한 중간 학습(mid-training)이 코드 LLM의 긴 컨텍스트 모델링을 향상시킴
Skill Entropy장기 호라이즌 추론의 벤치마킹·학습을 위한 스킬-엔트로피 지표
Loss vs Basis손실 함수는 기저(basis)를 보지 못하지만 Adam은 본다 (옵티마이저 기하학)
MT-GNN그래프 기반 메트릭 텐서 임베딩을 활용한 메쉬 진화 뇌 형태계측 예측
SSTQ서브샘플링 확률적 TurboQuant를 통한 프라이버시 보존 벡터 양자화
Argus장기 호라이즌 추론을 위한 범용 에이전틱 런타임
Nemotron Greek전문 도메인 전반의 현대 그리스어를 위한 코퍼스 마이닝, 검색 적응, 근거 기반 생성
OPD-V모달리티 균형을 갖춘 시각적 온-폴리시 자기 증류

한국어 요약

이번 주 핵심 AI 동향을 정리했습니다. OpenAI는 서드파티 사이버 평가 사고 후 새로운 안전장치(명확한 테스트 규칙, 전용 환경, 구조화된 공개 프로세스)를 발표했습니다. GeekNews에 올라온 'SQLite Critical CVE'는 실제로는 LLM이 생성한 환각이었으며, 공식 CVE 데이터베이스에 존재하지 않습니다. 엔터프라이즈 LLM 배포에서는 프롬프트 입력 분류보다 벤더 데이터 보관·서브프로세서·로그 보관·삭제 조건 등 데이터 경계 관리가 진짜 거버넌스 포인트입니다. RAG 실패 대부분은 모델이 아닌 의미 없는 토큰 경계 청킹에서 옵니다. Google DeepMind는 사이클론 예보에서 물리 앙상블을 이긴 WeatherNext, 음악 생성 품질을 높인 Lyria 3.5, 비디오 이해·멀티 로봇 협업을 추가한 Gemini Robotics ER 2를 공개했습니다. Microsoft는 에이전틱 AI 오픈 프레임워크 Orchard와 컴퓨터 사용 에이전트용 진화 환경 Echoverse를 열었습니다. arXiv에는 긴 컨텍스트 코드 모델링(OctoLong), 스킬 네이티브 LLM 벤치마크, 옵티마이저 기하학, 에이전틱 런타임 Argus 등 8편의 주목할 논문이 올라왔습니다.

주요 용어: 사이버 레드팀링(red-teaming), 환각(hallucination), 데이터 거버넌스(data governance), RAG 청킹(chunking), 에이전틱 AI(agentic AI), 롱호라이즌 추론(long-horizon reasoning)

#OpenAI#사이버보안#RAG#Google DeepMind#Microsoft Research#arXiv
Robeedau

Curated, fact-checked, and edited by a single operator before publishing.