Blog
Daily-curated tech trends and hands-on notes.
The Conditions for Trustworthy Synthetic Inference: A Size-Weight Frontier
Synthetic data alone doesn't guarantee better inference. arXiv 2608.28576 proposes a size-weight frontier that keeps target coverage when mixing real and LLM responses.
ChatGPT Ads Hits $1B Annual Run Rate Within 200 Days of Launch
OpenAI hit a $1B annual run rate for ChatGPT Ads within 200 days and expanded self-serve ads to India, Europe, the Middle East, and North Africa, showing AI monetization entering a growth phase.
OpenAI Launches 8-Week Thailand AI Startup Accelerator With 10 Startups
OpenAI and Thailand MHESI launched an 8-week accelerator for 10 healthcare, wellness, and education AI startups. Each team gets $2,000 in API credits plus mentoring, leading to a Demo Day in November.
Continuous Sepsis Score Without Hourly Supervision — arXiv 2608
Modern ICUs need sepsis scoring without fixed interval measurements. This two-center study learns a 0–10 continuous sepsis score with 43 variables over 72 hours, enabling dynamic monitoring.
Google rolls out 'Expert Intelligence' feature in NotebookLM
NotebookLM now supports Expert Intelligence from Google Play Books, letting users query purchased ebooks directly with insights and quizzes.
Agent Behavior Standard: A New Way to Evaluate AI Agents
Agent Behavior standardizes repeated AI agent actions. This framework makes long-running agent behavior observable and measurable across recognition, judgment, execution, and recovery.
GLM-5.3 openweight shifts coding, agents, and security at once
Z.ai released the GLM-5.3 openweight. Post-training alone lifts coding, agent, and security benchmarks on the same base model, and weights/configs/tokenizers can be deployed or fine-tuned directly.
K-Dense Scientific Agent Skills Analysis
Analysis of an open-source skills library that embeds scientific workflows into AI agents. 163 skills, 78+ databases, and strong compatibility with Cursor, Claude Code, and Codex.
How VK Deployed a GNN Ranker on a 194M-User Graph
VK scaled GNN friend recommendation on 194M users and 28B edges. Multi-hash embeddings cut storage by >98%, temporal sampling reduced lookup cost. Online A/B: +16% accuracy, +11.5% more recommenders.
A mathematical reading of LLM moral knowledge structure
arXiv 2608.27402 shows language models organize moral concepts geometrically, not as one detector. We summarize findings from a Moral Foundations Theory probe study and what they imply for alignment.
Scaling Git at Any Scale — Cursor's Continuity Storage Architecture
Git server scaling is hard by design. Cursor's Continuity uses S3 WAL as the storage source of truth, keeping consistency while flexibly sizing replicas from small repos up to large monorepos.
Why a firewall alone is not enough for AI agent isolation
Trail of Bits' QEMU/KVM escape experiment with GPT 5.6-Cyber linked 3 zero-days into a host path after ~12 hours of autonomous search. Firecracker resisted, showing VM isolation is insufficient alone.
Nvidia-Hugging Face Acquisition Raises Open Source AI Risks
Nvidia is reportedly in talks to acquire Hugging Face for over $13B. If the open source AI hub moves under Nvidia, hardware neutrality, antitrust risk, and developer access could all shift.
AI agentic research refines cell-edge power control algorithm
arXiv 2608.26093 shows an AI coding agent autonomously improving cell-edge power control, reaching 99.5% of the reference baseline through 81 experiments in 26 hours.
ChatGPT and Giftedness Training Shape Student Assignments Differently
Bocconi University tested over 1,000 ninth graders: ChatGPT access improved completion, while giftedness training boosted thought diversity. Combining both yielded the strongest effects.
Archify: The Agent That Draws Verified Architecture Diagrams
Archify turns codebases and system descriptions into architecture, workflow, state, datastore, and lifecycle diagrams as one verified HTML. Works with Cursor, Claude Code, Codex CLI, and OpenCode.
ICNN Lipschitz Constant Computation Proven W[1]-Hard
2-layer ICNN L_p-Lipschitz computation is W[1]-hard for p in (1, ∞), matching zonotope L_p-norm maximization. This limits exact computation and favors approximation or upper-bound estimates.
FID가 감추는 것: 생성 모델 평가의 새로운 지표 ZID
생성 모델 평가의 표준 지표 FID와 KID가 놓치는 분산 왜곡 문제를 지적한 arXiv 2608.24881 논문을 소개한다. 저자가 제안한 ZID는 세 가지 출력을 통해 분산 변화의 방향까지 진단하며, DiT-XL/2와 SiT-XL/2 실험에서 고가이드 다양성 붕괴를 under-dispersion으로 정확히 라벨링한다.
DeepMind unveils speech AI model Gemini 3.5 Transcribe
DeepMind unveiled Gemini 3.5 Transcribe on August 26. It improves on Chirp 3 with lower WER, faster latency, two APIs, 85+ languages, and speaker diarization for up to 3 speakers.
Nitter Shutdown and the Next Challenge for Open Source X Clients
X Corp. shut down Nitter with cease-and-desist notices. The incident reveals how platform policy shifts can quickly disrupt open-source X clients, and what developers should do next.
Firefox 157 Begins Native JPEG XL Decoder Support
Mozilla is adding a Rust-based JPEG XL decoder in Firefox 157, reducing legacy C++ security exposure. With Chrome and Safari alignment, JPEG XL could reach mainstream browser support by 2026.
Provably Adaptive Sampling for Discrete Diffusion with Uniform Remasking
arXiv 2608.23554 analyzes provably efficient adaptive sampling for discrete diffusion by decomposing error into score-function and mutual-information noise, then proving bounds N=O(DTC/ε) and Ω(d).
Stable critic training recipe, summarized in 6 steps
Unstable critic training often breaks later-stage RLHF. arXiv 2608.23566 distills a 6-step recipe from DPPO to baseline GAE, confirmed in 1.5B and 30B-A3B MoE setups.
AI 코드 리뷰 반복, 몇 번이 충분할까
같은 코드에 400회의 LLM 호출을 돌린 실측 연구 결과, 리뷰 한 번은 실제 결함의 34%만 본다. 리뷰는 반복할수록 커버리지가 늘지만(34→61→76%) 리뷰-수정 루프를 반복하면 코드만 +24%~+152% 부풀어 오른다. 실무 처방 '리뷰는 여러 번, 수정은 한 번'과 종료 조건 설계의 핵심을 정리한다.
딥러닝 DFT '스칼라 1.1', 계산화학의 새 기준
마이크로소프트 리서치가 딥러닝 기반 DFT 범함수 '스칼라 1.1'을 공개했다. 광범위한 화학 벤치마크 GMTKN55에서 가중평균 오차 2.8 kcal/mol을 기록해 최고급 하이브리드 범함수를 능가하면서도 반국소 함수 수준의 계산 비용을 유지하고, CP2K·Psi4·FHI-aims·ORCA·VASP로 생태계를 확장하고 있다.
AI가 자기 학습 알고리즘을 만든다면? AI4AI-Bench
AI가 스스로를 만드는 훈련 알고리즘을 다시 쓸 수 있는지 측정하는 최초의 벤치마크 AI4AI-Bench가 공개됐다. 6개 시스템 29개 구성의 평균 점수는 0.166으로, 현실의 에이전트는 학습 방식을 바꾸지 않고 도전 자체를 꺼린다는 현황을 계량했다. 재귀적 자기 개선(RSI)의 현실화 속도를 보여주는 지표를 초록 기준으로 정리했다.
Gemini 3.7 Flash: 코딩·에이전트용 새 워크호스 모델
구글 딥마인드가 선보인 Gemini 3.7 Flash는 소프트웨어 엔지니어링·웹 개발·에이전트 워크플로우에 특화된 새 워크호스 모델이다. 3.6 대비 벤치마크가 크게 오르고 반값 입문 가격으로 책정되어, 프로덕션 에이전트를 비용 효율적으로 확장하려는 개발자에게 유용하다.
태풍 예측 AI, 예고 하루를 앞당기다
구글 딥마인드가 발표한 WeatherNext는 태풍·허리케인의 경로와 강도를 하나의 AI 모델로 예측해 최대 하루의 추가 예고시간을 확보한다. 3일 예보가 기존 2일 예보만큼 정확해진 셈이며, 이를 실현한 뒤 모델과 가중치를 오픈소스로 공개했다.
중고 전자제품 시세 리포트 — 에어팟 프로 2는 얼마면 잘 산 걸까 (8월 20일 실측)
번개장터 실매물을 직접 수집해 만든 첫 중고 시세 리포트입니다. 에어팟 프로 2·닌텐도 스위치 OLED·아이패드 프로 11·갤럭시 워치 7·플레이스테이션 5의 중앙값·최저가·적정 매수선을 8월 20일 실측 데이터로 정리했습니다.
AI 에이전트 '스킬' 생태계가 뜬다
오늘 GitHub 트렌딩에 AI 코딩 에이전트의 '스킬(skills)' 저장소들이 하루 수백~수천 개의 스타와 함께 대거 올라왔다. 어떤 도구가 아니라 에이전트 행동을 지시하는 '스킬'이라는 콘텐츠 형식 자체가 주목받는 이유와 대표 레포, 개발자가 놓치면 안 될 함정을 분석한다.
셀프-임프루빙 에이전트는 왜 취약한가
메모리 기반 셀프-임프루빙 에이전트가 평가 노이즈와 과제 순서에 얼마나 민감한지 밝힌 최신 연구와, 토크나이저 평가 스위트, 에이전트 위임 비대칭 연구를 함께 짚어 에이전트 AI 신뢰성의 측정 문제를 분석한다.
AI 업계 동향: 2026년 7월 — Google DeepMind의 돌파구, Microsoft 에이전틱 프레임워크, OpenAI 세이프가드
2026년 7월은 굵직한 AI 발표가 쏟아진 달이었습니다. DeepMind의 사이클론 예측 돌파구 WeatherNext와 Gemini Robotics ER 2, Google의 35만3천 명 규모 AI Agents 코스, Microsoft의 에이전틱 AI 프레임워크 Orchard·Echoverse, OpenAI의 새로운 사이버 평가 세이프가드까지 — 주요 연구소들의 가장 중요한 업데이트를 1차 소스 링크와 함께 정리했습니다.
주간 AI·테크 라운드업: OpenAI 사이버 안전장치, Google DeepMind의 돌파구, 그리고 RAG 청킹의 현실 점검
이번 주 핵심 라운드업은 OpenAI의 새로운 서드파티 사이버 평가 안전장치, Google DeepMind의 사이클론 예보 모델 WeatherNext와 Gemini Robotics ER 2, 에이전틱 AI를 위한 Microsoft의 Orchard 프레임워크, RAG 청킹 실패와 엔터프라이즈 LLM 데이터 프라이버시 공백에 관한 핵심 인사이트, 그리고 신뢰·PAC 학습·에이전트 평가를 다룬 arXiv 신규 논문 8편을 다룹니다.
OpenAI 사이버 안전장치, SQLite CVE 환각 사건, 그리고 이번 주 AI 리서치 동향
OpenAI가 최근 사건들을 겪은 뒤 새로운 서드파티 사이버 평가 안전장치를 발표했습니다. 한때 치명적이라고 보고됐던 SQLite CVE는 알고 보니 AI가 만들어낸 환각이었습니다. 한편 Google DeepMind는 사이클론 예보 모델 WeatherNext와 음악 생성 모델 Lyria 3.5를 선보였고, Microsoft는 에이전틱 AI를 위한 Orchard를 공개했으며, arXiv에는 긴 컨텍스트 코드 모델링, 스킬 네이티브 LLM, 에이전틱 런타임을 다룬 논문들이 올라왔습니다.
AI 보안 & 신뢰성 위클리: OpenAI 평가 강화, 환각 CVE, Codex 리셋, 에이전틱 프레임워크
이번 주 AI 보안·신뢰성 소식: OpenAI가 서드파티 테스트 이후 사이버 평가 세이프가드를 강화했고, 환각으로 조작된 SQLite CVE가 AI 생성 위협 정보의 위험성을 드러냈습니다. 엔터프라이즈 LLM의 프라이버시 갭이 드러났고, RAG 실패는 단순 청킹 문제로 밝혀졌으며, Codex 사용량 한도가 강제 리셋됐습니다. Microsoft는 Orchard와 Echoverse 프레임워크를 공개했고, DeepMind는 로보틱스와 음악 생성 기술을 발전시켰습니다. 테스트타임 추론과 에이전틱 인프라를 다룬 주요 arXiv 논문들도 함께 정리했습니다.
AI 보안·신뢰성·에이전트 프레임워크 금주 핵심 동향
OpenAI의 제3자 사이버 평가 강화, SQLite 환각 CVE 해프닝, Codex 사용량 리셋 등 AI 보안 이슈와 Google DeepMind의 로보틱스·음악 AI, Microsoft Orchard/Echoverse 에이전트 프레임워크, RAG 청킹 실패 원인 분석까지 금주 핵심 AI 동향을 종합 정리했습니다.
AI 위클리: MS 오키드·에코버스, 클릭하우스 인수, SQLite 치명적 CVE, 엔터프라이즈 LLM 배포의 숨은 리스크
이번 주 핵심 동향을 한눈에: 마이크로소프트가 에이전틱 AI 프레임워크 오키드와 에코버스를 공개하며 장기 실행 에이전트 인프라를 제시했고, 클릭하우스 랩스는 앤디 파블로 영입으로 엔터프라이즈 실시간 분석을 정조준합니다. SQLite 9.8 CVSS 치명적 취약점은 검증되지 않은 DB 파일 오픈 시 원격 코드 실행 위험이 있어 즉각 업데이트가 필수입니다. 엔터프라이즈 LLM 도입의 데이터 프라이버시 갭, RAG 실패의 주원인인 청킹 문제, 오픈AI 코덱스 사용량 리셋 사태, 그리고 주목할 arXiv 신규 논문 8편까지 정리했습니다.
제미나이 3.5 플래시 컴퓨터 사용부터 RAG 청킹 실패까지 — 2026년 7월 AI 트렌드 총정리
구글 딥마인드의 제미나이 3.5 플래시 컴퓨터 사용 기능 공개, 기업 LLM 도입 시 놓치기 쉬운 데이터 프라이버시 갭, RAG 실패의 진짜 원인인 청킹 문제, 오픈AI 코덱스 사용량 리셋 사태, 그리고 최신 아카이브 논문 8편까지 — 2026년 7월 주요 AI 트렌드를 한눈에 정리했습니다.
AI 위클리: Gemini 3.5 Flash 컴퓨터 사용, 엔터프라이즈 데이터 프라이버시 갭, RAG 청킹 실패, 그리고 신규 arXiv 논문 8편
이번 주 AI 주요 소식: Gemini 3.5 Flash의 컴퓨터 사용 기능 공개, 기업 LLM 도입 시 간과되는 데이터 프라이버시 갭, RAG 실패의 진짜 원인인 청킹 문제, OpenAI Codex 사용량 리셋, 그리고 최신 arXiv 논문 8편을 정리했습니다.
AI 주간: 제미나이 컴퓨터 사용·기업 프라이버시 갭·RAG 청킹 실패·현대 AI 스택
이번 주 AI 핵심 소식을 정리합니다. 구글 딥마인드의 제미나이 3.5 플래시 컴퓨터 사용 기능 공개, 기업 LLM 배포에서 간과되는 데이터 프라이버시 사각지대, RAG 실패의 진짜 원인인 청킹 문제, 오픈AI 코덱스의 전 계정 사용량 리셋, 그리고 토크나이제이션부터 월드 모델까지 현대 AI를 구성하는 엔지니어링 스택까지 다룹니다.
AI 에이전트 '컴퓨터 사용' 시대 개막... 엔터프라이즈는 프라이버시·RAG 청크 문제로 몸살
구글 제미나이 3.5 플래시가 네이티브 컴퓨터 사용 기능을 추가하며 AI 에이전트의 UI 자동화 시대가 열렸습니다. 하지만 엔터프라이즈 현장에서는 프롬프트 이후 데이터 흐름을 놓치는 프라이버시 갭과, 토큰 단위 무분별 청킹으로 망가지는 RAG 검색이 실제 배포의 걸림돌로 지목됩니다. 오픈AI 코덱스 사용량 리셋 사태와 최신 논문 8편, 빅테크 연구 동향 10건까지 한눈에 정리합니다.
AI 위클리: Gemini 컴퓨터 사용, RAG 청킹 실패, 그리고 현대 AI 스택
이번 주 소식: DeepMind가 Gemini 3.5 Flash에 컴퓨터 사용 능력을 부여했고, 실무자들은 RAG 실패가 모델이 아니라 부실한 청킹에서 비롯됨을 밝혔습니다. OpenAI는 Codex 한도를 리셋했고, 현대 AI 스택은 '마법'이 아닌 '엔지니어링'으로 그 실체가 드러났습니다.
링크드인 채용과제 사기, 숨은 악성코드
최근 AISafe가 다룬 사례는 LinkedIn에서 온 채용 제안이 악성코드 배포로 이어진 이야기였습니다. 겉보기엔 정상적인 React/Web3 과제였지만, `tailwind.config.js` 같은 설정 파일에 난독화된 스크립트가 숨어 있었고 실행 과정에서 추가 단계가 내려왔습니다.
Gemini API 에이전트 기능 확장 정리
Google DeepMind의 Gemini 3.5 Flash computer use와 Google AI의 Managed Agents 확장은, LLM을 대답하는 모델에서 실제 작업을 수행하는 실행 레이어로 옮기려는 흐름으로 읽힙니다. 배경 작업과 원격 MCP가 붙으면서 개발자는 모델 호출보다 권한 경계, 실패 복구, 작업 분해를 더 신경 써야 합니다.
Gemini API 에이전트 기능 확장
Google DeepMind가 Gemini 3.5 Flash의 computer use와 Gemini API Managed Agents 확장을 연달아 발표했습니다. 백그라운드 실행, 원격 MCP, 커스텀 함수, 자격 증명 갱신이 더해지면서 에이전트가 단발성 응답이 아니라 실제 작업 단위로 움직이는 방향이 뚜렷해졌습니다.
Gemini 3.5 Flash의 컴퓨터 사용, 왜 중요한가
DeepMind가 Gemini 3.5 Flash의 내장 computer use 도구를 공개하면서, 에이전트가 화면과 UI를 직접 다루는 흐름이 더 분명해졌습니다. 이 변화는 편의성만큼이나 권한 경계, 민감정보 제외, 행동 검증이 중요해졌다는 신호이기도 합니다.
에이전트 AI 데이터 프라이버시, 프롬프트만 보면 놓친다
Gemini 3.5 Flash의 computer use 발표는 에이전트 AI가 단순 생성 단계를 넘어 행동 단계로 들어왔다는 신호입니다. 동시에 X에서 제기된 데이터 프라이버시 문제처럼, 이제는 프롬프트 입력뿐 아니라 로그·툴 출력·보관 정책까지 함께 봐야 합니다.
Linux epoll 취약점 CVE-2026-46242 정리
CVE-2026-46242는 Linux 커널 epoll 처리 경로의 경합 조건 UAF로 이어질 수 있는 취약점입니다. 단순한 버그 설명을 넘어서, 왜 이 문제가 루트 권한 상승으로 연결될 수 있는지와 운영자가 지금 무엇을 확인해야 하는지 정리했습니다.
RAG 실패의 진짜 원인, 청크 분할
RAG가 기대만큼 안 나올 때 모델보다 먼저 봐야 할 것은 청크 분할 방식입니다. 문서를 아무 기준 없이 자르면 검색은 맞아도 의미는 틀어지기 쉽고, 그 결과 답변 품질이 급격히 흔들립니다.
Gemini 3.5 Flash의 컴퓨터 사용 기능
Google DeepMind가 Gemini 3.5 Flash에 컴퓨터 사용 기능을 기본 탑재했다고 발표했습니다. 브라우저·모바일·데스크톱을 넘나드는 에이전트 자동화와 함께, 안전장치와 운영 방식까지 같이 봐야 할 시점입니다.
GeekNews 오늘의 변화: AI 코딩 기여와 벤치마크 신뢰성 점검
2026-07-03 GeekNews 크론 결과를 바탕으로, AI 생성 코드 기여를 둘러싼 거버넌스 변화와 벤치마크 검증의 중요성, 그리고 에이전트 개발 도구의 제품화를 함께 정리한 테스트용 큐레이션 초안입니다.