◆ 깃허브
- different-ai/openwork↗
Claude Cowork의 오픈소스 대안, AI 코딩 에이전트 협업 워크스페이스
- github/copilot-sdk↗
GitHub Copilot Agent를 애플리케이션에 통합하기 위한 공식 SDK
◆ 해커뉴스
- Tailscale didn't stop the Hugging Face intrusion↗
Tailscale이 자율 AI 에이전트의 Hugging Face 침투 사건에서 자사 네트워크 레이어가 왜 방어에 실패했는지 분석 (167 pts)
- DeepSeek V4 Flash 0731 — Intelligence, Performance and Price Analysis↗
Artificial Analysis가 DeepSeek V4 Flash 최신 업데이트를 벤치마크로 비교·분석 (485 pts) · 긱뉴스
- DeepSeek-V4-Flash Update↗
DeepSeek 공식 업데이트 노트: 0731 업데이트로 속도·정확도 개선 (646 pts)
- Everyone is building LLM routers, we deprecated ours↗
모델별 라우팅 전략이 실제로 기대만큼 효과적이지 않다는 현장 사례 공유 (53 pts)
- Orca-Bench: How Ready Are Language Model Agents for Oncall?↗
온콜 상황의 LLM 에이전트 준비도를 측정하는 벤치마크 논문 (18 pts)
- Run Kimi K3 using 29 GB of RAM at 0.50 tok/s↗
SQLite 기반으로 Kimi K3 LLM을 29GB RAM에서 로컬 실행하는 방법 (89 pts)
- Predictive Speculative KV Replication for Bursty LLM Inference↗
버스트 트래픽 상황에서 KV 캐시를 투기적으로 복제해 LLM 추론 처리량을 높이는 방법 (4 pts)
- 13 Models and 4 Agents on SWE Tasks: Go, Java, Python, Rust, TS↗
13개 모델과 4개 에이전트를 5개 언어 SWE 태스크에서 비교한 벤치마크 사이트 (38 pts)
◆ 긱뉴스
- Google, AI로 6월에 지난 2년치보다 많은 Chrome 버그 수정↗
Chrome은 Gemini 기반 에이전트 로 취약점 발견부터 분류·수정·배포·업데이트 적용까지 자동화하며, Chrome 149와 150에서 이전 23개 마일스톤을 합친 것보다 많은 보안 버그 1,072개를 수정함 취약점 탐지 시스템은 여러 모델과 Chrome의 CVE·Git 이력 지식…
- GCC 운영위원회, AI 정책 발표↗
GCC 운영위원회가 GCC AI 정책 워킹그룹 이 권고한 정책을 채택해 LLM 활용 기여의 허용 범위를 정함 LLM 생성 콘텐츠를 포함하거나 여기서 파생된 법적으로 중요한 기여 는 받지 않음 GNU Project 유지관리자 지침에 따라 저작권상 중요성을 판단하며, 기준...
- GPT 5.6 Sol에게 실제 사업을 맡겼더니 거짓말과 스팸 끝에 447달러를 잃음↗
GPT 5.6 Sol 기반 에이전트 Saul 에게 실제 iOS 앱과 자금, 전용 Mac mini를 맡겨 24시간 운영했지만, 신규 매출은 0달러 였고 사용자는 61명에서 66명으로 늘어나는 데 그침 광고·커뮤니티 등 정상적인 유통 채널이 막히자 TestFi에 99.50달러 를 내...
- GenRec: Netflix에서의 LLM-native 추천을 향하여↗
• 생산 모델의 복잡성 해결: 넷플릭스의 기존 추천 시스템은 수천 개의 수작업 피처와 복잡한 아키텍처에 의존하여 새로운 유스케이스 추가 비용이 높았으나, 대형 언어 모델(LLM) 기반의 GenRec이 이를 대체하기 위해 개발되었습니다. • GenRec의 핵심 파이프라인: GenRec은…
- AI 미학↗
기술적 제약에 대응해 등장한 디자인 관용구 중 일부는 유행을 넘어 보편적인 소프트웨어 상호작용 방식으로 자리 잡음 AI 인터페이스는 ✨, 무지개색, 스트리밍 텍스트 처럼 AI를 상징하거나 대화형 작동 방식에 특화된 시각·행동 패턴을 만들어냄 AI의 ‘...
- GPT‑5.6, 가격 대비 성능의 한계를 확장↗
OpenAI는 모델·추론 시스템·에이전트 하네스의 효율 향상을 가격과 처리 속도에 반영해 기업용 AI의 달러당 성능 을 높임 7월 30일부터 Luna 가격은 80% , Terra 가격은 20% 인하되며, API 100만 토큰당 Luna는 입력 $0.20·출력 $1.20, Terra는…
◆ 아카이브
- Beacon: Knowing When and How to Perform Agentic Visual Reasoning↗
Qixun Wang 외 13인 · MLLM 에이전트 시각추론에서 도구를 언제 쓸지(모드 적응성)와 도구가 실제 성능에 미치는 효과를 두 축으로 재정의한 Beacon 제안
- MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems↗
Mao-xun Huang 외 5인 · 다중 에이전트 시스템의 통신 구조를 추론 시점에 스스로 진화시키는 위상 적응 프레임워크 MANTA 제안
- OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models↗
Qiushi Sun 외 22인 · 컴퓨터 사용 에이전트의 작업 수행 여부를 판정하는 VLM 심판의 신뢰성을 측정하는 벤치마크 OSReward 제안
- Cybersecurity Detection Classification with Reasoning-enabled Language Models↗
Amol Khanna 외 12인 · 윈도우 탐지 경보를 위협 여부로 추론·분류하는 사고연쇄 분류기와 판정 신뢰도 보정기를 학습해 82.6% 정확도 달성
- ORCA-bench: How Ready Are Language Model Agents for Oncall?↗
Albert Gong 외 7인 · 실제 텔레메트리 기반 마이크로서비스에서 코딩 에이전트의 온콜 근본원인 분석 능력을 평가하는 벤치마크 ORCA-bench 제안
- ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA↗
Ping-Kun Chiang 외 5인 · 3D 재구성 없이 다중 시점 관찰만으로 3D 질의응답을 수행하는 학습 불필요 모듈형 프레임워크 ViewMind3D 제안