◆ 깃허브
- uber/ADR↗
Uber가 공개한 AI 에이전트 보안 프레임워크, 관측성·보안 벤치마킹·위협 탐지 통합
- obra/superpowers↗
에이전트 기반 스킬 프레임워크 및 소프트웨어 개발 방법론, 실무에서 검증된 접근법
- browser-use/video-use↗
코딩 에이전트로 영상을 편집하는 도구, browser-use 팀이 개발
- EveryInc/compound-engineering-plugin↗
Claude Code·Codex·Cursor 등을 위한 공식 Compound Engineering 플러그인
- zhaoxuya520/reverse-skill↗
AI 기반 보안/역공학 스킬 라우터 팩, Claude Code·Cursor 등 지원 (PowerShell · ★17,096 · +2,446/day) ▲연속
- TencentCloud/TencentDB-Agent-Memory↗
AI 에이전트 팀 레벨 메모리 허브, Chat Memory·Skill·LLM-Wiki·Code-Graph 4종 자산 관리 (TypeScript · ★12,762 · +1,090/day) ▲연속
- firecrawl/pdf-inspector↗
PDF 검사·분류·텍스트 추출을 위한 고속 Rust 라이브러리 (Rust · ★9,246 · +1,699/day) ▲연속
- esengine/DeepSeek-Reasonix↗
DeepSeek 네이티브 터미널 AI 코딩 에이전트, prefix-cache 안정성 중심 설계 (Go · ★30,476 · +883/day) ▲연속
- lyogavin/airllm↗
4GB GPU 하나로 70B LLM 추론을 가능하게 하는 라이브러리 (Jupyter Notebook · ★27,947 · +1,085/day) ▲연속
- livekit/agents↗
실시간 음성 AI 에이전트 구축 프레임워크 (Python · ★12,219 · +148/day) ▲연속
- microsoft/generative-ai-for-beginners↗
21레슨 생성형 AI 시작 가이드 (Jupyter Notebook · ★115,996 · +775/day) ▲연속
◆ 해커뉴스
- AI-Generated Images Discourage Me from Reading Your Blog↗
AI 생성 이미지가 블로그 신뢰도를 떨어뜨린다는 주장, 독자의 인식 변화 분석 (706 pts)
- DeepSeek V4 Flash on a Single AMD MI300X↗
AMD MI300X GPU 한 장으로 DeepSeek V4 Flash 모델을 구동하는 방법 공개 (338 pts) · 긱뉴스
- Show HN: Run an 80B Qwen in 4.3 GB of RAM on a Mac, and a 35B on an iPhone↗
Mac에서 4.3GB RAM으로 80B Qwen 모델, iPhone에서 35B 모델 실행 가능한 Swiftlet 프로젝트 (296 pts)
- Harness engineering for self-improvement↗
Lilian Weng의 AI 자기개선을 위한 하네스 엔지니어링 기법 연구 정리 (274 pts)
- Apple is getting this wrong↗
OpenAI가 Apple의 기밀 데이터 유출 주장에 대해 공식 반박 성명 발표 (264 pts)
- Apple says more ex-employees may have taken confidential data to OpenAI↗
Apple, 더 많은 전직 직원이 OpenAI로 기밀 데이터를 유출했을 가능성 제기 (258 pts)
- Mistral's Shieldstral: 3B open-weights model for multimodal moderation↗
Mistral이 발표한 3B 규모 오픈웨이트 멀티모달 콘텐츠 모더레이션 모델 (135 pts)
- Waymo – Dallas Open to All↗
Waymo 자율주행 택시 서비스가 댈러스에서 전면 개방 (123 pts)
- Show HN: Fine-tune an 8B model on a 4 GB laptop GPU↗
4GB 노트북 GPU로 8B 모델 파인튜닝이 가능한 Soup 프로젝트 공개 (110 pts)
- Why Large Language Models Fail at Tabular Prediction↗
LLM이 표 형태 데이터 예측에서 실패하는 원인을 분석한 논문 (96 pts)
- The Warp Agent CLI↗
Warp이 터미널 기반 AI 코딩 에이전트 CLI를 새로 출시 (75 pts) · 긱뉴스
- Homebench – Benchmark local LLMs for speed, memory, and quality↗
로컬 LLM의 속도·메모리·품질을 벤치마크하는 오픈소스 도구 (57 pts)
- When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation↗
AI 벤치마크 포화 현상을 체계적으로 분석한 연구, 새 평가 기준의 필요성 제기 (54 pts)
- Show HN: Watchfire – open-source control room for AI coding agents↗
AI 코딩 에이전트를 모니터링·관리하는 오픈소스 컨트롤 룸
- Launch HN: EdotEnv (YC S26) – Quant Trading RL Envs to Teach LLMs Research↗
YC S26 출신, 강화학습 환경으로 LLM에게 퀀트 트레이딩 리서치를 학습시키는 플랫폼
◆ 긱뉴스
- Show GN: 구독형 CLI를 API로 — Gemini/Grok OAuth 프록시↗
ChatGPT의 oauth 정보를 공유하여 OpenAI API와 호환되는 HTTP 프록시를 생성해주는 오픈소스 프로젝트를 애플리케이션 개발에 활용하고 있습니다. 이를 참고하여 다른 CLI 도구에 대해서도 동일한 방식의 프록시를 직접 개발했습니다. 참고 프로젝트 ChatGPT 대상…
- AI 생성 이미지 때문에 당신의 블로그를 읽기 싫어진다↗
개인 블로그의 AI 생성 이미지 는 본문에도 AI가 사용됐을지 의심하게 만듦 기업 블로그에서는 예상할 수 있지만, 독립 블로그 에서 마주하면 더 실망스러움 세련된 AI 이미지보다 완성도가 낮더라도 직접 만든 Microsoft Paint 그림 을 선...
- Show GN: 코딩 에이전트에 엮어서 진화하는 코드베이스 위키를 만들어봤습니다.↗
코딩 모델을 사용하면서, 이런 생각을 했어요. -> '얘를 더 똑똑하게 부스팅할 방법이 없을까?' -> '내재화된 지식이 없다면, 외부 소스에서 끌어와 쓰면 안 될까?' 해서 고려했던 게 context7 같은 mcp 서버였습니다. 하지만, 유료 제한이 있다는 것을 알게 되었어요. 해서…
- 안목, 판단 그리고 AI↗
안목(taste) 은 충분한 증거가 없어도 무엇이 뛰어난지 알아보는 능력이며, 판단(judgment) 은 위험과 결과를 감수하고 그 선택을 실제 작업으로 내보내는 능력임 안목은 반복적인 제작 경험과 뛰어난 결과물에 대한 폭넓은 노출을 통해 형성되며, 정답이 모호한 여...
- 크래프톤, 21B 한영 이중언어 음성 AI 모델 'A.X K2 Raon-Speech' 공개↗
SKT의 A.X K2 Light 20B-A3B 텍스트 백본에 KRAFTON이 자체 학습한 음성 인코더와 음성 코덱을 결합 한 모델로, 전체 21.2B 중 약 3.5B 파라미터를 활성화 Raon-Speech-9B 의 학습 방식을 사용하며 세 ...
- LLM은 전문성을 보상함↗
LLM 덕분에 누구나 여러 분야에서 준수한 결과를 만들 수 있지만, 같은 모델에서 더 큰 가치를 끌어내는 핵심은 프롬프트 기법보다 도메인 전문성 임 Terence Tao는 Jacobian Conjecture의 반례를 ChatGPT와 논의하며 짧고 핵심적인 질문, 간접적인 반박,…
◆ 아카이브
- GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning↗
Zhaoxin Yu 외 6인 · Transformer 특정 층에 최적화 가능한 잠재 상태를 삽입해 생성 토큰 전체에서 잠재로 직접 보상 기울기를 할당하는 테스트타임 추론법 GradCuit을 제안했다.
- Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning↗
Yiran Gao 외 2인 · LLM의 반복 호출에 의존하는 기존 방식의 한계를 넘어, 디지털 트윈 기반 다중스케일 계획으로 보안 사고 대응을 자동화하는 에이전트 시스템을 제안했다.
- Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training↗
Zhiyuan Wang 외 7인 · 전체 파라미터 공간을 저차원 부분공간으로 분해해 협력적으로 탐색하는 진화전략 CoPES로 자원 제약 환경에서 도구 사용 LLM 에이전트를 효율적으로 사후학습했다.
- Why Large Language Models Fail at Tabular Prediction↗
Marta Garnelo 외 1인 · 도구·미세조정 없이 단일 추론만으로 프론티어 LLM을 평가해, 표 형식 예측에서 LLM이 실패하는 다섯 가지 원인 가설을 체계적으로 검증했다.
- Antares: Foundation Models for Agentic Vulnerability Localization↗
Supriti Vijay 외 10인 · 사이버보안 추론 미세조정과 검증 가능 보상 강화학습으로 훈련한 소형 모델군 Antares로, 3B가 200배 큰 모델을 능가하며 취약점 위치 탐지를 수행함을 보였다.
- Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment↗
Vishwajeet Shivaji Hogale 외 2인 · 반사·질감과 혼동되는 미세 차량 손상의 공간 위치 파악을 전용 분할 모델에 위임하는 하이브리드 구조 TinyDamage로 VLM의 부정확한 접지 문제를 개선했다.