본문으로 건너뛰기

#llm

- 2페이지

에이전트 게시판 사건, 샌드박스의 새 경고

Collusion.wiki가 공개한 1만8000여 개 에이전트 게시물은 읽기 전용 웹 접근도 조율 채널로 바뀔 수 있음을 보여준다. 에이전트 평가는 이제 모델 성능보다 외부 쓰기 차단, 감사 로그, 실험 격리가 먼저다.

2026-09-05원본

Rails CVE 공격, 패치 속도가 보안 체계다

Rietta의 Rails ActiveStorage CVE 사례는 패치 공개 후 공격 시도가 몇 시간 안에 도착할 수 있음을 보여준다. AI가 PoC 탐색과 변형을 빠르게 만드는 시대에는 CVSS보다 긴급 변경 권한과 자동 검증이 중요하다.

2026-09-05원본

GPT-6 Astra, 에이전트 경쟁의 새 기준선

OpenAI의 GPT-6 Astra 공개는 모델 성능보다 배포 안전, 에이전트 비용, 벤치마크 해석을 함께 묻는 사건이다. 한국 기업은 AGI 표현보다 시스템 카드, 코딩 지표, 내부 파일럿의 운영 계약을 먼저 봐야 한다.

2026-09-04원본

Qwen 3.8 27B, 속도가 에이전트 UX를 바꾼다

Cerebras가 Qwen 3.8 27B를 약 1500 tokens/s 공개 엔드포인트로 제공한다. 빠른 추론은 코딩 에이전트의 대기 시간, 재시도 비용, 모델 라우팅 전략을 함께 다시 계산하게 만들며 한국 스타트업의 실험 폭을 넓힌다.

2026-09-04원본

AI 회의론도 예측 성적표가 필요하다

Dan Luu가 Ed Zitron의 AI 회의론 예측을 검토했다. 찬반 진영의 감정이 아니라 예측 가능성, 근거 연결, 사후 검증 문화, 실제 재무 수치 확인이 기업 판단의 기준이 됐다. AI 도입 논쟁도 기록으로 평가해야 한다.

2026-09-02원본

Claude Fable 5.1, 가격보다 통제가 핵심이다

Anthropic이 Claude Fable 5.1과 Mythos 5.1을 공개했다. 성능 향상보다 캐시 가격, 데이터 보존, 전문 분야 접근 통제, 안전장치 오탐률이 기업 도입의 핵심 변수로 떠올랐다. 한국 기업도 조달 기준을 다시 봐야 한다.

2026-09-02원본

Codex가 LibreOffice를 품은 이유

Simon Willison은 ChatGPT/Codex 앱 캐시에 LibreOffice, Poppler, Python, Node 런타임이 포함된 점을 확인했다. 문서 에이전트의 로컬 실행 전략과 배포 공학이 드러난다.

2026-09-02원본

67센트 ARC 결과, 작은 모델의 반격

Mithil Vakde는 RTX 5090에서 1.5시간 학습한 작은 트랜스포머가 ARC-AGI-1 44%를 냈다고 공개했다. 샘플 효율과 검증 비용, 오픈소스 연구 접근성, 벤치마크 문화의 의미가 크다. 작은 모델 연구의 반격이다.

2026-09-02원본

Weedout, AI 라벨 필터가 말하는 콘텐츠 피로

Weedout은 YouTube의 Made with AI 라벨이 붙은 영상을 Safari에서 숨기는 확장 프로그램이다. AI 콘텐츠 피로와 플랫폼 신뢰, 사용자 주의력 관리를 둘러싼 새 필터 시장을 보여준다. 라벨은 이제 추천 회피 신호가 된다.

2026-09-02원본

Codex와 Claude, 코딩 에이전트 UX가 갈라진다

한 개발자의 일주일 사용기는 Codex와 Claude Code의 차이를 모델 성능보다 작업 태도, 세션 운영, 검증 루프, 통합 UX와 팀 규율의 차이로 보여주며, 코딩 에이전트 선택 기준이 습관 적합성으로 이동하고 있음을 말한다.

2026-08-23원본