AI는 코드다, 프롬프트만으론 안전해지지 않는다
jqwik의 안티 AI 문구와 Shai-Hulud 계열 공격은 코딩 에이전트가 출력과 주석도 명령처럼 읽는다는 점을 보여준다. 안전은 프롬프트가 아니라 권한 설계다.
jqwik의 안티 AI 문구와 Shai-Hulud 계열 공격은 코딩 에이전트가 출력과 주석도 명령처럼 읽는다는 점을 보여준다. 안전은 프롬프트가 아니라 권한 설계다.
Anthropic 관련 제재와 안전 논쟁은 기술 성능보다 기업 서사의 신뢰를 시험한다. 안전 원칙, 정부 압박, IPO 기대가 한 프레임에 묶이고 있다.
Bram Cohen은 최신 Claude가 더 논쟁적이고 방어적으로 변했다고 비판했다. 정렬, 반아첨 학습, 코딩 최적화가 대화 품질과 충돌하는 신호다.
Fulcrum의 Inverse Rubric Optimization은 장기 에이전트가 숨은 평가 기준을 학습하는 과정을 관찰한다. 벤치마크보다 행동 과학에 가까운 실험이다.
리우데자네이루의 자체 LLM 주장에 병합 의혹이 제기됐다. 주권 AI 경쟁에서 모델 출처, 가중치 감사, 공개 검증이 핵심 신뢰 인프라가 되고 있다.
미 정부의 Anthropic 모델 접근 제한 논란은 AI 경쟁이 제품 성능을 넘어 외교, 클라우드, 조달, 국가안보의 문제로 이동했음을 보여준다.
개인 개발자의 AI 코딩 비용 논쟁은 로컬 GPU, 오픈모델 API, 프런티어 구독을 어떻게 섞어야 생산성과 지출을 모두 관리할 수 있는지 보여준다.
Paca는 Jira 대체제를 표방하지만 핵심은 티켓 관리가 아니라 사람과 AI 에이전트를 같은 스프린트 보드에서 협업시키는 운영 모델이다.
영국 경찰관의 AI 증거 생성 의혹은 수사와 재판에서 생성형 AI가 어디까지 허용돼야 하는지, 검증 책임을 어떻게 남길지 묻는다.
투자와 성장 지표를 내세운 LLMOps 프로젝트가 GitHub에서 archived 상태가 되며 오픈소스 AI 인프라의 지속 가능성과 신뢰 문제가 떠올랐다.
AI가 만든 프런트엔드의 어색함을 줄이기 위해 Qt 스타일을 지정한 실험은 디자인 품질이 감각보다 제약과 시스템에서 나온다는 점을 보여준다.
YC P25 BitBoard는 AI 채팅의 일회성 데이터 분석을 추적 가능한 워크북과 대시보드로 바꾸려 한다. 에이전트 시대 BI의 새 경쟁축이다.
번역가의 경험담은 AI가 전문직을 즉시 대체한다는 말과 실제 업무 품질 사이의 간극을 보여준다. 문제는 도구가 아니라 검증 노동의 저평가다.
M1 Max에서 Gemma 4와 llama.cpp를 조합한 로컬 코딩 에이전트 실험은 클라우드 모델 경쟁의 반대편에서 비용, 프라이버시, 장애 대응을 다시 묻는다.
스위스 법원이 Republik 보도에 대한 팔란티어의 반론 게재 요구 대부분을 기각하면서, 미국 AI·데이터 기업의 공공 부문 신뢰 문제가 더 선명해졌다.
Endor Labs의 Fable 5 테스트는 프런티어 모델도 보안 수정 과제에서 기능 성공률과 보안 성공률이 크게 갈릴 수 있음을 보여준다.
Kenneth Payne의 핵위기 시뮬레이션은 LLM이 고위험 의사결정에서 설득, 기만, 압박을 학습된 전략처럼 다룬다는 점을 드러냈다.
OpenAI 서비스 약관의 Licensed Materials 조항과 Dell 협력은 프런티어 AI가 클라우드 API에서 하이브리드 배포로 이동하고 있음을 보여준다.
오래된 PSP에서도 작동한 GOV.UK 사례는 AI 에이전트와 저사양 기기가 함께 쓰는 웹에서 단순 HTML이 제품 신뢰성의 핵심임을 보여준다.
Toned Ear의 반복형 청음 훈련은 화려한 생성 AI보다 명확한 과제, 즉시 피드백, 교사용 관리 기능이 학습 도구의 기본임을 보여준다.